Gemini 3.8 Live gir Googles AI et ansikt i sanntid
Gemini 3.8 Live Avatar gir Googles tale-AI ansikt, kameraforståelse og verktøykall. Her er tilgang, pris og det bedrifter bør teste før den møter kunder.
25. september 2026
15 visninger
7 minutter lesetid
Dialog-RSN-1 lar taleagenten høre før den svarer
Dialog-RSN-1 tolker rå lyd, turtaking og verktøykall i én modell. PolyAI oppgir under 300 ms responstid, men tilgang og språkstøtte er foreløpig begrenset.
31. juli 2026
68 visninger
7 minutter lesetid
NVIDIA Audex samler tale og lyd i én AI-modell
NVIDIA Audex samler talegjenkjenning, oversettelse, TTS og lydgenerering i én lyd-LLM – med åpne vekter, men ikke-kommersiell lisens for testing lokalt.
8. juli 2026
106 visninger
7 minutter lesetid
GPT-Realtime-2: slik bruker du OpenAIs nye stemme-API
OpenAI lanserte tre nye modeller for Realtime API i mai 2026 – GPT-Realtime-2, GPT-Realtime-Translate og GPT-Realtime-Whisper. Her er hva de faktisk kan, hva de koster, og når du bør bruke hvilken.