Innhold Vis
Hvis du har snakket med en taleagent som avbryter midt i setningen, har du møtt problemet Dialog-RSN-1 prøver å løse. PolyAIs nye modell får selve lyden inn, ikke bare en utskrift av det du sa. Dermed kan den bruke pauser, tonefall, bakgrunnslyd og resten av samtalen når den avgjør både hva du mener og om det er dens tur til å svare.
Det mest interessante er hvordan PolyAI har trukket grensen. Dialog-RSN-1 samler turtaking, talegjenkjenning, resonnering, verktøykall og tekstsvar i én lydbevisst modell. Selve stemmen lages fortsatt av en separat TTS-løsning. Det gir en mellomting mellom den tradisjonelle kjeden med tale-til-tekst, LLM og TTS, og en full speech-to-speech-modell som både lytter og snakker.
PolyAI oppgir responstid på under 300 millisekunder i produksjon, men tallene kommer fra selskapets egne tester og et internt evalueringssett som ennå ikke er offentlig. Modellen er dessuten bare anbefalt for engelsk ved lansering, uten åpne vekter eller offentlig API. Dette er altså en lovende produksjonsmodell for store talesystemer, ikke noe du kan laste ned og prøve lokalt i kveld.
Hva gjør Dialog-RSN-1 annerledes?
Dialog-RSN-1 lar én modell tolke rå lyd, samtalekontekst og instruksjoner før den velger neste handling. Ifølge PolyAIs tekniske presentasjon fra 30. juli 2026 kan handlingen være å vente, svare eller kalle et verktøy. Transkripsjonen produseres først etter at modellen har tatt denne avgjørelsen.
I et vanlig kaskadesystem går talen først gjennom automatisk talegjenkjenning, ofte forkortet ASR. Språkmodellen får deretter én tekstlig tolkning av lyden. Det er effektivt og velprøvd, men informasjon blir borte på veien. En nølende «ja», et navn som høres ut som et vanlig ord, eller en pause fordi innringeren leter etter kundenummeret sitt, blir lett redusert til tekst uten forklaring.
Dialog-RSN-1 får både lyden, systeminstruksen og samtalehistorikken. Modellen kan derfor bruke konteksten når et faguttrykk blir uttalt uklart, vente til alle seks sifrene i en kode er lest opp, eller forstå at lyden på linjen er ventemusikk. Poenget er ikke at transkripsjon har blitt uviktig. Poenget er at utskriften ikke lenger er den smale flaskehalsen som alle senere avgjørelser må gjennom.
Hvorfor turtaking er mer enn å måle stillhet
Turtaking handler om å avgjøre om brukeren er ferdig med å snakke, ikke bare om mikrofonen har registrert stillhet. Dialog-RSN-1 gjør denne avgjørelsen som modellens første output-token: EMPTY, ONGOING eller COMPLETE. Dermed kan systemet raskt velge mellom å vente og å starte et svar.
Tradisjonelle løsninger bruker gjerne terskler for hvor lenge det skal være stille før agenten svarer. Kort ventetid føles rask, men øker faren for avbrytelser. Lang ventetid er tryggere, men får samtalen til å føles som en telefonsamtale med satellittforsinkelse. De samme tersklene passer heller ikke nødvendigvis både for en rask restaurantbestilling og en forsikringssamtale med lange referansenumre.
PolyAI bruker fortsatt en enkel voice activity detector, eller VAD, til å foreslå tidspunkter hvor modellen bør sjekkes. Den endelige avgjørelsen tas likevel med hele samtalekonteksten. Turtakingen kan også styres med instrukser, for eksempel at agenten skal vente på en telefontone eller la innringeren lese ferdig en tallrekke. Det er en liten arkitektonisk detalj med stor praktisk betydning: samtaleregler flyttes fra en haug med håndjusterte terskler til samme kontekst som styrer resten av agenten.
Hvorfor er TTS fortsatt separat?
TTS er separat fordi PolyAI vil beholde kontrollen over stemmen, uttalen og merkevareuttrykket. Dialog-RSN-1 forstår lyd på inngangssiden, men sender tekstsvaret videre til en egen tekst-til-tale-løsning. Selskapet mener at det meste av gevinsten ved lydforståelse ligger i lyttingen, ikke i at samme modell må produsere lyden.
En full speech-to-speech-modell kan gi en svært naturlig flyt, men stemmen er tettere bundet til modellen. Det kan være upraktisk når et selskap trenger konsekvent uttale av produktnavn, bestemte stemmer eller presis kontroll over hvordan svarene fremføres. PolyAIs deling gjør det mulig å bytte eller justere stemmen uten å trene dialoghjernen på nytt.
Prisen er at løsningen fortsatt består av flere komponenter. TTS kan legge til forsinkelse og introdusere egne feil, og PolyAI har ikke publisert noen pris som gjør det mulig å sammenligne totalkostnaden med åpne eller API-baserte alternativer. Arkitekturen ser fornuftig ut for kundeservice, men det er ikke det samme som at den automatisk er billigst.
Hvordan kan en lydmodell svare på under 300 ms?
PolyAI sikter mot under 300 millisekunder fra modellen blir kalt til nok tekst er generert til at TTS kan begynne. Kandidatene ligger ifølge selskapet fra tette modeller med 8 milliarder parametere til sparse modeller med 30 milliarder parametere på A100-GPU-er. Tiden inkluderer ikke nødvendigvis hele den opplevde forsinkelsen fra slutten av brukerens setning til ferdig lyd i øret.
Modellen kjører ikke som en kontinuerlig strøm som binder én GPU gjennom hele samtalen. Den kalles ved behov når VAD og tidtakere mener det kan være noe å avgjøre. Mellom disse sjekkene kan GPU-kapasiteten brukes andre steder. Det er en viktig forskjell fra alltid aktive full-duplex-systemer, særlig når tusenvis av telefonsamtaler skal håndteres samtidig.
PolyAI fyller også attention-cachen mens brukeren snakker, bruker en append-only prompt som begrenser hvor ofte cache må bygges på nytt, og sender samme innringer tilbake til samme GPU. En spesialtrent speculative drafter får i snitt godkjent 3,9 tokens per runde. Transkripsjonen legges til slutt og kan kjøres parallelt med talegenerering og agentløkken, slik at loggingen ikke trenger å holde igjen svaret.
Hva viser resultatene i praksis?
PolyAI rapporterer at en nasjonal restaurantgruppe fikk 11 prosent relativ økning i andelen samtaler som ble løst uten overføring til et menneske. En stor forsikringskunde skal ha redusert responstiden med 37 prosent. Selskapet sier også at Dialog-RSN-1 svarer stabilt på under 300 millisekunder i live drift.
Det er mer interessant enn en løs laboratoriedemo fordi modellen faktisk håndterer produksjonssamtaler. Samtidig må tallene leses med riktig merkelapp. Kundene er ikke navngitt i lanseringen, vi får ikke de absolutte nivåene før og etter, og PolyAI har selv både utviklet modellen og gjennomført evalueringen. En relativ forbedring på 11 prosent kan være viktig, men den forteller ikke alene hvor mange samtaler som faktisk ble løst.
Hovedtesten heter Dialog-Eval og består av samtaler som stoppes ved ett bestemt beslutningspunkt. Modellen vurderes på én atomisk neste handling, enten et verktøykall eller et svar til brukeren. Det gjør det lettere å finne ut nøyaktig hva som sviktet enn i lange simulerte samtaler, men rammeverket er foreløpig internt. PolyAI sier at det skal åpnes senere sammen med en teknisk rapport. Inntil det skjer, er resultatene lovende leverandørdata, ikke uavhengig dokumentasjon.
Verktøykall skjer før transkripsjonen er ferdig
Dialog-RSN-1 kan velge et verktøykall direkte fra lyden og konteksten, for eksempel å sende riktige argumenter til et bookingsystem. Den trenger ikke først fullføre en transkripsjon, sende teksten til en separat LLM og vente på at denne modellen tolker intensjonen. I PolyAIs evalueringsoppsett er neste steg alltid enten ett verktøykall eller ett brukersvar.
Det er et interessant slektskap med utviklingen jeg tidligere har skrevet om i Anthropics arbeid med mer effektiv tool calling: verdien ligger ikke bare i at modellen kan returnere strukturert data, men i hvor mye unødvendig mellomarbeid som kan fjernes før handlingen skjer. For en taleagent merker brukeren hvert ekstra ledd som venting.
Transkripsjonen beholdes likevel for logger, komprimering av eldre samtalekontekst og tekstbaserte sikkerhetsregler. Det virker som et godt kompromiss. Talegjenkjenning er fortsatt nyttig, slik også nye modeller for målrettet transkripsjon viser, men her får ikke utskriften bestemme alt som skjer videre.
Hvem kan faktisk bruke Dialog-RSN-1?
Eksisterende PolyAI-kunder kan aktivere Dialog-RSN-1 nå, mens nye kunder må be om tidlig tilgang. Det finnes verken åpne modellvekter eller et offentlig API ved lansering. PolyAI sier at et API skal åpnes senere, men oppgir ingen dato eller offentlig pris.
Dette gjør modellen mest aktuell for større virksomheter som allerede kjøper en ferdig plattform for kundesamtaler. PolyAIs plattformdokumentasjon viser API-er for å bygge og drifte agenter og hente samtaledata, men Dialog-RSN-1 presenteres ikke som en løs modell utviklere kan koble inn hvor de vil. SMB-er som ønsker et rimelig tale-API eller en lokal modell, må foreløpig se andre steder.
Engelsk er den andre klare begrensningen. Basismodellen er flerspråklig, og PolyAI sier den allerede har plukket opp andre språk i produksjon, men anbefalingen er fortsatt Dialog-RSN-1 for engelske taleagenter og Raven 3.5 for andre språk. «Den skjønte litt norsk i en samtale» er ikke det samme som produksjonsklar norsk. Det skillet er verdt å holde fast i.
Dette er den virkelige nyheten
Den virkelige nyheten er at PolyAI prøver å gjøre lyd til en del av agentens beslutning uten å gjøre hele samtalen til én kostbar, alltid aktiv lydstrøm. Modellen hører mer enn en transkripsjon, men TTS, logging og den enkle VAD-en får fortsatt være separate deler når det er praktisk. Det er mindre elegant på et arkitekturdiagram enn «én modell gjør alt», men ofte mer interessant i drift.
Jeg liker også at turtaking behandles som en ordentlig modellavgjørelse. En god telefonsamtale handler ikke bare om å finne riktige ord. Den handler om å vente når den andre tenker, skjønne når et svar faktisk er ferdig, og ikke begynne å prate over et kundenummer. Der har mange taleagenter fortsatt omtrent samme sosiale fingerspissfølelse som en røykvarsler.
Men jeg ville ventet med de største superlativene. Dialog-Eval må bli offentlig, den tekniske rapporten må komme, og andre må få mulighet til å måle systemet. Når tilgang, pris og språkstøtte fortsatt er begrenset, er Dialog-RSN-1 først og fremst et godt eksempel på hvor taleagenter er på vei: mindre tekstflaskehals, bedre timing og færre separate beslutningsledd.
Ofte stilte spørsmål
Kan jeg laste ned Dialog-RSN-1 og kjøre den lokalt?
Nei. Dialog-RSN-1 ble lansert uten åpne vekter og uten et offentlig modell-API. Eksisterende PolyAI-kunder kan aktivere modellen i plattformen, mens nye kunder må be om tidlig tilgang. PolyAI sier et offentlig API kommer senere, men har ikke oppgitt noen dato.
Støtter Dialog-RSN-1 norsk?
Ikke som anbefalt produksjonsspråk ved lansering. PolyAI har fokusert trening og evaluering på engelsk. Basismodellen skal være flerspråklig og har fanget opp andre språk i produksjon, men selskapet anbefaler foreløpig Raven 3.5 for ikke-engelske taleagenter.
Er Dialog-RSN-1 en speech-to-speech-modell?
Ikke fullt ut. Modellen mottar og tolker rå lyd, men lager et tekstlig svar som sendes til en separat TTS-løsning. Det gir lydforståelse på inngangssiden samtidig som virksomheten beholder kontroll over stemmen og uttalen.
Er responstiden på under 300 ms uavhengig bekreftet?
Nei. Tallet kommer fra PolyAIs egne målinger i live drift og gjelder tiden fra modellkallet til nok tekst er klar for TTS. Det interne Dialog-Eval-rammeverket og den tekniske rapporten er varslet, men var ikke offentlig tilgjengelige ved lansering.