Hvis du bygger en stemmeagent eller lager lange fortellerstemmer, gir Qwen-Audio-3.0-TTS deg et ganske tydelig valg: Flash prioriterer lav forsinkelse, mens Plus prioriterer lydkvalitet. Det er mer nyttig enn én modell som prøver å være best til alt og ender som et kompromiss til begge jobbene.

Alibaba har samtidig gjort et viktig produktvalg som er lett å overse i lanseringsstøyen. Dette er en driftet tjeneste i Alibaba Cloud Model Studio, ikke modellvekter du kan laste ned og kjøre lokalt. Du får streaming, instruksjonsstyring og støtte for 16 språk, men også en ny ekstern avhengighet i produksjonen.

Den mest interessante delen er derfor ikke at enda en Qwen-modell har dukket opp. Det er hvordan Flash og Plus fordeler fart, kvalitet, pris og funksjoner mellom seg – og hva du faktisk må sjekke før du bygger dem inn i et norsk produkt.

Hva er Qwen-Audio-3.0-TTS?

Qwen-Audio-3.0-TTS er en ny familie for tekst til tale med modell-ID-ene qwen-audio-3.0-tts-flash og qwen-audio-3.0-tts-plus. Alibaba registrerte begge som tilgjengelige internasjonalt 14. juli 2026, via Singapore-regionen i Model Studio, ifølge selskapets oversikt over nye modeller.

Begge modellene kan strømme tekst inn og lyd ut over WebSocket. Det gjør at avspillingen kan begynne før hele teksten er ferdig behandlet. I praksis er det avgjørende for samtaler, kundeservice og andre opplevelser der et langt stille sekund raskt får brukeren til å tro at systemet har sovnet.

Plus er kvalitetsmodellen for blant annet opplesning, dubbing og annet innhold der naturlighet og stemmepreg veier tyngst. Flash er laget for direkte samhandling. Alibaba oppgir under 200 millisekunder til første lyd i livssyklusloggen, mens lanseringsmaterialet beskriver ytelsen som rundt 300 millisekunder. Det er nært nok til å vise retningen, men stort nok avvik til at jeg ville målt i riktig region og eget nettverk før jeg lovet noe til kunder.

Visuell sammenligning av Qwen-Audio-3.0-TTS Flash for fart og Plus for kvalitet
Flash prioriterer rask respons og strømming, mens Plus er rettet mot lydkvalitet og lengre fortellerinnhold.

Hva skiller Flash fra Plus?

Flash er først og fremst modellen for ventetid og Plus modellen for lydkvalitet. Den offisielle modelloversikten for talegenerering viser dessuten en funksjonsforskjell som betyr mer enn navnene antyder: Flash er oppført med stemmekloning, mens Plus er oppført uten denne støtten. Begge støtter instruksjonsstyring.

Instruksjonsstyring betyr at utvikleren kan beskrive tempo, følelse og stil med vanlig språk for hver forespørsel. Modellen støtter også mer presise markører for hendelser som latter, pust, hoste og sukk. Det gir langt mer kontroll enn å velge en stemme og håpe at resten ordner seg, spesielt i spilldialog, dramatisert opplesning og virtuelle figurer.

Under panseret bruker familien en taletokenizer på 12,5 Hz, slik at den autoregressive delen trenger færre steg for hvert sekund lyd. Alibaba beskriver også en treningsprosess i fem trinn og syntese av opptil tre minutter i én omgang. Dette er tekniske detaljer, men de peker mot et praktisk mål: å holde stemme, rytme og uttale stabile gjennom lengre avsnitt uten å måtte lime sammen en haug med små lydklipp. Den offisielle presentasjonen fra FunAudioLLM viser også eksempler på styring og språkdekning.

Dokumentasjonen er ikke helt ryddig. Marktechpost beskriver stemmekloning som en funksjon i modellfamilien, mens Alibaba Clouds detaljerte modelltabell bare merker Flash med kloning og fører Plus opp uten støtte. Den offisielle tabellen er det tryggeste holdepunktet: Hvis kloning er et krav, bør du velge Flash eller verifisere den konkrete modell-ID-en og regionen før du vurderer Plus.

API-et støtter PCM, WAV, MP3 og Opus med opptil 48 kHz utdata. Alibaba tilbyr også ferdige stemmer, men språk og funksjoner varierer mellom stemmene. Det er enda en grunn til å sjekke den konkrete stemmen og regionen, ikke bare modellnavnet.

Hvor bred er språkstøtten?

Familien dekker 16 språk i materialet fra Tongyi Lab: arabisk, kinesisk, engelsk, fransk, tysk, indonesisk, italiensk, japansk, koreansk, malayisk, portugisisk, russisk, spansk, tagalog, thai og vietnamesisk. I tillegg omtales 20 kinesiske dialektområder. Norsk er ikke blant språkene.

Her er det viktig å skille mellom hva modellen kan generere med en klonet stemme, og hvilke ferdige systemstemmer som finnes. Alibaba Clouds modellside oppgir kinesisk og engelsk for systemstemmene, mens den bredere språklisten gjelder klonede stemmer og varierer mellom funksjoner. «16 språk» betyr altså ikke automatisk at du får 16 språk med samme ferdige stemmeutvalg og funksjonsnivå.

Tongyi Lab rapporterer at Flash fikk lavest gjennomsnittlig ord- eller tegnfeilrate med 3,87, mens Plus fikk 3,96 i en evaluering over de 16 språkene. Plus fikk samtidig høyest gjennomsnittlig stemmelikhet med 82,75 mot 80,44 for Flash. Tallene støtter arbeidsdelingen mellom modellene, men de kommer fra leverandørens egen evaluering. De sier heller ikke hvordan modellen håndterer norske navn, produktnavn eller blanding av språk i din tekst.

For norske brukere er dette dermed ikke en direkte erstatning for en talemodell som faktisk støtter norsk. Den kan likevel være relevant for internasjonale tjenester og særlig markeder i Asia. Qwen3.5-LiveTranslate-Flash viste allerede Alibabas satsing på flerspråklig tale. Denne gangen er fokuset selve stemmen ut, ikke oversettelsen.

Verdenskart viser 16 støttede språk i Qwen-Audio-3.0-TTS, men ikke norsk
Qwen-Audio-3.0-TTS dekker 16 språk, men norsk er ikke blant de offisielt støttede språkene.

Hva koster Qwen-Audio-3.0-TTS?

Alibabas internasjonale pristabell oppgir Plus til 0,20 dollar per 10 000 tegn og Flash til 0,15 dollar. Med en dollarkurs på omtrent 9,5 kroner blir det cirka 1,90 kroner for Plus og 1,40 kroner for Flash per 10 000 tegn. Per million tegn er prisen omtrent 20 dollar eller 190 kroner for Plus, og 15 dollar eller 140 kroner for Flash. Alibaba fakturerer etter antall tegn i teksten; den genererte lyden prises ikke separat. Kronebeløpene er omtrentlige fordi valutakursen varierer.

Flash koster dermed omtrent 25 prosent mindre per tegn enn Plus. Det passer godt med modellvalget: En stemmeagent som genererer mange korte svar, trenger lav ventetid og forutsigbar stykkpris. En ferdig fortellerstemme kan tåle høyere pris og lengre behandlingstid hvis resultatet faktisk låter bedre.

Pris per tegn er lett å forstå, men den er ikke hele driftskostnaden. Du må også ta høyde for samtidige jobber, feilforsøk, regional trafikk og eventuelle begrensninger i tjenesten. Alibaba oppgir en grense på tre jobbinnsendinger per sekund for begge modellene i Singapore og Beijing. Det er nok til mye, men ikke noe jeg ville oppdaget først etter at kampanjen gikk live.

Hvorfor er hosted-only en reell begrensning?

Qwen-Audio-3.0-TTS kan ikke lastes ned som åpne modellvekter. All syntese går gjennom Alibabas tjeneste. Dermed får du en ferdig skalerbar API-tjeneste og slipper å drifte modellen selv, men du mister lokal kontroll over kostnad, tilgjengelighet og hvor lyddataene behandles.

Navnet gjør dette litt forvirrende fordi Qwen3-TTS også finnes som en annen modellfamilie. Den eldre åpne linjen kan kjøres lokalt, mens Qwen-Audio-3.0-TTS er det nye driftede produktet med Flash og Plus. Ikke planlegg en lokal installasjon fordi du fant et Qwen3-TTS-repositorium. Det er ikke de samme modellene.

Jeg er generelt skeptisk til å lese «Qwen» og automatisk anta at åpne vekter kommer med på kjøpet. Her gjør de ikke det. For noen bedrifter er hosted-only helt greit. For andre er det diskvalifiserende fordi taleprøver, kundedialog eller konfidensiell tekst ikke skal sendes til en ekstern skytjeneste. Det er en arkitekturbeslutning, ikke en fotnote.

Det samme skillet gjelder når Qwen sammenlignes med tale-API-er fra andre leverandører. Gemini 3.1 Flash Live arbeider direkte med lyd og video i sanntid, mens Qwen-Audio-3.0-TTS er den siste delen av kjeden: tekst inn, tale ut. En komplett stemmeagent trenger fortsatt talegjenkjenning, språkmodell, verktøykall, avbruddshåndtering og god turstyring.

Hvem bør faktisk vurdere modellen?

Flash er mest interessant for utviklere som lager stemmeassistenter, samtalebaserte figurer eller kundeservice på et av de støttede språkene. Plus passer bedre til lydbøker, nyhetsopplesning, dubbing og annet produsert innhold. Begge er relevante når naturlig språkstyring av uttrykket er viktigere enn lokal kjøring.

Jeg ville likevel startet med en liten prøvepakke som ligner den virkelige jobben. Test navn, tall, forkortelser, lange avsnitt, språkbytter og dårlige referanseopptak. Mål tiden til første lyd fra infrastrukturen du faktisk skal bruke. Leverandørens beste tall er nyttige som retning, ikke som din ferdige tjenesteavtale.

Hovedfunnet er ganske jordnært: Alibaba har laget to driftede talemodeller med en fornuftig arbeidsdeling. Flash gir lavere pris og lav forsinkelse. Plus prioriterer stemmelikhet og kvalitet. Det er et troverdig produksjonsprodukt, men ikke en norsk, lokal eller åpen løsning. Velg det for det det faktisk er – ikke for alt Qwen-navnet får deg til å anta.

Ofte stilte spørsmål

Kan Qwen-Audio-3.0-TTS kjøres lokalt?

Nei. Flash og Plus leveres som driftede modeller gjennom Alibaba Cloud Model Studio. Det finnes andre Qwen3-TTS-modeller med åpne vekter, men de er en annen produktlinje og skal ikke forveksles med Qwen-Audio-3.0-TTS.

Støtter Qwen-Audio-3.0-TTS norsk tale?

Nei, norsk står ikke på listen over de 16 støttede språkene. Modellen retter seg blant annet mot kinesisk, engelsk, flere store europeiske språk og en rekke asiatiske språk. Norske navn i en ellers støttet tekst bør testes særskilt.

Hvilken variant passer best til en stemmeagent?

Flash er det naturlige startpunktet fordi modellen prioriterer lav forsinkelse og koster omtrent 25 prosent mindre per tegn enn Plus internasjonalt. Mål likevel faktisk ventetid, kapasitet og uttale i din region før du setter den i produksjon.

Kan begge variantene klone en stemme?

Dokumentasjonen spriker. Alibaba Clouds detaljerte modelltabell oppgir kloning for Flash, men ikke Plus, mens Qwen Clouds oversikt merker begge med egendefinert stemme. Verifiser derfor modell-ID, region og endepunkt før du gjør stemmekloning til et krav.

Legg igjen en kommentar

Din e-postadresse vil ikke bli publisert. Obligatoriske felt er merket med *

Meld deg på nyhetsbrevet

Få oppdateringer om AI nyhetene rett i inboxen!

Du liker kanskje denne også
Jan Sverre styrer et digitalt kontrollpanel omgitt av Claude AI-symboler og glødende lysstriper i et mørkt rom

Claude AI – pris, funksjoner og norsk guide (2026)

Alt om Claude AI i 2026 – priser i norske kroner, Claude Pro vs Max, Claude Code, og ærlig sammenligning med ChatGPT. Komplett norsk guide fra en som bruker Claude daglig.
Jan Sverre ser på en skjerm med Claude Code og er overrasket over påstanden om $5 000 kostnad per bruker

Claude Code Pris 2026 – Hva Koster Det Egentlig?

Forbes hevdet at Anthropic taper $5 000 per Claude Code Max-bruker. Men beregningen forveksler API-priser med faktiske produksjonskostnader. Gjennomsnittlig bruker koster Anthropic rundt $18 per måned — ikke $5 000.
Gpt53 codex

OpenAI svarer med GPT-5.3 Codex — selvforbedrende AI som bygget seg selv

Innhold Vis Hva er GPT-5.3 Codex?Fra kodeskriver til digital arbeiderKappløpet intensiveresMer drama…
Jan Sverre surfer på en bølge av ChatGPT-meldinger - komplett norsk guide til ChatGPT i 2026

ChatGPT Norsk Guide – Slik Kommer Du i Gang (2026)

Komplett norsk guide til ChatGPT i 2026. Slik kommer du i gang, hva det koster i norske kroner, beste tips, og ærlig sammenligning med Claude og Gemini.