Microsoft lancerer tre lydmodeller til stemmeassistenter
Microsoft har lanceret en model til løbende transskription og to modeller til talegenerering. De nye modeller kan afprøves nu, men de er stadig i offentlig preview uden SLA og bør ikke bruges til produktionsopgaver endnu.
Microsoft har lanceret tre nye lydmodeller: MAI-Transcribe-2-Streaming, MAI-Voice-2.1 og MAI-Voice-2.1-Flash. Den første omsætter en løbende lydstrøm til tekst, mens de to andre danner tale ud fra tekst.
Det relevante for danske udviklere er ikke blot, at Microsoft har fået nye stemmemodeller. MAI-Voice-2.1 og MAI-Voice-2.1-Flash har begge to danske standardstemmer. Microsofts SDK-dokumentation angiver desuden dansk med sprogkoden da som understøttet af MAI-Transcribe-2. Det dokumenterer sprogunderstøttelse, men siger ikke noget om modellens nøjagtighed på dansk eller om adgang i alle Azure-regioner.
Tre modeller med hver sin opgave
MAI-Transcribe-2-Streaming er lavet til realtidstransskription. Modellen modtager lyd som en kontinuerlig strøm og sender foreløbige tekstresultater tilbage, mens personen taler. Resultaterne kan blive rettet undervejs, hvorefter hvert segment afsluttes med en endelig tekst. Microsoft fremhæver blandt andet liveundertekster, mødenoter og stemmestyrede brugerflader som mulige anvendelser.
MAI-Voice-2.1 er tekst til tale med fokus på høj lydkvalitet, udtryk og længere oplæsninger. Microsoft retter den blandt andet mod lydbøger, podcasts og undervisningsindhold.
MAI-Voice-2.1-Flash understøtter de samme 23 sprog som MAI-Voice-2.1, men er optimeret til lavere svartid. Den er derfor den mest oplagte af de to til en stemmeassistent, et interaktivt telefonsystem eller en anden samtale, hvor svaret skal komme hurtigt.
Microsoft oplyser, at MAI-Voice-2.1-Flash kan danne op til 45 sekunders lyd med 150 millisekunders samlet svartid. Det er en leverandøroplysning, ikke et resultat af en test foretaget af AIBI.

Begge Voice-modeller har dansk tale
Den aktuelle modeloversigt viser to danske standardstemmer:
da-DK-Grant
- Sprogvariant: Dansk, Danmark.
- Modeller:
MAI-Voice-2.1ogMAI-Voice-2.1-Flash. - Angivne stilarter: Agent, kundecenter, undervisning, fortæller og neutral.
da-DK-Harper
- Sprogvariant: Dansk, Danmark.
- Modeller:
MAI-Voice-2.1ogMAI-Voice-2.1-Flash. - Angivne stilarter: Agent, lydbog, kundecenter, undervisning, fortæller og neutral.
De to stemmer er muligheder for at generere dansk tale. Det skal holdes adskilt fra talegenkendelse: Microsoft dokumenterer dansk som understøttet af MAI-Transcribe-2, mens Voice-modellerne bruger de navngivne danske stemmer ovenfor. AIBI har ikke testet nogen af modellerne og vurderer derfor hverken transskriptionsnøjagtighed, udtalekvalitet eller egnethed til en bestemt dansk opgave.
Begge Voice-modeller kan også efterligne en godkendt referencestemme fra et lydklip på 5 til 60 sekunder. Den funktion er adgangsbegrænset. Man skal søge Microsoft om adgang, indsende samtykke og have rettigheder til stemmen. Den er derfor ikke en åben genvej til at klone en vilkårlig persons stemme.
Modellerne er tilgængelige, men stadig i preview
Alle tre modeller er i offentlig preview i Azure Speech. Microsoft skriver udtrykkeligt, at preview-funktionerne leveres uden en serviceaftale, også kaldet SLA, og ikke anbefales til produktionsopgaver. Funktioner kan desuden mangle eller have begrænsninger.
Det betyder, at en udvikler kan afprøve modellerne og bygge en prototype, men ikke bør basere en kritisk telefonlinje eller anden drift på den nuværende preview-status. Før produktion bør man som minimum vente på en produktionsklar status, kontrollere de gældende vilkår og gennemføre egne test af sprog, forsinkelse, fejl og belastning.
MAI-Transcribe-2-Streaming kan integreres gennem en OpenAI Realtime-kompatibel WebSocket-forbindelse eller Azure Speech SDK. Begge metoder leverer foreløbige og endelige transskriptioner.
MAI-Voice-2.1 og MAI-Voice-2.1-Flash kan bruges gennem Azure Speech API og SDK. De kan også afprøves i Microsoft Foundry. Azure Voice Live er en yderligere kanal til Voice-modellerne, og Microsofts lancering nævner desuden OpenRouter for de to Voice-modeller. Microsofts lancering angiver Foundry, MAI Playground, Vercel og Azure Voice Live som adgangsveje til alle tre, mens LiveKit står som kommende.
Azure-dokumentationen angiver global adgang til begge Voice-modeller med rutning til en række Azure-regioner, herunder North Europe, West Europe og Sweden Central. Det er ikke det samme som, at behandlingen nødvendigvis sker i den region, brugeren befinder sig i. Den dokumenterede danske sprogunderstøttelse for transskription er heller ikke i sig selv dokumentation for adgang i alle regioner. Krav til regional tilgængelighed, dataplacering og personoplysninger skal derfor afklares særskilt før en virkelig løsning.
Et lukket eksempel: Lav en dansk prøveoplæsning
Dette konstruerede eksempel viser den korteste vej til at høre en af de danske standardstemmer. Det kræver et Azure-abonnement og en Microsoft Foundry-ressource til Speech. Eksemplet bruger ikke stemmekloning.
- Åbn tekst til tale i Microsoft Foundry, og vælg Open in playground.
- Vælg en stemme med det fulde navn
da-DK-Harper:MAI-Voice-2.1-Flash. - Indsæt denne tekst: “Din tid er flyttet til torsdag klokken 14. Du kan ændre den i selvbetjeningen.”
- Vælg Play.
- Lyt efter, om dato, klokkeslæt og sammensatte danske ord udtales tydeligt. Prøv derefter
da-DK-Grant:MAI-Voice-2.1-Flashmed præcis samme tekst, så sammenligningen ikke ændrer flere forhold på én gang. - Hvis begge stemmer udtaler et vigtigt navn eller fagord forkert, skal teksten eller udtalen justeres og prøves igen. Brug ikke eksemplet som bevis for generel kvalitet. Test også løsningens egne navne, tal, forkortelser og støjforhold, før den indgår i en større prototype.
Når Play vælges, er det forventede resultat en oplæsning af den indsatte danske tekst med den valgte standardstemme. AIBI har ikke udført dette eksempel og vurderer derfor ikke den faktiske lydkvalitet.
Prisoplysningerne er introduktionstilbud
I lanceringen angiver Microsoft en introduktionspris på 0,54 dollar pr. lydtime for MAI-Transcribe-2-Streaming frem til udgangen af 2026. MAI-Voice-2.1 er angivet til 22 dollar pr. million tegn, mens MAI-Voice-2.1-Flash er angivet til 15 dollar pr. million tegn.
Priserne stammer fra lanceringen den 1. oktober 2026. De bør kontrolleres på Microsofts aktuelle prisside før et budget eller en businesscase fastlægges, især fordi transskriptionsprisen udtrykkeligt er tidsbegrænset.
Hvad ændrer lanceringen i praksis?
Microsoft samler nu de centrale dele af en stemmeassistent i sin egen modelserie: løbende tale til tekst, behandling i en applikation eller anden model og et hurtigt talt svar. Det kan gøre Microsofts platform mere interessant for udviklere, der allerede bruger Azure Speech.
En stemmeassistent bliver dog først en samlet AI-agent, når applikationen også har logik til at formulere svar og eventuelt bruge værktøjer. Læs AIBI’s forklaring af AI-agenter for forskellen mellem en enkelt modelkomponent og et system, der løser opgaver i flere trin.
Den danske nyhed omfatter begge retninger. De to Voice-modeller kan generere dansk tale med navngivne danske standardstemmer, og Microsoft dokumenterer dansk som understøttet af MAI-Transcribe-2. Dokumentationen er ikke en AIBI-test og viser ikke dansk nøjagtighed, egnethed til en bestemt opgave eller adgang i alle regioner. Samtidig gør preview-status uden SLA, at modellerne foreløbig bør behandles som teknologi til afprøvning og prototyper, ikke som en færdig produktionsløsning.
