OpenAIs nye stemme-AI-modeller forbedrer transskriptionsnøjagtighed
OpenAIs stemme-AI-modeller sigter nu mod transskription i realtid og færdige lydfiler. ChatGPT desktop fik for nylig en stor Voice-opgradering, men OpenAI udvider også sine lydværktøjer til udviklere.
OpenAI introducerer to transskriptionsmodeller
OpenAI annoncerede to API-modeller kaldet GPT-Live-Transcribe og GPT-Transcribe.
GPT-Live-Transcribe fokuserer på lav latenstid og transskription i realtid til live-samtaler. GPT-Transcribe håndterer færdige optagelser og asynkrone batchbehandlingsopgaver.
Begge modeller understøtter kontekstbevidst transskription. Udviklere kan angive nøgleord, navne, brancheterminologi og forventede sprog for at hjælpe modellerne med at forstå en optagelse.
GPT-Live-Transcribe kan også bruge tidligere transskriptionssekvenser som kontekst under en igangværende samtale.
Kontekst forbedrer transskriptionsnøjagtigheden
I OpenAI’s Context Aware ASR-benchmark øgede yderligere kontekst GPT-Live-Transcribes semantiske nøjagtighed fra 38,5 % til 44,6 %.
GPT-Transcribe forbedredes fra 41,6 % til 45,2 % i samme benchmark.
OpenAI rapporterede også følgende transskriptionsfejlprocenter på lyd fra virkelige optagelser:
- GPT-Live-Transcribe: 9,60 %
- GPT-Realtime-Whisper: 11,65 %
- GPT-Transcribe: 8,98 %
- Whisper-1: 15,21 %
Artificial Analysis målte uafhængigt en ordfejlrate på 3,31 % for GPT-Transcribe. OpenAI opkræver 4,50 USD pr. 1.000 minutter lyd, der behandles med modellen.
I andre AI-nyheder introducerede Microsoft modellen MAI-Cyber-1-Flash til at opdage sikkerhedssårbarheder. Anthropic sagde også, at det ikke støtter et forbud mod open-weight AI-modeller, selvom virksomheden forbliver bekymret over potentielt misbrug.
Via Neowin
Læs siden med affiliate offentliggørelse for at finde ud af, hvordan du kan hjælpe Windows Report ubesværet og uden at bruge nogen penge. Read more
User forum
0 messages