OpenAIs nye stemme-AI-modeller forbedrer transskriptionsnøjagtighed
OpenAIs voice AI-modeller sigter nu mod transskription i realtid og færdige lydfiler. ChatGPT-skrivebordsappen modtog for nylig en stor Voice-opgradering, men OpenAI udvider også sine lydværktøjer til udviklere.
OpenAI introducerer to transskriptionsmodeller
OpenAI annoncerede to API-modeller kaldet GPT-Live-Transcribe og GPT-Transcribe.
GPT-Live-Transcribe fokuserer på transskription i realtid med lav latenstid til live-samtaler. GPT-Transcribe håndterer færdige optagelser og asynkrone batch-processeringsopgaver.
Begge modeller understøtter kontekstbevidst transskription. Udviklere kan angive nøgleord, navne, brancheterminologi og forventede sprog for at hjælpe modellerne med at forstå en optagelse.
GPT-Live-Transcribe kan også bruge tidligere transskriptionsrunder som kontekst under en igangværende samtale.
Kontekst forbedrer transskriptionsnøjagtigheden
På OpenAIs Context Aware ASR-benchmark øgede yderligere kontekst GPT-Live-Transcribes semantiske nøjagtighed fra 38,5 % til 44,6 %.
GPT-Transcribe forbedredes fra 41,6 % til 45,2 % på det samme benchmark.
OpenAI rapporterede også følgende transskriptionsfejlrate på lydoptagelser fra den virkelige verden:
- GPT-Live-Transcribe: 9,60 %
- GPT-Realtime-Whisper: 11,65 %
- GPT-Transcribe: 8,98 %
- Whisper-1: 15,21 %
Artificial Analysis målte uafhængigt en ordfejlsrate på 3,31 % for GPT-Transcribe. OpenAI opkræver $4,50 pr. 1.000 minutters behandlet lyd med modellen.
I andre AI-nyheder introducerede Microsoft MAI-Cyber-1-Flash-modellen til registrering af sikkerhedssårbarheder. Anthropic sagde også, at det ikke støtter et forbud mod open-weight AI-modeller, selvom virksomheden fortsat er bekymret for potentielt misbrug.
Via Neowin
Læs siden med affiliate offentliggørelse for at finde ud af, hvordan du kan hjælpe Windows Report ubesværet og uden at bruge nogen penge. Read more
User forum
0 messages