OpenAIs nye stemme-AI-modeller forbedrer transskriptionsnøjagtigheden
OpenAIs stemmebaserede AI-modeller sigter nu mod transskription i realtid og færdige lydfiler. ChatGPT desktop fik for nylig en stor Voice-opgradering, men OpenAI udvider også sine lydværktøjer til udviklere.
OpenAI introducerer to transskriptionsmodeller
OpenAI annoncerede to API-modeller kaldet GPT-Live-Transcribe og GPT-Transcribe.
GPT-Live-Transcribe fokuserer på transskription med lav latenstid i realtid til live-samtaler. GPT-Transcribe håndterer færdige optagelser og asynkrone batch-behandlingsopgaver.
Begge modeller understøtter kontekstbevidst transskription. Udviklere kan angive søgeord, navne, brancheterminologi og forventede sprog for at hjælpe modellerne med at forstå en optagelse.
GPT-Live-Transcribe kan også bruge tidligere transskriptionsrunder som kontekst under en igangværende samtale.
Kontekst forbedrer transskriptionsnøjagtigheden
På OpenAI’s Context Aware ASR-benchmark øgede ekstra kontekst GPT-Live-Transcribes semantiske nøjagtighed fra 38,5 % til 44,6 %.
GPT-Transcribe forbedrede sig fra 41,6 % til 45,2 % på samme benchmark.
OpenAI rapporterede også følgende transskriptionsfejlprocenter på lyd fra den virkelige verden:
- GPT-Live-Transcribe: 9,60 %
- GPT-Realtime-Whisper: 11,65 %
- GPT-Transcribe: 8,98 %
- Whisper-1: 15,21 %
Artificial Analysis målte uafhængigt en ordfejlprocent på 3,31 % for GPT-Transcribe. OpenAI opkræver $4.50 pr. 1.000 minutters lyd behandlet med modellen.
I andre AI-nyheder introducerede Microsoft modellen MAI-Cyber-1-Flash til at opdage sikkerhedssårbarheder. Anthropic sagde også, at det ikke støtter et forbud mod open-weight AI-modeller, selvom virksomheden fortsat er bekymret for potentiel misbrug.
Via Neowin
Læs siden med affiliate offentliggørelse for at finde ud af, hvordan du kan hjælpe Windows Report ubesværet og uden at bruge nogen penge. Read more
User forum
0 messages