OpenAI’s nye stemme-AI-modeller forbedrer transskriptionsnøjagtighed
OpenAI’s stemme-AI-modeller sigter nu mod transskribering i realtid og færdige lydfiler. ChatGPT-skrivebordsappen modtog for nylig en stor stemmeopgradering, men OpenAI udvider også sine lydværktøjer til udviklere.
OpenAI introducerer to transskriberingsmodeller
OpenAI annoncerede to API-modeller kaldet GPT-Live-Transcribe og GPT-Transcribe.
GPT-Live-Transcribe fokuserer på transskribering med lav latenstid til live-samtaler. GPT-Transcribe håndterer færdige optagelser og asynkrone batch-behandlingsopgaver.
Begge modeller understøtter kontekstbaseret transskribering. Udviklere kan angive nøgleord, navne, brancheterminologi og forventede sprog for at hjælpe modellerne med at forstå en optagelse.
GPT-Live-Transcribe kan også bruge tidligere transskriberingssekvenser som kontekst under en igangværende samtale.
Kontekst forbedrer transskriberingsnøjagtigheden
På OpenAI’s Context Aware ASR-benchmark øgede ekstra kontekst GPT-Live-Transcribes semantiske nøjagtighed fra 38,5 % til 44,6 %.
GPT-Transcribe forbedrede sig fra 41,6 % til 45,2 % på samme benchmark.
OpenAI rapporterede også følgende transskriberingsfejlprocenter på lyd fra den virkelige verden:
- GPT-Live-Transcribe: 9,60 %
- GPT-Realtime-Whisper: 11,65 %
- GPT-Transcribe: 8,98 %
- Whisper-1: 15,21 %
Artificial Analysis målte uafhængigt en ordfejlrate på 3,31 % for GPT-Transcribe. OpenAI opkræver $4,50 pr. 1.000 minutters lyd behandlet med modellen.
I andre AI-nyheder introducerede Microsoft modellen MAI-Cyber-1-Flash til at opdage sikkerhedssårbarheder. Anthropic sagde også, at virksomheden ikke støtter et forbud mod open-weight AI-modeller, selvom den fortsat er bekymret over potentielt misbrug.
Via Neowin
Læs siden med affiliate offentliggørelse for at finde ud af, hvordan du kan hjælpe Windows Report ubesværet og uden at bruge nogen penge. Read more
User forum
0 messages