OpenAI:s nya röst-AI-modeller förbättrar transkriptionsnoggrannhet
OpenAI:s röst-AI-modeller riktar nu in sig på realtidstranskribering och färdiga ljudfiler. ChatGPT-skrivbordsappen fick nyligen en stor Voice-uppgradering, men OpenAI utökar även sina ljudverktyg för utvecklare.
OpenAI introducerar två transkriberingsmodeller
OpenAI tillkännagav två API-modeller som heter GPT-Live-Transcribe och GPT-Transcribe.
GPT-Live-Transcribe fokuserar på transkribering med låg latens i realtid för livekonversationer. GPT-Transcribe hanterar färdiga inspelningar och asynkrona batchbearbetningsbelastningar.
Båda modellerna stöder kontextmedveten transkribering. Utvecklare kan tillhandahålla nyckelord, namn, branschterminologi och förväntade språk för att hjälpa modellerna att förstå en inspelning.
GPT-Live-Transcribe kan också använda tidigare transkriberingsvändor som kontext under en pågående konversation.
Kontext förbättrar transkriberingsprecisionen
På OpenAI:s Context Aware ASR-riktmärke ökade extra kontext GPT-Live-Transcribes semantiska precision från 38,5 % till 44,6 %.
GPT-Transcribe förbättrades från 41,6 % till 45,2 % på samma riktmärke.
OpenAI rapporterade även följande transkriberingsfelfrekvenser på verkligt ljud:
- GPT-Live-Transcribe: 9.60%
- GPT-Realtime-Whisper: 11.65%
- GPT-Transcribe: 8.98%
- Whisper-1: 15.21%
Artificial Analysis uppmätte oberoende en ordfelsfrekvens på 3,31 % för GPT-Transcribe. OpenAI tar $4,50 per 1 000 minuter bearbetat ljud med modellen.
I andra AI-nyheter introducerade Microsoft modellen MAI-Cyber-1-Flash för att upptäcka säkerhetsbrister. Anthropic sa också att de inte stöder ett förbud mot AI-modeller med öppen vikt, även om företaget fortfarande är oroat över potentiellt missbruk.
Via Neowin
Läs sidan för affiliate avslöjande för att ta reda på hur du kan hjälpa Windows Report utan ansträngning och utan att spendera några pengar. Read more
User forum
0 messages