OpenAI:s nya röst-AI-modeller förbättrar transkriptionsnoggrannheten
OpenAI:s röst-AI-modeller riktar nu in sig på transkribering i realtid och bearbetning av färdiga ljudfiler. ChatGPT-skrivbordsappen fick nyligen en stor röstuppgradering, men OpenAI utökar även sina ljudverktyg för utvecklare.
OpenAI introducerar två transkriberingsmodeller
OpenAI tillkännagav två API-modeller som heter GPT-Live-Transcribe och GPT-Transcribe.
GPT-Live-Transcribe fokuserar på transkribering med låg latens i realtid för livekonversationer. GPT-Transcribe hanterar färdiga inspelningar och asynkrona batchbearbetningsarbetsbelastningar.
Båda modellerna stöder kontextmedveten transkribering. Utvecklare kan ange nyckelord, namn, branschterminologi och förväntade språk för att hjälpa modellerna att förstå en inspelning.
GPT-Live-Transcribe kan också använda tidigare transkriberingsomgångar som kontext under en pågående konversation.
Kontext förbättrar transkriberingsnoggrannheten
I OpenAI:s Context Aware ASR-riktmärke ökade ytterligare kontext GPT-Live-Transcribes semantiska noggrannhet från 38,5 % till 44,6 %.
GPT-Transcribe förbättrades från 41,6 % till 45,2 % i samma riktmärke.
OpenAI rapporterade även följande felfrekvenser för transkribering på verkligt ljud:
- GPT-Live-Transcribe: 9.60%
- GPT-Realtime-Whisper: 11.65%
- GPT-Transcribe: 8.98%
- Whisper-1: 15.21%
Artificial Analysis uppmätte oberoende en 3.31 % ordfelsfrekvens för GPT-Transcribe. OpenAI tar $4,50 per 1 000 minuter ljud som bearbetas med modellen.
I andra AI-nyheter introducerade Microsoft modellen MAI-Cyber-1-Flash för att upptäcka säkerhetsbrister. Anthropic sade också att de inte stöder ett förbud mot AI-modeller med öppen vikt, även om företaget fortfarande är oroade över potentiellt missbruk.
Via Neowin
Läs sidan för affiliate avslöjande för att ta reda på hur du kan hjälpa Windows Report utan ansträngning och utan att spendera några pengar. Read more
User forum
0 messages