OpenAI:s nya röst-AI-modeller förbättrar transkriptionsnoggrannheten
OpenAI:s röst-AI-modeller riktar nu in sig på transkribering i realtid och färdiga ljudfiler. ChatGPT:s skrivbordsversion fick nyligen en stor uppgradering av Voice, men OpenAI utökar också sina ljudverktyg för utvecklare.
OpenAI introducerar två transkriberingsmodeller
OpenAI tillkännagav två API-modeller vid namn GPT-Live-Transcribe och GPT-Transcribe.
GPT-Live-Transcribe fokuserar på transkribering med låg latens i realtid för livesamtal. GPT-Transcribe hanterar färdiga inspelningar och asynkrona batchbearbetningsarbetsbelastningar.
Båda modellerna stöder kontextmedveten transkribering. Utvecklare kan tillhandahålla nyckelord, namn, branschterminologi och förväntade språk för att hjälpa modellerna att förstå en inspelning.
GPT-Live-Transcribe kan också använda tidigare transkriberingsvändor som kontext under pågående konversation.
Kontext förbättrar transkriberingsprecisionen
På OpenAI:s benchmark för kontextmedveten ASR ökade ytterligare kontext GPT-Live-Transcribes semantiska precision från 38,5 % till 44,6 %.
GPT-Transcribe förbättrades från 41,6 % till 45,2 % på samma benchmark.
OpenAI rapporterade även följande felfrekvenser för transkribering på verkligt ljud:
- GPT-Live-Transcribe: 9.60%
- GPT-Realtime-Whisper: 11.65%
- GPT-Transcribe: 8.98%
- Whisper-1: 15.21%
Artificial Analysis mätte oberoende en ordfelsfrekvens på 3,31 % för GPT-Transcribe. OpenAI tar 4,50 dollar per 1 000 minuter bearbetat ljud med modellen.
I andra AI-nyheter introducerade Microsoft modellen MAI-Cyber-1-Flash för att upptäcka säkerhetsbrister. Anthropic sade också att de inte stöder ett förbud mot AI-modeller med öppen vikt, även om företaget fortfarande är oroat över potentiellt missbruk.
Via Neowin
Läs sidan för affiliate avslöjande för att ta reda på hur du kan hjälpa Windows Report utan ansträngning och utan att spendera några pengar. Read more
User forum
0 messages