OpenAI:s nya röst-AI-modeller förbättrar transkriptionsnoggrannheten
OpenAI:s röst-AI-modeller riktar nu in sig på transkribering i realtid och färdiga ljudfiler. ChatGPT desktop fick nyligen en stor röstuppgradering, men OpenAI utökar också sina ljudverktyg för utvecklare.
OpenAI introducerar två transkriberingsmodeller
OpenAI tillkännagav två API-modeller som heter GPT-Live-Transcribe och GPT-Transcribe.
GPT-Live-Transcribe fokuserar på transkribering med låg latens i realtid för livesamtal. GPT-Transcribe hanterar färdiga inspelningar och asynkrona batchbearbetningsarbetsbelastningar.
Båda modellerna stöder kontextmedveten transkribering. Utvecklare kan tillhandahålla nyckelord, namn, branschterminologi och förväntade språk för att hjälpa modellerna att förstå en inspelning.
GPT-Live-Transcribe kan också använda tidigare transkriberingsvändor som kontext under ett pågående samtal.
Kontext förbättrar transkriberingsnoggrannheten
I OpenAI:s kontextmedvetna ASR-riktmärke ökade ytterligare kontext GPT-Live-Transcribes semantiska noggrannhet från 38,5 % till 44,6 %.
GPT-Transcribe förbättrades från 41,6 % till 45,2 % i samma riktmärke.
OpenAI rapporterade även följande transkriberingsfelfrekvenser på verkligt ljud:
- GPT-Live-Transcribe: 9,60 %
- GPT-Realtime-Whisper: 11,65 %
- GPT-Transcribe: 8,98 %
- Whisper-1: 15,21 %
Artificial Analysis mätte oberoende en ordelfrekvens på 3,31 % för GPT-Transcribe. OpenAI tar 4,50 dollar per 1 000 minuter bearbetat ljud med modellen.
I andra AI-nyheter introducerade Microsoft modellen MAI-Cyber-1-Flash för att upptäcka säkerhetssårbarheter. Anthropic sa också att de inte stöder ett förbud mot AI-modeller med öppen vikt, även om företaget fortfarande är oroligt för potentiellt missbruk.
Via Neowin
Läs sidan för affiliate avslöjande för att ta reda på hur du kan hjälpa Windows Report utan ansträngning och utan att spendera några pengar. Read more
User forum
0 messages