OpenAI's nieuwe Voice AI-modellen verbeteren de transcriptienauwkeurigheid
OpenAI spraak-AI-modellen richten zich nu op real-time transcriptie en voltooide audiobestanden. De ChatGPT-desktopversie kreeg onlangs een grote Voice-update, maar OpenAI breidt ook zijn audiotools voor ontwikkelaars uit.
OpenAI introduceert twee transcriptiemodellen
OpenAI kondigde twee API-modellen aan, genaamd GPT-Live-Transcribe en GPT-Transcribe.
GPT-Live-Transcribe richt zich op transcriptie met lage latentie en real-time voor livegesprekken. GPT-Transcribe verwerkt voltooide opnames en asynchrone batchverwerkingswerklasten.
Beide modellen ondersteunen contextbewuste transcriptie. Ontwikkelaars kunnen sleutelwoorden, namen, vakterminologie en verwachte talen opgeven om de modellen te helpen een opname te begrijpen.
GPT-Live-Transcribe kan tijdens een lopend gesprek ook eerdere transcriptiebeurten als context gebruiken.
Context verbetert de nauwkeurigheid van transcriptie
Op OpenAI’s Context Aware ASR-benchmark verhoogde extra context de semantische nauwkeurigheid van GPT-Live-Transcribe van 38,5% naar 44,6%.
GPT-Transcribe verbeterde op dezelfde benchmark van 41,6% naar 45,2%.
OpenAI rapporteerde ook de volgende transcriptiefoutpercentages op real-world audio:
- GPT-Live-Transcribe: 9,60%
- GPT-Realtime-Whisper: 11,65%
- GPT-Transcribe: 8,98%
- Whisper-1: 15,21%
Artificial Analysis mat onafhankelijk een woordfoutpercentage van 3,31% voor GPT-Transcribe. OpenAI rekent $4,50 per 1.000 minuten verwerkte audio met het model.
In ander AI-nieuws introduceerde Microsoft het MAI-Cyber-1-Flash-model voor het detecteren van beveiligingskwetsbaarheden. Anthropic gaf ook aan het verbieden van AI-modellen met open gewichten niet te steunen, hoewel het bedrijf zich zorgen blijft maken over mogelijk misbruik.
Via Neowin
Lees de pagina met affiliate onthullingen om erachter te komen hoe u Windows Report moeiteloos en zonder geld uit te geven kunt helpen. Read more
User forum
0 messages