OpenAIs nye tale-KI-modeller forbedrer transkripsjonsnøyaktigheten
OpenAIs stemme-KI-modeller retter seg nå mot sanntidstranskripsjon og ferdige lydfiler. ChatGPT-skrivebordsversjonen mottok nylig en stor Stemme-oppgradering, men OpenAI utvider også lydverktøyene sine for utviklere.
OpenAI introduserer to transkripsjonsmodeller
OpenAI annonserte to API-modeller kalt GPT-Live-Transcribe og GPT-Transcribe.
GPT-Live-Transcribe fokuserer på lav latenstid, sanntidstranskripsjon for direktesamtaler. GPT-Transcribe håndterer ferdige opptak og asynkrone batchbehandlingsjobber.
Begge modellene støtter kontekstbevisst transkripsjon. Utviklere kan oppgi nøkkelord, navn, bransjeterminologi og forventede språk for å hjelpe modellene med å forstå et opptak.
GPT-Live-Transcribe kan også bruke tidligere transkripsjonsrunder som kontekst under en pågående samtale.
Kontekst forbedrer transkripsjonsnøyaktighet
På OpenAIs Context Aware ASR-referansetest økte ekstra kontekst GPT-Live-Transcribes semantiske nøyaktighet fra 38,5 % til 44,6 %.
GPT-Transcribe forbedret seg fra 41,6 % til 45,2 % på den samme referansetesten.
OpenAI rapporterte også følgende transkripsjonsfeilrater på virkelig lyd:
- GPT-Live-Transcribe: 9,60 %
- GPT-Realtime-Whisper: 11,65 %
- GPT-Transcribe: 8,98 %
- Whisper-1: 15,21 %
Artificial Analysis målte uavhengig en ordfeilrate på 3,31 % for GPT-Transcribe. OpenAI tar $4,50 per 1 000 minutter med lyd prosessert med modellen.
I andre KI-nyheter introduserte Microsoft MAI-Cyber-1-Flash-modellen for å oppdage sikkerhetssårbarheter. Anthropic sa også at de ikke støtter forbud mot KI-modeller med åpen vekt, selv om selskapet fortsatt er bekymret for potensielle misbruk.
Via Neowin
Les siden for affiliate-avsløring for å finne ut hvordan du kan hjelpe Windows Report uten anstrengelse og uten å bruke penger. Read more
User forum
0 messages