OpenAIs nye stemme-KI-modeller forbedrer transkripsjonsnøyaktigheten
OpenAI stemme-KI-modeller retter seg nå mot sanntidstranskripsjon og fullførte lydfiler. Skrivebordsversjonen av ChatGPT fikk nylig en stor stemmeoppgradering, men OpenAI utvider også sine lydverktøy for utviklere.
OpenAI introduserer to transkripsjonsmodeller
OpenAI kunngjorde to API-modeller kalt GPT-Live-Transcribe og GPT-Transcribe.
GPT-Live-Transcribe fokuserer på lav latens og sanntidstranskripsjon for direktesamtaler. GPT-Transcribe håndterer fullførte opptak og asynkrone batchprosesseringsoppgaver.
Begge modellene støtter kontekstavhengig transkripsjon. Utviklere kan oppgi nøkkelord, navn, bransjeterminologi og forventede språk for å hjelpe modellene med å forstå et opptak.
GPT-Live-Transcribe kan også bruke tidligere transkripsjonsrunder som kontekst under en pågående samtale.
Kontekst forbedrer transkripsjonsnøyaktigheten
I OpenAIs Context Aware ASR-referansetest økte ekstra kontekst GPT-Live-Transcribes semantiske nøyaktighet fra 38,5 % til 44,6 %.
GPT-Transcribe ble forbedret fra 41,6 % til 45,2 % i den samme testen.
OpenAI rapporterte også følgende transkripsjonsfeilrater på virkelige lydopptak:
- GPT-Live-Transcribe: 9,60 %
- GPT-Realtime-Whisper: 11,65 %
- GPT-Transcribe: 8,98 %
- Whisper-1: 15,21 %
Artificial Analysis målte uavhengig en ordfeilrate på 3,31 % for GPT-Transcribe. OpenAI tar $4,50 per 1 000 minutter med lyd som behandles med modellen.
I andre KI-nyheter introduserte Microsoft modellen MAI-Cyber-1-Flash for å oppdage sikkerhetssårbarheter. Anthropic sa også at de Anthropic sier de ikke støtter forbud mot AI-modeller med åpen vekt, selv om selskapet fortsatt er bekymret for potensiell misbruk.
Via Neowin
Les siden for affiliate-avsløring for å finne ut hvordan du kan hjelpe Windows Report uten anstrengelse og uten å bruke penger. Read more
User forum
0 messages