OpenAIs nye stemme-AI-modeller forbedrer transkripsjonsnøyaktighet
OpenAIs stemme-KI-modeller retter seg nå mot sanntidstranskripsjon og fullførte lydfiler. ChatGPT-skrivebordsappen fikk nylig en stor stemmeoppgradering, men OpenAI utvider også lydverktøyene sine for utviklere.
OpenAI introduserer to transkripsjonsmodeller
OpenAI kunngjorde to API-modeller kalt GPT-Live-Transcribe og GPT-Transcribe.
GPT-Live-Transcribe fokuserer på sanntidstranskripsjon med lav latenstid for direktesamtaler. GPT-Transcribe håndterer fullførte opptak og asynkrone batch-prosesseringsarbeidsbelastninger.
Begge modellene støtter kontekstbevisst transkripsjon. Utviklere kan oppgi nøkkelord, navn, bransjeterminologi og forventede språk for å hjelpe modellene med å forstå et opptak.
GPT-Live-Transcribe kan også bruke tidligere transkripsjonsrunder som kontekst under en pågående samtale.
Kontekst forbedrer transkripsjonsnøyaktigheten
På OpenAIs Context Aware ASR-referansetest økte ekstra kontekst GPT-Live-Transcribes semantiske nøyaktighet fra 38,5 % til 44,6 %.
GPT-Transcribe forbedret seg fra 41,6 % til 45,2 % på den samme referansetesten.
OpenAI rapporterte også følgende transkripsjonsfeilrater på virkelig lyd:
- GPT-Live-Transcribe: 9,60 %
- GPT-Realtime-Whisper: 11,65 %
- GPT-Transcribe: 8,98 %
- Whisper-1: 15,21 %
Artificial Analysis målte uavhengig en ordfeilrate på 3,31 % for GPT-Transcribe. OpenAI tar 4,50 dollar per 1 000 minutter med lyd behandlet med modellen.
I andre KI-nyheter introduserte Microsoft modellen MAI-Cyber-1-Flash for å oppdage sikkerhetssårbarheter. Anthropic uttalte også at selskapet ikke støtter et forbud mot KI-modeller med åpen vekt, selv om selskapet fortsatt er bekymret for potensielt misbruk.
Via Neowin
Les siden for affiliate-avsløring for å finne ut hvordan du kan hjelpe Windows Report uten anstrengelse og uten å bruke penger. Read more
User forum
0 messages