OpenAIs neue Sprach-KI-Modelle verbessern die Transkriptionsgenauigkeit
OpenAI-Sprach-KI-Modelle zielen jetzt auf Echtzeit-Transkription und abgeschlossene Audiodateien ab. Der ChatGPT-Desktop erhielt kürzlich ein umfangreiches Voice-Upgrade, doch OpenAI erweitert auch seine Audio-Tools für Entwickler.
OpenAI stellt zwei Transkriptionsmodelle vor
OpenAI kündigte zwei API-Modelle mit den Namen GPT-Live-Transcribe und GPT-Transcribe an.
GPT-Live-Transcribe konzentriert sich auf latenzarme Echtzeit-Transkription für Live-Gespräche. GPT-Transcribe verarbeitet abgeschlossene Aufnahmen und asynchrone Batch-Verarbeitungslasten.
Beide Modelle unterstützen kontextbewusste Transkription. Entwickler können Schlüsselwörter, Namen, Branchenterminologie und erwartete Sprachen bereitstellen, um den Modellen zu helfen, eine Aufnahme zu verstehen.
GPT-Live-Transcribe kann zudem frühere Transkriptionsdurchgänge als Kontext während eines laufenden Gesprächs nutzen.
Kontext verbessert die Transkriptionsgenauigkeit
Auf OpenAIs Context-Aware-ASR-Benchmark steigerte zusätzlicher Kontext die semantische Genauigkeit von GPT-Live-Transcribe von 38,5 % auf 44,6 %.
GPT-Transcribe verbesserte sich auf demselben Benchmark von 41,6 % auf 45,2 %.
OpenAI meldete zudem die folgenden Transkriptionsfehlerraten bei realen Audioaufnahmen:
- GPT-Live-Transcribe: 9,60 %
- GPT-Realtime-Whisper: 11,65 %
- GPT-Transcribe: 8,98 %
- Whisper-1: 15,21 %
Artificial Analysis maß unabhängig eine Wortfehlerrate von 3,31 % für GPT-Transcribe. OpenAI berechnet 4,50 $ pro 1.000 verarbeitete Audiominuten mit dem Modell.
In weiteren KI-Nachrichten stellte Microsoft das Modell MAI-Cyber-1-Flash zur Erkennung von Sicherheitslücken vor. Anthropic erklärte zudem, dass es ein Verbot von Open-Weight-KI-Modellen nicht unterstützt, obwohl das Unternehmen weiterhin über möglichen Missbrauch besorgt ist.
Via Neowin
Lesen Sie unsere Offenlegungsseite, um zu erfahren, wie Sie Windows Report dabei helfen können, das Redaktionsteam zu unterstützen. Read more
User forum
0 messages