OpenAIの新しい音声AIモデルが文字起こしの精度を向上させます
OpenAI の音声 AI モデルは、リアルタイム文字起こしと録音済み音声ファイルの両方をターゲットにしています。ChatGPT デスクトップ版は最近大規模な音声アップグレードを受けましたが、OpenAI は開発者向けの音声ツールも拡大しています。
OpenAI が 2 つの文字起こしモデルを発表
OpenAI は、GPT-Live-Transcribe と GPT-Transcribe と呼ばれる 2 つの API モデルを発表しました。
GPT-Live-Transcribe は、低遅延でリアルタイムの会話文字起こしに重点を置いています。GPT-Transcribe は、録音済みの音声や非同期バッチ処理のワークロードを処理します。
両モデルとも、コンテキストを考慮した文字起こしに対応しています。開発者はキーワード、名前、業界用語、予想される言語を提供し、モデルが録音内容を理解するのを支援できます。
GPT-Live-Transcribe は、進行中の会話の中で、以前の文字起こしターンをコンテキストとして利用することも可能です。
コンテキストが文字起こしの精度を向上させる
OpenAI の Context Aware ASR ベンチマークでは、追加のコンテキストにより、GPT-Live-Transcribe の意味的正確度が 38.5% から 44.6% に向上しました。
GPT-Transcribe は同じベンチマークで 41.6% から 45.2% に向上しました。
OpenAI は、実音声における文字起こしエラー率についても以下の数値を報告しています。
- GPT-Live-Transcribe: 9.60%
- GPT-Realtime-Whisper: 11.65%
- GPT-Transcribe: 8.98%
- Whisper-1: 15.21%
Artificial Analysis は独自に GPT-Transcribe の単語誤り率を 3.31% と測定しました。OpenAI は、このモデルで処理された音声 1,000 分あたり 4.50 米ドルを課金します。
その他の AI ニュースでは、Microsoft がセキュリティ脆弱性を検出するための MAI-Cyber-1-Flash モデルを発表しました。また、Anthropic はオープンウェイト AI モデルの禁止を支持しないと述べましたが、同社は潜在的な悪用について依然として懸念を示しています。
Neowin 経由
情報開示ページをご覧いただき、Windows Report の編集チームをどのように支援できるかをご確認ください。 Read more
User forum
0 messages