OpenAIの新しい音声AIモデルが文字起こし精度を向上
OpenAIの音声AIモデルは、リアルタイムの文字起こしと録音済みの音声ファイルに対応することを目指しています。ChatGPTデスクトップ版は最近、音声(Voice)機能の大幅なアップグレードが行われましたが、OpenAIは開発者向けの音声ツールの拡充も進めています。
OpenAIが2つの文字起こしモデルを発表
OpenAIは、GPT-Live-TranscribeとGPT-Transcribeと呼ばれる2つのAPIモデルを発表しました。
GPT-Live-Transcribeは、ライブ会話向けの低遅延なリアルタイム文字起こしに特化しています。GPT-Transcribeは、録音済みの音声や非同期のバッチ処理ワークロードを処理します。
両モデルはコンテキスト認識型の文字起こしをサポートしています。開発者は、キーワード、名前、業界用語、想定される言語を提供して、モデルが録音内容を理解しやすくすることができます。
GPT-Live-Transcribeは、進行中の会話中に、以前の文字起こしのターンをコンテキストとして利用することも可能です。
コンテキストにより文字起こしの精度が向上
OpenAIのContext Aware ASRベンチマークでは、追加のコンテキストにより、GPT-Live-Transcribeの意味的正確性が38.5%から44.6%に向上しました。
GPT-Transcribeは同じベンチマークで41.6%から45.2%に向上しました。
OpenAIは実際の音声における以下の文字起こしエラー率も報告しました:
- GPT-Live-Transcribe: 9.60%
- GPT-Realtime-Whisper: 11.65%
- GPT-Transcribe: 8.98%
- Whisper-1: 15.21%
Artificial Analysisが独自に測定したところ、GPT-Transcribeの単語誤り率は3.31%でした。OpenAIは、このモデルで処理された音声1,000分あたり4.50ドルを課金します。
その他のAI関連ニュースでは、Microsoftがセキュリティ脆弱性を検出するためのMAI-Cyber-1-Flashモデルを発表しました。また、Anthropicは、オープンウェイトAIモデルの禁止を支持していないと述べましたが、悪用の可能性については依然として懸念しています。
経由: Neowin
情報開示ページをご覧いただき、Windows Report の編集チームをどのように支援できるかをご確認ください。 Read more
User forum
0 messages