OpenAIの新しい音声AIモデルが文字起こし精度を向上


OpenAIの音声AIモデルが、リアルタイムの文字起こしと完了した音声ファイルを対象とするようになりました。ChatGPTデスクトップ版は最近、音声機能の大幅なアップグレードを受けましたが、OpenAIは開発者向けの音声ツールも拡大しています。

OpenAIが2つの文字起こしモデルを発表

OpenAIは、GPT-Live-TranscribeとGPT-Transcribeと呼ばれる2つのAPIモデルを発表しました。

GPT-Live-Transcribeは、ライブ会話向けの低レイテンシなリアルタイム文字起こしに重点を置いています。GPT-Transcribeは、完了した録音や非同期のバッチ処理ワークロードを処理します。

両モデルとも、コンテキストアウェアな文字起こしをサポートします。開発者は、キーワード、名前、業界用語、想定される言語を提供して、モデルが録音内容を理解しやすくすることができます。

GPT-Live-Transcribeは、進行中の会話中に、以前の文字起こしのターンをコンテキストとして使用することもできます。

コンテキストが文字起こし精度を向上させる

OpenAIのContext Aware ASRベンチマークでは、追加のコンテキストにより、GPT-Live-Transcribeのセマンティック精度が38.5%から44.6%に向上しました。

GPT-Transcribeは同じベンチマークで41.6%から45.2%に向上しました。

OpenAIはまた、実際の音声に対する以下の文字起こしエラー率を報告しました。

  • GPT-Live-Transcribe: 9.60%
  • GPT-Realtime-Whisper: 11.65%
  • GPT-Transcribe: 8.98%
  • Whisper-1: 15.21%

Artificial Analysisが独自に測定したところ、GPT-Transcribeの単語誤り率は3.31%でした。OpenAIは、このモデルで処理された音声1,000分あたり4.50米ドルを請求します。

その他のAIニュースでは、Microsoftがセキュリティ脆弱性を検出するMAI-Cyber-1-Flashモデルを発表しました。Anthropicも、オープンウェイトAIモデルの禁止を支持しないと述べましたが、悪用の可能性については依然として懸念しています。

Neowin経由

読者の皆様のご支援が Windows Report を支えています。当サイトのリンクを経由してご購入いただいた場合、当社が手数料を受け取ることがあります。 Tooltip Icon

情報開示ページをご覧いただき、Windows Report の編集チームをどのように支援できるかをご確認ください。 Read more

User forum

0 messages