OpenAIの新しい音声AIモデルが文字起こしの精度を向上させます


OpenAI の音声 AI モデルは、リアルタイム文字起こしと録音済み音声ファイルの両方をターゲットにしています。ChatGPT デスクトップ版は最近大規模な音声アップグレードを受けましたが、OpenAI は開発者向けの音声ツールも拡大しています。

OpenAI が 2 つの文字起こしモデルを発表

OpenAI は、GPT-Live-Transcribe と GPT-Transcribe と呼ばれる 2 つの API モデルを発表しました。

GPT-Live-Transcribe は、低遅延でリアルタイムの会話文字起こしに重点を置いています。GPT-Transcribe は、録音済みの音声や非同期バッチ処理のワークロードを処理します。

両モデルとも、コンテキストを考慮した文字起こしに対応しています。開発者はキーワード、名前、業界用語、予想される言語を提供し、モデルが録音内容を理解するのを支援できます。

GPT-Live-Transcribe は、進行中の会話の中で、以前の文字起こしターンをコンテキストとして利用することも可能です。

コンテキストが文字起こしの精度を向上させる

OpenAI の Context Aware ASR ベンチマークでは、追加のコンテキストにより、GPT-Live-Transcribe の意味的正確度が 38.5% から 44.6% に向上しました。

GPT-Transcribe は同じベンチマークで 41.6% から 45.2% に向上しました。

OpenAI は、実音声における文字起こしエラー率についても以下の数値を報告しています。

  • GPT-Live-Transcribe: 9.60%
  • GPT-Realtime-Whisper: 11.65%
  • GPT-Transcribe: 8.98%
  • Whisper-1: 15.21%

Artificial Analysis は独自に GPT-Transcribe の単語誤り率を 3.31% と測定しました。OpenAI は、このモデルで処理された音声 1,000 分あたり 4.50 米ドルを課金します。

その他の AI ニュースでは、Microsoft がセキュリティ脆弱性を検出するための MAI-Cyber-1-Flash モデルを発表しました。また、Anthropic はオープンウェイト AI モデルの禁止を支持しないと述べましたが、同社は潜在的な悪用について依然として懸念を示しています。

Neowin 経由

読者の皆様のご支援が Windows Report を支えています。当サイトのリンクを経由してご購入いただいた場合、当社が手数料を受け取ることがあります。 Tooltip Icon

情報開示ページをご覧いただき、Windows Report の編集チームをどのように支援できるかをご確認ください。 Read more

User forum

0 messages