Les nouveaux modèles vocaux d’IA d’OpenAI améliorent la précision de la transcription


Les modèles vocaux d’OpenAI ciblent désormais la transcription en temps réel et les fichiers audio terminés. ChatGPT desktop a récemment reçu une mise à jour majeure de la Voix, mais OpenAI étend également ses outils audio pour les développeurs.

tipVous rencontrez toujours des problèmes? Corrigez-les avec cet outil:
Ce logiciel réparera les erreurs informatiques courantes, vous protégera contre la perte de fichiers, les logiciels malveillants et les pannes matérielles tout en optimisant les performances de votre PC. Réparez votre PC et supprimez les virus instantanément en 3 étapes faciles:
  1. Téléchargez l'outil Fortect
  2. Cliquez sur Analyser pour dépister les erreurs de votre PC.
  3. Cliquez sur Réparer pour résoudre les erreurs de sécurité et des performances du PC.
  • 0 utilisateurs ont téléchargé Fortect ce mois-ci.

OpenAI présente deux modèles de transcription

OpenAI a annoncé deux modèles d’API appelés GPT-Live-Transcribe et GPT-Transcribe.

GPT-Live-Transcribe se concentre sur la transcription à faible latence et en temps réel pour les conversations en direct. GPT-Transcribe gère les enregistrements terminés et les charges de travail de traitement par lots asynchrones.

Les deux modèles prennent en charge la transcription consciente du contexte. Les développeurs peuvent fournir des mots-clés, des noms, une terminologie sectorielle et des langues attendues pour aider les modèles à comprendre un enregistrement.

GPT-Live-Transcribe peut également utiliser les tours de transcription précédents comme contexte pendant une conversation en cours.

Le contexte améliore la précision de la transcription

Sur le benchmark Context Aware ASR d’OpenAI, le contexte supplémentaire a augmenté la précision sémantique de GPT-Live-Transcribe de 38,5 % à 44,6 %.

GPT-Transcribe est passé de 41,6 % à 45,2 % sur le même benchmark.

OpenAI a également indiqué les taux d’erreur de transcription suivants sur des enregistrements audio réels :

  • GPT-Live-Transcribe : 9,60 %
  • GPT-Realtime-Whisper : 11,65 %
  • GPT-Transcribe : 8,98 %
  • Whisper-1 : 15,21 %

Artificial Analysis a mesuré indépendamment un taux d’erreur de mots de 3,31 % pour GPT-Transcribe. OpenAI facture 4,50 $ par tranche de 1 000 minutes d’audio traitées avec le modèle.

Dans d’autres actualités sur l’IA, Microsoft a présenté le modèle MAI-Cyber-1-Flash pour la détection des vulnérabilités de sécurité. Anthropic a également déclaré ne pas soutenir l’interdiction des modèles d’IA à poids ouverts, bien que l’entreprise reste préoccupée par un usage abusif potentiel.

Via Neowin

Les lecteurs aident à soutenir Windows Report. Nous pouvons percevoir une commission si vous achetez via nos liens. Tooltip Icon

Consultez notre page de divulgation pour découvrir comment vous pouvez aider Windows Report à soutenir l'équipe éditoriale. Read more

User forum

0 messages