Les nouveaux modèles d’IA vocale d’OpenAI améliorent la précision de la transcription


Les modèles d’IA vocale d’OpenAI ciblent désormais la transcription en temps réel et les fichiers audio complétés. L’application de bureau ChatGPT a récemment reçu une mise à niveau majeure de la voix, mais OpenAI étend également ses outils audio pour les développeurs.

tipVous rencontrez toujours des problèmes? Corrigez-les avec cet outil:
Ce logiciel réparera les erreurs informatiques courantes, vous protégera contre la perte de fichiers, les logiciels malveillants et les pannes matérielles tout en optimisant les performances de votre PC. Réparez votre PC et supprimez les virus instantanément en 3 étapes faciles:
  1. Téléchargez l'outil Fortect
  2. Cliquez sur Analyser pour dépister les erreurs de votre PC.
  3. Cliquez sur Réparer pour résoudre les erreurs de sécurité et des performances du PC.
  • 0 utilisateurs ont téléchargé Fortect ce mois-ci.

OpenAI présente deux modèles de transcription

OpenAI a annoncé deux modèles d’API appelés GPT-Live-Transcribe et GPT-Transcribe.

GPT-Live-Transcribe se concentre sur la transcription en temps réel à faible latence pour les conversations en direct. GPT-Transcribe gère les enregistrements terminés et les charges de travail de traitement par lots asynchrones.

Les deux modèles prennent en charge la transcription contextuelle. Les développeurs peuvent fournir des mots-clés, des noms, une terminologie sectorielle et des langues attendues pour aider les modèles à comprendre un enregistrement.

GPT-Live-Transcribe peut également utiliser les tours de transcription précédents comme contexte au cours d’une conversation en cours.

Le contexte améliore la précision de la transcription

Sur le benchmark Context Aware ASR d’OpenAI, le contexte supplémentaire a fait passer la précision sémantique de GPT-Live-Transcribe de 38,5 % à 44,6 %.

GPT-Transcribe est passé de 41,6 % à 45,2 % sur le même benchmark.

OpenAI a également communiqué les taux d’erreur de transcription suivants sur des fichiers audio réels :

  • GPT-Live-Transcribe : 9,60 %
  • GPT-Realtime-Whisper : 11,65 %
  • GPT-Transcribe : 8,98 %
  • Whisper-1 : 15,21 %

Artificial Analysis a mesuré indépendamment un taux d’erreur de mots de 3,31 % pour GPT-Transcribe. OpenAI facture 4,50 $ par tranche de 1 000 minutes audio traitées avec le modèle.

Dans d’autres actualités sur l’IA, Microsoft a présenté le modèle MAI-Cyber-1-Flash pour la détection des vulnérabilités de sécurité. Anthropic a également déclaré ne pas soutenir l’interdiction des modèles d’IA à poids ouverts, bien que l’entreprise reste préoccupée par les utilisations abusives potentielles.

Via Neowin

Les lecteurs aident à soutenir Windows Report. Nous pouvons percevoir une commission si vous achetez via nos liens. Tooltip Icon

Consultez notre page de divulgation pour découvrir comment vous pouvez aider Windows Report à soutenir l'équipe éditoriale. Read more

User forum

0 messages