Novos Modelos de IA de Voz da OpenAI Melhoram a Precisão da Transcrição
Os modelos de IA de voz da OpenAI visam agora a transcrição em tempo real e ficheiros de áudio concluídos. A aplicação de secretária do ChatGPT recebeu recentemente uma grande atualização de Voz, mas a OpenAI também está a expandir as suas ferramentas de áudio para programadores.
OpenAI apresenta dois modelos de transcrição
A OpenAI anunciou dois modelos de API chamados GPT-Live-Transcribe e GPT-Transcribe.
O GPT-Live-Transcribe foca-se na transcrição em tempo real e de baixa latência para conversas ao vivo. O GPT-Transcribe processa gravações concluídas e cargas de trabalho de processamento assíncrono em lote.
Ambos os modelos suportam transcrição sensível ao contexto. Os programadores podem fornecer palavras-chave, nomes, terminologia da indústria e idiomas esperados para ajudar os modelos a compreender uma gravação.
O GPT-Live-Transcribe também pode utilizar turnos de transcrição anteriores como contexto durante uma conversa em curso.
O contexto melhora a precisão da transcrição
Na referência Context Aware ASR da OpenAI, o contexto adicional aumentou a precisão semântica do GPT-Live-Transcribe de 38,5% para 44,6%.
O GPT-Transcribe melhorou de 41,6% para 45,2% na mesma referência.
A OpenAI também comunicou as seguintes taxas de erro de transcrição em áudio real:
- GPT-Live-Transcribe: 9,60%
- GPT-Realtime-Whisper: 11,65%
- GPT-Transcribe: 8,98%
- Whisper-1: 15,21%
A Artificial Analysis mediu de forma independente uma taxa de erro de palavras de 3,31% para o GPT-Transcribe. A OpenAI cobra 4,50 dólares por cada 1.000 minutos de áudio processado com o modelo.
Noutras notícias de IA, a Microsoft apresentou o modelo MAI-Cyber-1-Flash para detetar vulnerabilidades de segurança. A Anthropic também afirmou que não apoia a proibição de modelos de IA de peso aberto, embora a empresa continue preocupada com a potencial utilização indevida.
Via Neowin
Leia a nossa página de divulgação para descobrir como pode ajudar o Windows Report a sustentar a equipe editorial. Read more
User forum
0 messages