OpenAI научила ИИ расшифровывать речь под музыку — и почти без ошибок
OpenAI представила две новые модели распознавания речи — для live-транскрибации и пакетной обработки аудио, обе точнее whisper-1.
OpenAI выпустила в своём API две новые модели распознавания речи — GPT Transcribe и GPT Live Transcribe.
GPT Live Transcribe сделана для расшифровки речи в реальном времени с минимальной задержкой — подходит для звонков и live-субтитров. GPT Transcribe, наоборот, рассчитана на пакетную обработку уже готовых аудиофайлов.
Обе модели лучше понимают контекст разговора, включая профессиональные термины, и справляются с шумным звуком. В демонстрации OpenAI показала, как модель точно расшифровывает речь человека, который параллельно играет на музыкальном инструменте.
По бенчмаркам OpenAI, GPT Transcribe ошибается реже, чем старая модель whisper-1. Она также обходит по точности gpt-realtime-whisper — модель, которую компания выпустила в мае 2026 года.
Транскрибация речи — базовая функция для голосовых ассистентов, субтитров и обработки звонков.