OpenAI выпустила голосовую модель, которую можно перебивать
OpenAI открыла API к GPT-Live-1: модель одновременно говорит и слушает, быстрее реагирует на реплики и стоит $0,05 за минуту.
OpenAI открыла разработчикам доступ к GPT-Live-1 — голосовой модели, которая умеет одновременно слушать человека и отвечать ему. Такой режим называется полным дуплексом. Благодаря ему разговор с ИИ меньше похож на обмен голосовыми сообщениями: модель слышит собеседника даже во время собственной реплики и может вовремя остановиться.
GPT-Live-1 уже работает внутри ChatGPT. Теперь компании смогут подключать модель через API и создавать голосовых операторов, помощников и сервисы для телефонных звонков.
Разработчики могут сочетать GPT-Live-1 с разными моделями на сервере. Для простого запроса можно выбрать быстрый и дешёвый вариант, а для сложной задачи — модель с более глубоким рассуждением. Сам голосовой API стоит $0,05 за минуту разговора.
По тестам OpenAI, новая модель заметно лучше справляется с живым диалогом. В тесте на интерактивность GPT-Live-1 набрала 80,1% против 45,4% у GPT-Realtime-2.1. Задержка при передаче хода сократилась с 1,4 до 0,8 секунды.
Точность вызова внешних инструментов выросла с 60% до 87%. Это важно для сценариев, где голосовой агент должен не только говорить, но и проверить расписание, оформить заказ или изменить бронь. В тесте банковской голосовой поддержки доля успешно выполненных заданий поднялась с 12,4% до 32%.
Сервис Yelp уже использует GPT-Live-1 для бронирования по телефону. Технический директор Yelp Алекс Леви заявил, что модель лучше справляется со звонками.
В API также появились 12 новых голосов с разными акцентами, диалектами и языками. Расшифровка речи пользователя и текст ответа доступны сразу.
Главное изменение — голосовой ИИ больше не обязан ждать тишины, чтобы понять, что ему можно отвечать. При цене $3 за час разговора массовые телефонные сервисы всё равно должны внимательно считать экономику.