Google выпустила голосовую Gemini 3.8 Live — час разговора стоит $1,38
Google выпустила две голосовые модели Gemini 3.8 Live: час диалога стоит около $1,38 против минимум $3 у OpenAI.
Google DeepMind представила две голосовые модели для разработчиков: Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Они уже доступны через Gemini API и Google AI Studio.
На их основе можно создавать голосовых ассистентов, которые продолжают разговор, пока обращаются к внешним сервисам через API. Модель также умеет обрабатывать изображение и поддерживает более 97 языков.
Версия Extended Thinking заняла первое место в рейтинге Speech-to-Speech от Artificial Analysis. Она набрала 82,6% и обошла новые модели OpenAI GPT-Live-1. Google опубликовала примеры приложений на GitHub, чтобы разработчики могли быстрее проверить технологию в своих проектах.
Главный аргумент Google — цена. Обработка входящего аудио стоит $0,005 за минуту, исходящего — $0,018. Час голосового диалога обойдётся примерно в $1,38. У GPT-Live-1 такой разговор стоит не менее $3.
Но лидерство в тестах не означает, что Gemini звучит естественнее. GPT-Live-1 работает в полнодуплексном режиме: модель может одновременно слушать человека и говорить. Благодаря этому собеседник может перебить ассистента, а паузы и смена реплик меньше напоминают разговор с автоответчиком.
Судя по демонстрациям, голос OpenAI также звучит живее. Google предлагает разработчикам другой компромисс: более низкую стоимость, поддержку десятков языков и высокие результаты в тестах — при менее естественной подаче.
Gemini 3.8 Live дешевле GPT-Live-1 более чем вдвое, но OpenAI пока сохраняет преимущество в качестве самого разговора.