Перейти к содержимому
Соня Лебедева

Google выпустила голосовую Gemini 3.8 Live — час разговора стоит $1,38

Google выпустила две голосовые модели Gemini 3.8 Live: час диалога стоит около $1,38 против минимум $3 у OpenAI.

Google выпустила голосовую Gemini 3.8 Live — час разговора стоит $1,38

Google DeepMind представила две голосовые модели для разработчиков: Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Они уже доступны через Gemini API и Google AI Studio.

На их основе можно создавать голосовых ассистентов, которые продолжают разговор, пока обращаются к внешним сервисам через API. Модель также умеет обрабатывать изображение и поддерживает более 97 языков.

Версия Extended Thinking заняла первое место в рейтинге Speech-to-Speech от Artificial Analysis. Она набрала 82,6% и обошла новые модели OpenAI GPT-Live-1. Google опубликовала примеры приложений на GitHub, чтобы разработчики могли быстрее проверить технологию в своих проектах.

Главный аргумент Google — цена. Обработка входящего аудио стоит $0,005 за минуту, исходящего — $0,018. Час голосового диалога обойдётся примерно в $1,38. У GPT-Live-1 такой разговор стоит не менее $3.

Но лидерство в тестах не означает, что Gemini звучит естественнее. GPT-Live-1 работает в полнодуплексном режиме: модель может одновременно слушать человека и говорить. Благодаря этому собеседник может перебить ассистента, а паузы и смена реплик меньше напоминают разговор с автоответчиком.

Судя по демонстрациям, голос OpenAI также звучит живее. Google предлагает разработчикам другой компромисс: более низкую стоимость, поддержку десятков языков и высокие результаты в тестах — при менее естественной подаче.

Gemini 3.8 Live дешевле GPT-Live-1 более чем вдвое, но OpenAI пока сохраняет преимущество в качестве самого разговора.

Соня Лебедева
Все статьи
Читайте также
Все статьи