«ГигаЧат» научился слышать эмоции в голосе и искать нужный момент в трёхчасовой записи
Сбербанк обновил GigaChat Audio: нейросеть распознаёт эмоции по голосу и работает с записями до трёх часов.
Сбербанк обновил голосовую нейросеть GigaChat Audio, которая работает внутри ИИ-помощника «ГигаЧат». Модель обрабатывает звук напрямую, без промежуточного перевода речи в текст.
Главное новшество — распознавание эмоций. Нейросеть анализирует интонацию, тембр и особенности произношения и понимает, обращается к ней раздражённый человек или тот, кто делится хорошей новостью. Отвечать она теперь старается соответственно тону разговора.
Изменилась и работа с длинными записями. Модель принимает аудио до трёх часов и ориентируется внутри него: можно спросить, в какой момент обсуждали конкретный вопрос, попросить пересказать отрезок или получить саммари со ссылками на таймкоды. Нейросеть также различает голоса разных говорящих — это пригодится для протоколирования встреч и звонков.
Появилась и память: «ГигаЧат» запоминает факты из голосового разговора и использует их в следующих сессиях — например, учитывает пожелания при составлении маршрута поездки. Все записи можно посмотреть, отредактировать или отключить в настройках профиля.
По внутренним тестам Arena Hard Audio, где нейросети вслепую сравнивают ответы на одинаковые голосовые вопросы, GigaChat Audio набрала 75% побед — почти как у Gemini-3-Flash-preview (77,5%) и выше, чем у Gemini-2.5-Pro (62%). Точность распознавания эмоций у модели Сбербанка — 80%, у Qwen3-Omni-30B — 70%, у Kimi-Audio — 62%.
Сбербанк выложил в открытый доступ облегчённую версию модели — GigaChat3.1-Audio-10B — и отдельное семейство GigaAM Multilingual для распознавания речи. Это первая российская открытая модель, работающая с несколькими языками: русским, английским, киргизским, казахским и узбекским. По заявленным замерам, она ошибается в полтора-два раза реже конкурентов при распознавании русской речи. Обе модели уже доступны на GitVerse и Hugging Face.