DeepSeek научила V4 видеть изображения и открыла модель по лицензии MIT
DeepSeek открыла 305-миллиардную модель V4 с распознаванием изображений и результатами на уровне Claude Opus 4.8.
Китайская DeepSeek выпустила DeepSeek-V4-Flash-Vision-Exp — первую мультимодальную модель семейства V4, которая принимает не только текст, но и изображения. Экспериментальная версия опубликована с открытыми весами по лицензии MIT.
Модель содержит 305 млрд параметров. За основу разработчики взяли архитектуру DeepSeek-V4-Flash, добавили модуль обработки изображений и обучили систему работать с визуальными данными.
По опубликованным результатам, новая версия сохранила текстовые возможности DeepSeek-V4-Flash-0731 и получила сопоставимые или более высокие оценки. В испытаниях с визуальными заданиями DeepSeek-V4-Flash-Vision-Exp оказалась на уровне Claude Opus 4.8. На тестах Agents’ Last Exam и ZeroBench она обошла модель Anthropic, а в Chartography отстала на 0,7 балла.
Модель доступна через API. Он принимает JPEG, PNG, GIF и WebP. Максимальная длина стороны изображения составляет 8192 пикселя, но при загрузке 15 и более файлов лимит снижается до 4096 пикселей.
Большие изображения автоматически уменьшаются с сохранением пропорций примерно до площади 800 × 800 пикселей. Благодаря этому одно изображение занимает не более 384 токенов. Такой подход удерживает расходы под контролем, но мелкие детали исходника могут потеряться после масштабирования.
В часы пик миллион входных токенов стоит $0,44, кэшированных — $0,014, а выходных — $1,32. Вне пиковой нагрузки тарифы снижаются вдвое. Пиковыми считаются интервалы с 01:00 до 04:00 и с 06:00 до 10:00 UTC по будням.
DeepSeek добавила зрение в крупную модель V4 без заметной потери текстовых результатов и сразу открыла её для локального запуска и коммерческой разработки.