GPT-5.6 Sol научилась видеть предметы, но за точность приходится платить
GPT-5.6 Sol резко улучшила поиск и подсчёт объектов, но не превзошла GPT-5.5 в чтении и извлечении текста.
OpenAI представила семейство GPT-5.6 из трёх моделей: Sol, Terra и Luna. Главный скачок произошёл в работе с изображениями — прежде всего в поиске и подсчёте объектов.
Компания Roboflow проверила модели на своём готовящемся бенчмарке для систем компьютерного зрения. Он охватывает распознавание объектов, подсчёт, чтение текста и извлечение данных из изображений.
В тесте на поиск объектов Sol набрала 46,2 mAP@50 против 13,8 у GPT-5.5. Эта метрика показывает, насколько точно модель находит предметы и обводит их рамками. Terra получила 44,7, а Luna — 43,3.
Sol уверенно разбирала структуру документов: находила заголовки, абзацы, таблицы, изображения и подписи. Модель также справлялась с плотными сценами, где рядом находится много похожих предметов, например таблеток или яиц.
Но результат сильно зависит от запроса. GPT-5.6 лучше работает, когда координаты рамок задаются в пикселях в формате XYXY. Неподходящий формат снижал показатель примерно на 15 пунктов.
На изображениях размером около 2000 × 2000 пикселей и больше Sol иногда размещала рамки в случайных местах. OpenAI подтвердила Roboflow, что модель становится менее стабильной на крупных картинках при низком уровне рассуждений. Практическое решение — заранее уменьшать или обрезать изображение.
В подсчёте объектов Sol набрала 73% против 64,9% у GPT-5.5. Даже самая дешёвая Luna превзошла прежнюю модель и получила 66,2%.
С чтением текста прогресса нет. Результат Sol составил 90,7% против 91,2% у GPT-5.5. При извлечении отдельных данных новая модель отстала ещё сильнее: 82,5% против 87,6%.
Sol обрабатывала одно изображение почти 10 секунд и стоила около 2,5 цента. Luna укладывалась примерно в пять секунд и обходилась дешевле половины цента. По тестам Roboflow, Sol стала лучшей зрительной моделью OpenAI, но для массовой обработки изображений её цена и задержка остаются ограничением.