Перейти к содержимому
Иван Полев

Cognition обновила ИИ-агента Devin: почти как GPT-5.5, но за 2 доллара

Cognition выпустила модель SWE-1.7 для агента Devin с показателями, близкими к GPT-5.5 и Opus 4.8, но дешевле — доступна только внутри платформы.

Cognition обновила ИИ-агента Devin: почти как GPT-5.5, но за 2 доллара

Cognition, компания, которая делает ИИ-агента для программирования Devin, выпустила новую модель — SWE-1.7. С 8 июля она работает внутри Devin: в веб-версии, десктопном приложении и командной строке.

Компания заявляет, что модель показывает результаты, близкие к топовым моделям рынка, но обходится дешевле. На бенчмарке FrontierCode 1.1 Main — тесте самой Cognition на основе реальных pull request’ов — SWE-1.7 набрала 42,3%. У GPT-5.5 там 43%, у Opus 4.8 — 46,5%. На Terminal-Bench 2.1 у SWE-1.7 81,5% против 84,2% у GPT-5.5 и 86,9% у Opus 4.8. А вот на SWE-Bench Multilingual модель обошла GPT-5.5 — 77,8% против 76,8%, хотя обеим моделям Anthropic всё равно уступает.

Главный аргумент Cognition — цена: компания оценивает стоимость одной задачи на FrontierCode Main в 1,97 доллара. Модель обучена на базе Kimi K2.7 Code с дополнительным обучением с подкреплением и техникой самосжатия контекста — агент периодически суммирует свою работу, чтобы не упираться в лимит памяти. Работает модель через инфраструктуру Cerebras на скорости 1000 токенов в секунду.

Важная деталь: SWE-1.7 доступна только внутри Devin. Открытых весов или отдельного API компания не публикует — значит, локально развернуть модель или встроить её в свой стек не получится.

Есть и скепсис. На Hacker News пользователь под ником pants2 спросил: «Какова вероятность, что бенчмарк CursorBench ставит модель Cursor на первое место, а бенчмарк Cognition — модель Cognition?» Дело в том, что и модель, и тест FrontierCode принадлежат самой Cognition — это не отменяет результатов, но означает, что перед покупкой стоит проверить их на своих задачах, а не доверять только цифрам вендора.

SWE-1.7 — это модель для конкретного продукта, а не самостоятельный релиз. Оценивать её стоит не по бенчмаркам, а по тому, сколько правок агента реально доходит до мержа после проверки человеком.

Иван Полев
Все статьи
Читайте также
Все статьи