Cognition выпустила модель SWE-2 под инженерные задачи

Cognition выпустила SWE-2 — модель под инженерные задачи, ту, что стоит за агентом Devin. Компания заявляет результат 92,8 на Terminal-Bench 2.1 — наборе задач, где агент работает в терминале и должен довести работу до конца, а не просто предложить правку.
По заявлению Cognition, модель держится на уровне Fable 5.1 и GPT-Astra. В обсуждении спорят о привычном: замер на своём агенте сравнивают с чужими моделями в чужом коде вокруг модели. Разница в этом коде даёт разброс в десятки пунктов.
Что говорят
mydreamofHacker News
Похоже на подгонку под бенчмарки: на Terminal-Bench 4 результаты не блестящие. И почему не показали остальные тесты?
scronkfinkleHacker News
Поправьте, если ошибаюсь, но для использования, кажется, нужен Devin? Обидно, что для работы с агентом требуется их собственная платформа — скорее всего, я так и не попробую.
_doctor_loveHacker News
SWE-1.5 при последнем использовании оказалась на удивление хороша. Мне кажется, Cognition — один из крепких игроков, который остаётся в тени, пока Anthropic и OpenAI несутся к IPO.