Яндекс.Метрика
← Дайджест от 12 сентября 2026

Сервис Specific выпустил тест Real-SWE — модели чинят код, которого не видели

Сервис Specific опубликовал Real-SWE — тест, где модели чинят код не в открытых библиотеках, а в закрытых корпоративных репозиториях. Обычные тесты вроде SWE-bench собраны из публичного кода на GitHub, и модели этот код с большой вероятностью видели при обучении.

Авторы взяли реальные задачи из закрытых кодовых баз компаний и прогнали по ним модели. Смысл затеи — отделить умение решать задачу от запоминания готового ответа: на приватном коде подсмотреть негде.

В обсуждении спорят о главном ограничении такого теста: проверить результат со стороны нельзя, потому что сами задачи и код закрыты, и остаётся верить авторам на слово.