Сервис Specific выпустил тест Real-SWE — модели чинят код, которого не видели
Сервис Specific опубликовал Real-SWE — тест, где модели чинят код не в открытых библиотеках, а в закрытых корпоративных репозиториях. Обычные тесты вроде SWE-bench собраны из публичного кода на GitHub, и модели этот код с большой вероятностью видели при обучении.
Авторы взяли реальные задачи из закрытых кодовых баз компаний и прогнали по ним модели. Смысл затеи — отделить умение решать задачу от запоминания готового ответа: на приватном коде подсмотреть негде.
В обсуждении спорят о главном ограничении такого теста: проверить результат со стороны нельзя, потому что сами задачи и код закрыты, и остаётся верить авторам на слово.
Что говорят
traceroute66Hacker News
То есть бенчмарк в принципе невоспроизводим? «Модель X отработала отлично, но про код мы ничего рассказать не можем, кроме того, что это большая кодовая база неизвестной компании». Бенчмаркинг под честное слово — в чём тут ценность?
IshKebabHacker News
По-моему, такие бенчмарки мало что дают: тут выходит, что Fable лучше Astra, а на практике Astra примерно в 5 раз быстрее и с ней куда приятнее работать. Вменяемых вариантов всего два-три — просто попробуйте все и выберите сами.
demibabsHacker News
«Каждая задача взята из приватной продакшн-кодовой базы, которую мы лицензировали у реальной компании» — а как это вообще устроено?