Исследователи проверили, не помнят ли модели задачи популярного теста наизусть

Исследователи выложили статью, которая проверяет, решают ли модели задачи SWE-bench — популярного набора задач по починке реальных багов в открытых репозиториях — или помнят их из обучения. Название работы обыгрывает кота Шрёдингера: репозиторий одновременно и знаком модели, и нет.
Авторы сравнивают поведение моделей на задачах из публичного набора и на свежих, попавших в репозитории после отсечки обучающих данных. Расхождение результатов и есть мера запоминания.
Работа вышла в подборке HuggingFace Daily Papers, отбираемой голосами сообщества.