Модель начинает обобщать скачком, а не плавно — замер Стэнфорда и Беркли
Исследователи из Стэнфорда и Беркли проследили, в какой момент при обучении языковая модель перестаёт угадывать по поверхностным признакам и начинает обобщать. Для этого они брали частые промежуточные сохранения весов — чекпоинты — у открытых моделей и смотрели, как меняется поведение между ними.
Вывод: переход происходит не плавно. Чекпоинты одной и той же модели различаются по способности обобщать сильнее, чем по привычным метрикам качества, и выбрать «лучший» по итоговой потере не получается — он может оказаться хуже соседнего.
Авторы называют это лотереей: момент остановки обучения влияет на обобщение почти случайно.