Данные без единой ошибки учат модель хуже данных с браком — разбор Селектела

Селектел разобрал контринтуитивный результат из практики обучения моделей: датасет без единой ошибки не всегда лучший. Если в обучающих данных примерно процент неверных ответов, модель учится не копировать разметку слепо, а искать закономерность.
Аналогия из статьи — школьник по учебнику с редкими опечатками в ответах: он всё равно решает новые задачи, потому что опирается на метод, а не на сверку с ключом. Идеально вычищенный набор, наоборот, подталкивает модель запоминать конкретные пары «вопрос — ответ».
Практический смысл: тратить бюджет на вычистку последнего процента разметки не всегда окупается, а иногда вредит.