Модель обучили только на текстах уровня пятого класса
Проект LittleLearner проверял, что будет, если языковая модель никогда не увидит текста сложнее школьного: корпус для обучения ограничили материалами примерно до пятого класса. Идея — понять, сколько в способностях моделей идёт от объёма данных, а сколько от их сложности.
Модель осваивает грамматику и связную речь, но упирается в потолок там, где нужны понятия, которых в корпусе не было: рассуждение по нескольким шагам и специальная лексика не появляются сами. Авторы выложили и сам корпус, и результаты замеров.
В обсуждении сравнивают это с человеческим обучением и спорят, корректна ли аналогия: ребёнок помимо книг видит мир, а модель — только текст.
Что говорят
uniq7Hacker News
Спрашиваю «почему небо синее» — а в ответ: солнце посылает УФ и инфракрасные волны, часть застревает в атмосфере, волны бьются о молекулы, рассеивают синие, те отскакивают и попадают нам в глаза. И это «отфильтровано по программе американской начальной школы», ага.
montebicycleloHacker News
Работа классная, но главный вопрос — сама фильтрация текстов до уровня «не выше пятого класса». В статье показаны только примеры того, что исключили, датасет вроде ещё не выложен; хотелось бы выборочной проверки людьми, а не только валидации по другим датасетам.
mindwokHacker News
Одна из главных проблем LLM — неспособность сказать «нет». Не в смысле «я не знаю», а иметь субъективную причину не делать что-то: бесконечное соглашательство в итоге подрывает доверие.