Модели сами вырабатывают предубеждения, а не наследуют их из данных — исследование
Исследование о том, что большие языковые модели вырабатывают собственные социальные предубеждения, вышло на OpenReview и собрало почти двести очков на Hacker News. Речь не о предвзятости, унаследованной из обучающих текстов, а о новых искажениях, которые появляются в ходе адаптивного исследования — когда модель сама пробует варианты поведения и закрепляет удачные.
Это меняет постановку задачи: чистка обучающих данных от таких предубеждений не спасает, потому что они возникают уже после обучения, в процессе взаимодействия.