Новый закон масштабирования связал размер модели и объём данных одной формулой

Законы масштабирования — формулы, которые предсказывают качество модели по её размеру и количеству данных для обучения. Два известных варианта, Kaplan и Chinchilla, дают разные рекомендации, сколько данных брать на каждый параметр, и спор между ними тянется годами.
Исследователи из Meta AI предложили формулу Skaling, которая объединяет оба случая: размер модели и объём данных входят в неё через единую связку, и прежние законы получаются как частные случаи при разных допущениях. Код выложен в репозитории lingua.
Разбор в канале gonzo_ML идёт с оговорками: обобщённая формула красиво сшивает известные результаты, но проверить её предсказательную силу за пределами обученного диапазона авторам пока нечем.