Sakana AI обучила сеть из тысячи слоёв без обратного распространения ошибки
Sakana AI показала PC-ALM — способ обучать нейросети без обратного распространения ошибки, главного алгоритма современного машинного обучения. В обычной схеме ошибка считается на выходе сети и градиенты передаются назад через все слои, из-за чего слои нельзя считать независимо.
В PC-ALM каждый слой — локальная система, которая обменивается сигналами только с соседями. Так удалось обучить сеть глубиной до тысячи слоёв, где обратное распространение обычно ломается на затухающих градиентах.
Метод пока показан на исследовательских задачах, а не на больших языковых моделях; о выигрыше в скорости обучения авторы не заявляют.
Что говорят
cs702Hacker News
~85% точности на MNIST. Вздох. А что на CIFAR-10 или, ещё лучше, на ImageNet? Исследование интересное, но что это альтернатива обратному распространению — не уверен. (Правка: на MNIST не ~90%, а ~85%.)
lukeinator42Hacker News
Есть масса интересных работ про предиктивное кодирование как способ решить задачу распределения ответственности за ошибку — и он, возможно, биологически правдоподобнее. Особенно понравилась статья, где показано, что правило обучения на предиктивном кодировании даёт в точности те же градиенты, что и backprop, в произвольных сетях: «Predictive Coding Approximates Backprop Along Arbitrary Computation Graphs».
rao-vHacker News
Интересно, можно ли взять обычную LLM, обученную через backprop, и применить этот подход к файнтюну — памяти и вычислений, видимо, нужно меньше? Ещё один вариант в спектре между LoRA и полным файнтюном.