Anthropic дала Claude 48 часов, и он сам предложил и проверил методы выравнивания
Anthropic дала Claude 48 часов и один ускоритель, чтобы улучшить выравнивание маленьких моделей — то есть их склонность следовать инструкциям и не вредить. Работа вышла в программе Fellows, где внешние исследователи работают внутри компании.
Модель сама придумывала методы, потом обучала и тестировала подопытные модели без человека в цикле. Anthropic пишет, что сработало неожиданно хорошо. Ограничения жёсткие: маленькие модели, двое суток, одна карта — то есть проверялась не полная замена исследователя, а способность вести короткий самостоятельный цикл экспериментов.
Anthropic@AnthropicAI
New Fellows Research: Can Claude autonomously align other AIs? We gave Claude 48 hours and 1 GPU to improve the alignment of small models. It researched and proposed methods, then trained and tested the models on its own. It worked surprisingly well. https://t.co/nhlCMgQl46
2 67728 августа 2026