Meta научила агента собирать наборы задач — без человека выходит хуже

Команда Джейсона Уэстона из Meta показала AutoBenchmark — систему, которая сама составляет наборы задач для проверки моделей и попутно меряет качество самого составления.
Главный вывод работы: полностью автоматическая сборка набора проигрывает, а совместная работа человека и агента даёт заметный выигрыш. То есть участие человека в цикле остаётся не формальностью, а источником качества теста.
Jason Weston@jaseweston
⏱️⚙️Introducing *AutoBenchmark* 📊🏁 - Creating benchmarks automatically - Benchmarking benchmark creation - Studying the role & impact of humans in the loop Blog post: https://t.co/yv9Qph6UsQ Key takeaways: 1) We find human-agent collaboration gives big wins over agents https://t.co/PpoYBHGyB7
38230 сентября 2026