Sierra открыла тест на то, насколько хорошо модель строит других агентов
Sierra открыла исходники hyper-τ-bench — теста, который меряет и то, как модель работает агентом, и то, как она такого агента собирает. Публикация вышла под названием τ^τ-bench.
Брет Тейлор из Sierra объясняет мотив: сегодня большинство агентов строят с помощью других агентов, у самой Sierra для этого есть инструмент Ghostwriter. Значит, полезно мерить именно способность модели выстроить работающего агента на длинном горизонте, а не пройти отдельный сценарий самой.
Bret Taylor@btaylor
Today, most agents are built with the help of other agents like Sierra's Ghostwriter. Yesterday, Sierra open-sourced hyper-𝜏-bench (published as 𝜏^𝜏-bench), a new long horizon agent evaluation that measures how well models can not only act as an agent, but construct one.
629 сентября 2026