Появился тест Terminal-Bench-Science — агентов проверяют на полном научном цикле

Вышел бенчмарк Terminal-Bench-Science — набор задач, который проверяет агентов на реальных научных процессах в командной строке. Речь не про ответы на вопросы, а про полный цикл: обработать данные, запустить расчёт, собрать результат.
Под ту же задачу с другой стороны заходит библиотека scientific-agent-skills: 163 готовых навыка и доступ к более чем сотне научных баз данных, которыми, по заявлению авторов, пользуются 175 тысяч учёных. За сутки репозиторий собрал 720 звёзд на GitHub. Замеры на бенчмарке пока не опубликованы, поэтому насколько агенты справляются с этими процессами — неизвестно.