Google открыла систему VeriHarness — агент сам перепроверяет свои результаты
Google AI Research и Кембриджский университет открыли код VeriHarness — системы, которая проверяет результат долгой агентной задачи силами той же модели, что его получила. Агент решает задачу несколько раз, каждая попытка даёт свой вариант отчёта, таблицы или патча, а VeriHarness сравнивает варианты и отбирает надёжный.
Вместе с кодом выложены около 26 тысяч записей работы агентов Gemini 3.5 Flash и Opus 4.8 — на их генерацию ушло больше 100 тысяч долларов. Такие записи обычно не публикуют: это основной расходный материал для исследований по проверке агентов.