Бенчмарк HANDBOOK.md: агенты не соблюдают многостраничные регламенты
HANDBOOK.md — новый тест для агентов, который проверяет не правильность ответа, а способ его получения. Агенту выдают многостраничный корпоративный регламент, дают задачи через подключённые сервисы и смотрят, шёл ли он к результату разрешённым путём. Проверка автоматическая и одинаковая при повторных прогонах.
Вывод замера: длинный документ с политиками не заставляет агента работать по правилам.
DAIR.AI@dair_ai
On benchmarking long-context agentic instruction following. Agent benchmarks mostly reward reaching the answer. This new benchmark measures whether the agent reached it the permitted way, which is the question enterprise deployments care about. If you ship skills files, policy https://t.co/AK1s4c91TI
89 ♡
29 июля 2026Что говорят
@mcdeltatHacker News
Совпадает с моим опытом с Claude: он отлично держится инструкций минут десять, а потом начинает игнорировать то, что я говорил раньше. В CLAUDE.md у меня прописано вполне жёстко (не писать огромные комментарии, использовать существующий код), но на реальных задачах это обходится удивительно быстро — а если сказать то же самое прямо в промпте по ходу дела, результат гораздо лучше.
@firasdHacker News
Лучший результат у Opus 4.8 (максимальное «думание»), худший — у Grok 4.3. С Grok непонятно что происходит: способности как будто есть, но обучение, похоже, настолько заточено под x.com/grok.com с веб-поиском в стиле «это правда?», что на любом API-использовании — документы, инструкции, инструменты, генерация кода — он полностью рассыпается.
@DiabloD3Hacker News
Это проблема моделей с длинным контекстом: заявленный миллион токенов не значит, что им реально можно пользоваться. Из-за жёсткого квантования моделей и KV-кэша, а также убогих сэмплеров (у пользователя вообще отбирают ручки настройки) так и будет продолжаться. Хотите, чтобы это исчезло почти волшебным образом — локальный инференс, где всё под вашим контролем.