Автор на Хабре собрал MarathonMemBench для проверки памяти агентов
Автор Хабра выложил MarathonMemBench — площадку для проверки долговременной памяти агентов. Обычные тесты памяти проверяют, помнит ли модель факт из начала диалога, но не то, что происходит после часов разговора с противоречиями.
Устройство такое: заданная личность на основе модели часами беседует с проверяемым агентом, рассказывает о своей жизни, меняет решения, путается и сама себя поправляет. К концу начало разговора уже вытеснено из контекстного окна, и агента спрашивают о ранних деталях и о том, какая версия событий актуальна.
Это мерит не объём контекста, а способность агента удерживать и обновлять картину собеседника.