Замер памяти на связях: GigaChat 2 Max отвечает верно в 57% случаев

Проверяли узкий, но частый в работе класс вопросов: в проекте всплыла проблема — каким изменением её уже когда-то чинили. Ответ требует не рассуждения, а того, чтобы нужный факт из истории проекта доехал до модели в контексте.
На семи моделях сравнивали два способа подачи. GigaChat 2 Max с памятью на связях между сущностями отвечает верно в 57% случаев, YandexGPT Pro 5.1 — в 61%, а Claude Opus 5 с обычным поиском по тексту — в 41%. Сами модели никто не дообучал.
Вывод автора в том, что разница целиком лежит в способе доставки контекста: сильная модель без нужного факта проигрывает более слабой, которой этот факт нашли.