Тесты для ИИ-ментора засчитали как верные ответы, где он решал за ученика

Автор Хабра написал 61 тест для своего ИИ-ментора и выяснил, что тестам нельзя верить. Ментор — встроенный в учебную платформу помощник, который должен подсказывать ученику, а не решать за него.
Проверять автор собирался именно поведение: укажет ли помощник на строку с ошибкой или перепишет задачу целиком, скажет ли «не знаю, давай проверим» или уверенно додумает ответ. На практике тесты засчитывали как верные ответы, в которых ментор выдавал решение вместо подсказки: сформулированный критерий ловил наличие правильного кода, а не отказ от него.