Яндекс.Метрика
← Дайджест от 3 августа 2026

Epoch AI: Claude Fable опередил GPT-5.6 в переписывании программ втрое

Epoch AI обновила лидерборд бенчмарка MirrorCode — теста, где модель должна с нуля написать программу, воспроизводящую поведение уже существующей. Задача проверяет не правку кода, а способность держать длинный проект целиком.

Claude Fable 5 решил 64% задач, GPT-5.6 Sol — 20%. Разрыв втрое выбивается из общей картины: на большинстве других тестов эти модели идут почти вровень, а местами Sol впереди.

Epoch отдельно ставит вопрос, какой вообще максимальный по размеру проект модель доводит до конца сама — на MirrorCode граница видна яснее, чем на коротких задачах.