Anthropic выпустила Claude Fable 5.1 — на научном тесте 53% задач вместо 25%

Anthropic выпустила Claude Fable 5.1 и Mythos 5.1 — обновление своих старших моделей. По замерам компании, Fable 5.1 берёт 52,6% на Terminal-Bench Science (тест, где агент проходит полный научный цикл в терминале) против 24,7% у Fable 5. На Terminal-Bench 4.0 — 55,8% против 42,0%. Mythos 5.1 нацелена на кибербезопасность и биомедицину.
Цена за решение задачи упала не из-за тарифа за токены, а из-за кэша: чтение из него подешевело на 75%, до 0,25 доллара за миллион токенов. По оценке Anthropic, типичная задача выходит дешевле примерно на 25%, в сложных агентных сценариях экономия доходит до 45%. Компания также обещает, что модель на 60% реже отказывается отвечать на безобидные вопросы.
Внешние проверяющие подтверждают часть заявок: на финансовом тесте FrontierFinance модель дала 55,9% против 49,2% у прошлой версии. Итан Моллик из Уортона, получивший ранний доступ, называет это реальным продвижением в долгой работе, требующей суждения, но не в качестве текста.