Яндекс.Метрика
← Дайджест от 1 сентября 2026

Anthropic выпустила Claude Fable 5.1 — на научном тесте 53% задач вместо 25%

Anthropic выпустила Claude Fable 5.1 и Mythos 5.1 — обновление своих старших моделей. По замерам компании, Fable 5.1 берёт 52,6% на Terminal-Bench Science (тест, где агент проходит полный научный цикл в терминале) против 24,7% у Fable 5. На Terminal-Bench 4.0 — 55,8% против 42,0%. Mythos 5.1 нацелена на кибербезопасность и биомедицину.

Цена за решение задачи упала не из-за тарифа за токены, а из-за кэша: чтение из него подешевело на 75%, до 0,25 доллара за миллион токенов. По оценке Anthropic, типичная задача выходит дешевле примерно на 25%, в сложных агентных сценариях экономия доходит до 45%. Компания также обещает, что модель на 60% реже отказывается отвечать на безобидные вопросы.

Внешние проверяющие подтверждают часть заявок: на финансовом тесте FrontierFinance модель дала 55,9% против 49,2% у прошлой версии. Итан Моллик из Уортона, получивший ранний доступ, называет это реальным продвижением в долгой работе, требующей суждения, но не в качестве текста.

Ethan Mollick@emollick
Had early access to Claude Fable 5.1. Its a real advance in long-run work that requires judgement and taste, but less of an advance in the Claudish. Here is a game from Fable 5.1 with retro graphics where you run an accurate space ship inspired by FTL https://t.co/gqgtqtaIcy https://t.co/OAXGdBWlWZ
1 сентября 2026