Яндекс.Метрика
← Дайджест от 2 августа 2026

Karpathy заменил пеликана на велосипеде тестом с бюджетом в миллион токенов

Стандартной проверкой моделей несколько лет был запрос «нарисуй SVG-картинку пеликана на велосипеде» — короткая задача, по которой сравнивали качество. Андрей Карпатый говорит, что этот тест устарел: модели рисуют пеликана хорошо, а работают теперь долгими прогонами.

Вместо картинки он дал Opus 5 первый абзац «Властелина колец», бюджет около миллиона токенов (примерно $10) и просьбу развернуть его в большую работу. Смысл теста — не одна реплика, а что модель делает, когда у неё есть много шагов и никто не подсказывает.

Пост собрал больше 25 тысяч лайков и почти 400 комментариев на Hacker News, где спорят, можно ли вообще сравнивать такие прогоны между моделями: результат каждый раз разный, а оценивать его приходится вручную.

Andrej Karpathy@karpathy
We're starting to leave the territory where you'd test an LLM by e.g. "create an svg of pelican on a bicycle". As one idea to generalize it, I was interested what Opus 5 would do if I gave it the first paragraph of the Lord of the Rings, a 1M token budget (~$10) and asked for https://t.co/ybIpXhYSsj
25 070
2 августа 2026
Что говорят
quantumleaperHacker News
Мне грустно, что Андрей Карпаты из одного из самых разумных и авторитетных голосов в ИИ превратился в разносчика маркетингового шлака для Anthropic. Восемь месяцев назад он вполне обоснованно говорил, что до надёжных агентов минимум десятилетие, но теперь это противоречит интересам работодателя — и нарратив поменялся.
matchagauchoHacker News
Мыслить в экспонентах трудно, но здесь видно: мы всего в пару порядков от того, чтобы генерировать гиперперсональные развлечения и медиа один-на-один для конкретного человека, а не для масс.
bredrenHacker News
Я собирал с LLM ~3D-анимацию делореана из «Назад в будущее» для шапки страницы документации: потребовалось много ручной подгонки и отдельное окно настройки, чтобы поведение стало правильным. Но было так весело, что я обобщил это на любое описание сцены из фильма — оно само подтягивает детальные описания и кадры, а на тесте со сценой «Гаунтлет» из «Апокалипсиса» вышло низкодетально, но на удивление правдоподобно.