OpenAI объяснила слабый результат GPT-5.6 на тесте ARC-AGI-3 настройками запуска
У GPT-5.6 Sol был подозрительно низкий результат на ARC-AGI-3 — 7,8%, хотя та же модель прошла игру Pokémon FireRed и решила математическую гипотезу. OpenAI разобралась: дело в параметрах запуска, и после их изменения показатель вырос втрое.
Тот же вывод повторяют в разговорах про тесты агентов: измеряется связка «модель, оболочка и среда», а не веса модели сами по себе.
Arvind Narayanan@random_walker
Imagine if car safety testers only did tests on the engine and called it a day, instead of testing the vehicle itself. This is roughly the situation in our understanding of the mental health risks of chatbots. Most of the research is on models but models aren't what people
86 ♡
29 июля 2026