Разбор: модели специально делают глупее ради экономии
Автор блога w4g1 разбирает наблюдение, знакомое многим: модель, которая месяц назад справлялась с задачей, начинает отвечать хуже без объявления новой версии. Его объяснение — за одним публичным именем стоит несколько режимов работы, и провайдер тихо переключает трафик на более дешёвый вариант, когда нагрузка растёт.
Механизмы называются те же, что известны по инфраструктуре: сокращённая точность вычислений, урезанный бюджет на рассуждения, обрезка контекста. Для пользователя разницы в интерфейсе нет, а качество меняется.
В обсуждении на Hacker News спорят, где здесь экономия, а где обычная невоспроизводимость ответов модели: без публичных замеров одного и того же запроса во времени доказать подмену нельзя.
Что говорят
kennywinkerHacker News
В идеале я хочу подключаемые базы знаний: 9B базового кодинга и рассуждений, плюс 10B по Swift/SwiftUI, плюс 5B по GIS и 5B по дизайну фронтенда. Моей модели не нужна ни строчка Python — я хочу собирать модель как конструктор под конкретную задачу, а не универсальную «всё для всех».
kaufmannHacker News
Идея разумная, но SimpleQA Bench перестал измерять в сентябре 2025-го, так что интереснее были бы свежие данные. Выглядит немного как сгенерированный ИИ аргумент на старых фактах — со мной такое бывает часто.
Gecko4072Hacker News
При всём фокусе на кодинге и агентах — заметит ли это остальной мир? Большинство сценариев использования ИИ не про код, вопреки представлениям этого сайта: я, например, предпочитаю Kimi K2.6 на 1T параметров модели Flash V4 на 230B, даже если она формально умнее.