Яндекс.Метрика
← Дайджест от 14 сентября 2026

Дешёвая модель OpenAI проверила код не хуже старшей — сравнение Entelligence

Entelligence сравнила две модели OpenAI на задаче ревью кода: GPT-5.6 Luna примерно за 1,2 доллара против более дорогой GPT-6 Astra. Ревью здесь — разбор чужого pull request с поиском ошибок и замечаниями.

На большинстве обычных правок дешёвая модель находила те же проблемы, что старшая. Разрыв появлялся на изменениях, затрагивающих несколько файлов и неявные связи между ними: там Luna пропускала ошибки, которые Astra замечала.

Что говорят
verdvermHacker News
Мы используем ещё более дешёвую модель (сейчас K2.7), но ревью одного PR выходит дороже — правда, всё равно меньше доллара. У нас просто больше всего происходит: сбор контекста и постинг комментариев вынесены в скрипты до и после агента, плюс набегает десяток сессий сабагентов. Считаем, что оно того стоит: ревью ловит то, что пропускают и люди, и два платных варианта.
StevenWatermanHacker News
10 центов разницы на ревью PR — это ничто. Какая софтверная компания согласится на худшие ревью и меньше найденных багов, чтобы сэкономить гривенник?
SwellJoeHacker News
Я долго и почти религиозно пользовался Copilot Code Review (бесплатный план за опенсорс), но там появилась чудовищная антифича, которая тихо раздула сложность кода. Каждая следующая модель видела то изменение и объяснение к нему в чейнджлоге и считала это политикой, а не бредом модели, — в итоге получился фрактал безумия, который я разгребал хорошей моделью под плотным человеческим присмотром.