Яндекс.Метрика
← Дайджест от 9 сентября 2026

Автор книг по ИИ Себастьян Рашка разобрал GPT-6 Astra — часть рассуждений скрыта

Себастьян Рашка, автор книг по машинному обучению, разобрал устройство GPT-6 Astra и связанный с ней приём — зацикленные трансформеры. Идея в том, что модель прогоняет один и тот же блок слоёв по кругу несколько раз вместо того, чтобы наращивать глубину новыми слоями: считается больше, а вес модели не растёт.

Отдельный вопрос разбора — прячет ли такая схема ход рассуждений. При обычной цепочке рассуждений шаги видны текстом, при повторных проходах часть вычислений остаётся внутри и наружу не выходит. Рашка разбирает, чем это оплачивается по времени ответа, и приводит недавние работы по зацикленным трансформерам.

Sebastian Raschka@rasbt
I put together a mega write-up on GPT-6 Astra & looped transformers. How looped transformers / recurrent depth works, cost-tradeoffs, whether it hides reasoning traces, with lots of figures and a tour of recent looped transformer research. https://t.co/VR6HaPFVXH
9 сентября 2026
Что говорят
libraryofbabelHacker News
Краткая суть: статья The Information о «рекуррентной глубине» и «зацикленных трансформерах» в GPT-6 Astra подавала это как страшную секретную технику, мешающую следить за цепочкой рассуждений. На деле это то же самое, что добавить слоёв трансформера, только веса переиспользуются и экономится память GPU; модель по-прежнему выдаёт по одному токену за раз.
cubefoxHacker News
Статья устарела. Уже есть бенчмарки, часть из которых признаёт сама OpenAI, показывающие, что Astra куда хуже поддаётся мониторингу; свежий сторонний замер фиксирует резкий скачок многошаговых рассуждений без цепочки мыслей. Одной лишь «моделью стало умнее, значит, больше успевает за токен» это не объясняется.
iJohnDoeHacker News
Astra какая-то странная — я ей не доверяю. В Codex у неё отталкивающий тон, она бывает чрезмерно ретивой и слишком креативной в агентных задачах на уровне системы: лезет в файлы и делает то, чего делать не должна.