OpenAI признала, что следить за рассуждениями новой модели Astra стало труднее
OpenAI в системной карточке Astra — документе о рисках модели — признала, что следить за её рассуждениями стало труднее. Исследователь компании Мика Кэрролл написал, что вместе с большим скачком возможностей упала отслеживаемость, особенно при враждебной проверке, когда специально ищут обход правил. По его словам, контроль и отслеживаемость станут главным узким местом.
Нил Нанда, руководитель исследований интерпретируемости в Google DeepMind, возразил распространённому доводу, что читаемая цепочка рассуждений уже не нужна и её заменит анализ внутренностей модели. По его словам, сегодня цепочка рассуждений — лучший доступный инструмент безопасности, и терять её нельзя.
Neel Nanda@NeelNanda5
A concerningly common take seems to be that keeping Chain of Thought monitorable doesn't matter because interpretability will save us, or it's already useless This is total bullshit. CoT is our best current tool for safety & interpretability, losing it would be a major tragedy
1 1583 сентября 2026