Исследователи вычислили устройство закрытой модели Google по паузам в ответах

Группа исследователей во главе с Нилуфар Мирешгаллах показала новый способ подглядеть за закрытой моделью: не через веса, а через тайминги ответа. Когда сервис отдаёт ответ по частям (потоковый режим), задержки между кусками зависят от того, как модель устроена и какие ускорения включены на сервере.
На Gemini Flash 2.5 задержка при контексте в 130 тысяч токенов подскочила в 3,2 раза — по картине скачков авторы вычислили спекулятивное декодирование, когда черновая модель предсказывает продолжение, а основная его проверяет. Такие оптимизации провайдеры обычно не документируют.
Атака не требует ничего, кроме обычного платного доступа к API.
Niloofar@niloofar_mire
In a new episode of stealing parts of production LLMs, we found a way to steal hidden model architecture and expose undocumented inference optimizations through ordinary streaming APIs. On Gemini Flash 2.5, latency jumped 3.2× at 130k tokens, revealing speculative decoding and https://t.co/jcL01nT0B3
16627 августа 2026