DeepSeek открыла веса модели V4.1-Flash — она вдвое дешевле читает длинный текст
DeepSeek выложила веса V4.1-Flash — мультимодальной модели на 552 млрд параметров с контекстом до миллиона токенов. Под капотом архитектура Causal Encoder-Decoder, которая вдвое удешевляет разбор входного текста.
Задача, под которую модель делали, прикладная: долго работающий агент постоянно перечитывает свой контекст, и всё прочитанное надо держать в кэше ключей и значений. На длинных дистанциях кэш раздувается и упирается в пропускную способность памяти — новая схема сжимает его.
На Hugging Face уже появилась версия без фильтров ответов от стороннего разработчика. Рохан Анил из индустрии коротко оценил модель как «реально хорошую».