DeepSeek открыла зрение у V4-Flash: модель разбирает интерфейсы и документы

DeepSeek выложила в свой API экспериментальную модель V4-Flash-Vision-Exp — ту же быструю V4-Flash, но с обработкой картинок. Компания утверждает, что текстовые способности не просели: рассуждения, работа с инструментами и общие знания остались на уровне обычной V4-Flash.
Основной прирост заявлен на проверках мультимодальных агентов — задачах, где модель смотрит на скриншот интерфейса или страницу документа и решает, что нажать или что оттуда достать. Документация с примерами открыта, модель помечена как экспериментальная.
В обсуждении на Hacker News главный вопрос — можно ли на такое ставить продукт: у экспериментальных эндпоинтов DeepSeek нет обещаний по стабильности и срокам жизни.
DeepSeek@deepseek_ai
DeepSeek-V4-Flash-Vision-Exp is now live on the DeepSeek API Platform! 🚀 🔹 This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities—including agents, reasoning, and world knowledge. 🔹 On multimodal agent benchmarks, V4-Flash-Vision-Exp makes a major https://t.co/t2ELUZAagW
10 01921 августа 2026
Что говорят
LorenDBHacker News
Слышал, что DeepSeek v4 Flash 0731 постоянно считал, будто у него есть зрение, а когда выяснялось, что нет, начинал выдумывать текстовые инструменты для анализа изображений. Мне приходилось прямо запрещать ему смотреть скриншоты, иначе он ломал сессию, пытаясь прочитать картинку.
zmmmmmHacker News
«Большие изображения ужимаются с сохранением пропорций примерно до количества пикселей картинки 800×800» — полезно, но для OCR и многих других задач нужно побольше, например если подавать полноразмерную страницу A4 или Letter.
v9vHacker News
Любопытно. Разве основатель DeepSeek не говорил, что они сознательно решили не заниматься мультимодальностью и идти чисто текстом, потому что для AGI этого достаточно?