Apple открыла модель, которая хранит длинный контекст картинками страниц
Apple выложила LensVLM-9B — модель, которая сжимает длинный контекст, превращая текст в изображения страниц, и разворачивает в текст только те страницы, которые нужны для ответа.
Идея в том, что картинка страницы занимает меньше токенов, чем её текст, а модель всё равно может прочитать содержимое, когда до него дойдёт очередь. Так длинный документ помещается в окно, которого на полный текст не хватило бы.
Веса опубликованы на HuggingFace, обсуждение на Hacker News собрало 58 очков.