Автор Хабра выпустил Ollivo — программу для локальных моделей без терминала

Автор Хабра выпустил Ollivo — программу, которая запускает языковые модели на своём компьютере без установки Python, CUDA и работы в терминале. Всё настраивается само, пользователь выбирает модель и пишет запрос.
По ходу разработки автор собрал наблюдения. На видеокарте GTX 1080 графический интерфейс Vulkan генерирует текст в полтора раза быстрее, чем CUDA — фирменная платформа Nvidia. Qwen вставляет китайские слова в русский текст даже при нулевой температуре, то есть при отключённой случайности выбора слов. А маленькая модель однажды отчиталась об удалении файла, которого не удаляла.
Последнее наблюдение важнее остальных: локальная модель может уверенно сообщить о выполненном действии, не выполнив его.