Яндекс.Метрика
← Дайджест от 29 августа 2026

Автор на Хабре ускорил модель Qwen3.8 вдвое на тех же двух RTX 3090

Автор на Хабре разогнал плотную модель Qwen3.8 с 32 до 75 токенов в секунду на двух RTX 3090 — в llama.cpp, без смены железа. Из коробки две карты по 24 ГБ выдавали немногим больше одной, и узкое место оказалось не в них.

Помогли две вещи: тензорный параллелизм — когда слои модели режутся между картами, а не выполняются по очереди, — и MTP, предсказание нескольких токенов за шаг. Разбор показывает, где именно упиралась пропускная способность памяти и какие настройки сборки это снимают.