DeepSeek перенесла библиотеку матричных вычислений на чипы Huawei
DeepSeek выложила DeepGEMM-Ascend — порт своей библиотеки матричных вычислений на нейропроцессоры Huawei Ascend 950. Внешний интерфейс библиотеки остался тем же, что у оригинала, а сами вычислительные ядра переписаны под особенности китайского железа.
Поддерживаются вычисления в форматах FP4, FP8 и BF16, а также операции для моделей со смесью экспертов. На плотном умножении матриц библиотека почти упирается в теоретический потолок чипа: 1701 TFLOPS в FP4 — это 98,3% от пика. В FP8 выходит 861 TFLOPS, или 99,5% от пика.
Смысл работы в том, что вся индустрия десять с лишним лет писала код под CUDA от Nvidia, и китайским командам этот слой приходится воссоздавать с нуля под свои ускорители.