У Nvidia сильна не одна только аппаратная часть. CUDA за годы обросла компиляторами, библиотеками и готовыми ядрами, поэтому переход на другой ускоритель часто означает переписывание и повторную оптимизацию значительной части вычислительного стека. Новые проекты DeepSeek закрывают как раз этот пробел для Huawei Ascend 950.
Один из них, официальный DeepGEMM-Ascend, содержит ядра для матричного умножения. Репозиторий опубликован 30 сентября 2026 года, разработчики указывают поддержку Ascend 950 и ориентацию на производительность, близкую к пределам оборудования. Для сборки требуется CANN 9.2, Bisheng, torch_npu и Python не ниже 3.10. Это уже не абстрактное заявление о совместимости, а конкретный программный стек, под который можно собирать вычислительные ядра.
Второй компонент, DeepEP-Ascend, занимается обменом данными между ускорителями при обучении и инференсе. В частности, библиотека реализует операции all-to-all для экспертного параллелизма в MoE-моделях. Публичный API сделан совместимым по структуре с Nvidia-версией DeepEP. В тестах DeepSeek на Ascend 950DT скорость dispatch при восьми ускорителях составляла 373-375 ГБ/с, а при 128 ускорителях - 313-320 ГБ/с. Эти результаты относятся к конкретной тестовой конфигурации DeepSeek и не являются независимыми замерами.


