⚡️ DeepSeek перенесла DeepGEMM на Huawei Ascend и выжала из железа 99,8% DeepSeek выложила DeepGEMM-Ascend, порт своей библиотеки матричных ядер на NPU Huawei Ascend 950. API остался тем же, что у оригинального DeepGEMM, а сами ядра переписаны под особенности Ascend. Поддерживаются GEMM в FP4, FP8 и BF16, grouped GEMM для MoE, MQA logits и слитые операторы MegaMoE. Плотный GEMM почти упирается в теоретический потолок: FP4 даёт 1701 TFLOPS (98,3% от пика), FP8 861 TFLOPS (99,5%), BF16 431 TFLOPS (99,8%). Внутри JIT-компиляция, конвейеризация на корутинах и тонкая обёртка над матричными инструкциями Ascend. Нужны CANN 9.20, torch_npu и Python 3.10+. Лицензия MIT. https://github.com/deepseek-ai/DeepGEMM-Ascend @ai_machinelearning_big_data #DeepSeek
- 84
- 47
- 18
- 14
- 11
- 3
- 1
- 1