跳到正文
原文
Prime Intellect·· 6 小時前AI 評分48

Prime Flash MoE:為 Blackwell 優化的高速 MoE kernels

ResearchAUG 13TH, 2026Prime Flash MoE - Faster MoE Kernels optimized for Blackwell

AI 導讀

Prime Flash MoE 是一組為 Blackwell 優化的 CUDA kernels,速度最高比 PyTorch grouped GEMM 快 2.4×。在 4k-128k token 範圍內,速度提升約 2.3×,並已整合至 prime-rl,以加速 MoE 模型的前向傳播。

來源:Prime Intellect · primeintellect.ai