Prime Intellect·· 6 小時前AI 評分48
Prime Flash MoE:為 Blackwell 優化的高速 MoE kernels
ResearchAUG 13TH, 2026Prime Flash MoE - Faster MoE Kernels optimized for Blackwell
AI 導讀
Prime Flash MoE 是一組為 Blackwell 優化的 CUDA kernels,速度最高比 PyTorch grouped GEMM 快 2.4×。在 4k-128k token 範圍內,速度提升約 2.3×,並已整合至 prime-rl,以加速 MoE 模型的前向傳播。
來源:Prime Intellect · primeintellect.ai