熱點事件持續更新
Zyphra Research 提出降低 MoE 預訓練通信成本方法
1 篇報道1 個報道來源59 分鐘前更新
先了解這件事
AI 綜述
2026年10月8日,Zyphra Research 研究 MoE 專家耦合如何降低預訓練通信成本,提出關聯專家佈置與 token shuffling,利用 MoE 路由關聯提升 token–expert locality,減少跨 GPU 通信,且不改變模型架構或路由決策。在所測配置中,純 EP 配置的端到端訓練步驟最高加速 1.41×;採用 token shuffling 的 TP+EP 配置最高加速 1.34×,all-to-all 最多加速 2.63×。
AI 根據報道生成 · 58 分鐘前更新
最新進展10月8日 23:20
Zyphra Research 公佈關聯專家佈置與 token shuffling 的加速結果。報道時間線
沿着報道,瞭解事件的不同側面。
10月8日
- Zyphra ResearchZyphra Research 研究 MoE 專家耦合如何降低預訓練通信成本
Zyphra Research 提出關聯專家佈置與 token shuffling,利用 MoE 路由關聯提升 token–expert locality,降低跨 GPU 通信,且不改變模型架構或路由決策。在所測配置中,純 EP 配置的端到端訓練步驟最高加速 1.41×;採用 token shuffling 的 TP+EP 配置最高加速 1.34×,all-to-all 最多加速 2.63×。
本事件熱度走勢
還沒有足夠的連續觀測數據,暫不繪製趨勢。