跳到正文
熱點事件持續更新

Zyphra Research 提出降低 MoE 預訓練通信成本方法

1 篇報道1 個報道來源59 分鐘前更新

先了解這件事

AI 綜述

2026年10月8日,Zyphra Research 研究 MoE 專家耦合如何降低預訓練通信成本,提出關聯專家佈置與 token shuffling,利用 MoE 路由關聯提升 token–expert locality,減少跨 GPU 通信,且不改變模型架構或路由決策。在所測配置中,純 EP 配置的端到端訓練步驟最高加速 1.41×;採用 token shuffling 的 TP+EP 配置最高加速 1.34×,all-to-all 最多加速 2.63×。

AI 根據報道生成 · 58 分鐘前更新

報道時間線

沿着報道,瞭解事件的不同側面。

10月8日
  1. Zyphra Research
    Zyphra Research 研究 MoE 專家耦合如何降低預訓練通信成本

    Zyphra Research 提出關聯專家佈置與 token shuffling,利用 MoE 路由關聯提升 token–expert locality,降低跨 GPU 通信,且不改變模型架構或路由決策。在所測配置中,純 EP 配置的端到端訓練步驟最高加速 1.41×;採用 token shuffling 的 TP+EP 配置最高加速 1.34×,all-to-all 最多加速 2.63×。

本事件熱度走勢

還沒有足夠的連續觀測數據,暫不繪製趨勢。