跳到正文
Cartesia 產品與研究·· 2 小時前AI 評分57

Mamba-3B-SlimPJ 發佈,訓練 FLOPs 少 17% 並匹配同級 Transformer

Mamba‑3B-SlimPJ: State-space models rivaling the best Transformer architecture

AI 導讀

Cartesia 與 Together 發佈 Mamba-3B-SlimPJ,這款 2.8B 參數模型以 600B tokens 訓練,採 Apache 2.0 授權。它以少 17% 訓練 FLOPs,達到 BTLM-3B-8K 等強勁 3B Transformer 的模型品質。訓練使用 SlimPajama 數據集、上下文長度為 2048,模型亦可作為實驗及聊天和指令微調模型的基礎。

來源:Cartesia 產品與研究 · cartesia.ai