跳到正文

全部動態

今日 427 條
今天10月6日週二
  1. Zyphra Research41

    Tree Attention:面向 GPU 叢集長上下文注意力的拓撲感知解碼

    Zyphra 提出 Tree Attention,以樹狀歸約平行化多 GPU Transformer 解碼,實測可提升長上下文注意力的解碼速度並降低記憶體開銷。Zyphra 估算,在 1M 序列長度下,Tree Attention 的解碼速度較 Ring Attention 快逾 8x,通訊量則減至一半或更低。其跨裝置複雜度為對數級,而 Ring Attention 為線性級。

  2. Zyphra Research31

    MixPR:用於長上下文預處理的 Mixture-of-PageRanks 檢索器

    Zyphra 提出 MixPR,一套結合兩類 PageRank 檢索、用於高效預處理長上下文輸入的 RAG 系統。系統按任務採用 PageRank 作全域檢索,或 Personalized PageRank 作局部檢索,並在多項長上下文基準測試取得 SOTA 結果。MixPR 可配合任何現有基礎模型,把有效 LLM 上下文長度延伸至十億級,並可在 CPU 上高效運行。

  3. Zyphra Research43

    Zyphra 提出 Online Vector-Quantized (OVQ) Attention 處理長上下文

    Zyphra 提出 Online Vector-Quantized(OVQ)attention,以線性計算複雜度和常數記憶體複雜度處理長上下文。其稀疏狀態更新可擴大記憶容量;實驗顯示,在 16k+ 上下文長度下,OVQ-attention 使用的記憶狀態僅為強自注意力基線的一小部分,表現相若或略有差距。長上下文任務中,OVQ-attention 顯著勝過線性注意力及 SSM 基線。

  4. Zyphra Research55

    Zyphra 發佈 380M 參數 ZUNA 腦電圖基礎模型,支援訊號去噪與重建

    Zyphra 發佈 380M 參數的 ZUNA,這是一款用於腦電圖(EEG)訊號去噪、重建及上採樣的擴散自編碼器基礎模型。在通道缺失超過 75% 時,ZUNA 在所有評估數據集均優於球面樣條插值;模型亦可按電極座標預測新通道訊號。模型以約 2 million channel-hours EEG 數據訓練,並按 Apache 2.0 授權發佈模型權重及推理、預處理程式碼。

  5. Zyphra Research59

    Zyphra 發佈 ZONOS2 即時文字轉語音模型,支援高保真聲音複製

    Zyphra 發佈採用 Apache 2.0 授權的即時文字轉語音模型 ZONOS2,支援高保真聲音複製。模型採用 MoE 架構,規模由前代的 1.6B 增至 8B,即時生成吞吐量較前代提升 4x,並支援最長一分鐘的多語言及語碼轉換語音生成。ZONOS2 提供 stable 和 expressive 兩種模式,分別側重乾淨輸出,以及聲音複製的自然度與保真度。

  6. Goodfire Research46

    解讀 Evo 2:Arc Institute 的下一代基因組基礎模型

    Goodfire 與 Arc Institute 合作將可解釋性技術應用於 Evo 2,識別出多種具生物學意義的模型特徵。Evo 2 提供 7B 和 40B 參數架構,可處理長達 1M 個鹼基對的序列。以特徵引導 Evo 2 精確設計新蛋白質結構的研究仍處早期,尚需進一步研究。

  7. Goodfire Research57

    Goodfire 剖析 DeepSeek R1 推理模型內部機制,公開兩個 SAE

    Goodfire 公開兩個以 DeepSeek R1 激活值訓練的稀疏自編碼器(SAE),並分享對推理模型內部機制及操控方式的早期研究。研究發現,R1 的特徵操控需等模型開始輸出「Okay, so the user has asked a question about…」一類思考前綴後才有效;部分特徵被過度操控時,模型反而會回復原有行為。

  8. Goodfire Research74

    Goodfire Research 展示 Paint With Ember 以擴散模型潛在表徵進行概念繪圖

    Goodfire Research 展示 Paint With Ember,讓用戶透過畫布操控 SDXL-Turbo 的內部表徵,以概念方式生成和編輯圖像。工具使用 BatchTopK SAE 拆解圖像潛在表示,再以 NMF 將相關特徵聚合為概念,支援繪製、拖曳和調整概念。Goodfire Research 提供應用程式公開版本及開源 SAE 解讀器模型。

  9. Prime Intellect53

    Prime Intellect 預覽面向公共互聯網的分散式推理堆疊,並開源三個研究程式碼庫

    Prime Intellect 預覽面向消費級 GPU、為公共互聯網 100ms 延遲設計的分散式推理堆疊,並開源三個研究程式碼庫。PRIME-IROH 是管線並行通訊後端,PRIME-VLLM 是可在公共網絡運行的 vLLM 管線並行整合,PRIME-PIPELINE 是快速驗證研究構想的精簡研究沙盒;用戶現已可連接私人硬件,透過公共網絡執行推理。

  10. Prime Intellect56

    Prime Intellect 發佈 INTELLECT-2,這是首個透過全球分散式強化學習訓練的 32B 參數模型

    Prime Intellect 發佈 INTELLECT-2,稱這是首個透過全球分散式強化學習訓練的 32B 參數推理語言模型。訓練以跨異構運算節點的全非同步 RL 為核心,並配套推出 PRIME-RL、TOPLOC 和 SHARDCAST;模型、程式碼及數據均已開源,技術報告見 primeintellect.ai/intellect-2。

  11. Goodfire Research62

    Goodfire Research 提出模型差分放大法,協助發現罕見不良行為

    Goodfire Research 提出模型差分放大法,放大模型在後訓練前後的 logits 差異,以協助浮現罕見不良行為。實驗顯示,該方法令湧現失配回覆增加 10 至 300 倍;當資料集含 5% 不良醫療建議時,有害回覆由每 10,000 次抽樣 1 次增至每 30 次 1 次。研究亦把此法用於監察後訓練和偵測後門行為;作者指出,放大後的回覆頻率不代表模型行為的實際發生率。

  12. Goodfire Research8

    對抗樣本不是錯誤,而是疊加現象

    文章主張,對抗樣本並非錯誤,而是疊加現象。頁面另列出以蛋白質嵌入向量改善 AI 智能體生物安全監測、規模化捕捉模型獎勵作弊,以及估算文字生成不確定性動態的研究。頁面亦介紹 Silico,稱其為可解釋性智能體,可用於解釋、除錯及精確控制模型行為,並提供可解釋性方法與基礎設施。

  13. Fireworks AI53

    企業如何邁向專門化智能並訓練自有模型

    Fireworks AI 的文章梳理企業邁向專門化智能的路徑,從租用封閉式前沿模型、加入開源模型,逐步走到微調自有模型。在 UIPad 測試中,Kimi K3 與 GPT 5.6 Sol 整體同為 87.7 分,但 Kimi K3 執行成本為 $56,GPT 5.6 Sol 為 $115;按題型分流,可把座標題交給 Sol,其餘題目交給 K3。

  14. Prime Intellect74

    Prime Intellect 推出 Lab 全棧模型訓練平台

    Prime Intellect 推出 Lab,將 Environments Hub、Hosted Training 和 Hosted Evaluations 整合為模型後訓練研究的全棧平台。平台現支援基於 prime-rl、使用 LoRA 的智能體強化學習訓練,並可在自建環境中執行。私測期間已完成逾 3,000 次 RL runs,現已向所有人開放。

  15. Goodfire Research14

    時間先驗:語言模型可解釋性中缺失的歸納偏置

    題為《時間先驗》的文章聚焦語言模型可解釋性中缺失的歸納偏置。頁面另列出以蛋白質嵌入向量改善 AI 智能體生物安全監察、在大規模情況下捕捉模型獎勵破解,以及估算文字生成不確定性動態的研究。頁面亦介紹 Silico,稱其為可解釋性智能體,可用於解釋、除錯及精確控制模型行為。

  16. Goodfire Research54

    Goodfire Research 透過損失曲率分析模型記憶

    Goodfire Research 提出以損失曲率辨識記憶方向的模型編輯方法,移除低曲率權重方向以抑制背誦,無需標註指定遺忘資料。在採用 10% 隨機標籤噪聲的 ViT 實驗中,噪聲標籤記憶率由 81.6% 降至 3.5%,驗證準確率則由 67% 升至 71.7%。語言模型的純記憶任務準確率降至原有水平的 3–16%,邏輯推理維持或略有改善,但算術和封閉式事實回憶較易受影響。