神經網絡內部表徵以幾何結構映照外界
Goodfire Research 指出,神經網絡內部表徵會形成映照外界結構的幾何形狀,並以 Mountain Car 模型示範沿彎曲流形操控表徵可平順改變車輛位置。相比之下,線性操控可能令模型輸出混亂,或令車輛跳到另一位置。文章認為,研究神經幾何有助理解模型表徵、計算與行為,並支持更精準、可靠的模型控制。
Goodfire Research 指出,神經網絡內部表徵會形成映照外界結構的幾何形狀,並以 Mountain Car 模型示範沿彎曲流形操控表徵可平順改變車輛位置。相比之下,線性操控可能令模型輸出混亂,或令車輛跳到另一位置。文章認為,研究神經幾何有助理解模型表徵、計算與行為,並支持更精準、可靠的模型控制。
Replit 將 Replit Agent 的評估由發佈前的單次檢查,轉為結合離線基準、線上 A/B 測試及生產軌跡分析的持續改進閉環。ViBench 以自然語言產品需求文件和測試計劃評估生成應用是否符合規格,Telescope 則整理生產軌跡並聚類失敗模式。改進循環會提出候選修正、建立草稿 PR 並彙整評估證據,工程師仍負責審核及決定是否發佈。
LlamaIndex 解讀 DeepSeek-OCR 將文件圖像作為文字資訊的壓縮表示,並分析其與文件解析、LlamaParse 的關係。文中稱,論文示例把 1,000 個文字 tokens 壓至 100 個視覺 tokens,解碼準確率為 97%;20× 壓縮時準確率約為 60%。文章指出,RAG、文件問答和摘要等理解型用途可考慮視覺壓縮;若需要結構化資料、語義層級或精確文字操作,仍需文件解析。
研究人員發現,機器學習研究智能體經驗證集反覆優化後,所得策略壓縮成短提示詞並交由新智能體重現時,在多數問題上仍能維持原有表現。研究涵蓋 8 個數據集,32-token 提示詞在大多數問題上足以讓新智能體追平原智能體;一項語言建模策略更可壓至 16 tokens 而不損失保留集表現。刻意誘發過度擬合的 102 次實驗中,有 38 次驗證準確率比真正保留集準確率高逾 10%,這些優勢經壓縮後消失。
愛丁堡大學的 Filippo Menolascina 團隊使用 Co-Scientist 梳理 MASH 文獻,提出後經實驗驗證的肝病機製假説。針對近期獲批、用於 MASH 特定階段的 resmetirom 僅對少部分合資格患者有效的問題,該假説將 NLRP3 炎症小體指為連接疾病中炎症與代謝的分子橋樑。
Hugging Face 發佈 Cosmopedia,這套合成數據集旨在重現 Phi-1.5 的訓練數據,供大語言模型預訓練使用。
推薦理由:文章拆解 Cosmopedia 從種子資料、提示詞擴展到去污染與訓練的流程,並交代如何藉由受眾和文體變化擴大提示詞規模。
OpenAI 發佈近端策略優化(PPO),一類強化學習算法,其表現可媲美或優於最先進方法,同時更易實作和調校。OpenAI 表示,PPO 因易用且表現良好,已成為其預設的強化學習算法。
推薦理由:材料比較 PPO 與前沿方法的表現,並交代較簡單的實作和調校如何與良好性能共同構成 OpenAI 採用它作為預設算法的理由。