跳到正文

#開源生態

今日 7 條
10月6日週二
  1. 英國 AI Security Institute:Blog57

    最佳停止:英國 AI Security Institute 的 optstop 如何節省評測計算資源

    英國 AI Security Institute 開發並開源 Python 套件 optstop,按模型表現估計的精度或穩定程度提前停止評測抽樣。在涵蓋三類評分方式、三種預期模型表現水平,以及 MATH、GPQA Diamond 和 WritingBench 等公開基準的測試中,optstop 節省 57% 至 97% 的預定運行次數,且未影響分數估計。

  2. Anthropic:Research(發表成果 · 網頁)72

    Claude 如何提升生物分子建模效率

    Anthropic 表示,Claude 在不到四週內優化逾 30 個開源生物分子模型,平均加速約 4 倍,並在輸出完全相同的設定下接近 2 倍加速。低記憶體 Big 模式可在單一 NVIDIA GPU 節點上準確預測超過 10,000 tokens 的生物分子系統。

  3. NAVER / CLOVA 研究57

    NAVER Cloud 介紹 Sommelier 全雙工語音 AI 數據流程

    NAVER Cloud 的 Sommelier 論文於 ACL 2026 發表,提出供全雙工語音語言模型使用的多輪音訊預處理流程。Sommelier 開源流程包含説話者及發言時間標記、重疊語音還原,以及多個語音辨識模型輸出的交叉校驗。團隊以 83 小時對話資料進一步訓練全雙工 Moshi,插話內容回應評分由 0.765 升至 3.684,短回應頻率由 0.001 升至 0.052。

10月5日週一
  1. Tessl:產品與工程博客54

    智能體需要一個共享所學的公共知識庫

    cq 項目旨在為智能體建立可共享、可供審核的知識層,將解決問題所得整理成知識單元,供其他智能體日後檢索。cq 預設使用本地 SQLite 資料庫,知識經審核後可分享至團隊空間或公共知識庫。Joplin MCP 示例中,Claude 在一次配置排錯後提出知識單元,重試時再查詢並採用正確的設定路徑。

  2. IT之家37

    消息指 Reflection 等多家西方企業本月將推出開放權重 AI 模型

    Reflection 等多家西方企業據稱本月將推出開放權重 AI 模型,人工智能模型領域的競爭將進一步升級。開放權重模型支援客戶本地部署,對微調及推理數據安全要求嚴格的部分行業具關鍵優勢。Reflection 即將推出的模型預計初期落後於美國競爭對手最先進的閉源模型,但足以與中國同業的頂級開放權重模型競爭。

10月4日週日
10月3日週六
  1. LlamaIndex:產品、工程與評測51

    LlamaIndex 發佈 LlamaIndex.TS v0.0.1 TypeScript 優先程式庫

    LlamaIndex 發佈 LlamaIndex.TS v0.0.1,這是一個以 TypeScript 為先、協助開發者將私有數據接入大型語言模型的程式庫。它會將文件載入標準化格式並建立索引,再檢索相關資訊供 LLM 生成更有依據的回答。相較 Python 版,LlamaIndex.TS 使用 camel case 函數名、較簡化的提示詞介面及非同步函數,並支援 NodeJS v18 及以上版本。

  2. LlamaIndex:產品、工程與評測40

    RAGformation:自動生成雲端配置

    RAGformation 是一款開源 AI 工具,可根據用户的自然語言需求,自動選擇雲端服務、設計架構並估算價格。它運用 RAG 與 Llama Index Workflows 生成架構流程圖,並按需求調整推薦服務和配置。用户確認方案後,工具會生成包含流程圖、定價及所選服務摘要的報告,程式碼可在 GitHub 取得。

  3. Anthropic:Alignment Science Blog66

    Anthropic 發佈 Petri 2.0,新增 70 個場景並更新模型比較及評測意識緩解措施

    Anthropic 發佈 Petri 2.0,為自動化行為審計工具新增 70 個 seed 指令、評測意識緩解改進和較新前沿模型的評測結果。真實感分類器與人工修訂 seed 指令合用時,Claude 模型的評測意識中位相對降幅為 47.3%,但部分模型的未提示主動性亦有下降。

10月2日週五
10月1日週四
9月30日週三
  1. Hugging Face Blog65

    Open TTS Leaderboard 為多語言文字轉語音與聲音複製提供可擴展評估

    Hugging Face 建立 Open TTS Leaderboard,以客觀指標評估開源、多語言 TTS 模型及聲音複製能力。評估涵蓋 WER/CER、批次推理速度(RTFx)、首段音訊延遲(TTFA)及説話者相似度(SIM),可把單個模型的評估時間由數週縮短至數小時。排行榜不取代人工偏好評選,並設有 Listen 頁籤供用户比較生成音訊及投票;其指標不直接衡量自然度、表現力或聽者偏好。

    推薦理由:排行榜以客觀指標並列呈現語音清晰度、説話者相似度與速度表現,並保留聆聽投票,方便比較多語言及聲音複製模型。

9月29日週二
  1. Hugging Face Blog65

    NVIDIA Kumo Tabular 為表格預測樹立準確率與效率的新前沿

    NVIDIA 發佈開放式表格基礎模型 Kumo Tabular,用於表格分類與回歸,可根據帶標籤的上下文列,在單次前向傳播中預測新列標籤,無需訓練、調參或特徵工程。

    推薦理由:文章列出四項基準的結果,並以梯度提升樹、AutoGluon 等方法作對照,為表格預測模型的效能評估提供具體比較參照。

9月22日週二
  1. Hugging Face Blog51

    oMLX 創作者兼維護者 Jun Kim 加入 Hugging Face 支援 MLX 社羣

    Hugging Face 宣佈,oMLX 創作者兼維護者 Jun Kim 加入團隊,並會繼續領導 oMLX。oMLX 維持 Apache 2.0 授權,項目將轉為獲資助並持續維護;Hugging Face 預期這有助提升穩定性,並希望加快開發。Hugging Face 亦希望以 oMLX 作為新想法的試驗場,並加快將 transformers 模型定義轉成不同引擎可使用的 MLX 參考實作。