跳到正文

全部動態

今日 431 條
4月8日週三
  1. Hugging Face Blog61

    Safetensors 加入 PyTorch Foundation,成為 Linux Foundation 旗下託管項目

    Safetensors 加入 Linux Foundation 旗下的 PyTorch Foundation,成為基金會託管項目。商標、倉庫及項目治理歸 Linux Foundation,Hugging Face 的兩名核心維護者仍在 Technical Steering Committee,並繼續負責日常工作。

    推薦理由:Safetensors 轉由 Linux Foundation 治理,原維護者仍帶領項目,使用者所用格式與 API 不變。

4月6日週一
  1. Manus:Blog51

    2026 年五款最佳桌面 AI 智能體

    文章比較 Manus My Computer、Perplexity Computer、Claude Cowork、ChatGPT Agent 和 Genspark 五款桌面 AI 智能體,涵蓋功能、價格及適用場景。文中説明各工具在本地檔案存取和雲端執行上的差異,並按研究、Microsoft Office 文件處理和網頁自動化等需求提供選擇建議。

  2. Manus:Blog65

    Manus 推出 Slack 整合,提供三種工作委派方式

    Manus 推出 Slack 整合,提供智能體私訊、頻道內標記 @manus,以及 Slack 連接器三種工作方式。智能體私訊可延續過往對話記憶;頻道內標記只處理當前話題且不具持久記憶,連接器則可代讀和發送 Slack 訊息。智能體預設不能讀取其他頻道,須連接器已連接並將 Manus 加入指定頻道;Slack 應用內 AI 集成功能需使用付費 Slack 套餐。

4月4日週六
  1. FireRedTeam:原創語音與多模態項目59

    FireRedTeam 發佈 FireRed-Image-Edit-1.1,優化人像一致性等編輯能力

    FireRedTeam 發佈 FireRed-Image-Edit-1.1,基於 FireRed-Image-Edit-1.0,優化人像一致性、多元素融合、風格化文字參照及人像妝效。內置 Agent 可自動處理超過 3 張輸入圖片的區域偵測、裁切拼接及提示詞改寫。項目提供的加速推理配置標示使用 30GB VRAM,生成約 4.5s/sample。

4月3日週五
  1. Google Research51

    Google Research 評估大語言模型行為傾向的對齊程度

    Google Research 提出一套評估大語言模型行為傾向與人類偏好對齊程度的框架,並分析 25 個大語言模型。研究將經驗證的心理問卷改編為情境判斷測試,並以 550 名參與者中每題 10 名標註者的偏好分佈作比較。結果顯示,模型在低人類共識情境仍普遍過度自信,部分模型的自我陳述亦與其在情境中的行為傾向不一致。

4月2日週四
  1. Sarvam AI59

    印度語言 ASR 分層評測指南

    Sarvam AI 介紹印度語言 ASR 的分層評測方法,涵蓋 WER/CER、LLM-WER/LLM-CER、Intent Score、Entity Preservation Score 和 COMET。文中亦介紹兩個適用於任何 Indic ASR 系統的開源評測框架,均使用經 Google Vertex AI 呼叫的 Gemini 作為 LLM 評審。

  2. OpenAI News63

    OpenAI 收購 TBPN

    OpenAI 收購 TBPN,目標是加快全球圍繞 AI 的對話,並支持獨立媒體。OpenAI 表示,此舉將擴大與建設者、企業及更廣泛科技社羣的對話。

    推薦理由:公告將收購 TBPN 的目標連結至擴大全球 AI 對話及支持獨立媒體,並涵蓋建設者、企業與更廣泛科技社羣。

  3. Hugging Face Blog85

    Google DeepMind 發佈 Gemma 4 多模態模型系列,五種尺寸登陸 Hugging Face

    Google DeepMind 的 Gemma 4 多模態模型系列已登陸 Hugging Face,提供五種尺寸,支援圖像、文字及部分型號的音訊輸入。模型採 Apache 2 授權,最大上下文窗口為 256K;31B 和 26B A4B 的 text-only LMArena 估算分數分別為 1452 和 1441,後者有 4B 啟用參數。

    推薦理由:文章列出五種 Gemma 4 規格、上下文窗口和音訊支援差異,並整理多個推理與微調框架的接入方式,可供比較型號特點及部署路徑。

4月1日週三
  1. Hugging Face Blog68

    Gradio 介紹 gradio.Server,讓自訂前端使用 Gradio 後端

    Gradio 介紹 gradio.Server,讓自訂前端可使用 Gradio 的後端能力,同時採用自選的前端框架。gradio.Server 擴展 FastAPI,提供自訂路由等功能,並加入 Gradio 的佇列、SSE 串流、並發控制和 gradio_client 相容性。

    推薦理由:文章以圖像去背示例展示如何讓自訂 HTML/CSS/JS 前端透過 gradio.Server 使用 Gradio 佇列、並發控制與 ZeroGPU,提供兼顧介面自由度和後端管理的實作參考。

3月31日週二
  1. Hugging Face Blog65

    Hugging Face 發佈 TRL v1.0,打造能隨後訓練領域演進的函式庫

    Hugging Face 發佈 TRL v1.0,將已實作超過 75 種後訓練方法的研究程式碼庫明確定位為具穩定性契約的函式庫。穩定核心遵循語義化版本,實驗層則可快速變動;從最後一個 0.x 版本升級只需少量遷移。

    推薦理由:TRL v1.0 把遵循語義化版本的穩定核心與可快速變動的實驗層置於同一套函式庫,呈現下游穩定需求與新方法迭代之間的契約設計。

3月30日週一
3月29日週日
  1. Google DeepMind65

    Google DeepMind 探索 AI 時代的滑鼠遊標,介紹 Gemini 在 Chrome 的指向提問功能

    Google DeepMind 介紹 AI 指針的設計原則與實驗演示,並宣佈即日起可在 Chrome 用指針向 Gemini 提問網頁內容。這套設計以四項原則為核心,讓指針結合視覺和語義上下文及語音,減少使用者撰寫詳細提示詞的需要。Magic Pointer 將即將在 Googlebook 推出。

    推薦理由:文章以四項交互原則説明 AI 指針如何減少提示詞負擔,並列出 Gemini 在 Chrome 的現有功能及 Googlebook 即將推出的 Magic Pointer。

3月28日週六
  1. OpenAI:失準報告與通報51

    OpenAI 研究:對齊中訓練能泛化多遠?

    OpenAI 研究人員測試對齊中訓練在類似 o4-mini 的模型上能否泛化;模型經過推理後訓練後,這種訓練效果未能穩定延伸至較貼近現實的聊天及智能體評測。他們分別以 230k 份文件(約 340M tokens)進行對齊或失準中訓練,並與不加額外中訓練的基線比較;接近訓練分佈的問答評測呈現預期排序。聊天評測中,兩種中訓練結果大多相近;智能體評測未能明確區分三組模型,整體分數沒有顯著差異。

3月26日週四
  1. Google DeepMind73

    Google DeepMind 推出 Gemini 3.1 Flash Live,提升語音 AI 的自然度與可靠性

    Google DeepMind 推出 Gemini 3.1 Flash Live,提升即時語音對話的精準度並降低延遲。它在 ComplexFuncBench Audio 得分 90.8%,在 Scale AI 的 Audio MultiChallenge 開啟 thinking 時得分 36.1%。

    推薦理由:原文以兩項語音基準呈現多步函數調用與複雜指令跟隨表現,並列出開發者、企業及一般用户的使用入口,可對照其能力與部署場景。

  2. Hamel Husain 長文67

    數據科學家的反擊:LLM 時代評測仍需要數據科學方法

    Hamel Husain 認為,LLM API 雖讓團隊可自行整合 AI,評測、實驗設計和生產監測仍需要數據科學方法。文中列出五類評測陷阱,包括套用通用指標、未驗證 LLM 評審、測試集設計不當、數據及標籤質素欠佳,以及過度自動化。作者建議檢視 traces、以人工標註驗證評審,並根據真實生產數據設計測試集,讓領域專家參與標註。

  3. Google DeepMind64

    Google DeepMind 公開 AI 有害操縱評估工具包及研究結果

    Google DeepMind 公開一套經實證驗證的工具包及研究材料,用於評估 AI 有害操縱能力,並衡量操縱成效與模型採用操縱手法的傾向。研究涵蓋 9 項研究及逾 10,000 名來自英國、美國和印度的參與者,涉及金融、健康等高風險領域;結果顯示,不同領域的操縱成效不能互相推定,AI 在健康相關議題上達成有害操縱的效果最低。

    推薦理由:研究把有害操縱評估拆分為操縱成效與模型採用操縱手法的傾向,並發現不同領域的結果不能互相推定,為高風險情境評估提供可複用方法。

3月25日週三
  1. Google Research62

    Google Research 推出 Vibe Coding XR,以 Gemini 和 XR Blocks 生成 Android XR 原型

    Google Research 宣佈 Vibe Coding XR,結合 Gemini 與 XR Blocks,將自然語言描述轉成具物理感知能力的 Android XR 應用,最快可在 60 秒內生成。

    推薦理由:文章展示如何以 XR Blocks 架構、範例模板和專用系統提示詞約束 Gemini,令自然語言生成的 XR 原型遵循既有 API 與互動設計規範。

  2. ARC Prize:官方博客68

    ARC Prize 發佈 ARC-AGI-3 互動式基準測試,評估智能體探索能力

    ARC Prize 發佈 ARC-AGI-3,這是 ARC-AGI 系列首個完全互動式基準,包含數百個互動環境和數千個遊戲式關卡。環境沒有指示、規則或明示目標,AI 智能體須自行探索並將所學帶到難度逐步提高的關卡。ARC Prize 2026 現已開放參賽,獎金超過 $2 million;人類得分為 100%,前沿 AI 得分為 0.51%。

  3. Google Research42

    描繪現代世界:S2Vec 如何學習城市語言

    Google Research 開發 S2Vec,透過自監督學習將建成環境特徵轉為通用嵌入向量。評測中,S2Vec 在美國人口密度及中位收入等未見地區的零樣本地理適應任務中,通常是表現最佳的單一模型,但樹冠覆蓋、海拔等環境任務仍有改進空間。S2Vec 與影像嵌入向量融合,整體通常優於單一模態。

3月24日週二
  1. Mistral AI66

    Mistral AI 發佈 4B 參數語音生成模型 Voxtral TTS

    Mistral AI 發佈 4B 參數的 Voxtral TTS,支援 9 種語言語音生成。在典型的 10 秒語音樣本和 500 characters 輸入下,模型延遲為 70ms;人評顯示其自然度高於 ElevenLabs Flash v2.5,TTFA 相近。

    推薦理由:原文以人評比較 Voxtral TTS 與 ElevenLabs Flash v2.5 的自然度和 TTFA,並列出模型延遲及 API 定價,提供評估語音智能體應用的具體依據。

3月23日週一
3月19日週四
3月18日週三
  1. Google Research70

    Google Research 探討機器學習如何改善乳癌篩查流程

    Google Research 與 NHS 合作開展兩項研究,評估 AI 單獨讀片及融入乳癌篩查雙讀仲裁流程的表現。單獨讀片評估的癌症檢出率由每 1,000 名女性 7.54 升至 9.33,AI 亦檢出原雙讀流程漏掉的間隔癌中的 25%。融入雙讀仲裁後,流程在癌症檢出敏感度和特異度上達非劣效,估計可減少 46% 的人工讀片;但仲裁者曾推翻 AI 對 93 宗陽性癌症個案作出的正確召回判斷。

    推薦理由:兩項研究分別檢視 AI 單獨讀片及加入人機仲裁後的流程,讓讀者同時衡量讀片人力效益與仲裁風險。

  2. Hugging Face Blog64

    Hugging Face 2026 年春季開源 AI 生態現況分析

    Hugging Face 的 2026 年春季報告梳理過去一年開源 AI 生態的變化,指出平台用户、模型和數據集數量均接近翻倍。2025 年,Hugging Face 增至 13 million 名用户、逾 2 million 個公開模型及逾 500,000 個公開數據集;中國模型在過去一年佔平台下載量 41%,並在月度及總下載量上超越美國。

    推薦理由:報告把平台增長、地域下載差異和衍生模型放在同一框架,呈現開源 AI 並非單一市場,而是由多個重疊的子生態構成。

  3. Manus:Blog43

    使用 Manus 連接器連接 Meta Ads Manager

    Manus 推出與 Meta Ads Manager 連接的早期 Beta 版連接器,可即時查詢廣告帳户並分析廣告表現。連接器可按排程發送每日或每週摘要,並生成即時儀錶板、簡報及資訊圖表;它透過官方 API 提供安全唯讀存取,不能更改廣告活動。功能正逐步推出,可能尚未向所有人開放。

  4. Manus:Blog50

    使用 Manus Connectors 連接 Instagram Creator Marketplace

    Manus 推出 Manus Connectors 的 Instagram Creator Marketplace 早期 Beta,將 Meta 官方創作者發掘工具接入 Manus 工作流程。連接器可搜尋和篩選超過 200 萬名創作者,並提供 Meta 認證的一方受眾與績效洞察,亦可把創作者發掘及外聯電郵草擬整合至自動化流程。功能目前在所有 Manus 市場提供,但不包括歐盟國家。