跳到正文

全部動態

今日 427 條
2月27日週五
  1. Google DeepMind76

    Google DeepMind 發佈 Nano Banana 2(Gemini 3.1 Flash Image),融合 Pro 能力與 Flash 速度

    Google DeepMind 發佈圖像生成模型 Nano Banana 2(Gemini 3.1 Flash Image),以 Flash 速度帶來 Nano Banana Pro 的世界知識、品質與推理能力。

    推薦理由:Nano Banana 2 將 Nano Banana Pro 的世界知識、視覺品質與創作控制帶到 Flash 速度,並交代其在 Google 產品中的推出範圍及 Nano Banana Pro 的保留使用方式,説明兩款模型面向的工作流程差異。

2月26日週四
2月25日週三
2月24日週二
  1. AI as Normal Technology64

    新論文《Towards a Science of AI Agent Reliability》分析 AI 智能體可靠性

    新論文評估 14 個模型,發現近 18 個月模型能力提升明顯,AI 智能體可靠性僅小幅改善。研究把可靠性拆分為一致性、穩健性、可預測性和安全性四個維度,以 12 項指標測試 GAIA 與 TauBench;可預測性是整體最弱的一環。作者建議在準確率之外同步報告可靠性各維度表現,並計劃推出 AI agent reliability index。

2月23日週一
2月20日週五
  1. Sarvam AI44

    Sarvam AI 推出 Indus 限量測試版

    Sarvam AI 開放 Indus 限量測試,這個模型體驗介面由其 105B 主權模型驅動。Indus 現階段聚焦印度語境下的準確度、實用性、效率與對齊。服務正以有限運算容量逐步開放,初期用戶或需加入等候名單。

  2. Hugging Face Blog76

    GGML 團隊加入 Hugging Face,支持 llama.cpp 及 Local AI 長期發展

    GGML 團隊加入 Hugging Face,並將持續維護 llama.cpp;Hugging Face 會為項目提供長期資源支持。團隊仍將 100% 時間用於維護,並對技術方向及社羣保有完全自主權與領導權;項目會繼續 100% 開源並由社羣推動。雙方計劃讓 transformers library 的模型定義更順暢地用於 llama.cpp,並改善 ggml 軟件封裝及本地模型部署體驗。

    推薦理由:文章交代 GGML 團隊加入後 llama.cpp 的維護自主權與資源支持,也列出連接 transformers library 模型定義及改善本地部署體驗的方向。

  3. Benedict Evans:Blog61

    OpenAI 將如何在 AI 市場競爭?

    Benedict Evans 分析 OpenAI 的競爭處境,指出其模型與其他前沿模型能力接近,且龐大用戶羣的使用深度和黏性有限。文中稱 OpenAI 有 8-900m 用戶,只有 5% 的 ChatGPT 用戶付費,80% 用戶在 2025 年發送少於 1,000 則訊息。他進一步質疑,巨額算力投資與全棧平台構想是否足以建立網絡效應,並指出生成式 AI 的新產品體驗仍待創造。

  4. Google DeepMind77

    Gemini 3.1 Pro:面向最複雜任務的更智能模型

    Google DeepMind 發佈 Gemini 3.1 Pro,作為 Gemini 3 系列核心模型升級,提升複雜問題的推理能力。它在 ARC-AGI-2 取得經驗證的 77.1% 得分,推理表現超過 Gemini 3 Pro 兩倍。

    推薦理由:Gemini 3.1 Pro 在 ARC-AGI-2 取得經驗證的 77.1% 得分,並稱推理表現超過 Gemini 3 Pro 兩倍,為核心推理升級提供量化比較依據。

2月19日週四
  1. Google DeepMind75

    Google DeepMind 推出 Lyria 3 音樂生成模型,於 Gemini app 開放 beta 使用

    Google DeepMind 在 Gemini app beta 推出 Lyria 3 音樂生成模型,使用者可用文字提示或上傳照片、影片生成 30 秒音軌。系統會按提示生成歌詞,並可調整風格、人聲和節奏;音軌嵌入 SynthID,Gemini 的核驗功能亦延伸至音訊,使用者可上傳檔案詢問其是否由 Google AI 生成。

    推薦理由:Lyria 3 在 Gemini app 開放以文字、圖片或影片生成音樂,並納入 SynthID 與音訊核驗,呈現創作功能和 AI 內容識別並行的設計。

2月18日週三
2月17日週二
  1. Google DeepMind65

    Google DeepMind 與印度政府及當地機構合作,推進 AI 科學與教育應用

    Google DeepMind 宣佈與印度政府部門及當地機構建立新合作,擴大 AI 在科學與教育領域的應用。合作將向印度研究人員提供 AlphaGenome、AI Co-scientist 和 Earth AI,並推出 $30 million Google.org Impact Challenge: AI for Science。

    推薦理由:文章列出研究機構合作、AI 科學挑戰賽及教材互動化安排,呈現 Google DeepMind 在印度推進科學與教育應用的具體路徑。

2月16日週一
  1. 上海人工智能實驗室 InternLM:原創項目33

    InternLM/VSR:以像素引導的圖表解析方法

    Visual Self-Refine(VSR)提出像素引導的圖表解析方法,將解析轉為以渲染像素驗證並修正結果的回饋迴圈。流程先預測錨點並渲染圖表,再檢視渲染結果,依據已驗證的像素修正最終解析;專案亦提供資料處理流程和 benchmark 評估腳本。

2月13日週五
  1. AI as Normal Technology56

    AI 不會自動降低法律服務成本

    Justin Curl 與合著者指出,AI 能力提升不會自動降低消費者取得理想法律結果的成本,制度與工作流程中的瓶頸可能抵銷生產力增益。文章將瓶頸歸納為限制 AI 法律服務的監管規則、訴訟與合約談判中的對抗性,以及人類法官和法律專業人員的處理速度。作者討論調整職業監管、司法程序及律師角色等改革,並指出法律工作產出變便宜,不等於客户更容易取得所需法律結果。

  2. Manus:Blog54

    2026 年 8 款免費 PDF 轉 PPT 轉換器實測與比較

    作者以同一份 4 頁林肯市發展報告測試 8 款免費 PDF 轉 PPT 工具,認為 Manus 和 Gamma 較能產出可用簡報。Manus 將報告中的市場指標轉成數據圖表;Gamma 的設計風格較一致,但採用的 AI 圖像較通用。Smallpdf 和 iLovePDF 只轉換格式,Slidesgo 未使用原 PDF 內容,而 PresentationsAI 免費版無法匯出。

  3. Manus:Blog54

    Manus 與 Synthesia 比較:哪款 AI 影片生成器更適合你?

    Manus 的文章以兩組相同提示詞比較 Manus 與 Synthesia,測試顯示 Synthesia 動態較自然,Manus 更能遵循場景細節。企業影片提示要求生成 30 秒影片,Manus 輸出 30 秒,Synthesia 則約 8 秒,兩者的動畫都有瑕疵。文章認為 Synthesia 更適合專業化身影片,Manus 則較適合重視創意自由和多步驟工作流程的用户。

  4. Manus:Blog55

    2026 年最佳 AI 代碼審查工具評測與選擇指南

    Manus 以同一組 PR 案例評測 9 款 AI 代碼審查工具,涵蓋錯誤修復、重構、依賴更新和權限邊界。結果顯示,各工具在安全關鍵邏輯的風險檢測深度上差異明顯,工作流原生整合不代表分析更深入。Manus 在明確框定為安全審查的授權反轉測試中,生成了著重失敗模式、影響和補救步驟的報告,但未原生嵌入 PR 討論串作為自動審查員。

2月12日週四
  1. OpenAI News67

    OpenAI 發佈 GPT-5.3-Codex-Spark 即時編碼模型

    OpenAI 發佈 GPT-5.3-Codex-Spark,並稱其為首個即時編碼模型,生成速度快 15x,具備 128k 上下文窗口。目前以研究預覽形式向 ChatGPT Pro 用户提供。

    推薦理由:公告列出生成速度、上下文窗口及研究預覽的適用對象,讓讀者可同時瞭解 GPT-5.3-Codex-Spark 的性能宣稱與目前開放範圍。

2月11日週三
  1. Google Research49

    超越一對一:以 DialogLab 編寫、模擬及測試動態人類與 AI 羣體對話

    Google Research 提出開源原型框架 DialogLab,用於編寫、模擬及測試動態人類與 AI 羣體對話。框架採用「編寫、測試、驗證」流程,並以視覺化介面及驗證儀錶板協助設計與分析對話。14 名參與者的評估顯示,人類控制模式顯著更具投入感,並普遍被認為更有效、寫實。