跳到正文

全部動態

今日 443 條
6月24日週三
6月23日週二
  1. Mistral AI60

    Mistral OCR 4 發佈,新增文件區塊定位、分類與信心分數

    Mistral AI 發佈文件解析模型 Mistral OCR 4,除提取文字外亦輸出邊界框、區塊類型和信心分數,並支援 170 種語言、10 個語言組別。獨立人工偏好評估的平均勝率為 72%,模型在 OlmOCRBench 得分 85.20;官方提醒自動基準存在評分侷限,建議以自有文件評估。

    推薦理由:文章列明 OCR 4 的結構化輸出和自動基準評分侷限,為企業按自身文件評估解析、檢索及資料管線提供具體參照。

6月22日週一
6月19日週五
  1. OpenAI:失準報告與通報63

    OpenAI 研究以強化學習訓練廣泛且持續有益的模型

    OpenAI 的研究發現,在強化學習中加入少量有益行為特質資料,可改善模型的對齊表現,並把效果泛化至訓練未涵蓋的領域。在 53 項內外部評估中,該模型於 44 項較使用相同起點及相同 RL 算力訓練的基線模型有所改善,涵蓋欺騙、獎勵破解、健康及安全等評估。研究亦發現,這些改善在對抗提示及有害微調下較能維持,但仍需進一步區分有益特質訓練與一般後訓練 RL 的作用。

6月18日週四
  1. Hugging Face Blog68

    Hugging Face 以 agent-eval 評測開源模型操作 transformers 的成功率與成本

    Hugging Face 測試開源模型使用 transformers,CLI 與 Skill 縮短大型模型耗時,卻可能降低小模型成功率。Qwen3-14B 在 classify-sentiment 任務中,clone 環境的匹配率為 100%,Skill 環境則降至 0%。agent-eval CLI 可套用於其他命令列工具,並記錄匹配率、tokens、耗時、錯誤、行為標記及執行軌跡。

    推薦理由:評測不只看任務是否成功,也追蹤 tokens、耗時與操作路徑,呈現 CLI 與 Skill 對大小模型的影響並不一致。

6月17日週三
  1. Hugging Face Blog78

    GLM-5.2 發佈,最大上下文擴至 1M tokens並提升長程任務能力

    GLM-5.2 發佈,將最大上下文長度由 200K 擴至 1M tokens,並強化長程任務與編碼能力。它在 Terminal-Bench 2.1 和 SWE-bench Pro 分別取得 81.0、62.1,高於 GLM-5.1 的 63.5、58.4。

    推薦理由:文章並列長程編碼基準成績與 IndexShare、MTP 的效率改動,讓讀者可對照模型性能數據和 1M-token 上下文的工程支撐。

6月16日週二
6月15日週一
6月13日週六
6月12日週五
  1. Manus:Blog60

    透過 Canva 連接器,讓 Manus 成為你的設計部門

    Manus 的 Canva 連接器可在聊天中建立、編輯、調整尺寸和整理 Canva 設計,亦可把書面內容轉成多張幻燈片視覺素材。文章示範把研究、博客撰寫和 LinkedIn 輪播圖製作串成工作流,並將邀請函流程存為可重複調用的 Manus 技能。不同功能設有套餐限制,例如調整尺寸需 Pro 套餐及以上,品牌模板搜索僅限企業版。

6月11日週四
  1. AI as Normal Technology72

    為何 AI 尚未取代軟件工程師,未來也不會

    文章認為,AI 尚未取代軟件工程師,單靠能力提升也不會消除這類工作的需求。作者以「決策、執行、交付」三層框架解釋,AI 壓縮程式碼實作的執行層,但需求界定、驗證及交付責任仍需人員承擔。一項涵蓋 GitHub 上 100,000 名開發者的研究顯示,AI 智能體令程式碼行數增加 8 倍,發布量只增加 30%。

  2. Factory 研究 / 產品66

    Droid 推出自動化安全審查功能

    Factory 為 Droid 推出自動化安全審查,在每個非草稿 PR 中與標準程式碼審查同步執行 STRIDE 審查。結果會以 diff 行內評論列出嚴重程度、CWE 參照、説明及建議修正;Droid 會對照 diff 驗證候選發現,以過濾誤報。功能現已適用於所有方案;Droid CLI / Desktop App 可設定審查,亦可在本機工作階段按需審查整個程式碼庫或目前 diff。

6月10日週三
  1. Ethan Mollick:One Useful Thing77

    Ethan Mollick分享與Claude 5 Fable協作的體驗,並剖析人類角色轉變

    Ethan Mollick實測Claude 5 Fable後指出,模型能按多頁規格連續工作長達12小時,人的角色更像委託者。它在Claude Code中調用多個智能體研究交通資料並製作等時線地圖,也花九個半小時開發可校準人類與AI判斷的研究軟件Concord。Mollick指出,Fable消耗大量 tokens,安全護欄常令它退回能力較弱的Claude 4.8 Opus,而其決策過程不易看見。

    推薦理由:Ethan Mollick以等時線地圖和研究分析軟件的實測,呈現人類角色如何由過程操作轉向委託與驗收,以及模型自主決策帶來的可見性落差。

6月9日週二