跳到正文

#評測/基準

今日 0 條
10月6日週二
  1. 小米 MiMo:官網發佈與博客32

    MiMo 人文與社會科學能力評估

    小米 MiMo 的人文與社會科學能力評估顯示,它在創意寫作與藝術感知方面表現較均衡,兼顧邏輯結構與情感表達。評估由 9 名評估者比較 MiMo 與兩個對照模型,創意寫作共設計 40 項任務,涵蓋現代詩、古典詩詞及敍事小説。MiMo 能按文類調整創作側重,但遵守古典詩詞格律及運用相關知識方面仍不穩定。

  2. Eugene Yan:Writing67

    構建網絡安全評測的設計模式

    Eugene Yan 梳理多個網絡安全基準,歸納智能體評測的共同設計模式,並比較它們衡量漏洞發現、重現與利用能力的方法。文章將常見設計概括為沙盒目標環境、影響任務難度的資訊、工具和評分器,並介紹 Cybench、CVE-Bench、CyberGym 等基準如何提供部分分數或按攻擊階段分級。

10月5日週一
  1. MarkTechPost78

    GPT-6 Astra、GPT-6.1 Sol、Gemini 4 Argon 與 Claude Fable 5.1:不同工作適合哪款前沿模型?

    MarkTechPost 將 GPT-6 Astra、GPT-6.1 Sol、Gemini 4 Argon 與 Claude Fable 5.1 的基準、價格及存取條件並列,按工作負載整理各自適用情境。

    推薦理由:文章將四款模型的基準、價格、存取限制和任務成本並列,呈現不同工作負載下的取捨,説明排行榜名次不足以單獨決定選型。

10月3日週六
  1. LlamaIndex:產品、工程與評測43

    較弱的 LLM 智能體需要更多限制與更好的工具

    LlamaIndex 發現,較弱模型驅動的 ReAct 智能體在金融分析資料任務中較難取得相關結果。限制智能體互動,並提供更多能明確執行複雜操作的工具,可改善這類模型的查詢表現。相比之下,GPT-4 較能可靠地運用 ReAct 執行多種複雜資料查詢。

  2. LlamaIndex:產品、工程與評測45

    OlmOCR-Bench 評析:OCR 基準測試的洞見與陷阱

    LlamaIndex 評析 OlmOCR-Bench,認為它有助衡量文件 OCR 進展,但與多數真實文件處理需求仍有落差。基準涵蓋 1400+ 份 PDF、設有 7000+ 項二元單元測試,並按類別計算子分數。不過,約 56% 的 PDF 來自學術資料,表格與閲讀順序測試粒度偏粗,精確匹配亦容易造成脆弱判定。

  3. LlamaIndex:產品、工程與評測26

    2026 年面向全球文件辨識的最佳多語言 OCR 軟件

    2026 年多語言 OCR 軟件評估聚焦全球文件辨識,指出英語、拉丁字母文件上的準確率未必反映其他文字系統及混合語言文件的實際表現。評估工具時,須檢視其對 RTL、CJK、垂直文字、混合語言分段辨識及版面結構的處理能力。低資源語言及文件品質會影響辨識效果,應以實際文件測試,而非只看支援語言數量。

  4. Hacker News:AI 熱帖18

    評測智能體在雜亂真實公司知識中的檢索能力

    這場討論聚焦如何評測智能體在雜亂真實公司知識中的檢索能力,並詢問 BEAM、MemEval、MemoryArena 等基準的參考價值。提問者亦詢問 Karpathy 的 Episodic/Procedural/Semantic 分類(Doxa/Koine/Gnosis)是否有用、與設計哪些部分相符,並追問能否公開資料抽取流程,讓其他公司自行比較,以推進可重現性。

  5. Hacker News:AI 熱帖27

    Jev 等決策模型未能勝過 LLM-as-a-judge 或傳統分類器

    Jev 等決策模型未能勝過 LLM-as-a-judge 或傳統分類器;用於智能體堆疊的條件分支決策時,模型須兼具良好校準與資訊性。神經網絡輸出 logits 對可約減的認知不確定性屬高度有損壓縮,令校準在實務上難以落實;高概率區域的估計亦會在輕微協變量偏移下不穩,令多步搜尋圖可能走向模型訓練或校準時未見的分支,甚至落在分佈外。

  6. The Verge · AI71

    OpenAI 的 Dots 智能體像企業軟件,也能代點晚餐

    作者實測 OpenAI 的 Dots 智能體,發現它更像可操作其他軟件的工作助理,處理個人購物時則屢受網站安全檢查阻礙。取得電腦存取權後,Dots 成功整理影片及更新個人網站;在協助登入 Uber Eats 後,也訂到了照燒餐。作者透過每月 $100 的 Pro 賬户測試,認為以自己的工作需求而言,Dots 尚不值這個月費。

9月30日週三
9月25日週五
9月24日週四
  1. elsewhere:文章64

    這個中秋國慶,放過自己,讓元寶 AI 處理旅遊規劃

    作者實測元寶新上線的旅遊計劃 Agent,展示它如何把聊天需求整理成行程,並提供可互動行程卡和旅前裝備推薦。蘇州低精力行程每天安排兩個景點並預留午睡時間;新疆行程則把單日車程控制在最長 4 小時內,並按需求安排住宿與徒步路線。文中還展示元寶查詢蘇州 2026 年門票預約規則,並按對話修改行程。

9月23日週三
9月22日週二
9月16日週三
9月3日週四
8月25日週二
7月8日週三
6月18日週四
  1. Hugging Face Blog68

    Hugging Face 以 agent-eval 評測開源模型操作 transformers 的成功率與成本

    Hugging Face 測試開源模型使用 transformers,CLI 與 Skill 縮短大型模型耗時,卻可能降低小模型成功率。Qwen3-14B 在 classify-sentiment 任務中,clone 環境的匹配率為 100%,Skill 環境則降至 0%。agent-eval CLI 可套用於其他命令列工具,並記錄匹配率、tokens、耗時、錯誤、行為標記及執行軌跡。

    推薦理由:評測不只看任務是否成功,也追蹤 tokens、耗時與操作路徑,呈現 CLI 與 Skill 對大小模型的影響並不一致。

6月17日週三
6月10日週三
  1. Ethan Mollick:One Useful Thing77

    Ethan Mollick分享與Claude 5 Fable協作的體驗,並剖析人類角色轉變

    Ethan Mollick實測Claude 5 Fable後指出,模型能按多頁規格連續工作長達12小時,人的角色更像委託者。它在Claude Code中調用多個智能體研究交通資料並製作等時線地圖,也花九個半小時開發可校準人類與AI判斷的研究軟件Concord。Mollick指出,Fable消耗大量 tokens,安全護欄常令它退回能力較弱的Claude 4.8 Opus,而其決策過程不易看見。

    推薦理由:Ethan Mollick以等時線地圖和研究分析軟件的實測,呈現人類角色如何由過程操作轉向委託與驗收,以及模型自主決策帶來的可見性落差。

5月22日週五
4月30日週四
4月6日週一
  1. Manus:Blog51

    2026 年五款最佳桌面 AI 智能體

    文章比較 Manus My Computer、Perplexity Computer、Claude Cowork、ChatGPT Agent 和 Genspark 五款桌面 AI 智能體,涵蓋功能、價格及適用場景。文中説明各工具在本地檔案存取和雲端執行上的差異,並按研究、Microsoft Office 文件處理和網頁自動化等需求提供選擇建議。

4月2日週四
  1. Sarvam AI59

    印度語言 ASR 分層評測指南

    Sarvam AI 介紹印度語言 ASR 的分層評測方法,涵蓋 WER/CER、LLM-WER/LLM-CER、Intent Score、Entity Preservation Score 和 COMET。文中亦介紹兩個適用於任何 Indic ASR 系統的開源評測框架,均使用經 Google Vertex AI 呼叫的 Gemini 作為 LLM 評審。

3月10日週二
  1. Manus:Blog57

    9 款最佳 AI 電子商務網站建構工具評測

    評測者在相同的三類電商場景下實測 9 款 AI 網站建構工具,並按設計品質、品牌呈現、電商完整度和可編輯性比較表現。測試中,Squarespace Blueprint AI 的設計輸出較穩定,Wix AI 兼顧生成與編輯,Shopify 側重電商基建而非 AI 建站,Manus 則可製作自訂計算器和產品配置器。文章亦提醒,跨平台遷移通常無法帶走設計系統與版面,AI 文案仍需人工修改。

3月6日週五
  1. Manus:Blog50

    我們測試了 8 款工具,找出 2026 年最佳免費 AI 作品集製作工具

    Manus 以同一提示測試 8 款 AI 作品集製作工具,按設計質素、AI 對提示詞的理解與執行、發布選項及轉化導向比較,Manus 與 Replit 均獲 9/10。文章列 Manus 為整體首選,其免費版每日提供 300 積分,並可免費發佈至 manus.space 子域名;Lovable 則列為最佳免費選項,每日有 5 積分並可一鍵部署。文中指出,多數工具須付費方案才能連接自訂網域。

  2. Manus:Blog64

    2026 年最佳 AI 應用程式建構工具:以相同提示詞測試 7 個平台

    Manus 以相同的 Solace Studio 提示詞測試 7 個 AI 應用程式建構平台,並在文中將自家工具列為整體首選。測試中,Manus 從單一提示詞生成包含預約日曆、Stripe 付款及管理員面板的功能原型;Replit 也嘗試生成完整堆疊,但需具備一定技術經驗以作驗證和除錯。文章指出,多數其他平台先生成視覺介面,部分後端功能需要另行設定或手動構建。