跳到正文

#評測/基準

今日 0 條
10月3日週六
  1. LlamaIndex:產品、工程與評測45

    OlmOCR-Bench 評析:OCR 基準測試的洞見與陷阱

    LlamaIndex 評析 OlmOCR-Bench,認為它有助衡量文件 OCR 進展,但與多數真實文件處理需求仍有落差。基準涵蓋 1400+ 份 PDF、設有 7000+ 項二元單元測試,並按類別計算子分數。不過,約 56% 的 PDF 來自學術資料,表格與閲讀順序測試粒度偏粗,精確匹配亦容易造成脆弱判定。

  2. Hacker News:AI 熱帖18

    評測智能體在雜亂真實公司知識中的檢索能力

    這場討論聚焦如何評測智能體在雜亂真實公司知識中的檢索能力,並詢問 BEAM、MemEval、MemoryArena 等基準的參考價值。提問者亦詢問 Karpathy 的 Episodic/Procedural/Semantic 分類(Doxa/Koine/Gnosis)是否有用、與設計哪些部分相符,並追問能否公開資料抽取流程,讓其他公司自行比較,以推進可重現性。

  3. Hacker News:AI 熱帖27

    Jev 等決策模型未能勝過 LLM-as-a-judge 或傳統分類器

    Jev 等決策模型未能勝過 LLM-as-a-judge 或傳統分類器;用於智能體堆疊的條件分支決策時,模型須兼具良好校準與資訊性。神經網絡輸出 logits 對可約減的認知不確定性屬高度有損壓縮,令校準在實務上難以落實;高概率區域的估計亦會在輕微協變量偏移下不穩,令多步搜尋圖可能走向模型訓練或校準時未見的分支,甚至落在分佈外。

9月30日週三
6月10日週三
  1. Ethan Mollick:One Useful Thing77

    Ethan Mollick分享與Claude 5 Fable協作的體驗,並剖析人類角色轉變

    Ethan Mollick實測Claude 5 Fable後指出,模型能按多頁規格連續工作長達12小時,人的角色更像委託者。它在Claude Code中調用多個智能體研究交通資料並製作等時線地圖,也花九個半小時開發可校準人類與AI判斷的研究軟件Concord。Mollick指出,Fable消耗大量 tokens,安全護欄常令它退回能力較弱的Claude 4.8 Opus,而其決策過程不易看見。

    推薦理由:Ethan Mollick以等時線地圖和研究分析軟件的實測,呈現人類角色如何由過程操作轉向委託與驗收,以及模型自主決策帶來的可見性落差。

4月30日週四
4月6日週一
  1. Manus:Blog51

    2026 年五款最佳桌面 AI 智能體

    文章比較 Manus My Computer、Perplexity Computer、Claude Cowork、ChatGPT Agent 和 Genspark 五款桌面 AI 智能體,涵蓋功能、價格及適用場景。文中説明各工具在本地檔案存取和雲端執行上的差異,並按研究、Microsoft Office 文件處理和網頁自動化等需求提供選擇建議。

3月10日週二
  1. Manus:Blog57

    9 款最佳 AI 電子商務網站建構工具評測

    評測者在相同的三類電商場景下實測 9 款 AI 網站建構工具,並按設計品質、品牌呈現、電商完整度和可編輯性比較表現。測試中,Squarespace Blueprint AI 的設計輸出較穩定,Wix AI 兼顧生成與編輯,Shopify 側重電商基建而非 AI 建站,Manus 則可製作自訂計算器和產品配置器。文章亦提醒,跨平台遷移通常無法帶走設計系統與版面,AI 文案仍需人工修改。

3月6日週五
  1. Manus:Blog53

    2026 年十大最佳 AI 影片剪輯軟件

    Manus 在 2026 年以同一段 8 分鐘素材測試 10 款 AI 影片剪輯平台,比較它們減少剪輯時間、保留創作控制權及將長片改編為短片的表現。評測涵蓋 Manus、Adobe Premiere、Veed.io、Wisecut、DaVinci Resolve、Descript、CapCut、Runway、OpusClip 和 Filmora。

2月13日週五
  1. Manus:Blog54

    Manus 與 Synthesia 比較:哪款 AI 影片生成器更適合你?

    Manus 的文章以兩組相同提示詞比較 Manus 與 Synthesia,測試顯示 Synthesia 動態較自然,Manus 更能遵循場景細節。企業影片提示要求生成 30 秒影片,Manus 輸出 30 秒,Synthesia 則約 8 秒,兩者的動畫都有瑕疵。文章認為 Synthesia 更適合專業化身影片,Manus 則較適合重視創意自由和多步驟工作流程的用户。

  2. Manus:Blog55

    2026 年最佳 AI 代碼審查工具評測與選擇指南

    Manus 以同一組 PR 案例評測 9 款 AI 代碼審查工具,涵蓋錯誤修復、重構、依賴更新和權限邊界。結果顯示,各工具在安全關鍵邏輯的風險檢測深度上差異明顯,工作流原生整合不代表分析更深入。Manus 在明確框定為安全審查的授權反轉測試中,生成了著重失敗模式、影響和補救步驟的報告,但未原生嵌入 PR 討論串作為自動審查員。

2月6日週五
  1. Manus:Blog59

    2026 年 7 款最佳 AI 登陸頁面生成器:測試與比較

    Manus 以同一提示詞測試並比較 7 款 AI 登陸頁面生成器,評估設計質素、文案、可否直接發布、免費發布及自訂能力。Manus 獲 9/10,並被評為設計質素最高;Manus、Base44 和 Simplepages AI 的免費方案均可發布。Aura 免費生成及編輯但匯出須付費,Emergent AI 和 Squarespace 的免費方案則不能發布。

2月2日週一
1月22日週四
  1. Manus:Blog56

    非技術人員實測 Lovable、Replit、Bolt、Cursor 及 Manus 五款氛圍編碼工具

    一名非技術背景的內容寫作者以同一提示測試 Lovable、Replit、Bolt、Cursor 及 Manus,要求五款氛圍編碼工具製作個人作品集網站。測試中,Lovable 對初學者最友善,Manus 付費版最貼近其流行藝術設計要求;Manus 免費版出現 404 錯誤,而作者未能用 Cursor 產出網站。文章指出,工具各有適用人羣,提示須清晰具體,付費方案也可能帶來更符合創意要求的結果。

12月19日週五