Common Sense Media 稱 ChatGPT for Teens 存在「不可接受的風險」
Common Sense Media 認為 OpenAI 的 ChatGPT for Teens 存在「不可接受的風險」,並指家長警示與危機支援不足,系統仍會代做功課。OpenAI 質疑測試大多可能在家長控制功能完成啟用前已開始並結束;Common Sense Media 則回應,部分測試帳戶連結較長時間後仍未收到通知,並維持家長危機警示不可靠的結論。
Common Sense Media 認為 OpenAI 的 ChatGPT for Teens 存在「不可接受的風險」,並指家長警示與危機支援不足,系統仍會代做功課。OpenAI 質疑測試大多可能在家長控制功能完成啟用前已開始並結束;Common Sense Media 則回應,部分測試帳戶連結較長時間後仍未收到通知,並維持家長危機警示不可靠的結論。
英國 AI Security Institute 評估中,GPT-5.5 的 Expert 級進階任務平均通過率為 71.4%,高於 Mythos Preview 的 68.6%。
推薦理由:報告分別測試進階網絡任務、企業攻擊鏈及工控模擬,並交代結果與測試限制,呈現 GPT-5.5 網絡安全能力的不同面向。
小米 MiMo 的人文與社會科學能力評估顯示,它在創意寫作與藝術感知方面表現較均衡,兼顧邏輯結構與情感表達。評估由 9 名評估者比較 MiMo 與兩個對照模型,創意寫作共設計 40 項任務,涵蓋現代詩、古典詩詞及敍事小説。MiMo 能按文類調整創作側重,但遵守古典詩詞格律及運用相關知識方面仍不穩定。
Eugene Yan 梳理多個網絡安全基準,歸納智能體評測的共同設計模式,並比較它們衡量漏洞發現、重現與利用能力的方法。文章將常見設計概括為沙盒目標環境、影響任務難度的資訊、工具和評分器,並介紹 Cybench、CVE-Bench、CyberGym 等基準如何提供部分分數或按攻擊階段分級。
Liquid AI 以開源桌面智能體 LocalCowork 測試 LFM2-24B-A2B 在筆電本地執行工具調用的表現,模型、工具和資料均留在裝置上。在 Apple M4 Max、36 GB 統一記憶體的筆電上,工具選擇平均耗時約 385 ms、佔用約 14.5 GB 記憶體,單步準確率為 80%。
UK AISI 與美國 CAISI 聯合評估 Kimi K3 的網絡攻防能力,結果顯示其表現低於最新的前沿模型,但高於 GLM-5.2。Kimi K3 在 ExploitBench 得分 32%,高於 GLM-5.2 的 24%,但 41 項任務中未有一次達到任意程式碼執行(ACE)。
MarkTechPost 將 GPT-6 Astra、GPT-6.1 Sol、Gemini 4 Argon 與 Claude Fable 5.1 的基準、價格及存取條件並列,按工作負載整理各自適用情境。
推薦理由:文章將四款模型的基準、價格、存取限制和任務成本並列,呈現不同工作負載下的取捨,説明排行榜名次不足以單獨決定選型。
LlamaIndex 發現,較弱模型驅動的 ReAct 智能體在金融分析資料任務中較難取得相關結果。限制智能體互動,並提供更多能明確執行複雜操作的工具,可改善這類模型的查詢表現。相比之下,GPT-4 較能可靠地運用 ReAct 執行多種複雜資料查詢。
LlamaIndex 使用 Retrieval Evaluation 比較 RAG 流程中的嵌入模型與重排序模型,並以 Hit Rate 和 MRR 評估檢索表現。
LlamaIndex 使用其框架,基於包含 100 條問題的 Llama 2 論文資料集,比較 Prometheus 與 GPT-4 的 RAG 評估表現。GPT-4 的 Faithfulness 和 Relevancy 分數分別為 0.93 和 0.98,Prometheus 則為 0.39 和 0.57;文章亦展示 Prometheus 有時會誤判上下文資訊。
LlamaIndex 評析 OlmOCR-Bench,認為它有助衡量文件 OCR 進展,但與多數真實文件處理需求仍有落差。基準涵蓋 1400+ 份 PDF、設有 7000+ 項二元單元測試,並按類別計算子分數。不過,約 56% 的 PDF 來自學術資料,表格與閲讀順序測試粒度偏粗,精確匹配亦容易造成脆弱判定。
2026 年多語言 OCR 軟件評估聚焦全球文件辨識,指出英語、拉丁字母文件上的準確率未必反映其他文字系統及混合語言文件的實際表現。評估工具時,須檢視其對 RTL、CJK、垂直文字、混合語言分段辨識及版面結構的處理能力。低資源語言及文件品質會影響辨識效果,應以實際文件測試,而非只看支援語言數量。
這場討論聚焦如何評測智能體在雜亂真實公司知識中的檢索能力,並詢問 BEAM、MemEval、MemoryArena 等基準的參考價值。提問者亦詢問 Karpathy 的 Episodic/Procedural/Semantic 分類(Doxa/Koine/Gnosis)是否有用、與設計哪些部分相符,並追問能否公開資料抽取流程,讓其他公司自行比較,以推進可重現性。
Jev 等決策模型未能勝過 LLM-as-a-judge 或傳統分類器;用於智能體堆疊的條件分支決策時,模型須兼具良好校準與資訊性。神經網絡輸出 logits 對可約減的認知不確定性屬高度有損壓縮,令校準在實務上難以落實;高概率區域的估計亦會在輕微協變量偏移下不穩,令多步搜尋圖可能走向模型訓練或校準時未見的分支,甚至落在分佈外。
Artificial Analysis 更新 Capability Indices 至 v1.1,按領域整合 Intelligence Index v4.2、v4.3 的評測切片及專項評測。
作者實測 OpenAI 的 Dots 智能體,發現它更像可操作其他軟件的工作助理,處理個人購物時則屢受網站安全檢查阻礙。取得電腦存取權後,Dots 成功整理影片及更新個人網站;在協助登入 Uber Eats 後,也訂到了照燒餐。作者透過每月 $100 的 Pro 賬户測試,認為以自己的工作需求而言,Dots 尚不值這個月費。
Artificial Analysis 評測顯示,Claude Opus 5.5 以 max effort 在 Artificial Analysis Intelligence Index 得分 58,為其測得的最高分。
推薦理由:報告將多項基準表現、Agent 知識工作成績與每項任務成本並列,呈現模型在不同 effort 設定下的表現與成本取捨。
Artificial Analysis 的評測指出,GPT-6 Sol 和 Luna 定價約為 GPT-5.6 的一半,Intelligence Index 分數大致持平。
推薦理由:文章並列價格、單項任務成本與多項基準結果,呈現降本幅度與不同能力變化並不一致,並指出 GDPval-AA v2.1 的回退與交付內容縮短相關。
Artificial Analysis 的評測顯示,Claude Sonnet 5.5 在 Intelligence Index 取得 56 分,於 max effort 下排名第 2,僅落後 Opus 5.5(max)2 分。
推薦理由:評測把 Claude Sonnet 5.5 的基準表現與每項任務的 token 消耗、成本對照,呈現其接近 Opus 5.5 時的資源代價。
Google DeepMind 的 Gemini 4 Argon(高推理設定)在 Artificial Analysis Intelligence Index 得分 53,與 GPT-6 Astra(max)持平。
推薦理由:文章對照 Gemini 4 Argon 與 GPT-6 Astra 的指數分數、任務成本和智能體評測,呈現相近總分下的成本差距及不同基準表現。
Anthropic 為 Claude Code 的 claude-api plugin 加入 build_eval 和 hill-climb 指令,協助建立評測、檢查評分器並改進應用程式。
十字路口團隊實測 Today AI 一週,檢視這款 Personal AI Agent 如何以 Memory、圖形介面和主動推送支援創作者推進及回顧工作。採訪案例中,它結合本地 Obsidian、網絡搜索和過往資料整理背景與提綱,並按日程安排 Google Calendar;產品支援 macOS、Windows、Linux、iOS。
作者實測元寶新上線的旅遊計劃 Agent,展示它如何把聊天需求整理成行程,並提供可互動行程卡和旅前裝備推薦。蘇州低精力行程每天安排兩個景點並預留午睡時間;新疆行程則把單日車程控制在最長 4 小時內,並按需求安排住宿與徒步路線。文中還展示元寶查詢蘇州 2026 年門票預約規則,並按對話修改行程。
OpenAI 推出 MentalHealthBench,這是一項由專家提供意見的評測基準,用於評估 AI 在貼近現實的心理健康對話中能否提供有幫助且安全的回應。
Parallel 的智能體使用 GPT-6 Astra 研究並綜合勞動市場數據,較先前模型所需時間減半,成本亦減半。
TypeSafe AI 上週發布 Jev,將其定位為 System One(「決策模型」),可接收文字或半結構化資料,並以浮點數輸出分類、是非判斷或評分及信心度。
Epoch AI 的 ECI 比較顯示,GPT-6 Astra 在數學基準測試領先,但未在軟件工程領先。比較涵蓋 GPT-6 Astra、Claude Fable 5.1、GPT-5.6 Sol 和 Kimi K3,並以數學及軟件工程專項 ECI 評估模型能力;專項分數可與一般 ECI 比較。
Playco 使用 GPT-6 Astra,從同一個灰盒基礎構建三款主題遊戲原型,手動修正次數較前一模型減少 50%。
ARC Prize 評測顯示,OpenAI GPT-6 Astra 在 ARC-AGI-3 Semi-Private 的 Standard harness 得分為 62.7%,Provider Adapter harness 的最高分為 99.9%。
Jalapeño 是 OpenAI 自研的 AI 推理晶片,首批結果顯示其推理速度與能效領先業界。它為現代模型提供更快、能效更高的 AI 推理,並帶來更高吞吐量與更低延遲。
OpenAI 的新分析指出,熱門編碼基準 SWE-Bench Pro 存在問題,引發對 AI 模型評測可靠性與準確性的疑慮。
Hugging Face 測試開源模型使用 transformers,CLI 與 Skill 縮短大型模型耗時,卻可能降低小模型成功率。Qwen3-14B 在 classify-sentiment 任務中,clone 環境的匹配率為 100%,Skill 環境則降至 0%。agent-eval CLI 可套用於其他命令列工具,並記錄匹配率、tokens、耗時、錯誤、行為標記及執行軌跡。
推薦理由:評測不只看任務是否成功,也追蹤 tokens、耗時與操作路徑,呈現 CLI 與 Skill 對大小模型的影響並不一致。
OpenAI 推出 LifeSciBench,這是一項由專家撰寫並審核的基準,用於評估 AI 系統處理真實生命科學研究任務及決策的能力。
Ethan Mollick實測Claude 5 Fable後指出,模型能按多頁規格連續工作長達12小時,人的角色更像委託者。它在Claude Code中調用多個智能體研究交通資料並製作等時線地圖,也花九個半小時開發可校準人類與AI判斷的研究軟件Concord。Mollick指出,Fable消耗大量 tokens,安全護欄常令它退回能力較弱的Claude 4.8 Opus,而其決策過程不易看見。
推薦理由:Ethan Mollick以等時線地圖和研究分析軟件的實測,呈現人類角色如何由過程操作轉向委託與驗收,以及模型自主決策帶來的可見性落差。
OpenAI 獲 Gartner 評為 2026 年企業級 AI 編碼智能體魔力象限的領導者。Codex 因創新及企業規模部署獲得認可。
Manus Blog 以同一份個人理財網站提示詞實測 Replit、Manus AI、Lovable、Vercel v0、Base44 和 Hostinger Horizons,並比較各工具的生成結果與使用體驗。
文章比較 Manus My Computer、Perplexity Computer、Claude Cowork、ChatGPT Agent 和 Genspark 五款桌面 AI 智能體,涵蓋功能、價格及適用場景。文中説明各工具在本地檔案存取和雲端執行上的差異,並按研究、Microsoft Office 文件處理和網頁自動化等需求提供選擇建議。
Sarvam AI 介紹印度語言 ASR 的分層評測方法,涵蓋 WER/CER、LLM-WER/LLM-CER、Intent Score、Entity Preservation Score 和 COMET。文中亦介紹兩個適用於任何 Indic ASR 系統的開源評測框架,均使用經 Google Vertex AI 呼叫的 Gemini 作為 LLM 評審。
評測者在相同的三類電商場景下實測 9 款 AI 網站建構工具,並按設計品質、品牌呈現、電商完整度和可編輯性比較表現。測試中,Squarespace Blueprint AI 的設計輸出較穩定,Wix AI 兼顧生成與編輯,Shopify 側重電商基建而非 AI 建站,Manus 則可製作自訂計算器和產品配置器。文章亦提醒,跨平台遷移通常無法帶走設計系統與版面,AI 文案仍需人工修改。
Manus 以同一提示測試 8 款 AI 作品集製作工具,按設計質素、AI 對提示詞的理解與執行、發布選項及轉化導向比較,Manus 與 Replit 均獲 9/10。文章列 Manus 為整體首選,其免費版每日提供 300 積分,並可免費發佈至 manus.space 子域名;Lovable 則列為最佳免費選項,每日有 5 積分並可一鍵部署。文中指出,多數工具須付費方案才能連接自訂網域。