跳到正文

#Agent

今日 160 條
2月27日週五
2月26日週四
2月25日週三
2月24日週二
  1. AI as Normal Technology64

    新論文《Towards a Science of AI Agent Reliability》分析 AI 智能體可靠性

    新論文評估 14 個模型,發現近 18 個月模型能力提升明顯,AI 智能體可靠性僅小幅改善。研究把可靠性拆分為一致性、穩健性、可預測性和安全性四個維度,以 12 項指標測試 GAIA 與 TauBench;可預測性是整體最弱的一環。作者建議在準確率之外同步報告可靠性各維度表現,並計劃推出 AI agent reliability index。

2月23日週一
2月18日週三
2月17日週二
2月16日週一
2月13日週五
  1. Manus:Blog54

    Manus 與 Synthesia 比較:哪款 AI 影片生成器更適合你?

    Manus 的文章以兩組相同提示詞比較 Manus 與 Synthesia,測試顯示 Synthesia 動態較自然,Manus 更能遵循場景細節。企業影片提示要求生成 30 秒影片,Manus 輸出 30 秒,Synthesia 則約 8 秒,兩者的動畫都有瑕疵。文章認為 Synthesia 更適合專業化身影片,Manus 則較適合重視創意自由和多步驟工作流程的用户。

2月11日週三
  1. Google Research49

    超越一對一:以 DialogLab 編寫、模擬及測試動態人類與 AI 羣體對話

    Google Research 提出開源原型框架 DialogLab,用於編寫、模擬及測試動態人類與 AI 羣體對話。框架採用「編寫、測試、驗證」流程,並以視覺化介面及驗證儀錶板協助設計與分析對話。14 名參與者的評估顯示,人類控制模式顯著更具投入感,並普遍被認為更有效、寫實。

  2. Manus:Blog48

    初學者提示:開始使用 Manus

    Manus 初學者指南提供多組提示詞,協助非技術用户將 Manus 用作可跨步驟執行任務的 AI 智能體,而非只作聊天工具。提示詞涵蓋日常規劃、生活管理、工作跟進、研究監控、學習與活動策劃。指南建議按實際目標選擇提示詞、替換方括號內容,並讓 Manus 主導多步驟流程。

2月6日週五
  1. Manus:Blog59

    2026年12款最佳免費AI簡報製作工具測試與排名

    Manus 團隊以相同提示詞測試並排名12款AI簡報工具,Manus AI以9/10列為最佳整體工具。評分涵蓋內容質素、匯出保真度、演講備註、設計、易用性及價格價值;測試總結指出,速度較快的工具通常內容較淺。Manus披露其產品參與比較,並稱所有工具均按相同標準及測試方法評估。

2月5日週四
2月2日週一
1月28日週三
  1. Google Research58

    Google Research 探討智能體系統的規模化原理及有效條件

    Google Research 團隊對 180 種智能體配置進行受控評估,提出智能體系統的量化規模化原則。在可並行的金融推理任務中,集中式協作較單智能體提升 80.9%;在 PlanCraft 的序列規劃任務中,多智能體方案則令表現下降 39–70%。研究的預測模型根據工具數量及任務可拆解程度,對 87% 未見任務配置正確識別最佳協作策略。

1月27日週二
1月23日週五
1月22日週四
  1. Manus:Blog31

    電郵自動化和 AI 寫作工具究竟擅長甚麼?

    AI 寫作工具擅長快速起草、維持文案一致及改善語法,電郵自動化則處理觸發式序列、個人化與寄送時序,但兩者都難以掌握既有工作脈絡。Manus 作為 AI 智能體,可把先前研究、示範簡報及需求分析帶入跟進郵件草稿;Mail Manus 會觀察使用者的問候、語氣、句式和結尾習慣,逐步貼近其寫作方式。

1月21日週三
  1. Hugging Face Blog51

    AssetOpsBench 彌合 AI 智能體基準與工業實務的落差

    AssetOpsBench 是面向工業資產運維的 AI 智能體基準與評估系統,從六項質性維度評估智能體表現。它涵蓋 2.3M 個感測遙測點、4.2K 張工單及 53 種結構化失效模式,並以 881 條執行軌跡分析失敗。社羣測試中,沒有受測模型達到部署準備門檻 85 分;多智能體任務準確率為 47%,低於單智能體的 68%。

1月20日週二
  1. Factory 研究 / 產品53

    Factory 推出 Agent Readiness,評估程式碼庫對自主開發的支援程度

    Factory 推出 Agent Readiness,按八個技術支柱和五個成熟度級別評估程式碼庫對自主開發的支援程度,並提供優先修復建議。它以 LLM 評估 60+ 項準則,並以前一份報告作為評估基準;在涵蓋低、中、高成熟度級別的 9 個基準倉庫中,評分波動由平均 7%、峯值 14.5% 降至 0.6%,連續六週維持該水平。

1月13日週二
1月12日週一
  1. Manus:Blog54

    Manus 介紹 Meeting Minutes 會議紀要功能

    Manus 推出 Meeting Minutes,可把面對面會議、訪談或獨白轉成含要點、與會者和待辦事項的結構化筆記。錄音期間會即時轉錄並識別説話者;筆記亦可作為同一任務的上下文,用於製作簡報、網站或社交媒體素材,並邀請他人協作。該功能現已向所有 Manus 用户開放,不適用於線上會議;錄音免費,分析及生成筆記會消耗積分。

1月8日週四
12月31日週三
12月29日週一
  1. Manus:Blog78

    Manus 加入 Meta,開啟新一輪探索

    Manus 宣佈即將加入 Meta,並表示會繼續透過 app 和網站提供產品及訂閲服務,公司亦會繼續在新加坡營運。按 12 月初統計,自上線以來 Manus 已處理超過 147 萬億個 token,並建立超過 8000 萬台虛擬電腦。首席執行官肖弘表示,與 Meta 攜手可讓 Manus 在不改變運作方式和決策機制的前提下,在更強大、更可持續的基礎上發展。

    推薦理由:公告交代 Manus 加入 Meta 後產品服務及新加坡營運安排,並列出上線以來的使用規模,呈現組織變動與現有服務延續的關係。

12月23日週二