跳到正文

#Agent

今日 35 條
12月19日週四
  1. AI as Normal Technology69

    AI 進展是否正在放緩?

    Arvind Narayanan、Benedikt Ströbl 和 Sayash Kapoor 認為,現有證據不足以判定 AI 進展放緩或模型擴展已經終結,並指出業界人士的預測會受商業利益與技術視角影響。他們認為,推理時計算擴展短期仍有不少改進空間,但能力提升可能因任務領域而不均,且難以預測。文章指出,AI 對社會和經濟的實際影響更受產品開發及採用速度制約,而非單由能力進展決定。

11月20日週三
  1. Hugging Face Blog41

    BAAI FlagEval Debate:首個多語言 LLM 辯論賽讓大型模型同場辯論

    BAAI 的 FlagEval Debate 平台讓大型模型透過多語言辯論賽互相比試,以評估其推理與語言能力。平台支援中文、英文、韓文和阿拉伯文,讓模型直接交鋒,供評估者比較觀點、邏輯推理及論證策略。評估結合辯論專家評審和用户投票,並允許模型團隊調整參數、策略與對話風格。

11月18日週一
  1. Mistral AI76

    Mistral AI 為 le Chat 推出多項免費 beta 功能

    Mistral AI 為 le Chat 推出多項免費 beta 更新,新增網頁搜尋、Canvas、文件與圖像理解、圖像生成及智能體功能。文件與圖像理解由 Pixtral Large 與一款實驗模型支援,圖像生成則採用 Black Forest Labs 的 Flux Pro。新功能將於未來數週逐步推出。

    推薦理由:網頁搜尋、Canvas、文件與圖像理解、圖像生成及可分享智能體同列免費 beta,呈現 le Chat 將對話延伸至知識工作多個環節的產品方向。

10月16日週三
  1. Mistral AI65

    Mistral AI 發佈 Ministral 3B 和 Ministral 8B 邊緣模型

    Mistral AI 發佈 Ministral 3B 和 Ministral 8B,面向裝置端運算及邊緣場景。兩款模型支援最高 128k 上下文長度(vLLM 目前為 32k),Ministral 8B 採用交錯式滑動窗口注意力模式。

    推薦理由:文章以多個評測類別對照 Ministral 3B、8B 與 Gemma 2、Llama 3.2、Llama 3.1、Mistral 7B 等模型,涵蓋預訓練及 Instruct 版本,便於參照各模型表現。

10月10日週四
9月16日週一
  1. Hugging Face Blog67

    HuggingChat 推出 Community Tools,支援將 Hugging Face Spaces 轉為工具

    HuggingChat 推出 Community Tools,讓使用者可把 Hugging Face 上的公開 Space 轉成模型可直接調用的工具。這些工具可用於理解圖片、生成影片或文字轉語音,也可建立文件 RAG 工具。建立助手時最多可選 3 個工具;該功能目前仍屬實驗階段。

    推薦理由:文章展示如何把公開 Space、自建 Gradio 工具和文件 RAG 接入 HuggingChat,並在助手中組合最多 3 個工具,提供從建立到配置的實操路徑。

8月7日週三
7月23日週二
  1. Hugging Face Blog87

    Meta 發佈 Llama 3.1,推出 8B、70B、405B 模型並支援多語言與 128K tokens 上下文

    Meta 發佈 Llama 3.1,提供 8B、70B、405B 三種規模的 base 與 instruct 模型,均支援 128K tokens 上下文和 8 種語言。Instruct 版本加入工具調用能力,並支援自訂 JSON 函數;授權亦允許以模型輸出改進其他 LLM。Hugging Face 同時列出 Transformers、TGI 等整合,以及各型號在推理和微調時的記憶體需求。

    推薦理由:文章將 8B、70B、405B 的部署定位、128K tokens 上下文及記憶體需求一併列出,可比較不同規模模型的使用取捨。

6月5日週三
5月29日週三
5月13日週一
  1. Hugging Face Blog70

    Hugging Face 發佈 Transformers Agents 2.0,新增兩種可迭代的智能體

    Hugging Face 發佈 Transformers Agents 2.0,新增 ReactCodeAgent 和 ReactJsonAgent,能根據過往觀察迭代。框架以簡潔、模組化,以及工具和提示詞透明為設計目標。使用 Llama-3-70B-Instruct 的智能體在完整 GAIA 基準中排名第 4,超越多個基於 GPT-4 的智能體。

    推薦理由:文中比較 Code 與 JSON 智能體在不同模型上的表現,並展示 Llama-3-70B-Instruct 智能體於 GAIA 的名次,可作為評估 Agent 架構與模型搭配的具體參照。

4月5日週五
3月21日週四
2月7日週二
  1. Hugging Face Blog46

    ChatGPT 生成遊戲故事:AI 遊戲開發第 5 篇

    《AI for Game Development》第 5 篇示範以 ChatGPT 為農場遊戲生成故事摘要、遊戲內故事及商店物品描述,並透過多輪對話修訂內容。初稿與 Stardew Valley 的故事極為相似,長篇生成亦出現質素下降和重複。文章提醒直接採用生成內容可能帶來法律、倫理及商業風險,建議以 AI 協助構思,並由人手撰寫定稿。

1月24日週二
  1. Hugging Face Blog60

    甚麼令對話智能體有用?

    Hugging Face Blog 梳理對話智能體的訓練方法,涵蓋 IFT、SFT、RLHF 和 CoT。文中指出,IFT 所需指令數據僅為數百例量級,SFT 以人工標註改善有用性和安全性,RLHF 則根據人類偏好訓練獎勵模型,再用強化學習訓練對話智能體。

    推薦理由:文章把 IFT、SFT、RLHF 與 CoT 放在對話智能體訓練脈絡中梳理,並比較多個系統的訓練資料和評估方向,呈現各方法的分工。

7月22日週五
  1. Hugging Face Blog49

    優勢 Actor-Critic(A2C)

    Hugging Face 深度強化學習課程第 7 單元講解 Advantage Actor Critic(A2C),以 Actor 和 Critic 結合政策式與價值式方法,降低 Reinforce 策略梯度估計的方差並穩定訓練。課程使用 Stable-Baselines3,在 PyBullet 機械人模擬環境訓練雙足步行者和蜘蛛智能體。

6月23日週四
  1. OpenAI News64

    OpenAI 以 Video PreTraining 訓練神經網絡玩 Minecraft

    OpenAI 透過 Video PreTraining(VPT),使用大量未標註的人類 Minecraft 遊玩影片,配合少量已標註的承包商數據訓練神經網絡玩 Minecraft。經微調後,模型可學會製作鑽石工具;熟練玩家完成這項任務通常需要超過 20 分鐘(24,000 次操作)。模型使用按鍵輸入和滑鼠移動這種原生人類操作介面,研究將其視為邁向通用電腦操作智能體的一步。

    推薦理由:這項研究展示如何利用大量未標註的人類遊玩影片,配合少量標註數據訓練可透過鍵盤和滑鼠操作遊戲的模型。

6月7日週二
5月20日週五
5月4日週三
3月28日週一
1月21日週五
12月3日週二
9月17日週二
  1. OpenAI News56

    OpenAI 觀察到多智能體互動中湧現工具使用

    OpenAI 觀察到,智能體在簡單的捉迷藏遊戲中逐步發展出更複雜的工具使用方式。透過在新的模擬捉迷藏環境中訓練,智能體形成了六種不同策略及反制策略,其中一些是研究者此前不知道環境能支援的。這種簡單環境中自監督下湧現的複雜性,進一步暗示多智能體共同適應未來或能產生極其複雜且智能的行為。

3月4日週一
  1. OpenAI News39

    Neural MMO:大規模多智能體遊戲環境

    OpenAI 發佈 Neural MMO,這是一個供強化學習智能體使用的大規模多智能體遊戲環境。平台支援在持續且開放式任務中容納數量龐大且可變的智能體。眾多智能體與物種的加入可帶來更佳探索、分化的生態位形成,以及更高的整體能力。

12月6日週四
10月31日週三
  1. OpenAI News61

    OpenAI 開發 Random Network Distillation(RND),以預測獎勵促進強化學習探索

    OpenAI 開發了 Random Network Distillation(RND),一種以基於預測的獎勵鼓勵強化學習智能體出於好奇心探索環境的方法。OpenAI 表示,RND 在 Montezuma’s Revenge 上首次超越人類平均表現。

    推薦理由:文中把 RND 的探索方法與 Montezuma’s Revenge 上超越人類平均表現的結果連結,提供理解其研究成果的具體比較基準。

8月6日週一
  1. OpenAI News73

    OpenAI Five 基準測試結果

    OpenAI Five 昨日以三局兩勝制擊敗一隊排名位於第 99.95 百分位的 Dota 玩家。對手是 Blitz、Cap、Fogged、Merlini 和 MoonMeander,其中四人曾職業參與 Dota;比賽有現場觀眾,直播同時有 100,000 名觀眾觀看。

    推薦理由:這場三局兩勝賽呈現 OpenAI Five 對陣 99.95 百分位 Dota 玩家時的直接結果,亦交代對手中有四人曾以職業身份參與 Dota。

7月18日週三
7月4日週三
6月26日週二
  1. Sam Altman:Blog70

    OpenAI 用 PPO 訓練 5 個 Dota 智能體擊敗半職業玩家

    OpenAI 使用 PPO 訓練由 5 個智能體組成的 Dota 隊伍,讓它們擊敗半職業玩家。訓練未使用人類對局,團隊設計獎勵函數後,智能體透過自我對弈學習;對陣兩週前的智能體,勝率為 90-95%。Sam Altman 認為,深度強化學習可在計算規模足夠、模擬環境能刻畫目標問題時處理極難問題,這也是通往通用智能的一步。

6月25日週一
5月3日週四
10月26日週四
9月14日週四
8月16日週三
  1. OpenAI News68

    OpenAI 的 Dota 2 系統一個月內由勉強匹敵高排名玩家提升至擊敗頂尖職業選手

    OpenAI 的 Dota 2 系統在一個月內由勉強匹敵高排名玩家,提升至擊敗頂尖職業選手,之後仍持續進步。OpenAI 表示,在算力充足時,自我對弈可令機器學習系統由遠低於人類水平提升至超越人類水平。相較之下,監督式深度學習系統的表現受限於訓練數據集,而自我對弈的可用數據會隨智能體能力提升而自動改善。

    推薦理由:文章以 Dota 2 系統的進展對比自我對弈與監督式學習,説明自我對弈的可用數據會隨智能體變強而自動改善。

8月11日週五
  1. OpenAI News79

    OpenAI 的 Dota 2 機械人在標準賽事規則 1v1 對局中擊敗世界頂尖職業選手

    OpenAI 開發的 Dota 2 機械人在遵循標準賽事規則的 1v1 對局中擊敗世界頂尖職業選手。機械人從零開始透過自我對弈學習,沒有使用模仿學習或樹搜索。OpenAI 將此視為朝建立能在涉及真實人類的混亂複雜情境中完成明確目標的 AI 系統邁出的一步。

    推薦理由:這則公告同時交代對局成果與訓練方式,呈現自我對弈在規則明確、局勢複雜且有人類參與的遊戲環境中的應用。

6月8日週四
  1. OpenAI News26

    在多智能體環境中學習合作、競爭與溝通

    OpenAI 指出,多智能體環境是邁向 AGI 的踏腳石,智能體可在資源競爭中學習合作、競爭與溝通。這類環境形成自然課程,難度由競爭者的技能決定;與自身複製體競爭時,難度恰好匹配自身技能。環境沒有穩定均衡,持續帶來變得更聰明的壓力,而要有效應對仍需更多研究。