AI 進展是否正在放緩?
Arvind Narayanan、Benedikt Ströbl 和 Sayash Kapoor 認為,現有證據不足以判定 AI 進展放緩或模型擴展已經終結,並指出業界人士的預測會受商業利益與技術視角影響。他們認為,推理時計算擴展短期仍有不少改進空間,但能力提升可能因任務領域而不均,且難以預測。文章指出,AI 對社會和經濟的實際影響更受產品開發及採用速度制約,而非單由能力進展決定。
Arvind Narayanan、Benedikt Ströbl 和 Sayash Kapoor 認為,現有證據不足以判定 AI 進展放緩或模型擴展已經終結,並指出業界人士的預測會受商業利益與技術視角影響。他們認為,推理時計算擴展短期仍有不少改進空間,但能力提升可能因任務領域而不均,且難以預測。文章指出,AI 對社會和經濟的實際影響更受產品開發及採用速度制約,而非單由能力進展決定。
BAAI 的 FlagEval Debate 平台讓大型模型透過多語言辯論賽互相比試,以評估其推理與語言能力。平台支援中文、英文、韓文和阿拉伯文,讓模型直接交鋒,供評估者比較觀點、邏輯推理及論證策略。評估結合辯論專家評審和用户投票,並允許模型團隊調整參數、策略與對話風格。
Mistral AI 為 le Chat 推出多項免費 beta 更新,新增網頁搜尋、Canvas、文件與圖像理解、圖像生成及智能體功能。文件與圖像理解由 Pixtral Large 與一款實驗模型支援,圖像生成則採用 Black Forest Labs 的 Flux Pro。新功能將於未來數週逐步推出。
推薦理由:網頁搜尋、Canvas、文件與圖像理解、圖像生成及可分享智能體同列免費 beta,呈現 le Chat 將對話延伸至知識工作多個環節的產品方向。
Mistral AI 發佈 Ministral 3B 和 Ministral 8B,面向裝置端運算及邊緣場景。兩款模型支援最高 128k 上下文長度(vLLM 目前為 32k),Ministral 8B 採用交錯式滑動窗口注意力模式。
推薦理由:文章以多個評測類別對照 Ministral 3B、8B 與 Gemma 2、Llama 3.2、Llama 3.1、Mistral 7B 等模型,涵蓋預訓練及 Instruct 版本,便於參照各模型表現。
OpenAI 推出 MLE-bench,作為衡量 AI 智能體執行機器學習工程工作的基準,聚焦其在該領域的表現。
HuggingChat 推出 Community Tools,讓使用者可把 Hugging Face 上的公開 Space 轉成模型可直接調用的工具。這些工具可用於理解圖片、生成影片或文字轉語音,也可建立文件 RAG 工具。建立助手時最多可選 3 個工具;該功能目前仍屬實驗階段。
推薦理由:文章展示如何把公開 Space、自建 Gradio 工具和文件 RAG 接入 HuggingChat,並在助手中組合最多 3 個工具,提供從建立到配置的實操路徑。
Mistral AI 宣佈在 La Plateforme 開放旗下旗艦及專用模型自訂,並推出 Agents 早期版本及 mistralai 1.0 客户端 SDK。
推薦理由:這次發布把模型自訂、Agents 工作流程與客户端 SDK 更新並列,呈現 Mistral AI 如何涵蓋應用構建中的模型調整、流程編排和程式接入環節。
Meta 發佈 Llama 3.1,提供 8B、70B、405B 三種規模的 base 與 instruct 模型,均支援 128K tokens 上下文和 8 種語言。Instruct 版本加入工具調用能力,並支援自訂 JSON 函數;授權亦允許以模型輸出改進其他 LLM。Hugging Face 同時列出 Transformers、TGI 等整合,以及各型號在推理和微調時的記憶體需求。
推薦理由:文章將 8B、70B、405B 的部署定位、128K tokens 上下文及記憶體需求一併列出,可比較不同規模模型的使用取捨。
Cubzh 與 Gigax 推出 NPC-Playground,讓玩家在瀏覽器的 3D 場景中與 LLM 驅動的 NPC 互動,並用 Lua 腳本教授新技能。Gigax 已開源推理堆疊;示範所用模型託管於雲端,微調版 Phi-3 和 Mistral-7B 可從 🤗 Hub 下載。
面向 AI 時代的新軟件公司 MavenAGI 推出一款以 GPT-4 的靈活性為基礎打造的 AI 客户服務智能體。Tripadvisor、Clickup 和 Rho 等公司已使用該智能體節省時間,並更好地服務客户。
OpenAI Developers 的 Notebook 示範以 GPT-4o 建立檢查客服智能體回覆是否出現幻覺的輸出防護欄。流程先生成客服政策與對話作為評測集,再按句檢查事實準確性、相關性、政策遵循及上下文連貫性。文中報告 precision 為 0.97、recall 為 1.00。
Hugging Face 發佈 Transformers Agents 2.0,新增 ReactCodeAgent 和 ReactJsonAgent,能根據過往觀察迭代。框架以簡潔、模組化,以及工具和提示詞透明為設計目標。使用 Llama-3-70B-Instruct 的智能體在完整 GAIA 基準中排名第 4,超越多個基於 GPT-4 的智能體。
推薦理由:文中比較 Code 與 JSON 智能體在不同模型上的表現,並展示 Llama-3-70B-Instruct 智能體於 GAIA 的名次,可作為評估 Agent 架構與模型搭配的具體參照。
Klarna 的 AI 助理承擔相當於 700 名全職客服專員的工作。Klarna 正運用 AI 革新個人購物、客户服務及員工生產力。
Lighthouz AI 與 Hugging Face 推出 Chatbot Guardrails Arena,讓社羣以對抗式對話測試聊天機械人防止敏感資料外洩的能力。
《AI for Game Development》第 5 篇示範以 ChatGPT 為農場遊戲生成故事摘要、遊戲內故事及商店物品描述,並透過多輪對話修訂內容。初稿與 Stardew Valley 的故事極為相似,長篇生成亦出現質素下降和重複。文章提醒直接採用生成內容可能帶來法律、倫理及商業風險,建議以 AI 協助構思,並由人手撰寫定稿。
Hugging Face 推出開源工具 AI vs. AI,透過多智能體對戰和 ELO 排名評估強化學習模型的相對實力。
Hugging Face Blog 梳理對話智能體的訓練方法,涵蓋 IFT、SFT、RLHF 和 CoT。文中指出,IFT 所需指令數據僅為數百例量級,SFT 以人工標註改善有用性和安全性,RLHF 則根據人類偏好訓練獎勵模型,再用強化學習訓練對話智能體。
推薦理由:文章把 IFT、SFT、RLHF 與 CoT 放在對話智能體訓練脈絡中梳理,並比較多個系統的訓練資料和評估方向,呈現各方法的分工。
Hugging Face 深度強化學習課程第 7 單元講解 Advantage Actor Critic(A2C),以 Actor 和 Critic 結合政策式與價值式方法,降低 Reinforce 策略梯度估計的方差並穩定訓練。課程使用 Stable-Baselines3,在 PyBullet 機械人模擬環境訓練雙足步行者和蜘蛛智能體。
OpenAI 透過 Video PreTraining(VPT),使用大量未標註的人類 Minecraft 遊玩影片,配合少量已標註的承包商數據訓練神經網絡玩 Minecraft。經微調後,模型可學會製作鑽石工具;熟練玩家完成這項任務通常需要超過 20 分鐘(24,000 次操作)。模型使用按鍵輸入和滑鼠移動這種原生人類操作介面,研究將其視為邁向通用電腦操作智能體的一步。
推薦理由:這項研究展示如何利用大量未標註的人類遊玩影片,配合少量標註數據訓練可透過鍵盤和滑鼠操作遊戲的模型。
Hugging Face 深度強化學習課程第 3 單元介紹 Deep Q-Learning,並以 Space Invaders 説明神經網絡如何取代 Q-table,估算各動作的 Q 值。
Hugging Face 的 Deep Reinforcement Learning Class 第二部分講解 Q-Learning,並帶領學員從零實作強化學習智能體。
Hugging Face 的 Deep Reinforcement Learning Class 第一章介紹深度強化學習的基本框架,説明智能體如何透過與環境互動、採取行動並接收獎勵來學習。
Hugging Face 將 Decision Transformer 這種離線強化學習方法整合至 🤗 Transformers 函式庫及 Hugging Face Hub。
Hugging Face 將 Stable-Baselines3 整合至 Hugging Face Hub,讓使用者可託管已儲存的模型,並載入社羣模型。Stable-Baselines3 是 PyTorch 深度強化學習程式庫,整合支援透過 `load_from_hub` 載入模型,並以 `push_to_hub` 上傳分享。
OpenAI 發佈 Procgen Benchmark,提供 16 個易於使用的程序生成環境。該基準用於直接衡量強化學習智能體學習可泛化技能的速度。
OpenAI 觀察到,智能體在簡單的捉迷藏遊戲中逐步發展出更複雜的工具使用方式。透過在新的模擬捉迷藏環境中訓練,智能體形成了六種不同策略及反制策略,其中一些是研究者此前不知道環境能支援的。這種簡單環境中自監督下湧現的複雜性,進一步暗示多智能體共同適應未來或能產生極其複雜且智能的行為。
OpenAI 發佈 Neural MMO,這是一個供強化學習智能體使用的大規模多智能體遊戲環境。平台支援在持續且開放式任務中容納數量龐大且可變的智能體。眾多智能體與物種的加入可帶來更佳探索、分化的生態位形成,以及更高的整體能力。
OpenAI 發佈 CoinRun 訓練環境,為智能體將經驗遷移至新情境的能力提供量化指標,並已協助釐清強化學習中一項長期存在的難題。CoinRun 比 Sonic the Hedgehog 等傳統平台遊戲簡單,但仍為最先進算法帶來具挑戰性的泛化考驗。
OpenAI 開發了 Random Network Distillation(RND),一種以基於預測的獎勵鼓勵強化學習智能體出於好奇心探索環境的方法。OpenAI 表示,RND 在 Montezuma’s Revenge 上首次超越人類平均表現。
推薦理由:文中把 RND 的探索方法與 Montezuma’s Revenge 上超越人類平均表現的結果連結,提供理解其研究成果的具體比較基準。
OpenAI Five 昨日以三局兩勝制擊敗一隊排名位於第 99.95 百分位的 Dota 玩家。對手是 Blitz、Cap、Fogged、Merlini 和 MoonMeander,其中四人曾職業參與 Dota;比賽有現場觀眾,直播同時有 100,000 名觀眾觀看。
推薦理由:這場三局兩勝賽呈現 OpenAI Five 對陣 99.95 百分位 Dota 玩家時的直接結果,亦交代對手中有四人曾以職業身份參與 Dota。
OpenAI Five Benchmark 對賽現已結束;公告確認比賽完結,但未列出賽果、比分或其他賽事資訊。
OpenAI 訓練的智能體僅憑一次人類示範,便在《Montezuma’s Revenge》取得 74,500 分,超越此前所有已發表結果。智能體從示範中挑選的狀態開始連續遊玩多局,並以 PPO 優化遊戲分數;PPO 亦是支撐 OpenAI Five 的強化學習算法。
OpenAI 使用 PPO 訓練由 5 個智能體組成的 Dota 隊伍,讓它們擊敗半職業玩家。訓練未使用人類對局,團隊設計獎勵函數後,智能體透過自我對弈學習;對陣兩週前的智能體,勝率為 90-95%。Sam Altman 認為,深度強化學習可在計算規模足夠、模擬環境能刻畫目標問題時處理極難問題,這也是通往通用智能的一步。
OpenAI Five 是由五個神經網絡組成的團隊,已開始在 Dota 2 中擊敗業餘人類隊伍。
推薦理由:這則消息把 OpenAI Five 放在與 Dota 2 業餘人類隊伍對戰的場景中呈現,讀者可從勝負結果理解其神經網絡團隊的遊玩表現。
OpenAI 提出一種 AI 安全技術,透過訓練智能體互相辯論議題,再由人類判定勝方。
OpenAI 開發出一種階層式強化學習演算法,可學習適用於多種任務的高層動作,並快速解決需要數千個時間步的任務。應用於一組導航問題時,演算法會發現可朝不同方向行走和爬行的高層動作,令智能體能迅速掌握新的導航任務。
OpenAI 發佈 LOLA(Learning with Opponent-Learning Awareness)演算法,讓智能體將其他智能體也在學習納入考量。它在重複囚徒困境中找出以自身利益為先、同時具合作性的策略,例如以牙還牙。這是朝能建模其他心智的智能體邁出的一小步。
OpenAI 的 Dota 2 系統在一個月內由勉強匹敵高排名玩家,提升至擊敗頂尖職業選手,之後仍持續進步。OpenAI 表示,在算力充足時,自我對弈可令機器學習系統由遠低於人類水平提升至超越人類水平。相較之下,監督式深度學習系統的表現受限於訓練數據集,而自我對弈的可用數據會隨智能體能力提升而自動改善。
推薦理由:文章以 Dota 2 系統的進展對比自我對弈與監督式學習,説明自我對弈的可用數據會隨智能體變強而自動改善。
OpenAI 開發的 Dota 2 機械人在遵循標準賽事規則的 1v1 對局中擊敗世界頂尖職業選手。機械人從零開始透過自我對弈學習,沒有使用模仿學習或樹搜索。OpenAI 將此視為朝建立能在涉及真實人類的混亂複雜情境中完成明確目標的 AI 系統邁出的一步。
推薦理由:這則公告同時交代對局成果與訓練方式,呈現自我對弈在規則明確、局勢複雜且有人類參與的遊戲環境中的應用。
OpenAI 指出,多智能體環境是邁向 AGI 的踏腳石,智能體可在資源競爭中學習合作、競爭與溝通。這類環境形成自然課程,難度由競爭者的技能決定;與自身複製體競爭時,難度恰好匹配自身技能。環境沒有穩定均衡,持續帶來變得更聰明的壓力,而要有效應對仍需更多研究。