Arvind Narayanan 在 ICML 主題演講追問:AI 時代還有哪些工作留給人類?
Arvind Narayanan 在 ICML 主題演講中主張,AI 會逐步改變並重組工作,但不會因實驗室內某個能力里程碑而突然令所有人失業。他以 AI as Normal Technology 框架概括能力、產品、早期採用和適應四個階段,認為工作結構的適應最慢,需時數十年。他預期 AI 會令工作重心由建造系統轉向評估、判斷與引導,並主張培養與 AI 互補的技能及維持使用上的自主掌控。
Arvind Narayanan 在 ICML 主題演講中主張,AI 會逐步改變並重組工作,但不會因實驗室內某個能力里程碑而突然令所有人失業。他以 AI as Normal Technology 框架概括能力、產品、早期採用和適應四個階段,認為工作結構的適應最慢,需時數十年。他預期 AI 會令工作重心由建造系統轉向評估、判斷與引導,並主張培養與 AI 互補的技能及維持使用上的自主掌控。
英靈殿創始人 Odin 在《十字路口》公路播客中談及 AI for Science 創業願景,核心是打造「全模態分子世界模型」與「通用科學人工智能」。他離開 David Baker 實驗室後創業,短時間內融資數千萬美元,團隊有 30 人。其目標是打造「新時代科學發現的蒸汽機」,把人類科學進程壓縮上百年。
Arvind Narayanan 與 Akash Kapur 認為,模型推理競爭可能把價格壓向 token 生產的邊際成本,AI 實驗室更可能透過向堆疊上層遷移來實現持續盈利。
Benedict Evans 認為,token 供應短缺只是過渡狀態,現有市場動態指向基礎模型成為商品化基礎設施,但長期定價權與價值捕獲仍未明朗。供給擴張、推理效率、訓練成本及新用途的投資回報都會變動,長期供需均衡因此難以預測。文章以流動網絡、光纖和半導體為參照,指出類比可供參考,但不能預測 AI 市場最終會形成哪一種均衡。
節目邀請空山慈科技聯合創始人王曦明,討論團隊如何透過腦機互動與神經調控,探索抑鬱症、睡眠障礙及認知問題的下一代解決方案。對談亦涉及大腦的隱形負擔,以及腦科學、醫學工程、AI、仿真、硬件與臨牀驗證的結合。
MIT 校長 Sally Kornbluth 在 Washington Post Live 討論如何透過好奇心導向研究與教育,培育能引領美國應對 AI 時代的下一代人才。她主張保留基礎學科、加強道德、公民與倫理教育,並讓學生把 AI 作為增強工具,透過團隊協作學習。她警告,聯邦資金雖已撥予大學,款項大多尚未發放;若缺少好奇心導向研究資助,創新及人才培育管道可能枯竭。
Ethan Mollick 指出,隨着 AI 系統能持續處理更長任務,工作模式正由人與聊天機器人協作,轉向把工作交給 Agent 執行並由人管理。Epoch 的測試指出,Opus 4.7 獨立工作 14 小時,建成一個相當於人類工程師需花 2-17 週完成的軟件套件,token 成本為 $251。
OpenAI 的新報告描繪 AI 可能如何重塑歐盟各地的工作崗位。報告指出,部分職業可能面臨自動化、增長或工作流程變化。
Hamel Husain 指出,AI 產品若難以評測,往往也難以讓用戶核實輸出,因此產品設計應先降低驗證難度。文章以數據智能體、體育課教案工具和工傷賠償醫療報告工具為例,提出展示來源與假設、提供可核查的中間產物,並把輸出拆成較小的審核單位。這樣可降低標註成本,並為自動評測提供更明確的依據。
文章認為,AI 尚未取代軟件工程師,單靠能力提升也不會消除這類工作的需求。作者以「決策、執行、交付」三層框架解釋,AI 壓縮程式碼實作的執行層,但需求界定、驗證及交付責任仍需人員承擔。一項涵蓋 GitHub 上 100,000 名開發者的研究顯示,AI 智能體令程式碼行數增加 8 倍,發布量只增加 30%。
Ethan Mollick實測Claude 5 Fable後指出,模型能按多頁規格連續工作長達12小時,人的角色更像委託者。它在Claude Code中調用多個智能體研究交通資料並製作等時線地圖,也花九個半小時開發可校準人類與AI判斷的研究軟件Concord。Mollick指出,Fable消耗大量 tokens,安全護欄常令它退回能力較弱的Claude 4.8 Opus,而其決策過程不易看見。
推薦理由:Ethan Mollick以等時線地圖和研究分析軟件的實測,呈現人類角色如何由過程操作轉向委託與驗收,以及模型自主決策帶來的可見性落差。
OpenAI 的行動計劃聚焦以 AI 強化生物韌性,主題是智能時代的生物防禦。
Ethan Mollick 主張應有意識地選擇哪些認知工作交由 AI 處理,而非預設讓 AI 代做,避免削弱學習與思考所需的投入。土耳其高中數學實驗中,使用 ChatGPT 的學生作業表現較好,但測驗成績低於未使用 AI 的同學;台北高中五個月 Python 課程中,使用 AI 導師個人化題目序列的學生,在無 AI 協助的期末考高出 0.15 個標準差。
Benedict Evans認為,按職業逐項評分、量化 AI 影響程度,難以可靠預測 AI 對工作的實際影響。他以會計師人數在長期財務自動化下仍增加為例,指出自動化可能擴大工作需求,也會改變職務內容和職業分類。互聯網及 Uber 的例子則顯示,技術可改變企業商業模式和工作需求,這些影響未必能從職務描述預先推算。
Google 宣稱一組 AI 智能體花費 $916.92 建成作業系統,但作者認為公開資料不足以獨立核實。這次執行共使用 2.6B tokens;Google 所稱的單一提示詞長達數千行,但提示詞、程式碼及執行紀錄均未公開,人工介入與重試情況亦未交代。作者將此類長時程任務視為開放世界評測,認為其可補充基準評測,但需要新的方法規範。
Sayash Kapoor 主張,面對 AI 濫用風險,政府應優先投資社會韌性,而非依賴限制 AI 產品發佈等非常規幹預。文章指出,開放權重模型及前沿實驗室的廣泛 API 存取,令公開可用能力與前沿能力的差距最多隻有數月。作者建議透過 AI 輔助紅隊測試、漏洞懸賞、合成生物訂單篩查及危險材料追蹤,提升網絡與生物安全防護。
Parameter Golf 匯集 1,000+ 名參與者及 2,000+ 份投稿,探索在嚴格限制下進行 AI 輔助機器學習研究。探索範圍包括編碼智能體、量化及新型模型設計。
Berkeley AI Research 梳理自適應並行推理(Adaptive Parallel Reasoning,APR)的研究進展,將其界定為模型在推理時自行決定何時並行、分配多少執行緒及如何協調控制流的範式。
Jack Clark 根據公開研究與產品進展,估計到 2028 年底前,AI 系統自主訓練後繼模型、實現無人參與 AI 研發的機率約為 60%。他以 SWE-Bench 成績由 Claude 2 的約 2% 升至 Claude Mythos Preview 的 93.9%,以及 AI 在研究復現、模型微調和長時間任務上的進展,作為主要依據。
Manus Blog 以同一份個人理財網站提示詞實測 Replit、Manus AI、Lovable、Vercel v0、Base44 和 Hostinger Horizons,並比較各工具的生成結果與使用體驗。
Sam Altman 分享了指引 OpenAI 工作的五項原則。OpenAI 的使命是確保 AGI 惠及全人類。
文章比較 Manus My Computer、Perplexity Computer、Claude Cowork、ChatGPT Agent 和 Genspark 五款桌面 AI 智能體,涵蓋功能、價格及適用場景。文中説明各工具在本地檔案存取和雲端執行上的差異,並按研究、Microsoft Office 文件處理和網頁自動化等需求提供選擇建議。
Hamel Husain 認為,LLM API 雖讓團隊可自行整合 AI,評測、實驗設計和生產監測仍需要數據科學方法。文中列出五類評測陷阱,包括套用通用指標、未驗證 LLM 評審、測試集設計不當、數據及標籤質素欠佳,以及過度自動化。作者建議檢視 traces、以人工標註驗證評審,並根據真實生產數據設計測試集,讓領域專家參與標註。
Hugging Face 的 2026 年春季報告梳理過去一年開源 AI 生態的變化,指出平台用户、模型和數據集數量均接近翻倍。2025 年,Hugging Face 增至 13 million 名用户、逾 2 million 個公開模型及逾 500,000 個公開數據集;中國模型在過去一年佔平台下載量 41%,並在月度及總下載量上超越美國。
推薦理由:報告把平台增長、地域下載差異和衍生模型放在同一框架,呈現開源 AI 並非單一市場,而是由多個重疊的子生態構成。
評測者在相同的三類電商場景下實測 9 款 AI 網站建構工具,並按設計品質、品牌呈現、電商完整度和可編輯性比較表現。測試中,Squarespace Blueprint AI 的設計輸出較穩定,Wix AI 兼顧生成與編輯,Shopify 側重電商基建而非 AI 建站,Manus 則可製作自訂計算器和產品配置器。文章亦提醒,跨平台遷移通常無法帶走設計系統與版面,AI 文案仍需人工修改。
Manus 在 2026 年以同一段 8 分鐘素材測試 10 款 AI 影片剪輯平台,比較它們減少剪輯時間、保留創作控制權及將長片改編為短片的表現。評測涵蓋 Manus、Adobe Premiere、Veed.io、Wisecut、DaVinci Resolve、Descript、CapCut、Runway、OpusClip 和 Filmora。
五種 AI 價值模型展示領導者如何循序推進 AI,從提升員工 AI 熟練度走向流程重塑。這個推進次序可建立持久的業務優勢。
Benedict Evans 分析 OpenAI 的競爭處境,指出其模型與其他前沿模型能力接近,且龐大用戶羣的使用深度和黏性有限。文中稱 OpenAI 有 8-900m 用戶,只有 5% 的 ChatGPT 用戶付費,80% 用戶在 2025 年發送少於 1,000 則訊息。他進一步質疑,巨額算力投資與全棧平台構想是否足以建立網絡效應,並指出生成式 AI 的新產品體驗仍待創造。
Justin Curl 與合著者指出,AI 能力提升不會自動降低消費者取得理想法律結果的成本,制度與工作流程中的瓶頸可能抵銷生產力增益。文章將瓶頸歸納為限制 AI 法律服務的監管規則、訴訟與合約談判中的對抗性,以及人類法官和法律專業人員的處理速度。作者討論調整職業監管、司法程序及律師角色等改革,並指出法律工作產出變便宜,不等於客户更容易取得所需法律結果。
Manus 的文章以兩組相同提示詞比較 Manus 與 Synthesia,測試顯示 Synthesia 動態較自然,Manus 更能遵循場景細節。企業影片提示要求生成 30 秒影片,Manus 輸出 30 秒,Synthesia 則約 8 秒,兩者的動畫都有瑕疵。文章認為 Synthesia 更適合專業化身影片,Manus 則較適合重視創意自由和多步驟工作流程的用户。
Manus 以同一組 PR 案例評測 9 款 AI 代碼審查工具,涵蓋錯誤修復、重構、依賴更新和權限邊界。結果顯示,各工具在安全關鍵邏輯的風險檢測深度上差異明顯,工作流原生整合不代表分析更深入。Manus 在明確框定為安全審查的授權反轉測試中,生成了著重失敗模式、影響和補救步驟的報告,但未原生嵌入 PR 討論串作為自動審查員。
Manus 以同一提示詞測試並比較 7 款 AI 登陸頁面生成器,評估設計質素、文案、可否直接發布、免費發布及自訂能力。Manus 獲 9/10,並被評為設計質素最高;Manus、Base44 和 Simplepages AI 的免費方案均可發布。Aura 免費生成及編輯但匯出須付費,Emergent AI 和 Squarespace 的免費方案則不能發布。
DeepSeek R1 之後,中國開源 AI 生態正由模型擴展至部署、軟硬件協同與治理,開源成為中國 AI 機構近期的主流路徑。截至 2025 年中,逾 113k 個模型以 Qwen 為基礎,逾 200k 個模型倉庫標記 Qwen,遠多於 Meta 的 Llama(27k)和 DeepSeek(6k)。
作者以四組相同提示詞測試 ChatGPT(GPT-4o)、Midjourney、Nano Banana Pro、Adobe Firefly 和 Manus,比較五款 AI 圖像生成器的表現。
Arvind Narayanan 指出,Moravec 悖論從未經過實證檢驗,也不能用來預測哪些任務對 AI 容易或困難。他認為,AI 社羣偏重值得研究的任務、忽略對人與 AI 都過易或過難的任務,可能造成任務難度呈現表面上的負相關。由於新能力從突破到商業化和部署往往需要時間,他主張與其預測突破,不如適應已知的技術發展。
Indeed CRO Maggie Hulce 分享 AI 如何改變求職、招聘及人才招募,內容涵蓋僱主與求職者。
這份數據報告分析各行業員工如何使用 ChatGPT,涵蓋採用趨勢、主要任務及部門使用模式。報告亦探討 AI 在工作場所的未來。
AI 網站建構工具能加快建立專業網站,但不能單靠自動化確保專業效果;清晰的結構、資訊和目標仍是關鍵。Manus 的工具可生成基本版面與頁面結構、初稿,並加快設定和迭代;其端到端流程則先協助團隊梳理思路,再轉向視覺設計。較有效的做法是由 AI 負責草稿、版面和快速迭代,人工提供背景、策略判斷及最終優化。
一名非技術背景的內容寫作者以同一提示測試 Lovable、Replit、Bolt、Cursor 及 Manus,要求五款氛圍編碼工具製作個人作品集網站。測試中,Lovable 對初學者最友善,Manus 付費版最貼近其流行藝術設計要求;Manus 免費版出現 404 錯誤,而作者未能用 Cursor 產出網站。文章指出,工具各有適用人羣,提示須清晰具體,付費方案也可能帶來更符合創意要求的結果。
Hamel Husain 因 AI 編碼工具改變開發工具的取捨,停止使用自己曾協助建立及維護的 nbdev。nbdev 以 Jupyter notebooks 作為程式碼、文件和測試的單一來源,再轉譯成 Python 程式庫和文件網站;他認為這種工作流令 AI 工具難以分辨應修改 notebook 還是最終程式碼。