跳到正文

全部動態

今日 23 條
10月4日週日
  1. The Verge · AI38

    Splice CEO Kakul Srivastava 認為 AI 電郵正在扼殺對話

    Splice CEO Kakul Srivastava 認為,AI 撰寫的文件會令同事間的對話變得不同且更差;當人們無法判斷文字背後是否有人,這種改變便難以逆轉。她表示,Splice 採取遠端優先模式,許多好成果都始於有人仔細思考、寫下文件,再由團隊討論。

10月3日週六
  1. The Decoder54

    DeepMind 研究者提出 Artificial Symbiotic Intelligence 作為奇點論的替代構想

    DeepMind 研究者提出 Artificial Symbiotic Intelligence,主張把 AI 發展視為人與多個智能體共同演化的社會系統,而非單一超級智能走向奇點。他們將智能體描述為由模型、角色、記憶、倫理取向、工具與技能組成、可拆解重組的臨時組合,並認為協作需要制度、介面與治理框架。對齊也不應只是自上而下灌輸固定價值,而是在不同領域的人、智能體與制度持續互動中形成。

  2. Hacker News:AI 熱帖42

    Ask HN:有人用編碼智能體寫出優質程式碼嗎?

    Hacker News 的提問者詢問,有沒有人能用編碼智能體產出優質程式碼,並表示這是他從資深工程師處聽到的真實難題。他稱 AI 生成的程式碼常繁複且充滿陷阱,審查 Claude merge requests 要多花 5x 時間,自己仍難以理解批准的改動。他質疑解法是否只能達到「level 4 autonomy」,不再閲讀或編寫程式碼,並求助已解決此問題的人。

  3. IT之家55

    分析師 MBI 體驗 Meta 的 Muse 後清倉 Airbnb、加倉 Meta

    獨立股票分析師 MBI 表示,體驗 Meta 的 Muse 約 10 天後,他清倉 Airbnb、加倉 Meta,因認為 AI 智能體可能繞過平台完成預訂。他稱 Muse 可結合 Airbnb 評價與 Instagram 上收藏、觀看過的旅行 Reels 推薦體驗;一次尋找農舍體驗時,直接向房東預訂比透過 Airbnb 便宜約 60%,而替 5 家酒店比價花了 14 分鐘。

  4. Tessl:產品與工程博客52

    Vibe Coding 並非我們能做到的最佳方式

    作者認為,Vibe Coding 並不足以支撐嚴肅系統開發,AI 編碼仍需精確規格、獨立驗證與增量學習。文章提到,一位使用多個 AI 智能體的人估計每日產出 12,000 行程式碼,作者指出瓶頸在規格、驗證與發布。他主張把規格納入版本控制,在部署流程自行執行測試,並透過小步變更持續收集回饋。

  5. Tessl:產品與工程博客63

    Tessl 工程師提出 Harness Engineer 角色,主張 AI 智能體時代工程工作轉向系統設計與治理

    Tessl 研究員兼工程師提出 Harness Engineer 角色,主張 AI 智能體愈多負責編碼,工程重心愈轉向設計和管理其運行系統。他將相關工作歸納為明確系統不變條件、分析智能體及程式碼數據、按風險安排審核;Tessl 以約 1,000 個開源技能測試智能體,發現平均只有約 70% 的技能指令獲遵循。

  6. LlamaIndex:產品、工程與評測43

    MCP 會淘汰向量搜尋嗎?

    MCP 不會取代向量搜尋:聯邦式 MCP 可讓智能體直接查詢結構化資料,但跨來源排序、延遲和供應商搜尋品質仍有限。企業資料中有 90% 是缺乏原生查詢 API 的 PDF、PPT、掃描檔和試算表,仍須經解析、抽取、分塊及索引;集中式檢索層則可快速查找語義相關內容。

  7. LlamaIndex:產品、工程與評測26

    AI 文件解析:LLM 正重塑機器讀取與理解文件的方式

    LLM 正重塑 AI 文件解析,讓機器能從文字與圖像理解文件版面、語義及上下文。相較 OCR、NLP、NER 等依賴模板與規則的工具,多模態 LLM 可重建語義閲讀順序、理解圖表與表格,並處理新文件類型而毋須重新訓練。但單靠標準 LLM API 解析複雜版面,仍可能漏掉細節或產生幻覺數值。

  8. LlamaIndex:產品、工程與評測45

    OlmOCR-Bench 評析:OCR 基準測試的洞見與陷阱

    LlamaIndex 評析 OlmOCR-Bench,認為它有助衡量文件 OCR 進展,但與多數真實文件處理需求仍有落差。基準涵蓋 1400+ 份 PDF、設有 7000+ 項二元單元測試,並按類別計算子分數。不過,約 56% 的 PDF 來自學術資料,表格與閲讀順序測試粒度偏粗,精確匹配亦容易造成脆弱判定。

  9. LlamaIndex:產品、工程與評測53

    LlamaIndex 指出檔案系統正成為智能體管理上下文的核心介面

    LlamaIndex 指出,智能體正以檔案及檔案系統管理長期對話、檢索外部上下文和載入技能,並將其視為重要的上下文介面。作者稱,實驗中配備檔案系統工具和語義搜尋的推理智能體可動態檢索上下文,而單靠檔案搜尋在中小型文件集合上亦勝過 naive semantic search(不計延遲)。

  10. Google Developers Blog35

    Go 為何是 AI 輔助軟件工程的理想語言

    Go 是 AI 輔助軟件工程的理想語言,因其端到端工具鏈與可讀性設計,能支援人類審查、驗證及維護 AI 生成程式碼。Go 平台內置格式化器、測試框架、依賴管理和安全工具,配合標準庫,讓 AI 模型更快、更低成本且更可靠地處理 Go 程式碼。一致的程式碼風格亦有助團隊維護大型程式碼庫,並為 LLM 提供更標準化的訓練數據。

  11. LlamaIndex:產品、工程與評測41

    智能文件處理(IDP)平台:大多數供應商做錯了甚麼

    多數智能文件處理(IDP)平台在真實生產環境中,難以應付文件格式與品質差異,表現往往不及供應商示範。示範與生產環境的準確率差距常達 10 至 20 個百分點,模板式系統亦會因文件類型增加而累積維護成本。新一代架構以 LLM 編排層將文字交由 OCR 引擎、表格交由版面感知擷取,圖表及圖片則交由視覺語言模型處理。

  12. Hacker News:AI 熱帖30

    消費者對 AI 的疲勞感令人難以招架,本地商户應重新考慮使用 AI

    消費者對 AI 內容的疲勞感已令人難以招架,討論主張本地商户重新考慮使用 AI。支持者認為,專業運用 AI 可製作媲美甚至勝過人工作品的內容,速度更快、成本更低。批評者稱,AI 產出有 99% 一眼可見地粗劣;他們所見的做法是未用過 AI 的人只輸入「a poster」,便採用首個結果。

  13. Hacker News:AI 熱帖18

    評測智能體在雜亂真實公司知識中的檢索能力

    這場討論聚焦如何評測智能體在雜亂真實公司知識中的檢索能力,並詢問 BEAM、MemEval、MemoryArena 等基準的參考價值。提問者亦詢問 Karpathy 的 Episodic/Procedural/Semantic 分類(Doxa/Koine/Gnosis)是否有用、與設計哪些部分相符,並追問能否公開資料抽取流程,讓其他公司自行比較,以推進可重現性。

  14. Hacker News:AI 熱帖27

    Jev 等決策模型未能勝過 LLM-as-a-judge 或傳統分類器

    Jev 等決策模型未能勝過 LLM-as-a-judge 或傳統分類器;用於智能體堆疊的條件分支決策時,模型須兼具良好校準與資訊性。神經網絡輸出 logits 對可約減的認知不確定性屬高度有損壓縮,令校準在實務上難以落實;高概率區域的估計亦會在輕微協變量偏移下不穩,令多步搜尋圖可能走向模型訓練或校準時未見的分支,甚至落在分佈外。

  15. Anthropic:Alignment Science Blog63

    Anthropic 提出 ASL-4 安全論證的三種草圖

    Anthropic 提出三種 ASL-4 安全論證草圖,探討當開發者無法排除模型具備危險能力與破壞安全程序能力時,如何論證部署安全。草圖分別採用機制可解釋性監測、AI Control,以及檢驗 RLHF 是否激勵策略性欺騙的分析。Anthropic 尚未定義 ASL-4,並明言這些假設例子均未能完整處理破壞風險,亦非正式政策或計劃。

  16. Microsoft AI:官方博客33

    AI 究竟是甚麼?

    Microsoft AI 行政總裁 Mustafa Suleyman 提出以「新的數碼物種」比喻人工智能,作為理解 AI 未來發展的新視角。他指出,即使最接近 AI 開發的人,也難以準確描述 AI 將走向何方;演講後另有 TED 主席 Chris Anderson 參與問答。

  17. Redwood Research:Blog53

    能力研究也會擴展 AI 安全與有用性的帕累托前沿

    能力研究也會擴展 AI 安全與有用性的帕累托前沿,但擴展選項不代表開發者會選擇更安全的方案。安全研究通常降低提高安全所需付出的有用性代價,能力研究則通常增加以安全換取有用性的誘因。他認為,若開發者已全面自動化 AI 研發,並願意犧牲領先優勢換取安全,某些能力研究或可成為有效的安全乾預;但目前開發者仍處於激烈競爭中。

  18. Tessl:產品與工程博客50

    AI 智能體轉型中的上下文由誰擁有?

    AI 智能體轉型中,個人與團隊上下文應由領域專家擁有;組織級共享上下文則由 enablement 或平台團隊負責整理與品質管理,並開放各方貢獻。enablement 團隊應提供工具而非接管上下文;context engineering 屬於貼近領域知識的本地工作,loop engineering 則可較集中運作。

  19. Tessl:產品與工程博客59

    集體智能始於為錯誤標明歸屬

    智能體團隊要形成集體智能,須把事故、修正與決策保存為可追溯證據,再整理成可測試、可更新的重用指引。Go client 案例中,基準執行失敗、得分 67,載入相關 pack 後通過、得分 95;文章亦指出,LLM 評審須先由人標註樣本並調校標準。

  20. Anthropic:The Institute77

    The Anthropic Institute 分析 AI 加速研發與遞迴式自我改進的可能性

    Anthropic Institute 指出,AI 已加速 AI 系統研發,但尚未能完全自主設計並開發自身後繼系統,遞迴式自我改進亦非必然。截至 2026 年 5 月,合併至 Anthropic 程式碼庫的程式碼逾 80% 由 Claude 撰寫;2026 年第二季,典型工程師每日合併的程式碼量為 2024 年的 8×。

    推薦理由:這篇分析將公開基準與 Anthropic 內部數據並置,呈現 AI 執行工程與研究任務的進展,以及自主選擇研究方向仍存的能力差距。

10月2日週五
  1. TechCrunch · AI54

    教宗良十四世呼籲保護人類藝術,稱 AI 生成作品與人類藝術存在本體差異

    教宗良十四世在 X 發文,呼籲在 AI 時代保護人類藝術,並稱人類創作與機器生成作品在本體上存在差異。他認為機器根據數百萬張他人創作的圖像進行統計計算,算法缺乏人性的火花。他 5 月的通諭強調自動化日益普及時維護人類尊嚴的重要性;TechCrunch 援引《紐約時報》近期報道稱,Anthropic 曾遊説梵蒂岡重新考慮非人類意識立場,但似乎成效有限。

  2. Hacker News:AI 熱帖20

    電力審批料將延誤 Oracle 威斯康辛州 AI 資料中心項目

    Oracle 威斯康辛州 AI 資料中心的電力審批預計將令項目延誤。評論者指出,Oracle 債券評級為 BBB-,僅高於垃圾級一級,並推測公司可能因融資困難和前期建設開支而退出資料中心合約。他預測 Oracle 或於兩三年後收購現代技術企業,以重奪市場。

  3. Hacker News:AI 熱帖54

    AI 令我難過

    原帖作者感嘆,AI 編碼普及正削弱軟件開發能力帶來的競爭優勢,也令他擔憂工程師的創作樂趣與影響力減弱。回覆者對降低製作門檻的影響看法不一,有人認為 AI 釋放創作能力,也有人憂慮內容氾濫、產品難以差異化、技能貶值和工作流失。

  4. MIT Technology Review · AI54

    別被誤導,LLM 並不真正推理

    Thore Graepel 認為,當前 LLM 的鏈式推理仍由反覆預測下一個 token 產生,並非獨立的推理機制。AlphaGo 結合神經網絡提供的直覺與棋局樹搜尋;作者指出,聊天機械人缺少可持續檢視的信念狀態,思維鏈也可能在得出答案後才編造。Graepel 主張系統維護明確的認知狀態,僅在證據支持時更新信念,並評估每一步能否降低不確定性。

  5. Hacker News:AI 熱帖35

    別被這個夏天的 AI 熱潮矇蔽

    作者反駁對 AI 風險的反射式否定,主張質疑 AI 公司的説法,不應因此忽視現實危害。文中指出,近期 AI 安全事件多涉及內部測試或受控情境,部分移除了防護措施或要求模型角色扮演;目前沒有已知非 AI 公司實施同類行動的案例,相關風險亦難以獨立核實。

  6. AI as Normal Technology59

    AI 安全運動應走「大帳篷」還是「小帳篷」路線?

    文章主張 AI 安全運動應採取「大帳篷」路線,讓不認同 AI 生存風險論、但關注具體災難與系統性風險的人也能參與。文章認為,把公共討論集中於超級智能生存風險,可能加劇政治兩極化,並使政策資源偏離對既有風險及社會韌性的防護。文章倡議以透明度、責任制度和嵌入式評估等共同政策建立更廣泛的安全聯盟。

10月1日週四
  1. Ethan Mollick:One Useful Thing70

    Ethan Mollick 重新評估 AI 智能體自我組織的管理難度

    Ethan Mollick 重新評估智能體管理的難度,認為 AI 模型已能自行規劃及組織協作,安排智能體工作未必需要繁複的人為設計。他以 OpenAI 的 swarm 為例,稱數千個智能體處理 Navier-Stokes 存在性與光滑性問題,歷時 88 小時並互傳約 2.7 million 則訊息;相關成果尚未獲正式接納。他也指出,智能體仍有能力限制和失控風險,人類需要設定目標並在過程中調整方向。

  2. ChinaTalk57

    中國如何應對 Starlink

    中國應對 Starlink 的策略包括限制其擴張,以及建設自有衞星網絡,以削弱美國及其夥伴的戰略優勢。相關構想包括申報頻譜與軌道資源、電磁幹擾,以及網絡戰或動能手段;中俄是否曾聯合實施仍不明確。作者指出,以動能手段摧毀大量衞星會造成太空碎片,可能損害中國自身的衞星和太空計劃;幹擾手段亦沒有簡單而穩定的解決方案。