跳到正文

全部動態

今日 0 條
10月3日週六
  1. AWS Machine Learning Blog61

    Claude Platform on AWS 多環境存取實作指南

    AWS Machine Learning Blog 提供 Claude Platform on AWS 多環境存取指南,示範為 AWS 工作負載、開發者筆電及外部環境配置推理存取。

    推薦理由:文章按 AWS 工作負載、開發者筆電與外部環境,示範 cross-account SigV4、workspace-scoped API key 和 OIDC federation 如何配置,並維持 workspace 隔離。

  2. Redwood Research:Blog53

    能力研究也會擴展 AI 安全與有用性的帕累托前沿

    能力研究也會擴展 AI 安全與有用性的帕累托前沿,但擴展選項不代表開發者會選擇更安全的方案。安全研究通常降低提高安全所需付出的有用性代價,能力研究則通常增加以安全換取有用性的誘因。他認為,若開發者已全面自動化 AI 研發,並願意犧牲領先優勢換取安全,某些能力研究或可成為有效的安全乾預;但目前開發者仍處於激烈競爭中。

  3. Tessl:產品與工程博客63

    回饋迴路工程:讓項目更適合智能體開發

    Tessl提出回饋迴路工程,透過設計智能體周邊的迴路,讓每次執行改善後續工作的項目條件。文章把迴路分為單次改動、跨項目歷史及生產訊號三層,維護智能體分析日誌、PR 評論或程式庫狀態後,會把需修正事項整理成一般問題單交回既有開發流程,而不自行開 PR。

  4. Tessl:產品與工程博客50

    AI 智能體轉型中的上下文由誰擁有?

    AI 智能體轉型中,個人與團隊上下文應由領域專家擁有;組織級共享上下文則由 enablement 或平台團隊負責整理與品質管理,並開放各方貢獻。enablement 團隊應提供工具而非接管上下文;context engineering 屬於貼近領域知識的本地工作,loop engineering 則可較集中運作。

  5. Tessl:產品與工程博客59

    集體智能始於為錯誤標明歸屬

    智能體團隊要形成集體智能,須把事故、修正與決策保存為可追溯證據,再整理成可測試、可更新的重用指引。Go client 案例中,基準執行失敗、得分 67,載入相關 pack 後通過、得分 95;文章亦指出,LLM 評審須先由人標註樣本並調校標準。

  6. Tessl:產品與工程博客60

    「一個大腦」意味着掌握組織記憶

    Leapfrog 團隊的作者分享以 OpenClaw、GitHub、Obsidian 和 Telegram 搭建組織記憶系統,讓團隊可透過智能體以自然語言查詢公司知識與客户脈絡。研究庫當時約有 1,200 個檔案,另設客户資料庫;系統區分個人、領導層、公司與客户知識,只把經判斷扎實且有用的研究升格分享。作者建議先讓一人本機試行,確認維護、權限及資料安全要求,再按實際需要逐步增加檢索層。

  7. Tessl:產品與工程博客34

    Tessl 符合 SOC 2 Type 2 標準

    Tessl 已完成 SOC 2 Type II 審核,審核由獨立審計機構 A-Lign 執行,涵蓋其日常資料保護控制。報告涉及客户資料存取限制、持續監察與事件應變、員工安全培訓,以及安全軟件開發。客户可到 Tessl Trust Center 查看安全文件並申請完整 SOC 2 Type II 報告;Tessl 正推進 ISO 27001 認證,內部審計於本月開始,外部審計安排在 11 月。

  8. Dario Amodei:Blog9

    Dario Amodei 的 Google Scholar 論文與引用紀錄

    Dario Amodei 的 Google Scholar 頁面列出其 AI 研究論文、合著者、出版資訊及引用數,涵蓋語言模型、AI 安全與人類偏好強化學習。《Language models are few-shot learners》列有 83,699 次引用,《Language models are unsupervised multitask learners》列有 25,007 次引用。

  9. LlamaIndex:產品、工程與評測36

    AI 文件分類:自動化分揀與標記實用指南

    AI 文件分類利用訓練模型理解文件內容、結構與語境,自動分配類別及標籤,並將文件送入相應工作流程。傳統機器學習分類器須以數千份已標註文件訓練;大語言模型可根據自然語言類別描述進行零樣本分類,無須標註訓練資料。信心評分讓高信心結果直接流轉,低信心結果轉交人工審核。

  10. LlamaIndex:產品、工程與評測30

    KYC 自動化:如何以可擴展且合規的工作流程取代人工核驗

    KYC 自動化以軟件執行文件擷取、身份核驗、制裁篩查和風險評分,將人工審核集中於例外個案。標準案件的處理時間可由數天至數星期降至數分鐘至數小時,並留下完整、帶時間戳且可核查的審計紀錄。LlamaParse 以智能體式文件解析、版面感知電腦視覺及多重驗證迴圈,將不同格式文件轉為結構化資料。

  11. LlamaIndex:產品、工程與評測22

    按揭文件自動化:改造貸款處理流程

    按揭文件自動化把貸款申請、核保、驗證及成交中的人工文件工作,轉化為結構化、由機器處理的流程。系統結合機器學習、電腦視覺與結構化解析,辨識文件版面並抽取符合預設 schema 的資料,不止進行文字識別。抽取結果會按業務規則、核保準則及外部數據來源驗證,並以信心評分和人工審核處理模糊或不確定個案。

  12. LlamaIndex:產品、工程與評測24

    KYC 文件核驗中的 OCR:為何標準文字提取難以滿足合規要求

    標準 OCR 難以滿足 KYC 合規要求,因其無法可靠辨識磨損、斜拍、帶有防偽特徵或使用非拉丁文字的真實身份文件。人工資料輸入錯誤率平均為 1–4%,而真正直通式處理要求欄位準確率達 99.9%。錯誤欄位會流入 AML 篩查及合規紀錄,觸發誤報、錯過名單匹配或延誤客户開户。

  13. Meta AI:Research Blog76

    Meta 發佈 Muse Image 並預覽 Muse Video

    Meta 發佈 Muse Image,並預覽 Muse Video;兩者均為 Meta Superintelligence Labs 開發的媒體生成模型。Muse Image 可調用網絡搜尋和編碼工具、自我修訂,並支援精準編輯與多參考圖像構圖;Meta 稱增加推理時計算可提升生成質素。

    推薦理由:文中比較 Muse Image 的推理時計算策略,指出把資源投入刻意推理比 Best-of-N 更能持續提升圖像品質,工具調用亦可補足單靠推理的不足。

  14. Meta AI:Research Blog76

    Meta 發佈 Muse Spark 1.1,並開放 Meta Model API 公開預覽

    Meta 發佈多模態推理模型 Muse Spark 1.1,稱其較 Muse Spark 在工具與電腦操作、編碼及多模態理解方面均有重大提升。模型可協調多個子智能體並管理 1 million tokens 的上下文窗口;開發者現可透過公開預覽中的 Meta Model API 使用,Meta AI app 和 meta.ai 亦提供 Thinking 模式。

    推薦理由:Muse Spark 1.1 聚焦智能體工作流,涵蓋多智能體協作、電腦操作與 1 million tokens 上下文,並透過 Meta Model API 開放公開預覽。

  15. Google Developers Blog60

    Google Colab 納入 Google AI 訂閲方案,訂户可享高級權益

    Google 將高級 Google Colab 權益納入 Google AI 訂閲,訂户可優先使用更快的加速器和效能更強的機器。Google AI Ultra 訂户另可使用不中斷的背景執行和 Premium GPU,讓長時間訓練無須保持瀏覽器分頁開啟。現有 Colab 訂閲不變,Google AI 訂閲權益可疊加;相關權益將於未來數週向 Colab 支援國家的 Google AI 訂户推出。

  16. Anthropic:The Institute77

    The Anthropic Institute 分析 AI 加速研發與遞迴式自我改進的可能性

    Anthropic Institute 指出,AI 已加速 AI 系統研發,但尚未能完全自主設計並開發自身後繼系統,遞迴式自我改進亦非必然。截至 2026 年 5 月,合併至 Anthropic 程式碼庫的程式碼逾 80% 由 Claude 撰寫;2026 年第二季,典型工程師每日合併的程式碼量為 2024 年的 8×。

    推薦理由:這篇分析將公開基準與 Anthropic 內部數據並置,呈現 AI 執行工程與研究任務的進展,以及自主選擇研究方向仍存的能力差距。

  17. Every:最新文章44

    我如何打磨由 AI 智能體構建的軟件

    作者把親自使用 AI 智能體所構建的軟件、判斷體驗並反覆修整,視為 compound engineering 的最後一步。他以 `/ce-polish` 檢出分支、啟動開發伺服器,並在編輯器中與智能體並排查看應用程式。在 Cora Brief 中,他透過 Monologue 指出版面留白過多、卡片需要更緊湊,智能體調整版面後,應用程式隨即熱重載。

  18. Cohere Labs:官方研究博客44

    大型語言模型在 RAG 中的檢索穩健性評估

    研究以涵蓋五個資料集、三類任務的 1,891 個樣本,評估 11 個 LLM 在實際 RAG 設定中的檢索穩健性;整體穩健性普遍偏高,但因任務而異。停用推理時,Qwen 和 GPT 模型的穩健性明顯下降,即使在單跳 QA 任務上亦然;把檢索文件作為工具回覆提供,則提升 Claude 模型表現、損害 Qwen 和 GPT 模型表現。研究指出,是否採用 RAG 仍須按個案判斷。

  19. OpenAI Developers:Blog8

    OpenAI Apps SDK 開發者資源

    OpenAI 的 Apps SDK 頁面列出開發者文件與資源,涵蓋 API、Agents、工具、音訊與語音、部署及 API 參考。頁面亦列出以使用者 ChatGPT 方案運作的 Apps、可擴展 ChatGPT 和 Codex 的 Plugins、Workspace Agents,以及在 ChatGPT 建立 Commerce 流程和發布、衡量 Ads 的相關資源。

  20. OpenAI Developers:Blog8

    OpenAI API 開發者文件與資源總覽

    OpenAI API 開發者頁面匯集模型探索、智能體建置、工具與資料連接、音訊及語音體驗、部署和 API 參考等資源。頁面亦提供 ChatGPT 與 Codex 文件、使用案例、Cookbook、示例應用、開發者學習資料及社羣支援入口。

  21. OpenAI Developers:Blog3

    OpenAI Developers 開發者資源總覽

    OpenAI Developers 彙整 OpenAI API、模型、智能體、工具及音訊與語音開發資源,並涵蓋部署、API 參考,以及 ChatGPT 和 Codex 文件。頁面亦列出用例、Cookbook 範例、示範應用、開發者網誌及社羣支援。

  22. OpenAI Developers:Blog64

    重新思考 GPT-6 Astra 的技能與提示詞

    OpenAI 分享如何為 GPT-6 Astra 調整技能、AGENTS.md 與任務提示詞,指出較強模型未必需要舊有的密集引導。技能描述應精簡並明確限定適用情境,多流程技能可由主文件引導至補充文件;AGENTS.md 則宜按任務提供相關文件和安全工作流程。文章還建議重新檢視測試、決策邊界和完成條件,避免舊指引令 GPT-6 Astra 過早停下或執行不必要的工作。

  23. MiniMax:Blog68

    MiniMax 發佈 H3 多模態生成模型,支援原生立體聲 2K 影片生成

    MiniMax 發佈 H3 通用多模態生成模型,可理解文字、圖像、影片與音訊的統一上下文,並生成最長 15 秒、2K 解析度的原生立體聲影片。H3 預設提供 2K 輸出,官方表示其 2K 每秒價格低於主流模型的三分之一,並計劃在未來幾天內於適用法律法規範圍內開放模型權重。模型面向廣告、品牌、電商等創作場景,MiniMax 表示完整技術報告將於稍後分享。

  24. Anthropic:Alignment Science Blog57

    研究提出模糊任務中的分散式 AI 控制框架

    Anthropic、EPFL 與 Redwood Research 的研究人員提出紅藍隊對抗框架,評估模糊研究任務中 AI 以隱蔽破壞取得弱評分器高分的風險。在實驗構想生成測試中,對抗提示詞令 Opus 4.6 產生被弱評分器評為優良、但被可查閲原論文的 Sonnet 4.6 評為較差的提案;研究亦找到能抵禦紅隊提示詞攻擊的 Haiku 4.5 評分提示。