跳到正文

全部動態

今日 23 條
今天10月6日週二
  1. 英國 AI Security Institute:Blog55

    使用 Inspect Scout 分析 AI 對話紀錄的七步流程

    英國 AI Security Institute 與 Meridian Labs 合作開發開源對話紀錄分析工具 Inspect Scout,並在新論文中提出使用它進行分析的七步流程。Inspect Scout 建基於 Inspect,可平行分析數千份對話紀錄,並透過掃描器把紀錄中的特定內容轉為易讀結果。流程涵蓋界定研究問題、整理及抽查資料、設計和驗證掃描器,並將結果用於即時排查或後續研究。

  2. 英國 AI Security Institute:Blog58

    英國 AI Security Institute 發佈 AISI Engineering Playbook,整理前沿 AI 評估方法與實踐

    英國 AI Security Institute 發佈 AISI Engineering Playbook,整理其評估前沿 AI 系統時建立的方法與實踐。手冊將評估所需基建分為 Evaluate、Isolate、Connect、Run 和 Scale 五層,並提供技術介紹及現有開源程式碼連結。研究人員可採用個別組件,機構亦可參照五層架構建立自己的評估平台。

  3. Thinking Machines Lab:News39

    Tinker 徵集社羣項目

    Tinker 邀請開發者和研究人員提交社羣項目,並計劃定期在網誌刊出精選成果。徵集涵蓋機器學習研究、微調模型應用、產品原型、數據集及基礎設施;投稿應附研究説明,最好開源程式碼,並展示嚴謹評估和透明結果。

  4. Eugene Yan:Writing71

    產品評測的三個簡單步驟

    Eugene Yan 提出產品評測的三步流程:標註小型數據集、校準 LLM 評估器,並在每次配置變更後執行實驗與評測。他建議採用二元標籤,在 200 個以上樣本中準備 50–100 個失敗案例,並以 75% 樣本校準、25% 留作測試;不同評測維度應使用獨立評估器。

  5. Eugene Yan:Writing73

    如何與 AI 協作,讓工作成果持續累積

    Eugene Yan 分享一套與 AI 協作、讓工作成果持續累積的方法,涵蓋整理上下文、將個人偏好寫入設定、降低驗證成本、委派較大任務及持續修正流程。他建議以專案索引和 CLAUDE.md 保存背景與偏好,把每週至少做一次的工作整理成按需載入的技能,並根據工作階段紀錄修訂設定。

  6. Eugene Yan:Writing67

    構建網絡安全評測的設計模式

    Eugene Yan 梳理多個網絡安全基準,歸納智能體評測的共同設計模式,並比較它們衡量漏洞發現、重現與利用能力的方法。文章將常見設計概括為沙盒目標環境、影響任務難度的資訊、工具和評分器,並介紹 Cybench、CVE-Bench、CyberGym 等基準如何提供部分分數或按攻擊階段分級。

  7. Cohere 產品與研究博客32

    企業生成式 AI:應用案例、效益與採用方式

    企業可用生成式 AI 搜尋及整合知識、創作內容、提供對話支援、協助軟件開發與數據分析,並自動化多步工作流程。用得其所可提升生產力和工作質素、擴大個人化體驗,並加快創新。採用時須先確認生成式 AI 能否切合具體業務需要並值得投資,避免在缺乏明確商業理據下增加成本與複雜程度。

  8. Fireworks AI53

    企業如何邁向專門化智能並訓練自有模型

    Fireworks AI 的文章梳理企業邁向專門化智能的路徑,從租用封閉式前沿模型、加入開源模型,逐步走到微調自有模型。在 UIPad 測試中,Kimi K3 與 GPT 5.6 Sol 整體同為 87.7 分,但 Kimi K3 執行成本為 $56,GPT 5.6 Sol 為 $115;按題型分流,可把座標題交給 Sol,其餘題目交給 K3。

  9. Suno:Blog51

    Suno Voices:提升人聲品質的 6 個技巧

    Suno 分享了使用 Voices 製作高質素人聲的 6 個技巧,涵蓋安靜錄音、事前練習及按曲風配搭聲線。可行的話,建議錄製至少一分鐘的人聲參考;較長錄音能讓 Suno 學習更多內容,令整首曲目的人聲結果更一致。Voices 現已可在 Web、iOS 和 Android 使用,並提供免費試用及付費方案。

  10. Claude:Blog56

    Anthropic 分享 AI 驅動程式碼現代化項目的籌備方法

    Anthropic 的前線部署工程師分享企業籌備 AI 驅動程式碼現代化項目的六步方法,涵蓋界定目標、驗收條件、變更上線政策、前置準備、智能體工作流程及正式執行。文章建議以 Claude Code 建立按項目調整的工作流程,先在小部分程式碼上端到端試行,再擴展至完整程式碼庫。試行期間可量度 tokens 用量以估算成本,並把計算量大的驗證安排在較簡單的檢查通過後執行。

  11. Suno:Blog17

    為何要在 Suno 發佈你的音樂作品

    Suno 鼓勵創作者發佈音樂作品,讓作品接觸數以百萬計的聽眾。發佈有助創作者獲得聽眾回饋、瞭解哪些內容引起共鳴,並改善下一首作品。公開作品亦可讓社羣其他創作者重新混音,為彼此帶來靈感。

  12. Claude:Blog59

    Anthropic 銷售團隊如何以 Claude Managed Agents 重建銷售查詢流程

    Anthropic 以 Claude Managed Agents(beta)建立購買智能體,協助企業客戶瞭解方案並從查詢走到購買。智能體每日處理數千段對話,回答定價、安全及數據問題,並按情況引導結帳、即時答覆或轉交銷售代表。轉交銷售團隊的客戶轉化為銷售機會的比例,是舊表單線索的兩倍以上,成交時間約快五天;客戶可在開始時選擇與智能體或銷售代表洽談。

  13. 小米 MiMo:官網發佈與博客54

    MiMo-V2.5 系列全流程推理優化實踐

    小米 MiMo 團隊介紹 MiMo-V2.5 系列的全流程推理工程優化,涵蓋 KVCache 管理、排程、Prefill/Decode 執行流程及多模態推理。多模態 Encoder 的 QPS 由 15 增至 30,平均延遲由 78.39 ms 變為 80.28 ms;1 小時影片的 Encoder 端到端延遲由 156 s 降至 23 s。

  14. Cerebras:Blog53

    Cerebras 教 AI 智能體以自然語言測試 Cloud Console

    Cerebras 建立內部 console-prompt-tests 框架,讓 LLM 智能體透過真實瀏覽器,以自然語言執行 Cloud Console 端到端測試。框架可從 PDF 測試計劃或 DOM 基線生成測試,並檢查 PR 覆蓋、評估發布風險和分類失敗;自動修復僅用於 UI 漂移,模型提出修改後須經實時重跑驗證,合併仍由人員批准。發布流程亦會生成發布説明,整個流程約需 20 分鐘。

  15. Databricks:Blog55

    Databricks 分享挑選首批高影響力 Genie Agents 的方法

    Databricks 分享一套挑選首批 Genie Agents 的方法,建議團隊按五項準則評估候選工作流程,篩選適合作為試點的項目。準則涵蓋業務影響、需求頻率與重複性、數據與元數據準備度、範圍清晰度,以及治理和風險適配度;各項按 1–5 分評分,總分 20–25 可立即開發,14–19 需進一步完善,低於 14 則暫不適合。若沒有業務負責人或高層主管積極支持,即使評分高也應暫緩。

  16. AWS Machine Learning Blog55

    Amazon Bedrock AgentCore Evaluations 教學:評估多智能體系統的可解釋性與有用性

    AWS 示範如何透過 Amazon Bedrock AgentCore Evaluations,衡量多智能體系統的有用性、任務成功率、業務準確性與可解釋性。文章以虛構零售商 AnyCompany Retail 的供應鏈決策方案為例,逐層結合內置評估器、自訂業務規則及六項可解釋性評估。框架支援開發階段的按需評估及生產環境的線上持續監察,並分開衡量業務準確性與解釋透明度。

10月5日週一
10月3日週六
  1. IT之家32

    北京首都機場免費 Wi-Fi 使用攻略發布:一次認證有效 3 個月

    北京首都機場發布免費 Wi-Fi 使用攻略,旅客完成認證後,認證有效期可達 3 個月,期內再次到訪可自動連線。認證方式包括手機短信、護照、現場 Wi-Fi 取號機,以及首都機場官方微信及小程序一鍵登入;T2、T3 設有 46 台取號設備。Wi-Fi 覆蓋航站樓及停車樓所有旅客可達區域,每名旅客可獨享 15M 帶寬。

  2. IT之家58

    如何用好 GPT-6 系列 AI 模型?OpenAI 發佈指南講解選擇模型與優化提示詞

    OpenAI 發佈 GPT-6 系列模型指南,介紹按工作負載選擇模型、優化提示詞及調整推理強度的方法。指南推薦 GPT-6 Astra 處理高難度推理、GPT-6.1 Sol 處理複雜編程、研究和電腦使用,GPT-6 Luna 則用於大規模特定任務及明確的日常重複工作。提示詞應交代期望結果、受眾、上下文、限制及完成標準;最高推理強度適合複雜分析、除錯或深度研究。

  3. LlamaIndex:產品、工程與評測43

    較弱的 LLM 智能體需要更多限制與更好的工具

    LlamaIndex 發現,較弱模型驅動的 ReAct 智能體在金融分析資料任務中較難取得相關結果。限制智能體互動,並提供更多能明確執行複雜操作的工具,可改善這類模型的查詢表現。相比之下,GPT-4 較能可靠地運用 ReAct 執行多種複雜資料查詢。

  4. LlamaIndex:產品、工程與評測56

    使用 LlamaIndex 和 TruLens 構建並評估大語言模型應用

    TruLens 最新版本加入對 LlamaIndex 大語言模型應用的追蹤功能,讓開發者評估和記錄實驗,並檢視輸入輸出、模型呼叫及檢索內容。文章示範以回饋函數檢查語言匹配、答案相關性和檢索片段相關性,並在 TruLens 儀錶板查看彙總結果及個別互動紀錄。文中的錯誤回答案例顯示,檢索到相關性不足且不含答案的上下文時,應用可能產生模型幻覺。

  5. LlamaIndex:產品、工程與評測31

    LlamaIndex:運用 Text2SQL 與 RAG 分析產品評論

    LlamaIndex 示範以 Text2SQL 結合 RAG 分析產品評論,從資料庫查詢並整理產品洞見。示範資料由 GPT-4 生成,涵蓋 iPhone13、SamsungTV 和 Ergonomic Chair,並存於記憶體 SQLite 資料庫。流程先把自然語言問題拆成主、輔助查詢,再以 Text2SQL 擷取資料,最後透過 List Index 根據輔助問題生成答案。

  6. LlamaIndex:產品、工程與評測41

    使用 LlamaIndex 評估 RAG 系統的理想分塊大小

    LlamaIndex 示範使用 Response Evaluation 評估 RAG 系統的理想分塊大小,並比較不同設定下的平均回應時間、Faithfulness 與 Relevancy。實驗以 Uber 2021 年 10-K 文件生成問題,使用 GPT-3.5-turbo 產生回答,再以 GPT-4 評估回答的忠實度與相關性。

  7. LlamaIndex:產品、工程與評測53

    用 LayoutPDFReader 掌握 PDF 解析:抽取章節、標題、段落和表格

    文章介紹 LayoutPDFReader 解析具文字層的 PDF,保留章節層級、段落、表格和清單結構,並據此生成供 RAG 使用的分塊。文中示範以 LLMSherpa API 讀取 PDF,並用 LlamaIndex 建立向量索引及執行查詢。工具目前不支援 OCR,只能處理帶有文字層的 PDF;原文亦指出,並非所有 PDF 都能完美解析。

  8. LlamaIndex:產品、工程與評測56

    LlamaIndex 解析多模態 RAG 評估方法

    LlamaIndex 介紹多模態 RAG 的評估方法,建議沿用文字型 RAG 的檢索與生成兩階段框架,並分別計算文字和圖片的檢索指標。生成評估則可使用能處理文字及圖像上下文的 LMM 作裁判,衡量相關性與忠實度;文中亦介紹其 beta Multi-Modal Evaluator abstractions。