跳到正文

全部動態

今日 431 條
今天10月6日週二
  1. Replit:Blog55

    Replit 説明如何以評估閉環持續改進 Replit Agent

    Replit 將 Replit Agent 的評估由發佈前的單次檢查,轉為結合離線基準、線上 A/B 測試及生產軌跡分析的持續改進閉環。ViBench 以自然語言產品需求文件和測試計劃評估生成應用是否符合規格,Telescope 則整理生產軌跡並聚類失敗模式。改進循環會提出候選修正、建立草稿 PR 並彙整評估證據,工程師仍負責審核及決定是否發佈。

  2. Replit:Blog51

    Replit 指 AI 採用始於可信數據,語義層是基礎

    Replit 指出,企業要可靠採用 AI Agent,須先建立共享語義層及受治理的營運真相層,讓 Agent 依據一致的商業定義、指標和數據來源工作。其內部數據 Agent 將修正存入 git 儲存庫,經人工審核和驗證後供接觸數據的 Agent 共用;Replit 稱,該 Agent 每週回答遠超 1,000 個以數據倉庫為基礎的提問,並在答案中附上證據。

  3. Replit:Blog63

    Replit 推出黑盒滲透測試,模擬外部攻擊尋找程式碼掃描難以發現的漏洞

    Replit 現可為其應用程式執行黑盒滲透測試,透過網絡和瀏覽器模擬外部攻擊者,在無法存取程式碼的情況下尋找漏洞。執行 Level 3 掃描時,系統會在私有沙盒中的應用程式副本上並行執行白盒及黑盒掃描;黑盒掃描只需應用程式連結。Replit 表示,兩種掃描發現的問題很少重疊,案例包括白盒掃出存取權限已撤銷的用戶仍可操作,黑盒則找到無需登入即可進入的管理員控制台。

  4. Replit:Blog62

    Replit 開放 Intelligent Model Routing,按任務自動選擇模型

    Replit 已向所有用戶開放 Intelligent Model Routing,系統會按每項任務自動選擇合適模型,平衡質素、速度與成本。Replit 表示,測試中其輸出質素與上一版 Max Mode 相同,成本則低 65%。所有用戶會從 Free Mode 開始,工作升級至可能產生使用費的較高效能模式時會收到通知,並可選擇留在 Free Mode;Core & Pro 用戶仍可手動選擇模型。

  5. Replit:Blog60

    Replit 收購 Atta,將商業分析及互動圖表帶入平台

    Replit 宣佈收購位於舊金山的 Atta,將其商業分析方法及專門圖表技術整合至 Replit,並推出聊天互動圖表。用戶可在 Replit 對話中上載數據集或連接數據來源並提問,Replit 會分析數據並呈現圖表,無需編寫 SQL。圖表會按數據和問題選擇合適的視覺化方式,並提供可互動、可分享的呈現。

  6. Cohere 產品與研究博客71

    Cohere 與 Aleph Alpha 簽署業務合併協議,擬打造首個跨大西洋主權 AI 方案

    Cohere 宣佈與 Aleph Alpha 簽署最終業務合併協議,合併後公司將以 Cohere 名義全球營運,並計劃打造首個跨大西洋主權 AI 方案。交易完成後,公司員工人數將增至 1,000 人以上,並計劃在柏林和多倫多設立雙總部,保留海德堡辦公室作研究中心。交易仍須取得最終監管批准,預計今年稍後完成。

  7. Cohere 產品與研究博客38

    AI 變革管理:以人為本的方法

    AI 變革管理應把 AI 視為需要融入人類工作流程的協作參與者,而非僅是待部署的軟件工具。這項工作涵蓋企業由準備至日常使用的組織調整,包括角色職責、員工工作方式、流程及監督;人與 AI 的分工須區分可驗證、判斷型及混合型任務,並持續重新評估。

  8. ElevenLabs:Blog67

    Universal Music Group 與 ElevenLabs 宣佈多年期授權協議及戰略合作

    Universal Music Group(UMG)與 ElevenLabs 宣佈多年期音樂授權及戰略合作,並將共同開發 AI 音訊產品。ElevenLabs 正開發並將推出一個以授權音樂和藝人參與為基礎的 AI 音樂平台,讓粉絲以參與藝人及詞曲創作者的音樂創作 remix、mashup、新演繹和個人化人聲體驗。這是 ElevenLabs 首個與大型唱片公司達成、涵蓋授權及產品開發的協議。

  9. ElevenLabs:Blog70

    ElevenLabs 發佈 Eleven v4 與 Eleven v4 Turbo 文字轉語音模型

    ElevenLabs 發佈 Eleven v4 文字轉語音模型及低延遲版本 Eleven v4 Turbo,兩者均支援 90 多種語言。Eleven v4 可按語氣、節奏、情緒、角色和上下文生成語音,並改善多説話者對話、聲音克隆及跨語言口音保留。Turbo 的中位推理延遲約 100ms,兩款模型現已可透過 ElevenAgents、ElevenCreative 和 ElevenAPI 使用。

  10. Goodfire Research57

    Goodfire Research 發佈 Predictive Data Debugging 研究,訓練前預測並調整模型從數據中學到的內容

    Goodfire Research 發佈 Predictive Data Debugging 研究,提出在訓練前預測偏好數據如何影響模型行為的方法。其預測與模型實際學到的結果達到 R² = 0.9,並可追溯至相關數據羣組。使用 Dolci 和 Tulu 3 數據集的案例顯示,DPO 可能削弱模型對部分有害請求的穩健性;以除錯數據訓練則可同時改善安全與效能。

  11. Claude:Blog62

    Claude Tag 現支援在 Slack 頻道使用個人連接器

    Claude Tag(beta)現支援在 Slack 頻道的請求中使用用戶個人連接器,讓 Claude 存取用戶已連接至 Claude 帳戶的工具及資料。用戶可選擇在回覆發佈前先審閲,或使用自動模式;Enterprise 管理員亦可要求所有人先審閲。個人連接器現正向 Team 方案推出,Enterprise 方案其後跟進;排程工作及 Claude 自行啟動的操作仍使用管理員為頻道設定的共用連接器。

  12. Claude:Blog63

    Claude 推出插件目錄提交入口,支援審核追蹤及上線後使用分析

    Claude 推出插件目錄提交入口,讓開發者提交插件、追蹤審核進度,並在插件上線後查看使用分析。入口只開放予使用付費 Claude 方案的開發者,提交方式包括單一遠端 MCP 伺服器連接器,或把 MCP 伺服器與 Agent 技能組成插件套件、託管於 GitHub 並提交程式碼庫。上線後的分析包括按產品介面及版本分類的安裝量、目錄頁面的瀏覽量,以及引導用戶找到列表的搜尋詞。

  13. Claude:Blog59

    Anthropic 銷售團隊如何以 Claude Managed Agents 重建銷售查詢流程

    Anthropic 以 Claude Managed Agents(beta)建立購買智能體,協助企業客戶瞭解方案並從查詢走到購買。智能體每日處理數千段對話,回答定價、安全及數據問題,並按情況引導結帳、即時答覆或轉交銷售代表。轉交銷售團隊的客戶轉化為銷售機會的比例,是舊表單線索的兩倍以上,成交時間約快五天;客戶可在開始時選擇與智能體或銷售代表洽談。

  14. Fireworks AI57

    Fireworks AI 推出 Specialized Intelligence Index,首批涵蓋七個領域的模型基準

    Fireworks AI 推出 Specialized Intelligence Index(SII),比較開放模型、封閉模型及專用模型在特定領域基準上的表現,首批涵蓋七個領域。基準由實務工作者設計,結果按領域及基準呈現,不合併為跨領域綜合分數,並提供分數與成本、所需時間的比較視圖。文章指出,基準分數、能力主張與業務成果屬不同層次,後兩者需要各自有相應證據支持。

  15. Claude:Blog75

    Claude Code 推出 mods,讓用戶自訂提示詞、介面及內置功能

    Claude Code 推出 mods,這些小型 TypeScript 函數可改寫提示詞、阻止或改寫工具呼叫,並增添介面或替換內置功能。mods 隨插件一同提供,可在 Claude Code CLI 和桌面應用程式使用,也可由 Claude Code 編寫、安裝並在工作階段中熱重載。mods 不設沙盒,擁有與 Claude Code 相同的機器存取權限,應只安裝來自可信來源的 mods。

  16. Claude:Blog44

    Cresta 如何透過 Claude Agent SDK 將客戶體驗專業知識轉化為 Conductor 智能體建構工具

    Cresta 以 Claude Agent SDK 打造 Conductor,將客戶體驗專業知識融入自然語言智能體建構工具,協助團隊由藍圖推進至實作、評估和優化。Cresta 表示,早期用例中,Conductor 將初始部署時間縮短約一半。團隊以建立新智能體、編寫測試、修改現有智能體及根因分析等任務,評估其成果、執行路徑、品質和資源使用。