Replit 推出 Agent Customization,讓 Replit Agent 套用 Custom Instructions 和 Skills
Replit 推出 Agent Customization,讓 Replit Agent 在不同專案中套用個人或團隊慣例。Custom Instructions 會在每個專案和工作階段自動加入 Agent 上下文,適用於 Pro 和 Enterprise;Skills 則按相關任務載入,所有方案均可使用。
Replit 推出 Agent Customization,讓 Replit Agent 在不同專案中套用個人或團隊慣例。Custom Instructions 會在每個專案和工作階段自動加入 Agent 上下文,適用於 Pro 和 Enterprise;Skills 則按相關任務載入,所有方案均可使用。
Replit 現已可直接在 Claude 中使用,用戶可將設計及一般開發任務交由 Replit 繼續建置、完善及發布。用戶可在 Claude Design 以自然語言設計應用程式,再透過官方 Replit Connector 傳送至 Replit,無須複製貼上或切換工作情境。
Replit 將 Replit Agent 的評估由發佈前的單次檢查,轉為結合離線基準、線上 A/B 測試及生產軌跡分析的持續改進閉環。ViBench 以自然語言產品需求文件和測試計劃評估生成應用是否符合規格,Telescope 則整理生產軌跡並聚類失敗模式。改進循環會提出候選修正、建立草稿 PR 並彙整評估證據,工程師仍負責審核及決定是否發佈。
Replit 表示,已將 Agent 系統融入公司多個部門的工作流程,逐步形成由人設定目標、Agent 執行任務並檢查結果的「自我運作公司」模式。從 1 月初至 6 月底,程式碼貢獻量增加 5.8 倍;固定作者羣的程式碼產出達之前的 2.9 倍,而審查延遲、PR 回退率及事故數維持平穩。
Replit 推出 AI 設計套件 Replit Design,讓用戶描述構想並建立設計、應用程式或網站,可選用 Claude、GPT-5、Gemini、Kimi 和 GLM 等模型。
Replit 指出,企業要可靠採用 AI Agent,須先建立共享語義層及受治理的營運真相層,讓 Agent 依據一致的商業定義、指標和數據來源工作。其內部數據 Agent 將修正存入 git 儲存庫,經人工審核和驗證後供接觸數據的 Agent 共用;Replit 稱,該 Agent 每週回答遠超 1,000 個以數據倉庫為基礎的提問,並在答案中附上證據。
Replit 現可為其應用程式執行黑盒滲透測試,透過網絡和瀏覽器模擬外部攻擊者,在無法存取程式碼的情況下尋找漏洞。執行 Level 3 掃描時,系統會在私有沙盒中的應用程式副本上並行執行白盒及黑盒掃描;黑盒掃描只需應用程式連結。Replit 表示,兩種掃描發現的問題很少重疊,案例包括白盒掃出存取權限已撤銷的用戶仍可操作,黑盒則找到無需登入即可進入的管理員控制台。
Replit 已向所有用戶開放 Intelligent Model Routing,系統會按每項任務自動選擇合適模型,平衡質素、速度與成本。Replit 表示,測試中其輸出質素與上一版 Max Mode 相同,成本則低 65%。所有用戶會從 Free Mode 開始,工作升級至可能產生使用費的較高效能模式時會收到通知,並可選擇留在 Free Mode;Core & Pro 用戶仍可手動選擇模型。
Replit 宣佈收購位於舊金山的 Atta,將其商業分析方法及專門圖表技術整合至 Replit,並推出聊天互動圖表。用戶可在 Replit 對話中上載數據集或連接數據來源並提問,Replit 會分析數據並呈現圖表,無需編寫 SQL。圖表會按數據和問題選擇合適的視覺化方式,並提供可互動、可分享的呈現。
Cohere 宣佈與 Aleph Alpha 簽署最終業務合併協議,合併後公司將以 Cohere 名義全球營運,並計劃打造首個跨大西洋主權 AI 方案。交易完成後,公司員工人數將增至 1,000 人以上,並計劃在柏林和多倫多設立雙總部,保留海德堡辦公室作研究中心。交易仍須取得最終監管批准,預計今年稍後完成。
AI 變革管理應把 AI 視為需要融入人類工作流程的協作參與者,而非僅是待部署的軟件工具。這項工作涵蓋企業由準備至日常使用的組織調整,包括角色職責、員工工作方式、流程及監督;人與 AI 的分工須區分可驗證、判斷型及混合型任務,並持續重新評估。
Cohere 的企業檢索平台 Compass 以雲端託管服務 Compass Cloud 形式進入私人測試。Cohere 將管理完整檢索流程及模型推理,開發者可透過 APIs、MCP server 或 Python SDK 使用。自行託管部署仍可供有私隱限制的項目使用,Cohere 正與有限數目的企業團隊合作測試。
Cohere 發佈 Embed 5 嵌入模型系列,分為面向最高檢索品質的 Pro 和麪向低延遲、高流量工作的 Fast,兩款均支援多模態輸入、100+ 種語言及 128K-token 上下文窗口。
Cohere 發佈開源語音辨識模型 Cohere Transcribe,在 Hugging Face Open ASR Leaderboard 以 5.42% 平均 WER 排名第一。
Cohere 開源發佈 Command A+,這款採用 MoE 架構的 LLM 以 Apache 2.0 授權,面向高效能智能體任務。模型有 218B 總參數和 25B 活躍參數,支援 48 種語言,並提供 BF16、FP8 和 W4A4 量化版本。
Cohere 開源發佈 North Mini Code,稱其為首款智能體編碼模型,採用 MoE 架構,總參數 30B、啟用參數 3B,並採用 Apache 2.0 授權。
Universal Music Group(UMG)與 ElevenLabs 宣佈多年期音樂授權及戰略合作,並將共同開發 AI 音訊產品。ElevenLabs 正開發並將推出一個以授權音樂和藝人參與為基礎的 AI 音樂平台,讓粉絲以參與藝人及詞曲創作者的音樂創作 remix、mashup、新演繹和個人化人聲體驗。這是 ElevenLabs 首個與大型唱片公司達成、涵蓋授權及產品開發的協議。
ElevenLabs 完成 $300 million 員工股份要約交易,公司估值達 $22 billion,為其 2 月 Series D 時估值的兩倍。公司稱,企業業務現佔收入 55%;ElevenAgents 每週處理逾 15 million 次對話,較 2 月增加 3x,同期 ARR 增長逾 3x。
ElevenLabs 發佈 Eleven v4 文字轉語音模型及低延遲版本 Eleven v4 Turbo,兩者均支援 90 多種語言。Eleven v4 可按語氣、節奏、情緒、角色和上下文生成語音,並改善多説話者對話、聲音克隆及跨語言口音保留。Turbo 的中位推理延遲約 100ms,兩款模型現已可透過 ElevenAgents、ElevenCreative 和 ElevenAPI 使用。
頁面內容稱此頁應重新導向 arXiv,卻未提供大型模型為何學得更多的研究內容或結論。頁面另列三項研究及其日期,並介紹 Silico 為可解釋性 Agent,以先進的可解釋性方法及基礎設施解釋、除錯並精確控制模型行為。
Logits 被提出作為監測模型評測意識的新工具,旨在追蹤模型是否察覺自己正處於評測情境;現有內容未交代實作細節或驗證結果。
Goodfire Research 發佈 Predictive Data Debugging 研究,提出在訓練前預測偏好數據如何影響模型行為的方法。其預測與模型實際學到的結果達到 R² = 0.9,並可追溯至相關數據羣組。使用 Dolci 和 Tulu 3 數據集的案例顯示,DPO 可能削弱模型對部分有害請求的穩健性;以除錯數據訓練則可同時改善安全與效能。
Goodfire Research 介紹其新論文提出的區塊稀疏特徵器(Block-Sparse Featurizers,BSF),以多維子空間刻畫視覺模型中的概念結構。
Goodfire Research 的《Forking Fast》聚焦高效估算文本生成中的不確定性動態。現有內容未交代研究方法或結果,只列出其他研究項目,並介紹 Silico 為可解釋性智能體,可用來解釋、除錯及精確控制模型行為。
Goodfire Research 發現,開源模型內部存在與 reward hacking 相關的訊號,activation probes 可用於大規模偵測這類行為。
Claude Tag(beta)現支援在 Slack 頻道的請求中使用用戶個人連接器,讓 Claude 存取用戶已連接至 Claude 帳戶的工具及資料。用戶可選擇在回覆發佈前先審閲,或使用自動模式;Enterprise 管理員亦可要求所有人先審閲。個人連接器現正向 Team 方案推出,Enterprise 方案其後跟進;排程工作及 Claude 自行啟動的操作仍使用管理員為頻道設定的共用連接器。
Claude 推出插件目錄提交入口,讓開發者提交插件、追蹤審核進度,並在插件上線後查看使用分析。入口只開放予使用付費 Claude 方案的開發者,提交方式包括單一遠端 MCP 伺服器連接器,或把 MCP 伺服器與 Agent 技能組成插件套件、託管於 GitHub 並提交程式碼庫。上線後的分析包括按產品介面及版本分類的安裝量、目錄頁面的瀏覽量,以及引導用戶找到列表的搜尋詞。
Anthropic 與 NVIDIA 合作,透過 Claude Managed Agents 和 NVIDIA OpenShell 為企業 AI 智能體加入額外安全與控制層;NVIDIA 亦宣佈 Open Agent Safety Platform,作為加強 AI 安全的開放軟件平台及參考系統設計。
Fireworks 推出 DeepSeek-V4.1-Flash,其 DeepSWE Pass@1 為 74.34%,每項任務成本 $0.430,與 GPT-6 Astra 的 74.12% 相近。
生物研究環境 Biomni Lab 的開發者 Phylo 將大部分流量轉至 Fireworks 上的開放權重模型,推理成本降低 60%,用戶月度增長達 2x。Phylo 以自家的 BiomniBench 按品質、延遲和成本評估模型,並保留專有模型處理最難的一類問題。
Anthropic 以 Claude Managed Agents(beta)建立購買智能體,協助企業客戶瞭解方案並從查詢走到購買。智能體每日處理數千段對話,回答定價、安全及數據問題,並按情況引導結帳、即時答覆或轉交銷售代表。轉交銷售團隊的客戶轉化為銷售機會的比例,是舊表單線索的兩倍以上,成交時間約快五天;客戶可在開始時選擇與智能體或銷售代表洽談。
Fireworks AI 以 DeepSWE v1.1 的 113 項工程任務測試模型路由,逐項選出 18 個模型中的最佳者後,oracle 結果達 97.6% 通過率、每項成本 $1.88。
Anthropic 宣佈 Claude for Government 正式向聯邦及州政府機構開放,並透過 FedRAMP High 授權環境提供編碼及智能體工作能力。
Fireworks AI 推出 Specialized Intelligence Index(SII),比較開放模型、封閉模型及專用模型在特定領域基準上的表現,首批涵蓋七個領域。基準由實務工作者設計,結果按領域及基準呈現,不合併為跨領域綜合分數,並提供分數與成本、所需時間的比較視圖。文章指出,基準分數、能力主張與業務成果屬不同層次,後兩者需要各自有相應證據支持。
Fireworks Research 發佈 Ember-1,稱其在維持 Kimi K3 品質的同時,tokens 用量較 Kimi K3 減少 40%。模型以 Kimi K3 為基礎,經訓練縮短不必要的推理;在七項基準及兩家客戶的正式環境流量測試中,推理 token 數可減少 35–50%,準確度未有下降。
Claude Code 推出 mods,這些小型 TypeScript 函數可改寫提示詞、阻止或改寫工具呼叫,並增添介面或替換內置功能。mods 隨插件一同提供,可在 Claude Code CLI 和桌面應用程式使用,也可由 Claude Code 編寫、安裝並在工作階段中熱重載。mods 不設沙盒,擁有與 Claude Code 相同的機器存取權限,應只安裝來自可信來源的 mods。
Cresta 以 Claude Agent SDK 打造 Conductor,將客戶體驗專業知識融入自然語言智能體建構工具,協助團隊由藍圖推進至實作、評估和優化。Cresta 表示,早期用例中,Conductor 將初始部署時間縮短約一半。團隊以建立新智能體、編寫測試、修改現有智能體及根因分析等任務,評估其成果、執行路徑、品質和資源使用。
Fireworks 新增 GLOBAL 多區域部署選項,讓單一部署可跨地區調度兼容容量,並以同一端點管理工作負載。排程器預先安排容量,避免每個請求都經過全球路由步驟,並遵守硬件、配額、可靠性及資料駐留限制。
Prime Intellect 推出開源編碼智能體框架 Prime Agent,以 RLM 和 Continual Harness 管理上下文及可更新的 harness 狀態。
Prime Intellect 在 verifiers 0.3.0 和 prime-rl 0.8.0 加入多智能體訓練與評估支援,並以 Agent 和 Env 抽象編排智能體互動。