Google DeepMind 為 Gemini 推出智能體影片理解功能
Google DeepMind 推出 Gemini 智能體影片理解功能,影片分析成本最多降低 66%、token 用量最多降低 88%,準確度最多提升 7%。
推薦理由:相較固定 FPS 靜態處理,Gemini 會動態檢視畫面、音訊與字幕,影片分析的 token 用量最多減少 88%、成本最多減少 66%。
Google DeepMind 推出 Gemini 智能體影片理解功能,影片分析成本最多降低 66%、token 用量最多降低 88%,準確度最多提升 7%。
推薦理由:相較固定 FPS 靜態處理,Gemini 會動態檢視畫面、音訊與字幕,影片分析的 token 用量最多減少 88%、成本最多減少 66%。
醫療機構現可將 EHR 及其他行業數據連接至 ChatGPT。ChatGPT 可連接可信醫療數據,讓臨牀人員安全存取患者背景、醫學研究等資訊。
Hugging Face 推出 @huggingface/kernels JavaScript loader,並在 Hub 發布首批 207 個 WebGPU kernels。
推薦理由:文章將 207 個 WebGPU kernels 的版本化操作契約、正確性測試與基準案例一併呈現,並提供 Apple M4 上與 ORT WebGPU 的比較數據。
XCENA 與 Samsung 合作打造 MX1,將 CXL 記憶體擴充、SSD 連接及近記憶體運算整合於同一裝置。MX1 最多支援 2 TB DDR5,透過 PCIe 6/CXL 3.2 x8 連接主機,頻寬為 128 GB/s;其晶片搭載 3072 個 RISC-V 核心,向量處理引擎提供約 3 TFLOPS 點積吞吐量。
Google DeepMind 推出 Gemini Omni 1.1 Flash,為影片生成加入場景延伸、首尾幀控制、影片參考輸入及 1080p 或 4K 輸出。
推薦理由:場景延伸可分析最多10秒的既有影片,並以10秒增量延長至累計40秒;配合首尾幀指定,呈現更長影片創作中的控制方式。
Johann Rehberger 測試 Claude Code Opus 5 Auto Mode,利用網站摘要請求觸發提示詞注入鏈,在小樣本測試中達到 60-80% 攻擊成功率並執行程式碼。
ChatGPT for Teachers 正擴展至 55 個美國學區系統。此擴展將為額外超過 100,000 名教育工作者及職員提供安全 AI 工具、培訓和支援。
Gradio 內置的 gr.Workflow 可把 AI 工作流表示為由帶類型節點組成的圖,並提供可拖放、逐節點執行及查看中間結果的畫布。節點可執行 Python 函數、調用 Hugging Face Inference Providers 模型或其他 Gradio Space,也可處理 Hub 數據集資料。
推薦理由:文章以多個可執行示例展示如何把模型、Python 函數與 Gradio Space 串成工作流,並讓節點輸出直接成為 API。
OpenAI 推出供 ChatGPT Work 和 Codex 使用的 Admin plugin,可分析工作區使用情況、管理成員與權限、調整限制,並處理管理員請求。
GPT-5.6 現已在 Kiro 中提供,協助開發者以更佳性價比規劃、建構、審查及測試軟件。
Mistral 推出 Agentic Search,讓模型透過多步檢索搜尋、查看、導覽及核實複雜文件中的資料。在 FinanceBench 金融文件測試中,正確率由 26.7% 升至 86%;OfficeQA Pro 表格密集的多文件問題則由 6.3% 升至 51.9%。
推薦理由:FinanceBench 和 OfficeQA Pro 的基準數據呈現 Agentic Search 相較單次 RAG 的準確率提升,也量化延遲與 token 使用量變化。
OpenAI 重申,符合資格的 API 客户可在前沿模型中使用零數據保留安排。OpenAI 亦預告 Private Safety Processing,支援進階 AI 安全而不損害數據私隱。
Replit 透過由 GPT-5.6 Luna 驅動的 Free Mode 擴大軟件創作入口。Free Mode 讓任何人把想法轉化為可運作的軟件,並稱毋須擔心 token 費用。
ChatGPT Ads 正擴展至歐洲 31 個市場。廣告客户可接觸正在探索、比較選項及作出決策的人士。
OpenAI 推出 ChatGPT for Teens,協助青少年學習、批判思考,並更有信心地使用 AI。產品內置更強防護措施和健康使用功能,亦為家長提供額外控制選項。
Asana 使用 OpenAI Codex,在 2 週內替換一套過時的測試系統,並完成原需數年的程式碼遷移。此次使用的模型與基礎設施成本約為 $12K。
Cursor 推出「構建」功能,透過預先準備好的開發環境,讓雲端智能體啟動速度最快提升至 3 倍,且不額外收費。預設每小時建立新構建,成功版本會成為後續智能體的啟動環境;新構建失敗時,智能體仍使用上一次成功版本。從 8 月 17 日起,所有新建及現有環境將預設啟用構建。
OpenAI 預覽新的 API 服務層 Ultrafast,為 GPT-5.6 Sol 提供最高 14× 的速度提升。該服務由 Cerebras 提供支援,輸出速度最高可達每秒 750 個 token。
OlmoEarth Studio 新增自訂嵌入向量匯出功能,輸出可用於下游分析的 COG。使用者可設定研究區域、時間範圍、編碼器、解析度及影像來源;文章示範相似度搜尋、少樣本分割、變化檢測和 PCA 探索。以 60 個標註像素訓練的分類器取得 weighted F1 = 0.84,匯出檔可用於 QGIS、GDAL、rasterio 等工具。
OpenAI 開始在 ChatGPT 測試廣告,以支持免費使用。測試安排包括清晰標示廣告、維持答案獨立、提供強力私隱保障,並保留用户控制。
推薦理由:材料列出 OpenAI 測試 ChatGPT 廣告時的設計邊界,包括清晰標示、答案獨立、私隱保障及用户控制,呈現其支持免費使用時採取的安排。
OpenAI 與 AWS 現透過 Amazon Bedrock 提供 Daybreak 網絡安全能力,支援企業安全工作流程。
OpenAI 已在 ChatGPT Business 推出 Premium seats,提供 5x 使用量,且不設五小時使用上限。方案亦為每位團隊成員提供彈性席位選項。
Sarvam AI 在 Sarvam Epoch 公佈 Sarvam 105B 的對話及工作智能體版本,並介紹 Sarvam Vision 2.0、Saaras V4 和研究預覽版 Bulbul V4。
OpenAI 為 ChatGPT Work 和 Codex 推出新的教育外掛,面向 K–12 教師、大專院校教育工作者及學生。外掛協助他們學習、教學、研究和構建。
Manus 上線 ElevenLabs 連接器,讓用户可在對話中生成語音、轉錄錄音、克隆聲音及構建語音應用。用户須連接有效的 ElevenLabs 帳户;Manus 透過 ElevenLabs API 處理音訊,功能可用性取決於套餐和積分餘額。音訊資料按 ElevenLabs 的資料保留政策處理,生成與計費仍由 ElevenLabs 管理。
FireRedTeam 開源 FireRed-OpenStoryline,這是一款透過自然語言對話製作和編輯影片的工具。它可搜尋並下載符合要求的圖片和影片片段、生成故事線和旁白,並按提示詞調整剪輯及畫面細節。
avatarin 使用 OpenAI 的 GPT-Realtime,為 Yamada Denki 顧客提供 24/7 多語言支援。該智能體在兩週內有 30,000 人使用,調查回覆中 92% 為正面。
OpenAI 向 100,000 名學術研究人員免費提供 ChatGPT 最先進 AI 模型的使用權,以加速科學研究、協作與發現。
推薦理由:免費使用權涵蓋 100,000 名學術研究人員,讓讀者可把握這項科研支持安排所面向的羣體與規模。
Microsoft 介紹 Project Perception,一套以 AI 防禦 AI 的智能體安全系統,並預定於 8 月 3 日開放公開預覽。系統協調紅隊、藍隊和綠隊智能體形成持續防禦閉環,並採用多模型架構配合不同安全工作。
Manus 已提供 Supabase 連接器,獲授權後,用户可用自然英文查詢和操作 Supabase 專案資料。在 CRM 遷移示例中,Manus 會先提出架構更新供用户批准,再執行遷移並驗證結果;連接器亦可執行 SQL、遷移架構及部署 Edge Functions。可執行的操作取決於用户授予的權限及 Supabase 套餐功能。
OpenAI 推出 ChatGPT 的 Health 功能,讓符合資格的美國用户安全連接醫療紀錄和 Apple Health。用户可藉此獲取更個人化的洞察,並更瞭解自身健康。
推薦理由:材料交代了 Health 的適用對象、可連接的健康資料來源及預期用途,便於瞭解這項功能的使用範圍。
Diffusers 現已原生支援 Nunchaku Lite 的 4-bit 擴散模型推理,預量化檢查點可用 `from_pretrained()` 載入,無須獨立推理引擎或本機編譯 CUDA。
推薦理由:文章説明 Nunchaku Lite 在 Diffusers 的原生載入方式,並以 RTX PRO 6000 基準量化呈現延遲與顯存變化。
OpenAI 推出 OpenAI Presence,一個經驗證的企業 AI 智能體平台,協助機構部署可信賴的語音及聊天智能體,以支援客户與內部工作流程。
OpenAI 推出 ChatGPT for Small Businesses 計劃,協助創業者培養 AI 技能、自動化工作,並透過 ChatGPT Work 發展業務。
Manus 推出 Plan Mode,讓用户在開始建構前查看、編輯並批准結構化計劃。計劃以 Markdown 文件列出目標、步驟和限制,Manus 在用户確認前不會開始建構。功能現已向所有 Manus 用户開放,支援網頁版及流動端,亦可在任務途中啟用以規劃下一階段。
上海人工智能實驗室 InternLM 推出 ArchSpace,將社羣提出的大語言模型架構假設納入公開、可追溯及可復現的訓練與評測流程。獲批提案按對齊 Olmo 3 的流程驗證,涵蓋 1B、3B、8B 模型及預訓練、中期訓練、指令微調,完整流程約使用 6.2T tokens。
Pollen Robotics 發佈開源、低成本的 Grabette 手持式系統,可記錄人工操作示範並轉成機械人訓練數據集。裝置配備兩部攝影機,瀏覽器處理流程透過 RTAB-MAP 執行 SLAM,並輸出 LeRobot 格式數據;Grabette 的物料清單成本約 490€。
推薦理由:Grabette 把手持式示範、SLAM 軌跡處理與 LeRobot 數據集串成採集流程,並以 200 段示範呈現訓練及機械臂評估的端到端用法。
OpenAI 正透過符合年齡的保護措施、學習工具、家長控制功能及專家合作,提升 ChatGPT 對青少年的安全保障。
Manus 推出 PowerPoint 模式,可直接生成原生 .pptx 文件,毋須先輸出網頁格式再轉換。圖表保留可編輯數據,表格採結構化單元格;用户可在下載前於 Manus 修改圖表數據,下載後亦可在 Microsoft PowerPoint 或 Google Slides 編輯圖表。此 Beta 功能現向使用 1.6 和 Max 模型的用户開放。
Manus 推出自動發佈功能,開啟後每次成功構建都會直接部署至公開 URL,無需手動確認。該開關預設關閉,可在發布彈窗中隨時切換;構建失敗或仍在進行時,網站會維持上一個穩定版本。此功能現已向所有用户開放,支援網頁端、iOS 和 Android。