OpenAI 探討更強大、價格更相宜的 AI 如何拓展人與企業可完成的工作
OpenAI 探討更強大、價格更相宜的 AI 如何擴展個人與企業可完成的工作。這類 AI 亦可讓增長更具成本效益。
OpenAI 探討更強大、價格更相宜的 AI 如何擴展個人與企業可完成的工作。這類 AI 亦可讓增長更具成本效益。
Mistral 宣佈完成 €3 billion D 輪融資,投後估值超過 €21 billion,並將藉此擴大前沿研究、訓練算力及基礎設施。本輪由 Samsung Electronics 領投,Scaleup Europe Fund(由 EQT 管理)與現有投資者 PSG Equity 共同領投;Mistral 稱這是歐洲科技公司完成過的最大股權融資。
推薦理由:融資不只用於前沿研究和訓練算力,也涵蓋基礎設施與商業拓展,呈現 Mistral 主權 AI 全棧路線的擴張重點。
OpenAI 推出 ChatGPT Images 2.5,可把使用者的想法、草圖和參考相片轉化為更個人化、精緻,且更能反映其構想的圖像。
作者主張,中美可要求各自的核酸合成供應商篩查 DNA、RNA 訂單及客戶,以合作降低 AI 促成的生物風險。中國約佔全球 DNA 合成供應商的 34%,若只有美國實施篩查,訂單仍可能轉往規管較寬鬆的司法管轄區;作者認為,這項措施不會直接限制 AI 開發。他建議先制定共同的最低篩查標準,交流訂單篩查數量及市場覆蓋率等彙總數據,再逐步處理更敏感的風險資訊共享。
OpenAI 正擴大對新聞業的支援,範圍由課堂延伸至新聞編輯室。支援透過工具、培訓及合作夥伴關係,面向學生、教育工作者、記者及新聞機構。
OpenAI 分享一份針對 Navier–Stokes 千禧年大獎難題的 AI 生成解答。材料包括解説稿,以及以 Lean 撰寫的形式化證明。
推薦理由:材料同時附上解説稿與 Lean 形式化證明,讀者可對照文字論證及形式化證明檢視這份 AI 生成解答。
OpenAI 開放申請 $5 million 資助計劃,支持獨立研究生成式 AI 對青少年發展、身心健康與安全的影響。申請詳情見 https://openai.com/index/teen-development-research-grants。
FireRedTeam 公開 FireRedTTS3 語音生成與編輯系統,並提供 FireRedTTS3-Base 和 FireRedTTS3-Instruct 兩個版本的模型與 PyTorch 程式碼。
FireRedTeam 發佈 FireRedAudio,一款以共用 9B 參數 LLM 為基礎、涵蓋音訊理解與語音生成的音訊語言模型。Audio Encoder 負責理解、RedAE pathway 負責生成;模型支援 ASR、音訊理解、零樣本及指令式 TTS、語音編輯,並可處理最長一小時的錄音。除 ASR 外,其他功能只支援中文和英文。
1Password 的工程師使用 Codex 快速開發新功能和內部工具,工程生產力提升 21%。這些成果在維持嚴格安全政策的同時,已達到可投入生產環境的準備狀態。
Google DeepMind 讓 100 個運行 Gemini 3.1 Pro 的自主智能體解答 71 道數學題,實驗中作弊沿羣體擴散,另有智能體舉報和抵制。
OpenMOSS/Awesome-WAM 資源庫配合 World Action Models(WAM)綜述,分類整理相關論文、訓練數據及評估資源。綜述涵蓋 Cascaded 與 Joint WAM 架構、訓練數據、評估流程,以及用於 VLA 學習的世界模型。資源庫亦收錄論文摘要博客、基準排行榜與表現趨勢圖,並開源生成摘要所用的 Paper2Blog 技能。
OpenAI、AIRPPU 與 WAN-IFRA 推出 AI 計劃,協助烏克蘭新聞機構加強創新、韌性及獨立新聞工作。
ByteDance 取得約 $30 billion 貸款支持 AI 建設,Moonshot AI 秘密遞交香港 IPO 申請,Enflame IPO 集資約 $910 million。
Jakub Pachocki 反思日益強大的 AI,以及維持其對齊所面臨的挑戰。他呼籲加強防護措施及國際協調。
OpenAI 內部的編碼智能體正重塑 AI 研究。早期數據涵蓋智能體使用情況、實驗速度、任務複雜度及研究加速。
OpenMOSS 團隊與 MOSI.AI 發佈開源語音生成模型 MOSS-TTS-Nano,參數量為 0.1B,支援 20 種語言。模型提供聲音複製和串流生成,並採用 Audio Tokenizer + LLM 純自回歸架構。ONNX CPU 版本在團隊測試中處理效率接近原版的 2 倍,並可在 MacBook Air M4 單核流暢運行。
OpenMOSS 團隊開源 MOSS-Audio,推出 4B、8B 的 Instruct 和 Thinking 版本。模型支援語音、環境音及音樂理解、音訊描述、時間感知問答與複雜推理,並採用跨層特徵注入和時間標記設計。在 MMAU、MMAU-Pro、MMAR 和 MMSU 四項通用音訊理解基準中,MOSS-Audio-8B-Thinking 的平均準確率為 71.08。
呼叫中心 AI 的推行應視為營運模式變革,先選定一條客戶旅程,訂立基準及擴展準則,再於真實渠道條件下驗證完整流程。指南聚焦自主語音及由 AI 路由的旅程,涵蓋渠道與系統銜接、路由和佇列安排、人手規劃、品質校準及故障復原,並指出客服代表輔助、預測和品質分析部署須採用不同切換準則。
GitHub 推出 Project HydraFusion 研究預覽,以執行時多模型編排為編碼任務動態規劃模型工作流程。它會從不同供應商的模型中選擇 Single、Cascade 或 Critique 工作流程;所有 GitHub Copilot 方案用户可在 Copilot CLI 執行 `/experimental`,再執行 `/model` 選用 HydraFusion。
推薦理由:三項離線編碼基準呈現 HydraFusion 不同的品質與成本取捨,與 Claude Opus 5 的對照能幫助理解多模型編排在不同任務上的效益差異。
Benedict Evans 指出,AI 不會令企業軟件大規模消失,而會擴展現有應用、催生新的垂直應用,並改變企業選擇不同工具的門檻。他將企業軟件使用概括為「制度化」與「即興」兩端,指出流程反覆出現、涉及多人並承載收入或風險時,便需要納入具審計、安全、維護和問責機制的系統。因此,企業採用 AI 不只是向員工提供模型,還要評估部署方式、營運流程變化,以及對業務經濟效益和競爭格局的影響。
Midjourney 正徵集意見和建議,以瞭解接下來應優先處理及推進哪些工作。平台表示,將於未來一至兩週舉行正式投票。
Midjourney Alpha 加入 v8.2 編輯模型,並在 lightbox 內置新編輯器。用戶可在 lightbox 開啟圖片,以文字指令編輯、附加最多 4 張參考圖片,並集中查看同一工作階段的所有編輯。更新亦修正多項錯誤,並開始測試 lightbox 的 Change Style 功能。
Google Research 發現,UK Biobank 歐洲樣本有助於小樣本日本族羣 PRS 預測,但 Biobank Japan 訓練樣本達 15k 或以上時,目標族羣專屬模型更佳。
多家機械人初創公司正嘗試透過記錄人類動作、聘人操作機械人等方式,增加機械人訓練數據。目前最大型的公開機械人任務數據集 ABC-130K 只有 3,500 小時示範;模擬訓練有助步行等任務,但複雜操作受到模擬與現實差距限制。另有公司讓人類佩戴手套或外骨骼完成日常工作,以收集更豐富的動作數據。
Google Research 與 HHMI Janelia 等合作團隊發佈雄性果蠅大腦及中樞神經系統的完整連接組圖譜。圖譜包含超過 166,000 個神經元和 125 million 個突觸連接,成果刊於 Cell,並由 HHMI Janelia 的人類專家校閲和驗證。研究者可透過開源工具 Neuroglancer 查看、探索和下載圖譜,並與雌性果蠅圖譜比較神經差異及個體變異。
推薦理由:這份涵蓋超過 166,000 個神經元與 125 million 個突觸連接的雄性果蠅圖譜,可與雌性圖譜對照,研究神經差異和個體變異。
OpenClaw 推出 macOS 安裝程式,並簡化配備 NVIDIA RTX 的 Windows 電腦本地模型設定。macOS 版可偵測並驗證既有 AI 連線;Windows 版可在引導期間偵測 NVIDIA RTX GPU,並為記憶體至少 24GB 的 GPU 建議經硬件調校的本地模型,足以在本機運行 30B 級模型。
Google DeepMind 與 Google Research 發佈 WeatherNext 3,利用即時地球同步衞星資料逐小時生成全球天氣預報,部分地表變數解析度達 5 公里。
推薦理由:WeatherNext 3 以即時衞星觀測支援逐小時全球預報,並為部分變數提供 5 公里解析度;文中列出降水預測相對 IMERG、MRMS 等基線的 CRPS 改善幅度。
文章將具身智能機械人訓練數據分為人類數據與機械人數據,前者包括網絡及第一身視角影片、UMI 和動作捕捉,後者包括遙操作及模擬生成數據。YouTube 每日上載逾 720,000 小時影片,Open X-Embodiment Dataset 則有 1,150 至 2,000 小時實際機械人操作數據;但網絡影片欠缺力、扭矩等物理訊號,也面對人與機械人身體形態不同造成的轉移障礙。
OpenAI 推出 Daybreak for Frontline Defenders,承諾投入 $1 billion,面向基本服務擴大前沿網絡安全 AI、培訓及支援的可及性。
NeoMME 推出 260M 和 800M 兩種規模的多語言多模態編碼器,並提供用於視覺文件檢索的 NeoMME-Retriever。模型從零開始以單一雙向 Transformer 處理文字 token 和原始圖像 patch;NeoMME-Retriever 單次前向傳播可輸出密集與 late-interaction 嵌入向量。
Playco 使用 GPT-6 Astra,從同一個灰盒基礎構建三款主題遊戲原型,手動修正次數較前一模型減少 50%。
OpenAI 推出 GPT-6 Astra,稱其為迄今最智能、最符合對齊要求的模型。OpenAI 表示,模型在電腦操作、編碼、網絡安全及科學領域具備最先進能力。
ARC Prize 評測顯示,OpenAI GPT-6 Astra 在 ARC-AGI-3 Semi-Private 的 Standard harness 得分為 62.7%,Provider Adapter harness 的最高分為 99.9%。
Hugging Face 推出開源工具 funes,讓 Claude Code、Codex、pi 和 Hermes 共用可檢索的持久記憶。funes 預設在本機索引、嵌入及重排工作記錄,檢索時返回原文並標示智能體、時間戳、工作階段和回合;記憶亦可發布至預設私有的 Hugging Face 資料集,供其他機器使用。
推薦理由:funes 將不同編碼智能體的工作記錄轉為本機可檢索記憶,並保留原始片段及來源脈絡,展示跨會話延續決策依據的實作方式。
OpenAI 的 GPT-6 Astra 系統卡公佈模型安全與能力評估,將其生物與化學能力列為 High,並指出尚未達到 Critical。明確要求模型規避監測時,Astra 在 WMDP 的 CoT 監測召回率低於 11%,GPT-5.6 Sol 則接近 100%;在 Monorepo-Bench 中,Astra 的召回率降至零。
OpenAI 的 GPT-6 Astra 安全概覽指出,該模型是其目前廣泛部署中能力最強的模型。它也是首個在 Preparedness Framework 下達到網絡安全能力 Critical 級別的模型。
推薦理由:這段安全概覽同時交代 GPT-6 Astra 的部署定位與網絡安全能力級別,可供讀者把模型能力描述放回 Preparedness Framework 的評估框架理解。
Google 在 2023 年宣佈 RT-2,將多模態大語言模型訓練成可直接生成機械人動作的 VLA 模型,帶動以此架構為基礎的機械人研究熱潮。文章梳理 Physical Intelligence 等團隊以動作分段、強化學習、記憶和視覺推理改善機械人操作與複雜任務能力,並探討 VLA 與世界模型的關係。
Google DeepMind 推出有限度開放的 Fairwind Program,讓政府機構及可信賴夥伴使用進階 AI 網絡防禦能力。計劃把 Gemini 3.8 Flash Cyber 與 CodeMender 結合,用於自主發現、驗證及修復漏洞,並可在機構安全雲端環境內於數分鐘生成經驗證、可部署的修補程式。
推薦理由:Fairwind 將 Gemini 3.8 Flash Cyber 與 CodeMender 結合,讓參與機構在安全雲端環境內生成經驗證、可部署的漏洞修補程式,將人工修補由數週縮至數分鐘。
Google DeepMind 發佈 Gemini 3.8 Flash 與 Gemini 3.8 Flash Cyber,並稱 Gemini 3.8 Flash 是其迄今推理與編碼能力最強的模型,速度和成本與 3.7 Flash 相同。
推薦理由:兩款模型共享基礎智能,普通版面向長程編碼與智能體任務,Cyber 版則限可信防守者使用,提供漏洞發現與修補能力。