OpenAI 與 Broadcom 揭曉 Jalapeño:專為 LLM 推理最佳化的自訂 AI 晶片
OpenAI 與 Broadcom 推出 Jalapeño,這款自訂 AI 晶片專為 LLM 推理打造,旨在提升 AI 系統的效能、效率及擴展規模。
OpenAI 與 Broadcom 推出 Jalapeño,這款自訂 AI 晶片專為 LLM 推理打造,旨在提升 AI 系統的效能、效率及擴展規模。
Hugging Face 與 Treble Technologies 推出並開放提交 FFASR Leaderboard,這是針對真實遠場聲學條件的開放、社羣協作 ASR 評測基準。
GPT-5 Pro 協助免疫學家 Derya Unutmaz 解開一宗困擾 3 年的免疫學謎團,並提供有關 T 細胞行為的見解。這項突破可能支持癌症及自身免疫研究。
OpenAI 透過 Appia Foundation 協助建立先進 AI 的共同標準,並支持評估框架、安全實踐與全球合作。
Mistral AI 發佈文件解析模型 Mistral OCR 4,除提取文字外亦輸出邊界框、區塊類型和信心分數,並支援 170 種語言、10 個語言組別。獨立人工偏好評估的平均勝率為 72%,模型在 OlmOCRBench 得分 85.20;官方提醒自動基準存在評分侷限,建議以自有文件評估。
推薦理由:文章列明 OCR 4 的結構化輸出和自動基準評分侷限,為企業按自身文件評估解析、檢索及資料管線提供具體參照。
Omio 正運用 OpenAI 打造對話式旅行體驗、加快產品開發,並轉型為 AI 原生公司。
OpenAI 推出 Patch the Planet,這項 Daybreak 倡議旨在協助開源維護者運用 AI 和專家審查尋找、驗證並修復漏洞。
OpenAI 推出 Daybreak 工具,包括 Codex Security 和 GPT-5.5-Cyber,協助組織大規模尋找、驗證及修補漏洞。Daybreak 旨在協助全球所有組織加強安全防護。
Jason Liu 使用 Codex 保留脈絡並管理複雜專案。這讓工作得以延續至單一提示詞以外,支援長時間任務。
Samsung Electronics 向全球員工部署 ChatGPT Enterprise 和 Codex。OpenAI 稱,這是其規模最大的企業 AI 部署之一。
推薦理由:這則公告提供企業級 AI 落地的具體案例,交代 Samsung Electronics 面向全球員工部署的產品,也呈現 OpenAI 對此次部署規模的定位。
OpenAI 的研究發現,在強化學習中加入少量有益行為特質資料,可改善模型的對齊表現,並把效果泛化至訓練未涵蓋的領域。在 53 項內外部評估中,該模型於 44 項較使用相同起點及相同 RL 算力訓練的基線模型有所改善,涵蓋欺騙、獎勵破解、健康及安全等評估。研究亦發現,這些改善在對抗提示及有害微調下較能維持,但仍需進一步區分有益特質訓練與一般後訓練 RL 的作用。
OpenAI 為 ChatGPT Enterprise 推出全新用量分析及更新版支出控制。這些功能協助機構管理成本,並更有信心地擴展 AI。
GPT-5.5 Instant 改善 ChatGPT 對健康與保健問題的回應,並提升推理、上下文運用及溝通清晰度。相關評估參考醫師意見。
研究人員使用 OpenAI 推理模型協助診斷兒童罕見遺傳病,並在此前未解的病例中識別出 18 項新診斷。
推薦理由:文中同時交代模型介入的診斷場景與未解病例結果,提供觀察 AI 參與兒童罕見遺傳病研究的一個具體切面。
Hugging Face 測試開源模型使用 transformers,CLI 與 Skill 縮短大型模型耗時,卻可能降低小模型成功率。Qwen3-14B 在 classify-sentiment 任務中,clone 環境的匹配率為 100%,Skill 環境則降至 0%。agent-eval CLI 可套用於其他命令列工具,並記錄匹配率、tokens、耗時、錯誤、行為標記及執行軌跡。
推薦理由:評測不只看任務是否成功,也追蹤 tokens、耗時與操作路徑,呈現 CLI 與 Skill 對大小模型的影響並不一致。
GLM-5.2 發佈,將最大上下文長度由 200K 擴至 1M tokens,並強化長程任務與編碼能力。它在 Terminal-Bench 2.1 和 SWE-bench Pro 分別取得 81.0、62.1,高於 GLM-5.1 的 63.5、58.4。
推薦理由:文章並列長程編碼基準成績與 IndexShare、MTP 的效率改動,讓讀者可對照模型性能數據和 1M-token 上下文的工程支撐。
Hugging Face 推出 Discover Tool,作為 Agentic Resource Discovery(ARD)規範的參考實作,讓智能體可在執行時搜尋並發現能力。
推薦理由:ARD 把能力發現由預先安裝轉為跨登錄表搜尋,Hugging Face Discover 可按需求將 Space 呈現為技能或 MCP 伺服器。
OpenAI 推出 LifeSciBench,這是一項由專家撰寫並審核的基準,用於評估 AI 系統處理真實生命科學研究任務及決策的能力。
OpenAI 研究發現,以 WildChat 對話前綴模擬部署,可預測 OpenAI 模型在實際生產環境中的不良行為率,95% 的預測與實際生產率相差不超過 1.04 個數量級。
Google Research 發佈由 Farmscapes 2020 像素地圖轉製的英格蘭農地向量數據集,列出樹籬、石牆與樹叢等細尺度生態要素。
OpenAI 推出 Deployment Simulation,透過真實對話資料預測 AI 模型部署前的行為。該方法旨在提升安全性及評估準確度。
OpenAI 推出 Partner Network,並投入 $150M 支援全球合作夥伴。這項計劃旨在加快企業 AI 的採用、部署與轉型。
Google Research 分享兩項關於皮膚狀況 AI 的研究,發現 AI 輔助能提高參與者辨認病況的能力,但標準 AI 組判斷後續步驟的準確度沒有顯著提升。
OpenAI Academy 推出三門課程,協助人們培養實用 AI 技能、建立可重複使用的工作流程,並在日常工作中應用 AI 智能體。
Preply 使用 OpenAI 推出 AI 生成的課堂摘要,提供個人化回饋及語言學習練習,將 AI 用於個人化語言學習。
Manus 的 Canva 連接器可在聊天中建立、編輯、調整尺寸和整理 Canva 設計,亦可把書面內容轉成多張幻燈片視覺素材。文章示範把研究、博客撰寫和 LinkedIn 輪播圖製作串成工作流,並將邀請函流程存為可重複調用的 Manus 技能。不同功能設有套餐限制,例如調整尺寸需 Pro 套餐及以上,品牌模板搜索僅限企業版。
文章認為,AI 尚未取代軟件工程師,單靠能力提升也不會消除這類工作的需求。作者以「決策、執行、交付」三層框架解釋,AI 壓縮程式碼實作的執行層,但需求界定、驗證及交付責任仍需人員承擔。一項涵蓋 GitHub 上 100,000 名開發者的研究顯示,AI 智能體令程式碼行數增加 8 倍,發布量只增加 30%。
Factory 為 Droid 推出自動化安全審查,在每個非草稿 PR 中與標準程式碼審查同步執行 STRIDE 審查。結果會以 diff 行內評論列出嚴重程度、CWE 參照、説明及建議修正;Droid 會對照 diff 驗證候選發現,以過濾誤報。功能現已適用於所有方案;Droid CLI / Desktop App 可設定審查,亦可在本機工作階段按需審查整個程式碼庫或目前 diff。
天體物理學家 Chi-kwan Chan 使用 Codex 建構黑洞模擬,協助科學家研究極端物理,並檢驗 Einstein 的廣義相對論。
Hugging Face Blog 第二篇 PyTorch 效能分析教程,從 nn.Linear 追蹤至 GeGLU MLP。
推薦理由:文章對比 eager、torch.compile 與 Liger,展示 MLP 融合如何減少 HBM 往返,以及固定形狀特化與跨形狀通用的取捨。
OpenAI 計劃收購 Ona,以安全、持久的雲端環境擴展 Codex。此舉將支援 AI 智能體在企業工作流程中長時間運行。
推薦理由:這宗收購把雲端環境與 Codex 的擴展連結起來,可從中瞭解 OpenAI 如何將長時間運行的 AI 智能體延伸至企業工作流程。
BBVA 將 ChatGPT Enterprise 擴展至 100,000 名員工,並與 OpenAI 合作。合作旨在加快全球銀行業的 AI 轉型。
OpenAI 支持歐盟《AI 內容透明度實務守則》,推進內容來源追溯標準及工具建設,協助公眾理解 AI 生成內容。
OpenAI 開放企業透過 Oracle Cloud 使用 OpenAI 模型與 Codex,並可利用現有承諾建構及部署 AI。此方式涵蓋企業安全與治理。
Google Research 提出 Regularized f-Divergence Kernel Tests,以相對距離檢驗審核機器遺忘,並於 AISTATS 2026 發表。
Google DeepMind 發佈實驗性開放模型 DiffusionGemma,透過文字擴散並行生成文字,在專用 GPU 上文字生成最高快 4 倍。
推薦理由:DiffusionGemma 的優勢集中於低至中等批次的單加速器推理,高 QPS 雲端服務則可能收益較小並增加服務成本。
Google DeepMind 宣佈最高 $10M 的多智能體 AI 安全研究資助計劃,面向全球研究人員徵集申請。
LSEG 使用 OpenAI,在全球業務中擴大可信 AI 的應用規模。此舉加速洞察產出、縮短發布週期,並賦能 4,000 名員工。
Ethan Mollick實測Claude 5 Fable後指出,模型能按多頁規格連續工作長達12小時,人的角色更像委託者。它在Claude Code中調用多個智能體研究交通資料並製作等時線地圖,也花九個半小時開發可校準人類與AI判斷的研究軟件Concord。Mollick指出,Fable消耗大量 tokens,安全護欄常令它退回能力較弱的Claude 4.8 Opus,而其決策過程不易看見。
推薦理由:Ethan Mollick以等時線地圖和研究分析軟件的實測,呈現人類角色如何由過程操作轉向委託與驗收,以及模型自主決策帶來的可見性落差。
Google DeepMind 發佈 Gemini 3.5 Live Translate,這款音訊模型可自動識別 70+ 種語言,並進行近乎即時的語音轉語音翻譯。
推薦理由:模型以連續生成譯語音訊取代逐輪等待,並透過 API、Google Meet 和 Google Translate 進入開發、企業會議及日常翻譯場景,呈現其部署路徑。