Google 發佈 PaliGemma 2 視覺語言模型
Google 發佈 PaliGemma 2 視覺語言模型,提供 3B、10B、28B 三種規模及 224x224、448x448、896x896 三種輸入解析度。
推薦理由:PaliGemma 2 將前代單一 3B 規格擴展至 3B、10B、28B,並提供三種輸入解析度,呈現下游微調時在品質與效率間選擇的彈性。
Google 發佈 PaliGemma 2 視覺語言模型,提供 3B、10B、28B 三種規模及 224x224、448x448、896x896 三種輸入解析度。
推薦理由:PaliGemma 2 將前代單一 3B 規格擴展至 3B、10B、28B,並提供三種輸入解析度,呈現下游微調時在品質與效率間選擇的彈性。
OpenAI 與全球專業媒體平台 Future 宣佈建立策略合作夥伴關係。合作將 Future 旗下 200 多個媒體品牌的內容帶給 OpenAI 用户。
摩根士丹利運用 AI 評測,塑造金融服務的未來。
Hugging Face Blog 發佈 EU AI Act 開源開發者指南,梳理法規對 AI 系統及 GPAI 模型的適用範圍與分級義務。指南聚焦有限風險 AI 系統和非系統性風險開源 GPAI 模型,涵蓋披露 AI 互動、以機器可讀格式標記合成內容、提供訓練內容摘要及尊重版權 opt-out 等要求。
推薦理由:文章區分有限風險 AI 系統與非系統性風險開源 GPAI 模型,梳理透明標示、訓練內容摘要及版權 opt-out 等合規要求。
Hugging Face 發佈 SmolVLM 2B 視覺語言模型系列,提供 Base、Synthetic 和 Instruct 三個版本。模型檢查點、VLM 資料集、訓練配方及工具均採 Apache 2.0 授權開放;模型亦已整合至 transformers。
推薦理由:文中將 SmolVLM 與其他模型的多項基準、GPU 記憶體及吞吐量並列,提供評估小型視覺語言模型效能與資源取捨的依據。
這篇教程逐步拆解 Transformer 位置編碼的設計,從整數、二進制及正弦方案推導至 RoPE。文章解釋 RoPE 如何對 query 和 key 向量的分量成對旋轉,令注意力點積帶入相對位置資訊,同時不改變向量範數。文中也介紹如何分開處理各維度的位置資訊,以延伸至多維資料。
推薦理由:文章從位置編碼的設計需求出發,逐步比較整數、二進制與正弦方案,並推導 RoPE 如何以旋轉在注意力計算中表達相對位置。
OpenAI 推進由人類與 AI 共同參與的紅隊測試。
BAAI 的 FlagEval Debate 平台讓大型模型透過多語言辯論賽互相比試,以評估其推理與語言能力。平台支援中文、英文、韓文和阿拉伯文,讓模型直接交鋒,供評估者比較觀點、邏輯推理及論證策略。評估結合辯論專家評審和用户投票,並允許模型團隊調整參數、策略與對話風格。
Rox 全面押注 OpenAI,結合 OpenAI 模型、商業經驗與深厚的 LLM 專業知識,讓每位銷售人員都成為排名前 1% 的銷售員。
Mistral AI 為 le Chat 推出多項免費 beta 更新,新增網頁搜尋、Canvas、文件與圖像理解、圖像生成及智能體功能。文件與圖像理解由 Pixtral Large 與一款實驗模型支援,圖像生成則採用 Black Forest Labs 的 Flux Pro。新功能將於未來數週逐步推出。
推薦理由:網頁搜尋、Canvas、文件與圖像理解、圖像生成及可分享智能體同列免費 beta,呈現 le Chat 將對話延伸至知識工作多個環節的產品方向。
Mistral AI 發佈 Pixtral Large,一款基於 Mistral Large 2 的 124B 開放權重多模態模型,支援 128K 上下文窗口。
推薦理由:Pixtral Large 在 MathVista 得分 69.4%,並於 ChartQA、DocVQA 超越 GPT-4o 和 Gemini-1.5 Pro;這些結果提供數學視覺推理、圖表與文件理解的具體比較參照。
OpenAI 在法國設立其首個歐洲大陸辦公室,這是 OpenAI 在歐洲大陸的首個辦公室。
雅詩蘭黛集團運用 ChatGPT Enterprise 和自訂 GPT 分析消費者數據、發掘洞察,並加快美妝創新。
Mistral AI 推出 Batch API,讓 La Plateforme 上的 Mistral 模型以批次方式處理高流量請求,成本比同步 API 呼叫低 50%。
推薦理由:Batch API 將高流量請求的成本降至同步 API 呼叫的一半,並以檔案提交、處理後下載的流程,適合不要求同步回覆的批量任務。
Mistral AI 發佈 Mistral Moderation API,該 API 亦為 Le Chat 的審核服務提供支援。其 LLM 分類器按 9 個政策類別分類文本,並提供原始文本和對話內容兩種端點;對話端點會結合上下文分類最後一則訊息。
Argilla 2.4 新增免程式 UI 工作流程,讓使用者從 Hugging Face Hub 匯入資料集、配置欄位與問題,再收集人工回饋以整理微調或評測資料。首版只支援公開 Hub 資料集;部署在 Spaces 時,預設啟用 Hugging Face OAuth,讓 Hub 使用者參與標註。
OpenAI 推出 ChatGPT search,提供快速、及時的答案,並附上相關網頁來源連結。
推薦理由:ChatGPT search 提供快速、及時的答案並附相關網頁來源連結,材料呈現了它的核心搜尋回答形式。
Promega 採取由上而下的 ChatGPT 應用方式,帶動製造、銷售及市場營銷業務提速。
OpenAI 推出 SimpleQA,這是一項事實性基準測試,用來衡量語言模型回答簡短、以尋求事實答案為目的之問題的能力。
Decagon 與 OpenAI 大規模提供高效能、全自動化客户支援。這項服務以自動化方式交付,並面向大規模客户支援需求。
Cohere For AI 發佈 Aya Expanse 8B 和 32B 開放權重模型,並公開多語言訓練流程的技術細節。
推薦理由:文章拆解多語言訓練中的模型池數據仲裁、離線與線上偏好訓練及模型合併流程,呈現改善多語言表現的具體技術路徑。
OpenAI 簡化、穩定並擴展連續時間一致性模型,令其樣本品質可媲美領先擴散模型。採樣僅需兩個步驟。
Google DeepMind 與 Hugging Face 宣佈在 Transformers v4.46.0 推出 SynthID Text,讓生成時可加入文字水印,並透過分類器檢測水印。
推薦理由:文章梳理 SynthID Text 從生成端配置到分類器訓練的部署流程,並説明改寫、翻譯與事實性回答對水印效果的限制,便於評估適用場景。
OpenAI 與 Lenfest Institute 的 AI Collaborative and Fellowship 計劃是頁面所列主題;原文未提供更多背景或計劃細節。
Hugging Face 宣佈與 Protect AI 合作,並將 Guardian 整合至 Hub 掃描套件,所有公開模型倉庫在推送檔案後都會自動接受掃描。
dottxt 與 Hugging Face 合作推出 outlines-core,將 Outlines 的結構化生成核心算法移植至 Rust。項目現已公開並整合至 outlines,Python 綁定版本 0.1.0 已推出,索引編譯速度平均提升 2x。輕量化核心讓其他程式庫更易整合結構化生成,亦可建立 Python 以外語言的綁定。
Stable Diffusion 3.5 Large(8B)及其 timestep 蒸餾版(8B)已在 Hugging Face Hub 提供,並可透過 Diffusers 進行推理與訓練。
推薦理由:文章把 Diffusers 中的量化推理與 LoRA 微調落到具體步驟,並提供在 24GB VRAM 消費級 GPU 上微調 SD3.5 Large 的參考路徑。
Hugging Face 發佈 Transformers.js v3,新增 WebGPU 支援和量化格式選擇,支援架構總數增至 120 種。官方稱 WebGPU 最高可比 WASM 快 100 倍;此版本另提供 25 個示例專案與範本,以及超過 1200 個已轉換模型。
推薦理由:這次更新把 WebGPU、量化格式選擇及 120 種架構納入同一 JavaScript 庫,並兼容 Node.js、Deno、Bun,展示其瀏覽器與伺服器端部署路徑。
Hugging Face 示範以自訂 Docker 映像,將 Speech-to-Speech(S2S)流程部署至 Hugging Face Inference Endpoints。
推薦理由:文章把多模型語音流程拆解為自訂 Docker 映像、端點設定和 WebSocket 音訊服務等步驟,提供部署複雜推理管線時可參照的實作路徑。
Mistral AI 發佈 Ministral 3B 和 Ministral 8B,面向裝置端運算及邊緣場景。兩款模型支援最高 128k 上下文長度(vLLM 目前為 32k),Ministral 8B 採用交錯式滑動窗口注意力模式。
推薦理由:文章以多個評測類別對照 Ministral 3B、8B 與 Gemma 2、Llama 3.2、Llama 3.1、Mistral 7B 等模型,涵蓋預訓練及 Instruct 版本,便於參照各模型表現。
OpenAI 使用 AI 研究助理保障用户私隱,分析 ChatGPT 如何根據用户姓名作出回應。
OpenAI 推出 MLE-bench,作為衡量 AI 智能體執行機器學習工程工作的基準,聚焦其在該領域的表現。
Hugging Face Blog 示範以 Dask 和 Coiled 把 FineWeb-Edu 網頁分類流程,從 pandas 本機處理 100 行擴展至雲端多 GPU 處理 211 million 行。
推薦理由:FineWeb-Edu 分類案例呈現了由 pandas 本機小批次測試,擴展至 Dask 與 Coiled 雲端多 GPU 處理 211 million 行資料的完整流程,為大型資料集推理提供可參照的工程做法。
Gradio 5 推出穩定版,讓開發者可用 Python 建構面向生產環境的機器學習網頁應用,並改進效能、介面、即時串流及網絡安全。
推薦理由:Gradio 5 將 SSR、低延遲串流與網絡安全改進納入穩定版,並交代 Gradio 4.x 應用的相容條件,方便開發者評估升級影響。
OpenAI 與 Hearst 建立內容合作,Hearst 旗下品牌將精選生活資訊及本地新聞內容帶入 OpenAI 產品。
Hugging Face 推出 Open FinLLM Leaderboard,評估金融大語言模型在金融任務上的表現,並以 zero-shot 測試模型在未經微調任務上的泛化能力。
OpenAI 推出 canvas,將其介紹為使用 ChatGPT 寫作與編碼的新方式。
OpenAI 在取得領先投資者提供的 $6.6 billion 新資金之外,另與多家銀行設立 $4 billion 信貸額度。參與銀行包括 JPMorgan Chase、Citi、Goldman Sachs、Morgan Stanley、Santander、Wells Fargo、SMBC、UBS 和 HSBC。
推薦理由:OpenAI 公佈的安排並列投資者提供的 $6.6 billion 新資金與 $4 billion 銀行信貸額度,並列出參與銀行,呈現其融資來源構成。
OpenAI 的新資金旨在擴大 AI 帶來的益處。公司正推進確保通用人工智能造福全人類的使命。
OpenAI 推出 Realtime API,開發者現可在應用程式中構建快速語音到語音體驗。