oMLX 創作者兼維護者 Jun Kim 加入 Hugging Face 支援 MLX 社羣
Hugging Face 宣佈,oMLX 創作者兼維護者 Jun Kim 加入團隊,並會繼續領導 oMLX。oMLX 維持 Apache 2.0 授權,項目將轉為獲資助並持續維護;Hugging Face 預期這有助提升穩定性,並希望加快開發。Hugging Face 亦希望以 oMLX 作為新想法的試驗場,並加快將 transformers 模型定義轉成不同引擎可使用的 MLX 參考實作。
Hugging Face 宣佈,oMLX 創作者兼維護者 Jun Kim 加入團隊,並會繼續領導 oMLX。oMLX 維持 Apache 2.0 授權,項目將轉為獲資助並持續維護;Hugging Face 預期這有助提升穩定性,並希望加快開發。Hugging Face 亦希望以 oMLX 作為新想法的試驗場,並加快將 transformers 模型定義轉成不同引擎可使用的 MLX 參考實作。
Google Research 已將 Multi-Token Prediction(MTP)架構部署至 Pixel 9 和 10 系列的 Gemini Nano v3,透過凍結主模型權重加快裝置端文字生成。
推薦理由:文章對照整合式 MTP head 與獨立草稿模型,説明直接利用主模型狀態如何提升候選 token 準確度,並改善 Pixel 端的速度與記憶體效率。
Google Research 在 Nature 發表 PHRM 研究系統,透過智能手機前置鏡頭在面部解鎖後擷取 8 秒影片,於日常使用中被動估算心率(HR)及每日靜息心率(RHR)。
推薦理由:研究結合實驗室測試與八日自由生活驗證,按膚色報告 HR 誤差,並呈現 RHR 估算覆蓋率及穿戴裝置對照,讓讀者掌握日常使用中的證據範圍。
Google DeepMind 發佈 Gemma 4 開放模型家族,提供 E2B、E4B、26B MoE 和 31B Dense 四種尺寸,並採用 Apache 2.0 授權。
推薦理由:Gemma 4 提供從手機端到工作站的多種尺寸,並列出排行榜名次與上下文窗口,便於比較本地部署時的硬件需求和能力差異。
Mistral AI 發佈 Voxtral Transcribe 2,包含用於批次轉寫的 Voxtral Mini Transcribe V2,以及面向即時應用的 Voxtral Realtime。
推薦理由:批次版與即時版的定位和能力差異清晰,文章亦列出即時轉寫的延遲設定、開放權重授權及兩款模型的 API 價格,便於比較部署選項。
Google Research提出分解式流程,令小型多模態 LLM 從網頁及手機互動軌跡提取意圖,表現勝過 CoT 提示和端到端微調。流程先逐屏摘要,再從摘要序列抽取整體意圖;測試涵蓋手機、網頁軌跡及 Gemini、Qwen2 基礎模型。Gemini 1.5 Flash 8B 配合此法,效果可媲美 Gemini 1.5 Pro,展示裝置端意圖理解的應用潛力。
Hugging Face 的 Swift 函式庫 swift-transformers 發佈 1.0,標誌套件進入穩定階段,並為後續功能迭代奠定基礎。Tokenizers 和 Hub 現已成為頂層模組,套件亦採用支援有狀態模型的 Modern Core ML API,並完整支援 Swift 6。團隊表示,後續將聚焦 MLX 與智能體應用。
Gemma 3n 已接入多個主流開源工具庫,並推出 E2B、E4B 兩種尺寸的 base 與 instruct 版本。支援工具包括 Transformers、timm、MLX、llama.cpp、Transformers.js 和 Ollama;兩款模型實際參數量為 5B 和 8B,GPU 記憶體佔用約相當於 2B 和 4B 模型。
推薦理由:文章並列模型的實際參數量、GPU 記憶體需求和多個工具庫的接入方式,方便衡量 Gemma 3n 本地多模態部署時的硬件門檻與工具選擇。
Hugging Face Blog 的教程示範以 React Native 建立手機應用,在裝置本地執行 LLM 聊天。應用從 Hugging Face Hub 下載 GGUF 模型,並以 llama.rn(llama.cpp 的 binding)載入,教程涵蓋 Android 和 iOS。文章亦介紹 GGUF 量化格式、手機選模取捨,以及逐 token 生成與推理速度追蹤等功能。
推薦理由:文章按模型選擇、GGUF 下載與載入、聊天介面逐步拆解 React Native 實作,並説明量化格式與設備能力的取捨,可作為端側 LLM 應用的開發參考。
Mistral AI 發佈 Ministral 3B 和 Ministral 8B,面向裝置端運算及邊緣場景。兩款模型支援最高 128k 上下文長度(vLLM 目前為 32k),Ministral 8B 採用交錯式滑動窗口注意力模式。
推薦理由:文章以多個評測類別對照 Ministral 3B、8B 與 Gemma 2、Llama 3.2、Llama 3.1、Mistral 7B 等模型,涵蓋預訓練及 Instruct 版本,便於參照各模型表現。
Meta 發佈 Llama 3.2,共有 10 個開放權重模型,包括 5 個多模態模型和 5 個純文字模型,涵蓋 11B、90B 視覺模型及面向裝置端的 1B、3B 純文字模型。
推薦理由:Llama 3.2 涵蓋 11B、90B 視覺模型與 1B、3B 裝置端純文字模型,並列出 Transformers、llama.cpp 等運行示例,可作為選擇部署路徑的參考。