OpenAI 任命退役美國陸軍將領 Paul M. Nakasone 為董事會成員
OpenAI 任命退役美國陸軍將領 Paul M. Nakasone 加入董事會。他具備網絡安全經驗,並將加入董事會安全與保安委員會。
推薦理由:這項任命把網絡安全經驗帶入 OpenAI 董事會,並安排 Nakasone 加入安全與保安委員會,呈現董事會安全職責的配置。
OpenAI 任命退役美國陸軍將領 Paul M. Nakasone 加入董事會。他具備網絡安全經驗,並將加入董事會安全與保安委員會。
推薦理由:這項任命把網絡安全經驗帶入 OpenAI 董事會,並安排 Nakasone 加入安全與保安委員會,呈現董事會安全職責的配置。
Hugging Face 宣佈 Stable Diffusion 3 Medium(2B parameters)已在 Hugging Face Hub 上提供,並可透過 Diffusers 使用。
推薦理由:文章比較 offloading、移除 T5 與 8-bit T5 的顯存和耗時,並提供 torch.compile 加速與 LoRA 微調腳本,可作為 SD3 推理部署與微調的實作參考,並呈現節省顯存方案的耗時取捨。
Hugging Face 在 TRL 引入 RLOO Trainer,這是一種較 PPO 更易實作、較省 GPU 記憶體的線上 RLHF 訓練方法。測試顯示,RLOO 約比 PPO 少用 50–70% vRAM,1B 模型快 2 倍、6.9B 模型最高快 3 倍;6.9B checkpoint 的 GPT4 評審偏好率為 78.7%(k=2)。
推薦理由:文章對照 RLOO 與 PPO 的 GPU 記憶體用量、訓練速度及回答勝率,並披露 bf16 下 RLOO 有較多批次資料的梯度被清零。
OpenAI 與 Apple 宣佈合作,將 ChatGPT 整合至 Apple 的使用體驗。
推薦理由:合作內容聚焦於將 ChatGPT 整合進 Apple 的使用體驗,提供觀察 AI 服務透過平台合作融入既有使用場景的切入點。
OpenAI 進一步説明文字轉語音模型 Voice Engine 的運作方式,並分享相關安全研究。內容聚焦於 Voice Engine 背後的技術。
Hugging Face 計劃重新設計 Transformers 文件,令內容更貼合開發者需要,並改善導覽與內容整合。文件原為機器學習工程師與研究人員而寫,後隨文本、LLM及優化等階段逐步擴充,造成內容分散、結構僵化和導覽困難。重設方向是以程式碼示例和解決方案為先,結合初階機器學習概念,並採用可自然擴展的靈活架構。
Hugging Face 宣佈 Embedding Container for Amazon SageMaker 正式 GA,AWS 客户可在 SageMaker 部署嵌入向量模型,支援包括 RAG 在內的生成式 AI 應用。
Artificial Analysis 推出文生圖模型排行榜與 Image Arena,以超過 45,000 次人類圖像偏好計算模型 ELO 排名。排行榜收錄 Midjourney、DALL·E、Stable Diffusion、Playground 等開源及專有模型,評測為每個模型生成超過 700 張圖像。用户可在 Image Arena 投票,投滿 30 票後查看個人化模型排名。
推薦理由:排行榜以超過 45,000 次人類圖像偏好計算 ELO,並涵蓋開源與專有模型,為比較不同文生圖模型提供同一參照。
OpenAI 從 GPT-4 的計算中自動識別出 16 million 個模式。研究使用擴展稀疏自編碼器的新技術。
Mistral AI 在 la Plateforme 推出模型客製化方案,提供自有基礎設施微調 SDK、無伺服器微調服務和客製訓練三種入口。開源工具 mistral-finetune 採用 LoRA 訓練範式;平台微調服務目前支援 Mistral 7B 和 Mistral Small,並使用 LoRA adapters,以保留基礎模型知識及提升服務效率。
推薦理由:Mistral AI 同時提供開源微調 SDK、la Plateforme 無伺服器微調服務及客製訓練,呈現不同基礎設施與資料需求下的模型調整途徑。
Cubzh 與 Gigax 推出 NPC-Playground,讓玩家在瀏覽器的 3D 場景中與 LLM 驅動的 NPC 互動,並用 Lua 腳本教授新技能。Gigax 已開源推理堆疊;示範所用模型託管於雲端,微調版 Phi-3 和 Mistral-7B 可從 🤗 Hub 下載。
Hugging Face 為 Intel Gaudi 適配並優化輔助生成,並將支援納入 Optimum Habana。該方法先由草稿模型生成 K 個 tokens,再交由目標模型評估;大型 Transformer 模型通常可提速約 2x,並維持與自回歸採樣相同的採樣品質。
OpenAI 已終止與隱蔽影響行動相關的帳户,以打擊 AI 的欺騙性用途。OpenAI 表示,其服務未令相關行動的受眾顯著增加。
OpenAI 推出新計劃,旨在提升非牟利機構使用其工具的可及性,並為 ChatGPT Team 和 Enterprise 提供折扣。
OpenAI 提供面向大學的平價方案,協助校園以負責任的方式引入 AI。
面向 AI 時代的新軟件公司 MavenAGI 推出一款以 GPT-4 的靈活性為基礎打造的 AI 客户服務智能體。Tripadvisor、Clickup 和 Rho 等公司已使用該智能體節省時間,並更好地服務客户。
Mistral AI 發佈 22B 開放權重程式碼生成模型 Codestral,支援 80+ 種程式語言,並提供 32k 上下文窗口。其評測圖表稱,Codestral 在 RepoBench 長距離程式碼生成評測中超越其他模型;模型亦可補全程式碼、編寫測試及以 fill-in-the-middle 機制補完片段。
推薦理由:文章列明 Codestral 的研究與測試授權、商業授權申請方式,以及專用 endpoint 的免費 beta 和候補名單,呈現不同使用入口的條件。
Mistral AI 推出 MNPL 非生產許可證,允許開發者將其技術用於非商業用途及研究工作,並按此許可發佈 Codestral。Mistral AI 表示會繼續按 Apache 2.0 發佈模型和程式碼,並逐步整合採用 Apache 2.0 和 MNPL 的兩個產品系列。
推薦理由:公告交代 MNPL 對非商業用途與研究工作的許可範圍,並説明 Codestral 和 Apache 2.0 的發佈安排,有助理解 Mistral AI 不同產品系列的許可路線。
OpenAI 與《The Atlantic》建立策略性內容及產品合作,將《The Atlantic》定位為 OpenAI 旗下的高級新聞來源。其文章將可在包括 ChatGPT 在內的 OpenAI 產品中被發現。《The Atlantic》亦會協助制定未來即時探索產品呈現新聞的方式。
OpenAI 與 Vox Media 達成多方面合作,Vox Media 的內容將增強 ChatGPT 的輸出。Vox Media 亦將基於 OpenAI 技術開發產品,以更好服務其受眾和廣告商。
Hugging Face 介紹如何使用 TGI Benchmarking 工具,測量 Text Generation Inference(TGI)在不同 batch size 下的吞吐量與延遲,並據此調整部署設定。
Sentence Transformers 指南示範如何微調嵌入模型以配合特定任務,並説明亦可從頭訓練新模型。內容講解資料集、損失函數、訓練參數、評估器與 Trainer,並示範從 Hugging Face Hub 或本機載入資料及多資料集訓練。文中 AllNLI 三元組範例以餘弦相似度計算,開發集及測試集準確率分別為 90.04% 和 91.5%;訓練前基礎模型的開發集準確率為 68.32%。
推薦理由:文章拆解資料集格式、損失函數、訓練參數、評估器與 Trainer 的配合,並展示多資料集搭配不同損失函數的訓練方式,方便轉用於不同嵌入任務。
TII 發佈 Falcon 2 系列的 11B LLM 與 11B VLM,VLM 可接收圖像並回答相關問題。LLM 使用逾 5000B tokens 訓練,主要支援英語,並對另外 10 種語言具備良好能力。VLM 結合 CLIP ViT-L/14 視覺編碼器,先以 558K 圖像描述配對訓練多模態投影器,再以 1.2M 圖像文字指令資料微調。
OpenAI 與 News Corp 達成多年期全球合作夥伴關係,雙方將以優質新聞內容豐富 OpenAI 的生成式 AI 產品及平台。
推薦理由:這項合作將優質新聞內容與 OpenAI 的生成式 AI 產品及平台連結,呈現媒體內容方與 AI 產品平台合作的具體方向。
Hugging Face Inference Endpoints 新增 AWS Inferentia2 執行個體選項,使用者可從 Hugging Face Hub 部署支援的模型。
OpenAI 表示,通用人工智能(AGI)有潛力惠及我們生活的幾乎每個方面,因此 AGI 必須以負責任的方式開發和部署。
Hugging Face Spaces 推出 Dev Mode,讓用户可透過 VS Code 或 SSH 直接連接 Space 並編輯程式碼。功能目前處於 beta,供 PRO 訂閲者使用;修改後可在 Space 點擊「Refresh」測試,無需先推送變更或重建容器。確認修改後,可透過 commit and merge 保存。
Hugging Face 宣佈把 AMD Instinct MI300 整合至平台,透過 Transformers、text-generation-inference 等工具部署模型時無需改動程式碼。
推薦理由:文章比較 Azure MI300X 與 MI250 執行 Llama 3 70B 推理和微調的結果,並公開基準程式碼,便於核對性能差異及復現測試。
Hugging Face 宣佈推出 Dell Enterprise Hub,讓企業透過 Dell 平台在本地訓練和部署開源模型。平台提供包括 Llama 3、Mixtral 和 Gemma 在內的精選開源模型,可按授權或模型大小篩選,並查看模型資訊及適用的 Dell 平台。
Hugging Face 與 Microsoft 宣佈加深合作,擴充 Azure AI Studio 中可一鍵部署的 Hugging Face Collection,並推出 Spaces Dev Mode。
OpenAI 改進 ChatGPT 數據分析功能,加入表格和圖表互動能力。用户可直接從 Google Drive 和 Microsoft OneDrive 添加檔案。
推薦理由:更新將表格與圖表互動、直接從 Google Drive 和 Microsoft OneDrive 添加檔案納入 ChatGPT 數據分析,呈現這次功能改進涵蓋的操作範圍。
OpenAI 與 Reddit 合作,將 Reddit 的獨特內容引入 ChatGPT 及 OpenAI 產品。
推薦理由:公告交代 OpenAI 與 Reddit 合作的核心方向,是把 Reddit 的獨特內容引入 ChatGPT 及 OpenAI 產品,呈現雙方合作的內容整合方向。
Hugging Face 將 KV cache 量化功能加入 Transformers,以較低精度儲存快取,減少長文本生成的記憶體佔用。int4 快取約帶來 x2.5 記憶體節省,品質接近 fp16,但較高 batch size 下生成速度會下降。
OpenAI 宣佈 Ilya Sutskever 將離開公司,Jakub Pachocki 出任首席科學家。
Google 發佈 PaliGemma,一系列可接收圖像與文字並輸出文字的開源視覺語言模型。模型結合 SigLIP-So400m 圖像編碼器與 Gemma-2B 文字解碼器,提供 PT、Mix、FT 三類檢查點及 224x224、448x448、896x896 三種解像度。PaliGemma 是單輪模型,不適用於對話;Mix 檢查點適合以自由文字提示進行通用推理,但僅供研究用途。
推薦理由:文章整理 PT、Mix、FT 檢查點的用途,並指出高解像度會增加記憶體需求、多數任務的質素提升有限,有助按任務需要選擇模型。
OpenAI 宣佈 GPT-4 Omni(GPT-4o)為新的旗艦模型。該模型可即時跨音訊、視覺和文字進行推理。
推薦理由:公告把 GPT-4o 定位為新旗艦模型,並明確列出音訊、視覺和文字的即時推理能力,讓讀者掌握此次宣佈的多模態重點。
OpenAI 在春季更新中推出 GPT-4o,並在 ChatGPT 中免費開放更多能力。
推薦理由:這次更新同時涵蓋 GPT-4o 的推出與 ChatGPT 免費可用能力的擴展,呈現新模型推出和免費使用安排兩方面的變化。
OpenAI 推出最新旗艦模型 GPT-4o,並在 ChatGPT 中向免費用户開放更多功能。
Hugging Face 發佈 Transformers Agents 2.0,新增 ReactCodeAgent 和 ReactJsonAgent,能根據過往觀察迭代。框架以簡潔、模組化,以及工具和提示詞透明為設計目標。使用 Llama-3-70B-Instruct 的智能體在完整 GAIA 基準中排名第 4,超越多個基於 GPT-4 的智能體。
推薦理由:文中比較 Code 與 JSON 智能體在不同模型上的表現,並展示 Llama-3-70B-Instruct 智能體於 GAIA 的名次,可作為評估 Agent 架構與模型搭配的具體參照。
Hugging Face Blog 示範以 Intel Xeon CPU 運行嵌入模型、以 Intel Gaudi 2 運行 LLM,並透過 LangChain、Redis 和 TGI 構建及部署企業級 RAG 應用。