AI Security Institute 評估 Claude Mythos Preview 的網絡安全能力
英國 AI Security Institute 評估 Anthropic 的 Claude Mythos Preview 網絡安全能力,結果顯示其表現較以往前沿模型提升。
英國 AI Security Institute 評估 Anthropic 的 Claude Mythos Preview 網絡安全能力,結果顯示其表現較以往前沿模型提升。
英國 AI Security Institute 評估中,GPT-5.5 的 Expert 級進階任務平均通過率為 71.4%,高於 Mythos Preview 的 68.6%。
推薦理由:報告分別測試進階網絡任務、企業攻擊鏈及工控模擬,並交代結果與測試限制,呈現 GPT-5.5 網絡安全能力的不同面向。
小米 MiMo 的人文與社會科學能力評估顯示,它在創意寫作與藝術感知方面表現較均衡,兼顧邏輯結構與情感表達。評估由 9 名評估者比較 MiMo 與兩個對照模型,創意寫作共設計 40 項任務,涵蓋現代詩、古典詩詞及敍事小説。MiMo 能按文類調整創作側重,但遵守古典詩詞格律及運用相關知識方面仍不穩定。
G42 旗下 Inception、MBZUAI 基礎模型研究所與 Cerebras Systems 推出 Jais 2 阿拉伯語大型語言模型系列,包含 8B 和 70B 型號。
Cerebras 宣佈,Z.ai 的 GLM-4.7 現已登陸 Cerebras Inference Cloud,程式碼生成約為 1,000 tokens per second,部分場景最高達 1,700 TPS。
Cerebras 宣佈,由其提供運算支援的 OpenAI GPT-5.3-Codex-Spark 已開放研究預覽,面向即時軟件開發。模型運行速度超過 1,000 tokens/s;在 SWE-Bench Pro 和 Terminal-Bench 2.0 等基準上,其回應較 GPT-5.1-Codex-mini 更有能力,完成任務只需一小部分時間。
Aleph Alpha 發佈 Kolibri(Kolibri-1),一款面向英語和德語的開放權重 MoE 語言模型,總參數為 78.1B,每個 token 啟用 3.46B。
ElevenLabs 發佈 Scribe v2 Realtime,即時語音轉文字模型可在低於 150 ms 內轉錄語音,面向語音智能體、會議助理及即時字幕等場景。
ElevenLabs 推出 Scribe v2,面向大規模批量轉錄、字幕製作及字幕生成,並提升對長篇、複雜錄音的處理穩定性與準確度。Scribe v2 在業界標準基準測試中錄得最低詞錯誤率,支援最多 100 個詞語或短語的關鍵詞提示,以及涵蓋最多 56 個類別、附精確時間戳的實體偵測。
ElevenLabs 的 Eleven v3 文字轉語音模型已結束 Alpha 階段,現已在所有平台正式提供。內部基準涵蓋 8 種語言、27 個類別,模型錯誤率由 15.3% 降至 4.9%,減少 68%。測試中,用戶有 72% 的情況偏好新版本;模型處理數字、符號及專門記法的準確度亦有所提升。
ElevenLabs 發佈音樂生成模型 Music v2,改善不同曲風的歌聲、樂器與編曲表現,並提升多語言支援。用戶可逐段構建完整歌曲,並選取曲目任一部分重新生成,而不影響其他部分。
Zyphra 發佈 Zamba2-small(2.7B),一款面向裝置端應用的小型語言模型。相較 Phi3-3.8B,其首 token 生成速度快 2x、記憶體開銷減少 27%,生成延遲低 1.29x。模型權重以 Apache 2.0 授權開源。
Zyphra 發佈 Zamba2-VL 視覺語言模型系列,提供 1.2B、2.7B 和 7B 參數版本,採用 Zamba2 混合 SSM–Transformer 骨幹。
Zyphra Research 發佈 Zonos-v0.1 beta,開源兩款採用 Transformer 與 SSM hybrid 架構的 1.6B TTS 模型,授權為 Apache 2.0。
Zyphra 預覽 ZAYA1,稱其為首個完全以 AMD 硬件、軟件及網絡堆疊端到端訓練的 AI 模型。ZAYA1-base 使用 Zyphra 內部 AMD 專用訓練堆疊,訓練總量為 14T tokens;訓練叢集由 128 個節點組成,搭載 AMD MI300X GPU,實際訓練效能超過 750 PFLOPs。
Zyphra 發佈 380M 參數的 ZUNA,這是一款用於腦電圖(EEG)訊號去噪、重建及上採樣的擴散自編碼器基礎模型。在通道缺失超過 75% 時,ZUNA 在所有評估數據集均優於球面樣條插值;模型亦可按電極座標預測新通道訊號。模型以約 2 million channel-hours EEG 數據訓練,並按 Apache 2.0 授權發佈模型權重及推理、預處理程式碼。
Zyphra 發佈 ZAYA1-8B,這款 MoE 模型的活躍參數少於 1 billion。該模型在部分數學和編碼基準中勝過規模大得多的開放權重模型;搭配 Markovian RSA 時,HMMT'25 得分為 89.6,並逐輪只傳送最後 4K tokens 以維持固定上下文長度。
Zyphra 發佈 ZAYA1-8B-Diffusion-Preview,將自回歸訓練的 ZAYA1-8B 轉換為離散擴散模型,並同時草擬 16 個 token。
Zyphra 發佈採用 Apache 2.0 授權的即時文字轉語音模型 ZONOS2,支援高保真聲音複製。模型採用 MoE 架構,規模由前代的 1.6B 增至 8B,即時生成吞吐量較前代提升 4x,並支援最長一分鐘的多語言及語碼轉換語音生成。ZONOS2 提供 stable 和 expressive 兩種模式,分別側重乾淨輸出,以及聲音複製的自然度與保真度。
Prime Intellect 發佈 INTELLECT-1,並稱這是首個全球協作訓練的 10B 參數語言模型。模型以 1T tokens 訓練 42 天,橫跨 5 個國家和 3 大洲,最多同時使用 112 張 H100 GPU;全球分散式訓練的計算利用率為 83%。
Prime Intellect、USC 與 Nucleic Acid Observatory 合作發佈 METAGENE-1,這是一個為疫情監測設計的 7B 參數宏基因組基礎模型。
Prime Intellect 啟動 INTELLECT-2,展開 32B 參數模型的全球分散式強化學習訓練,並開放任何人無需許可地貢獻異構算力。訓練以 QwQ-32B 為基礎,採用 DeepSeek-R1 的 GRPO 方法,聚焦可驗證的數學與編碼任務,並以系統提示詞設定思考 token 預算。
Prime Intellect 發佈 INTELLECT-2,稱這是首個透過全球分散式強化學習訓練的 32B 參數推理語言模型。訓練以跨異構運算節點的全非同步 RL 為核心,並配套推出 PRIME-RL、TOPLOC 和 SHARDCAST;模型、程式碼及數據均已開源,技術報告見 primeintellect.ai/intellect-2。
Prime Intellect 發佈 106B 參數的 INTELLECT-3 MoE 模型,並開源模型權重、訓練框架、數據集、RL 環境及評測。模型以 GLM-4.5-Air 為基礎,經 SFT 和 RL 訓練,使用 512 張 NVIDIA H200 GPU、分佈於 64 個互連節點,歷時兩個月。
Suno 發佈首個可製作電台級音樂的模型 v3,用戶可在數秒內生成完整兩分鐘歌曲。v3 現已向所有用戶開放,網址為 https://app.suno.ai。v3 亦改善音質、增加風格與曲風選擇,並提升提示詞遵循度、減少模型幻覺,令歌曲結尾更自然。
推薦理由:v3 可在數秒內生成完整兩分鐘歌曲,並改善音質、風格選擇及提示詞遵循,呈現這次更新在生成速度與創作控制上的具體變化。
Liquid AI 發佈 LFM2,推出 0.35B、0.7B 和 1.2B 三個參數規模的模型,面向裝置端生成式 AI。官方表示,LFM2 在 CPU 上的 prefill 和 decode 速度最高達 Qwen3 的 2 倍,訓練效率較上一代提升 3 倍。
LFM2-VL 推出 LFM2-VL-450M 和 LFM2-VL-1.6B 兩款開放權重視覺語言模型,支援文字及可變解像度圖像輸入。在 GPU 上的推理速度最高達現有 VLM 的 2 倍,並原生處理最高 512×512 解像度的圖像;更大的圖像會切分為 512×512 區塊。兩款模型現已於 Hugging Face 提供,採用基於 Apache 2.0 的開放授權。
Suno 發佈 v5.5,並推出 Voices、Custom models 和 My Taste,加入以用戶聲音、原創音樂及音樂偏好為基礎的個人化功能。
推薦理由:更新把個人化分為歌聲、原創曲目調校和偏好學習三條路徑,也交代各功能面向哪些用戶開放。
Liquid AI 發佈 Liquid Nanos,一系列 350M–2.6B 參數的基礎模型,可在手機、手提電腦及嵌入式裝置上本機運行。首批實驗性模型涵蓋資料抽取、英日雙向翻譯、RAG、工具調用及數學推理,另包括社羣製作的法語微調模型。模型現已在 Liquid Edge AI 平台(LEAP)及 Hugging Face 提供,並以開放授權向學術界、開發者及小型企業開放。
Liquid AI 發佈 LFM2-Audio-1.5B,這款 1.5B 參數模型支援音訊與文字輸入及生成。模型在 VoiceBench 九項音訊互動基準的總分為 56.78,ASR 基準平均詞錯誤率為 7.24。以 4 秒輸入波形測試,平均端到端延遲低於 100 ms;Liquid AI 亦提供 Python 套件及語音對話應用參考實作。
Liquid AI 發佈 LFM2-8B-A1B 早期檢查點,這款端側 MoE 模型共有 8.3B 參數,每個 token 啟用 1.5B 參數。官方公佈 16 項基準測試結果,其中 MMLU-Pro 得分為 37.42,較 LFM2-2.6B 高 11.46 分;模型面向手機、平板及手提電腦的本地推理。頁首註明,該模型已棄用,並由 LFM2.5-8B-A1B 取代。
Liquid AI 發佈 3B 參數的視覺語言模型 LFM2-VL-3B,面向需要更高準確度並保留 LFM2 架構速度優勢的應用。模型以 LFM2-2.6B 為骨幹,整合 SigLIP2 400M NaFlex 編碼器,並可調整每張圖片的視覺 token 數量,以平衡效能與速度;現已可透過 LEAP 及 Hugging Face 取得。
Claude Opus 5.5 針對更長、上下文用量更高的編碼工作階段設計,按 token 計費的典型工作負載估計比 Opus 5 便宜約 40%。輸入及輸出 token 價格下調 20%,讀取快取 token 的價格下調 60%;Claude Code 的快取未命中輸入亦減少逾 50%。文中指出,長而開放的任務較有機會透過減少錯誤方向上的回合降低成本,而簡單、短小的機械式任務所需回合數大致相同。
Liquid AI 發佈面向端側部署的 LFM2.5 模型系列,涵蓋 Base、Instruct、日文、視覺語言及音訊語言型號。LFM2.5-1.2B 的預訓練規模由 10T 增至 28T tokens;LFM2.5-Audio-1.5B 的音訊 detokenizer 在 mobile CPU 上以同等精度較 LFM2 的 Mimi detokenizer 快 8x。
Liquid AI 發佈 LFM2-2.6B-Transcript,支援在 CPU、NPU 和 GPU 上完全本機執行。模型針對 30–60 分鐘會議逐字稿設計,並已在 LEAP 和 Hugging Face 開放下載,可輸出討論要點、決策及標註負責人的行動項目。
Liquid AI 發佈 LFM2.5-1.2B-Thinking,一款可完全在裝置上運行的推理模型,手機記憶體佔用低於 900 MB。模型有 1.2 billion 個參數,在多數推理基準中匹敵或超越 Qwen3-1.7B(thinking mode),參數量少 40%。現已可透過 Hugging Face、LEAP 和 Playground 使用。
Liquid AI 發佈 LFM2-24B-A2B 早期檢查點,這款開放權重 MoE 模型有 24B 總參數,並已在 Hugging Face 提供。
Liquid AI 以開源桌面智能體 LocalCowork 測試 LFM2-24B-A2B 在筆電本地執行工具調用的表現,模型、工具和資料均留在裝置上。在 Apple M4 Max、36 GB 統一記憶體的筆電上,工具選擇平均耗時約 385 ms、佔用約 14.5 GB 記憶體,單步準確率為 80%。
Liquid AI 發佈基於 LFM2 架構的 LFM2.5-350M,這款 350M 參數模型經額外預訓練(由 10T 增至 28T tokens)及大規模強化學習。
Liquid AI 發佈 LFM2.5-VL-450M,作為 LFM2-VL-450M 的改進版本,提升視覺定位與指令遵循能力,並新增函數調用支援。預訓練規模由 10T 增至 28T tokens;RefCOCO-M 邊界框預測分數由 0 升至 81.28,MMMB 多語言分數由 54.29 提升至 68.09。