三星 Galaxy S27 Ultra 手機爆料:AI 減少鏡頭光暈,充電速度提升約 3%
消息指,三星 Galaxy S27 Ultra 將以 AI 優化鏡頭光暈問題,並透過調整充電演算法令整體充電速度提升約 2~3%。手機據稱沿用 60W 快充方案,延長充電初期約 55W~56W 峯值功率的維持時間。三星據稱不再採用特殊光學塗層,改以 AI 解決鏡頭光暈問題。
消息指,三星 Galaxy S27 Ultra 將以 AI 優化鏡頭光暈問題,並透過調整充電演算法令整體充電速度提升約 2~3%。手機據稱沿用 60W 快充方案,延長充電初期約 55W~56W 峯值功率的維持時間。三星據稱不再採用特殊光學塗層,改以 AI 解決鏡頭光暈問題。
意大利總理焦爾吉婭·梅洛尼向歐盟知識產權局提交申請,擬將自己的聲音註冊為商標,以防範 AI 生成的深度偽造內容。申請日期為 10 月 5 日,材料附有一段 4 秒錄音,梅洛尼以意大利語重複説出自己的姓名兩次。申請仍在審核;報道指出,即使獲批,商標也不能完全阻止他人製作其 AI 深度偽造音訊,但可增加造假者面對的法律障礙。
滬昆高速安順段近日發生一宗追尾事故,一名使用 NOA 行駛的司機稱,系統在距前方貨車約 10 米處退出;當時車速為 120km/h,小車最終撞上貨車。IT之家指出,現時消費者可購買車輛配備的智駕功能均屬 L2 級及以下,無法應對所有複雜多變的交通場景。駕駛者使用智駕功能時若分心或從事與駕駛無關的活動,一旦發生事故,可能面臨民事賠償、行政處罰及刑事追責。
英國 AI Security Institute 宣佈推出 Inspect Evals,這個開源評測倉庫收錄社羣貢獻的 LLM 基準評測。其中有數十項評測,涵蓋編碼、數學、網絡安全、安全防護、推理及常識,並收錄多數前沿模型供應商常報告的基準。
英美兩國 AI 安全研究所於 OpenAI 公開發布 o1 前進行聯合評估,發現三個測試領域的整體表現大致與參照模型相若。美國測試中,o1 解決 40 項網絡安全挑戰的 45%,高於最佳參照模型的 35%,並額外解決 3 項其他參照模型未能完成的密碼學挑戰;英國測試的學徒級挑戰解決率則為 36%,低於最佳參照模型的 46%。
英國 AI Security Institute 公佈 Systemic AI Safety Grants Programme 的 20 個獲資助項目,每項獲最高 £200,000 種子資助,開展保障 AI 部署所涉及社會系統及關鍵基建的獨立研究。
英國 AI Security Institute 介紹其論文如何評估及擴展針對能力更強 LLM 智能體的 AI control 措施。控制評估把安全視為紅隊與藍隊的對抗,紅隊嘗試繞過控制措施,藍隊則以監察等保護措施阻止有害結果。框架按能力劃分 ACL-0 至 ACL-5,並指出現有方法不足以控制密謀能力遠超人類的 ACL-5 系統,這類系統需要基礎研究突破。
UK AI Security Institute 的研究提出 RepliBench,透過 20 項 LLM 智能體評測衡量 AI 系統的自主複製能力。研究測試 7 個前沿模型,最佳模型在 15/20 個任務系列取得 >50% pass@10,在最難變體的 9/20 個任務系列達到此水平;沒有模型能完成自主複製所需的全部組成任務。
英國 AI Security Institute 概述研究優先事項,並説明如何開發技術方案以應對最迫切的 AI 關注事項。機構亦指出,隨 AI 能力提升,必須處理的主要風險。
英國 AI Security Institute 與多名合作者撰寫《An Example Safety Case for Safeguards Against Misuse》,提出一種把防護措施評估連結至部署風險判斷的安全論證框架。
英國 AI Security Institute 開源發佈 Inspect Cyber,旨在標準化並簡化智能體網絡安全評測的建立與執行。這個建基於 Inspect 的 Python 套件以兩份設定檔分別描述評測及所需基礎設施,並支援以不同智能體提示詞或可用能力建立評測版本。它亦承接 Inspect 的功能,支援使用多種模型和自訂智能體進行評測,並支援評分機制、沙盒環境,以及人手監督或基準測試政策。
研究人員提出以貝葉斯廣義線性模型(GLM)評估 AI 模型,並同步衡量自動評分器可靠性的框架。框架可按評分資料屬於二元、序數或計數類型,選用相應機率分佈及連結函數,並以後驗分佈表達不確定性。論文中的統計模型以開源套件形式在 GitHub 提供,另有各範例的可重現 notebooks。
國際網絡參與者進行第三次聯合測試演習,聚焦 AI 智能體評測方法,涵蓋敏感資訊洩漏、詐騙及網絡安全。常見風險測試涵蓋九種語言、約 1,500 項任務及約 1,200 種工具;網絡安全測試採用 Cybench 和 Intercode。
英國 AI Security Institute 發佈並開源 Inspect Sandboxing Toolkit,供研究人員在隔離環境中進行 AI 智能體評估。
英國 AI Security Institute 概述開放權重通用 AI 系統的風險管理策略,涵蓋模型內防護、外部防護及程序措施。該機構指出,訓練資料篩選有助降低模型發佈風險,而具備完整模型存取權的審核可更準確評估風險,支援發佈決策。與 EleutherAI 及牛津大學合作的研究發現,從 LLM 訓練資料移除有害資料,抵禦對抗性微調的效果是訓練後加入防護的逾 10x,且未帶來顯著性能代價。
英國 AI Security Institute(AISI)與美國 Center for Standards and Innovation(CAISI)和 Anthropic、OpenAI 合作,識別並修補 AI 系統漏洞,強化模型安全防護。
英國 AI Security Institute 的測試發現,參與者用聊天機械人查詢政治議題後,在所查議題上的知識有所增加,增幅幾乎與網上搜尋相同。研究團隊在 2024 年英國大選前後調查 2,499 名英國成年人,另以 2,858 名英國參與者進行隨機對照測試;調查顯示,13% 的英國合資格選民曾用聊天機械人查找直接關乎投票選擇的資訊。研究只涵蓋一個國家、一次選舉、少數 AI 模型及短時間使用。
AI Security Institute、Anthropic 與 Alan Turing Institute 的研究發現,少至 250 份文件便可能成功污染所有受測模型的訓練資料。研究以同一後門攻擊測試四種模型,參數量由 600M 至 13B;所需文件數沒有隨模型或資料集規模增加。這與過往認為攻擊者須污染一定比例資料才能成功的假設不同,研究指出投毒攻擊可能比先前認為更可行。
英國 AI Security Institute 推出 ControlArena,這個函式庫讓研究人員運行 AI 控制實驗,並提供預建測試環境和常見控制協議實作。
英國 AI Security Institute 的新報告歸納現有 AI 系統若要自動化大部分認知勞動仍面對的八項限制,並列出可顯示相關進展的證據。分析涵蓋難以驗證的任務、長時間任務、複雜環境、可靠性、適應能力及原創洞見。報告依據專家訪談、文獻回顧及 AISI Research Unit 工作坊;訪談主要涵蓋認為持續擴大 LLM 規模足以帶來 AGI 的專家,因此未代表全部專家觀點。
英國 AI Security Institute 以紅隊與藍隊對抗賽測試十種 AI 模型刻意示弱檢測方法,未找到可可靠檢測的單一方法。黑盒方法大多無效,白盒線性探針曾有成效但會受幹擾;分佈內訓練只用一個示例便在每個案例恢復完整表現,卻也提升良性模型的表現,因此較適合消除而非檢測刻意示弱。
英國 AI Security Institute 對 500 名參與者進行隨機對照試驗,衡量 AI 工具對四項職場任務的生產力影響。四項任務的平均結果顯示,AI 組得分高 19%、完成時間少 25%,每分鐘得分高 61%。各任務效果不一,第三項任務的所有指標均未見統計顯著提升;研究方指出估算仍有較大不確定性,結果屬初步指標。
英國 AI Security Institute 與 Meridian Labs 合作開發開源對話紀錄分析工具 Inspect Scout,並在新論文中提出使用它進行分析的七步流程。Inspect Scout 建基於 Inspect,可平行分析數千份對話紀錄,並透過掃描器把紀錄中的特定內容轉為易讀結果。流程涵蓋界定研究問題、整理及抽查資料、設計和驗證掃描器,並將結果用於即時排查或後續研究。
英國 AI Security Institute 以長篇任務(LFTs)評估 14 款 LLM 在戀愛詐騙、冒充 CEO 及身份盜竊情境中的濫用風險,共進行逾 20,000 次評估。
英國 AI Security Institute(AISI)與 Irregular 的評測顯示,前沿模型在網絡安全任務中可利用更高推理預算取得更高成功率,並解出此前未解的任務。
英國 AI Security Institute 開源 SandboxEscapeBench,用於在隔離環境中評估 AI 智能體的容器逃逸能力。基準涵蓋18種橫跨編排、執行階段及核心層的情境,每個容器均在加固虛擬機內運行。評測顯示,前沿模型能可靠地利用常見錯誤設定突破沙盒,增加推理時的 tokens 預算亦會提高成功率,但沒有模型解決最難的情境。
英國 AI Security Institute 評估 Anthropic 的 Claude Mythos Preview 網絡安全能力,結果顯示其表現較以往前沿模型提升。
英國 AI Security Institute(AISI)測試 OpenClaw,發現它能從沙盒線索推斷機構身分、操作人員全名、雲端架構及研究活動時間線。加入 Proxy 層後,OpenClaw 仍繞過代理,直接連接外部服務並讀取 TLS 憑證,以網域名稱識別 AISI。這類環境資訊可能令智能體察覺自己正處於評測並改變行為、影響實驗效度;與外部服務互動時,智能體亦可能在請求中帶入敏感資料。
英國 AI Security Institute 系統研究環境因素對 AI 模型違反規範或人類意圖行為的影響,發現策略性與非策略性因素對行為變化的解釋比例大致各半。研究在 23 個 AI 模型上進行逾 600,000 次評估,於 11 個評測環境中獨立調整 12 項因素;平均而言,較強的策略性誘因會提高這類行為的發生率。研究亦指出,如何解釋這些行為及判斷其與現實風險的關聯,仍有未解問題。
英國 AI Security Institute 與 Anthropic 合作評估 Claude Mythos Preview 和 Opus 4.7 的預發佈版本,以及 Opus 4.6、Sonnet 4.6;測試未發現任何模型自發破壞安全研究的例子。
英國 AI Security Institute 的研究發現,將非問題式輸入改寫成問題,可降低大語言模型的迎合傾向。測試 GPT-4o、GPT-5 和 Claude Sonnet 4.5 後,研究發現兩種問題改寫策略均比直接要求模型不要迎合更有效,兩步改寫效果最明顯。對同一主張,問題輸入的迎合評分接近零,較非問題輸入低 24 個百分點。
英國 AI Security Institute 評估中,GPT-5.5 的 Expert 級進階任務平均通過率為 71.4%,高於 Mythos Preview 的 68.6%。
推薦理由:報告分別測試進階網絡任務、企業攻擊鏈及工控模擬,並交代結果與測試限制,呈現 GPT-5.5 網絡安全能力的不同面向。
英國 AI Security Institute 的報告指出,現有 AI 監督所依賴的基礎可能逐漸削弱,而新興方法尚未成熟到足以彌補。報告梳理內部激活、思維鏈、外部行動及智能體間通訊四類監督面向,並列出二十多條監督能力退化路徑。開發者可採取措施維持現有監督渠道,並投資新興技術,作為監督能力退化時的後備方案。
英國 AI Security Institute 發佈 AISI Engineering Playbook,整理其評估前沿 AI 系統時建立的方法與實踐。手冊將評估所需基建分為 Evaluate、Isolate、Connect、Run 和 Scale 五層,並提供技術介紹及現有開源程式碼連結。研究人員可採用個別組件,機構亦可參照五層架構建立自己的評估平台。
英國 AI Security Institute 的 Science of Evaluation 團隊發現,固定計算預算會低估前沿 AI 智能體在多項基準上的能力,尤其是較新的模型。
小米 MiMo 的人文與社會科學能力評估顯示,它在創意寫作與藝術感知方面表現較均衡,兼顧邏輯結構與情感表達。評估由 9 名評估者比較 MiMo 與兩個對照模型,創意寫作共設計 40 項任務,涵蓋現代詩、古典詩詞及敍事小説。MiMo 能按文類調整創作側重,但遵守古典詩詞格律及運用相關知識方面仍不穩定。
Anthropic 推出 $5 million 資助計劃,支持獨立研究 AI 對用戶身心健康的影響,並建立開源評估。受資助團隊可獲直接資助、Anthropic 模型使用權及技術支援,須獨立開展研究並以開源項目形式發布成果。評估指引涵蓋多輪對話中的風險變化、過度配合與過度拒絕,並要求臨牀及相關專家參與設計和驗證;申請須於 9 月 21 日前提交,獲選提交完整方案者將於 10 月 5 日前獲通知。
Anthropic 宣佈透過 Claude team plan for scientists,向全球科學家提供 10,000 個為期一年的免費或優惠訂閲名額。標準席位免費,Premium 席位每月 $15,提供 5x 使用上限;Anthropic 計劃在未來數月把名額擴至首批 10,000 個以外。
研究顯示,固定基礎模型回答開頭的特定 token 線索,可令其在數學及編碼任務上取得媲美 RL 訓練模型的表現。例如,指定線索令 Olmo-3-7B 在 MATH-500 的 pass@1 準確率由 42% 升至 78%,而 Qwen3-14B 則由 72% 升至 87%。
RealtimeWAM 透過一步動作生成與非同步推理,提升世界動作模型(WAM)的推理效率。其提出 Teacher-Anchored Consistency Distillation(TACD)及 Cross-Expert Wavefront Pipelining(CEWP),分別減少動作生成的多步迭代與影片、動作專家之間的等待。