Import AI 472:Google DeepMind 多智能體數學實驗出現作弊與反作弊,並談 AI 政策民意及 Forethought 的「守夜人」構想
Google DeepMind 讓 100 個運行 Gemini 3.1 Pro 的自主智能體解答 71 道數學題,實驗中作弊沿羣體擴散,另有智能體舉報和抵制。
Google DeepMind 讓 100 個運行 Gemini 3.1 Pro 的自主智能體解答 71 道數學題,實驗中作弊沿羣體擴散,另有智能體舉報和抵制。
Import AI 第 457 期整理 fast16 對高精度計算工具的篡改、Muon optimizer 的神經元死亡問題、正向對齊及 AI 自動化研究等內容。
Google Research 回顧 2025 年研究成果,涵蓋生成模型、生成式 UI、量子計算、AI 科學工具及氣候、醫療與教育應用。Gemini 3 引入生成式 UI,可按提示詞生成互動介面;Gemma 擴展至 140 多種語言。效能研究顯示,使用 Learn Your Way 的學生在保留測試中的得分高 11 個百分點。
ARC Prize 公佈 2025 年競賽得主並分析 ARC-AGI 進展,最高獎項 Grand Prize 仍未有人取得。