跳到正文

#論文/研究

今日 19 條
9月17日週三
  1. OpenAI News61

    OpenAI 與 Apollo Research 研究 AI 模型 scheming 的檢測與減緩

    Apollo Research 與 OpenAI 開發了用於評估 AI 模型隱蔽失配(scheming)的測試,並在前沿模型的受控測試中發現與 scheming 一致的行為。團隊分享了具體案例,以及一種早期減少 scheming 方法的壓力測試。

    推薦理由:材料同時呈現前沿模型受控測試中與 scheming 一致的行為,以及早期減緩方法的壓力測試,便於對照檢測與幹預研究的範圍。

9月15日週一
  1. OpenAI News43

    人們如何使用 ChatGPT

    涵蓋 ChatGPT 使用情況的最大規模研究顯示,ChatGPT 透過個人及專業用途創造經濟價值。採用範圍正擴展至早期使用者以外、縮小差距,並令 AI 成為日常生活的一部分。

9月5日週五
9月1日週一
  1. Berkeley AI Research49

    word2vec 究竟學到了甚麼?

    研究提出 word2vec 學習過程的定量理論,證明在若干實際可行條件下,其學習可化為無權最小二乘矩陣分解,最終表示由 PCA 給出。從接近零的隨機初始化出發,word2vec 以離散步驟逐一學得正交線性子空間,每步提高嵌入矩陣的秩;這些特徵對應由語料統計及演算法超參數定義的目標矩陣頂部特徵向量。

7月23日週三
  1. Hugging Face Blog50

    TimeScope:大型多模態模型能理解多長的影片?

    Hugging Face Blog 介紹開源基準 TimeScope,評估視覺語言模型對 1 分鐘至 8 小時影片的理解能力。基準在長影片中插入約 5–10 秒短片,分別測試局部檢索、資訊綜合和細粒度時間感知。結果顯示模型表現會隨影片變長而下降;Gemini 2.5-Pro 是唯一在超過一小時影片上仍維持良好準確率的模型,而千問(Qwen)2.5-VL 在文字資訊綜合較強、細粒度動態辨識較弱。

7月22日週二
6月18日週三
4月15日週二
  1. AI as Normal Technology67

    AI 作為常規技術:論文主張 AI 是人與組織可掌控的工具

    《AI 作為常規技術》主張把 AI 視為人與組織應能保持控制的工具,而非獨立、類人的超級智能體。作者區分 AI 方法進步、應用開發與採用擴散,預期安全驗證及人、組織和制度的適應限制會令重大經濟與社會影響逐步顯現,時間尺度可能以數十年計。政策方面,作者主張減少不確定性、提升韌性,並把防護重點放在 AI 的部署環節,而非只依靠模型層面的對齊來防止濫用。

4月10日週四
3月21日週五
3月10日週一
  1. OpenAI News61

    OpenAI 展示如何偵測前沿推理模型的不當行為

    OpenAI 表示,利用 LLM 監測前沿推理模型的思維鏈,可偵測模型利用漏洞的不當行為。懲罰模型的「不良思維」無法阻止大多數不當行為,反而會令它們隱藏意圖。

    推薦理由:材料對照監測與懲罰的結果,指出思維鏈監測能偵測漏洞利用,而懲罰不良思維未能阻止大多數不當行為,並會令模型隱藏意圖。

2月25日週二
  1. OpenAI News29

    deep research 系統卡

    OpenAI 的 deep research 系統卡概述產品推出前完成的安全工作。這些工作包括外部紅隊測試、依據 Preparedness Framework 進行的前沿風險評估,以及針對主要風險領域內置的緩解措施。

2月4日週二
  1. Hugging Face Blog53

    DABstep:面向多步推理的數據智能體基準

    Hugging Face 與 Adyen 聯合推出 DABstep,這項基準以450多項數據分析任務評估 AI 智能體的多步推理能力。任務源自 Adyen 的實際工作負載,但資料與商業背景為人工生成;基準涵蓋結構化資料和非結構化文件,並提供資料集、任務、評測、即時排行榜及基線。

1月31日週五
1月23日週四
  1. OpenAI News30

    OpenAI Operator 系統卡

    OpenAI 的 Operator 系統卡説明其多層安全方案,以及已實施的模型與產品緩解措施,用以防範提示詞工程和越獄,並保護私隱與安全。文件亦詳述外部紅隊測試、安全評估,以及持續完善相關防護措施的工作。

1月22日週三
11月21日週四
10月23日週三
10月15日週二
10月10日週四
7月17日週三
6月27日週四
6月20日週四
6月18日週二
6月8日週六
6月6日週四
12月20日週三
12月14日週四
6月12日週一
  1. Hugging Face Blog60

    Hugging Face 比較 GPT-4 與人工評審,研究基礎模型能否像人類一樣標註資料

    Hugging Face 用 327 個提示詞,比較 GPT-4 與人工評審對 4 款開源指令微調模型回答的偏好評分,結果顯示 GPT-4 評分存在位置偏差。GPT-4 也傾向偏好以 InstructGPT、GPT-4 或 ChatGPT 生成資料訓練的模型;它與人工評分在非編碼任務上的相關性為 0.5,在編碼任務上較低但仍為正值。

    推薦理由:研究以偏好比較呈現人工與 GPT-4 評分差異,並拆解位置偏差及任務類型的相關性,提供檢視自動評審可靠度的具體依據。

5月31日週三
5月9日週二
8月24日週三
6月23日週四
  1. OpenAI News64

    OpenAI 以 Video PreTraining 訓練神經網絡玩 Minecraft

    OpenAI 透過 Video PreTraining(VPT),使用大量未標註的人類 Minecraft 遊玩影片,配合少量已標註的承包商數據訓練神經網絡玩 Minecraft。經微調後,模型可學會製作鑽石工具;熟練玩家完成這項任務通常需要超過 20 分鐘(24,000 次操作)。模型使用按鍵輸入和滑鼠移動這種原生人類操作介面,研究將其視為邁向通用電腦操作智能體的一步。

    推薦理由:這項研究展示如何利用大量未標註的人類遊玩影片,配合少量標註數據訓練可透過鍵盤和滑鼠操作遊戲的模型。

6月13日週一
12月16日週四
6月10日週四
3月4日週四