評估 ChatGPT 回應的公平性
OpenAI 使用 AI 研究助理保障用户私隱,分析 ChatGPT 如何根據用户姓名作出回應。
OpenAI 使用 AI 研究助理保障用户私隱,分析 ChatGPT 如何根據用户姓名作出回應。
OpenAI 推出 MLE-bench,作為衡量 AI 智能體執行機器學習工程工作的基準,聚焦其在該領域的表現。
Hugging Face 推出 Open FinLLM Leaderboard,評估金融大語言模型在金融任務上的表現,並以 zero-shot 測試模型在未經微調任務上的泛化能力。
OpenAI 推出 SWE-bench Verified,這是經人工驗證的 SWE-bench 子集,可更可靠地評估 AI 模型解決真實世界軟件問題的能力。
OpenAI 開發並應用一種利用 Rule-Based Rewards(RBRs)的新方法,讓模型無須大量收集人工數據,便能對齊至安全行為。
Hugging Face 發佈 Docmatix 文件視覺問答數據集,包含 2.4 million 張圖片及 9.5 million 組問答,規模較先前數據集增加 240X。
Prover-Verifier Games 可提升語言模型輸出的可讀性,令 AI 解答更清晰、易於驗證,並讓人類和機器更信任這些結果。
CriticGPT 是一個基於 GPT-4 的模型,會撰寫對 ChatGPT 回應的評析,協助人類訓練員在 RLHF 過程中找出錯誤。
擴散模型大幅推進圖像、音訊和影片生成,但依賴反覆採樣流程,令生成速度較慢。
OpenAI 改進一致性模型的訓練技術。一致性模型是一類新興生成模型,無需對抗式訓練即可一步生成高質素數據。
OpenAI 提出一套面向真實世界內容審核的整體方法,旨在建立穩健且實用的自然語言分類系統,用於偵測不當內容。
BigCodeBench 團隊發布 BigCodeBench 程式碼生成基準,收錄1,140項函式級任務,涵蓋139個程式庫。基準分為 BigCodeBench-Complete 和 BigCodeBench-Instruct;GPT-4o 的 calibrated Pass@1 分別為61.1%和51.1%。團隊開源任務、測試案例、評測框架及排行榜,並提供 PyPI 安裝方式。
Artificial Analysis 推出文生圖模型排行榜與 Image Arena,以超過 45,000 次人類圖像偏好計算模型 ELO 排名。排行榜收錄 Midjourney、DALL·E、Stable Diffusion、Playground 等開源及專有模型,評測為每個模型生成超過 700 張圖像。用户可在 Image Arena 投票,投滿 30 票後查看個人化模型排名。
推薦理由:排行榜以超過 45,000 次人類圖像偏好計算 ELO,並涵蓋開源與專有模型,為比較不同文生圖模型提供同一參照。
OpenAI 從 GPT-4 的計算中自動識別出 16 million 個模式。研究使用擴展稀疏自編碼器的新技術。
Open Medical-LLM Leaderboard 為醫療大語言模型提供標準化評測平台,按多種醫療任務與資料集比較表現。平台以準確率為主要指標,涵蓋 MedQA、MedMCQA、PubMedQA 及 MMLU 的醫學與生物學子集。
LiveCodeBench Leaderboard 推出,基於 UC Berkeley、MIT 和 Cornell 研究人員開發的 LiveCodeBench 基準評估程式碼大語言模型。
Hugging Face 發佈 Cosmopedia,這套合成數據集旨在重現 Phi-1.5 的訓練數據,供大語言模型預訓練使用。
推薦理由:文章拆解 Cosmopedia 從種子資料、提示詞擴展到去污染與訓練的流程,並交代如何藉由受眾和文體變化擴大提示詞規模。
FlagOpen/TACO 是供程式碼生成模型訓練與評估的演算法題資料集,含 25,443 道訓練題及 1,000 道測試題。題目來自程式競賽,附有主題、演算法、技能及難度等細粒度標籤,可透過 Hugging Face 或 BAAI DataHub 下載,並按難度或技能篩選。
OpenAI 提出超級對齊的新研究方向,探索能否利用深度學習的泛化特性,讓弱監督者控制更強模型。這項研究亦取得初步且具前景的結果。
Hugging Face 用 327 個提示詞,比較 GPT-4 與人工評審對 4 款開源指令微調模型回答的偏好評分,結果顯示 GPT-4 評分存在位置偏差。GPT-4 也傾向偏好以 InstructGPT、GPT-4 或 ChatGPT 生成資料訓練的模型;它與人工評分在非編碼任務上的相關性為 0.5,在編碼任務上較低但仍為正值。
推薦理由:研究以偏好比較呈現人工與 GPT-4 評分差異,並拆解位置偏差及任務類型的相關性,提供檢視自動評審可靠度的具體依據。
OpenAI 表示,以獎勵正確推理步驟的過程監督訓練模型,使其數學問題求解達到新的最佳水平。相較只獎勵正確最終答案的結果監督,過程監督也能直接訓練模型產生獲人類認可的思維鏈。
OpenAI 使用 GPT-4 自動撰寫大型語言模型中神經元行為的解釋,並為這些解釋評分。OpenAI 發佈的數據集涵蓋 GPT-2 每個神經元的解釋與評分,並指出這些解釋並不完美。
MTEB 是一套評估文本嵌入模型在多種任務上表現的大型基準測試,並以排行榜彙整模型成績。該基準涵蓋 56 個數據集、8 類任務及最多 112 種語言,排行榜彙整 >2000 項結果。
推薦理由:MTEB 把 56 個數據集、8 類任務納入同一排行榜,並提供自行測試及提交結果的流程,方便按具體任務比較文本嵌入模型。
OpenAI 正提升 AI 系統從人類回饋中學習及協助人類評估 AI 的能力。其目標是建立足夠對齊的 AI 系統,讓該系統協助解決其他所有對齊問題。
OpenAI 透過 Video PreTraining(VPT),使用大量未標註的人類 Minecraft 遊玩影片,配合少量已標註的承包商數據訓練神經網絡玩 Minecraft。經微調後,模型可學會製作鑽石工具;熟練玩家完成這項任務通常需要超過 20 分鐘(24,000 次操作)。模型使用按鍵輸入和滑鼠移動這種原生人類操作介面,研究將其視為邁向通用電腦操作智能體的一步。
推薦理由:這項研究展示如何利用大量未標註的人類遊玩影片,配合少量標註數據訓練可透過鍵盤和滑鼠操作遊戲的模型。
OpenAI 訓練了能描述摘要缺陷的評註撰寫模型;人類評估者閲讀這些評註後,發現摘要缺陷的頻率大幅提高。較大型模型更善於自我評註,規模擴大對評註撰寫的提升幅度大於摘要撰寫。這顯示 AI 系統有望協助人類監督難度較高任務中的 AI 系統。
OpenAI 微調 GPT-3,讓它透過文字式網頁瀏覽器更準確地回答開放式問題。
OpenAI 最新研究發現,使用小型精選資料集進行微調,可改善語言模型在特定行為價值方面的表現。
OpenAI 發現,CLIP 中有些神經元在同一概念以字面、符號或概念方式呈現時,均會作出反應。這或可解釋 CLIP 為何能準確分類出人意料的概念視覺呈現,也有助理解 CLIP 及類似模型學到的聯想與偏見。
OpenAI 將人類反饋強化學習用於訓練語言模型,以提升模型的摘要能力。
推薦理由:這項研究把人類反饋納入摘要模型訓練,呈現以強化學習提升語言模型摘要能力的一條具體研究路徑。
OpenAI 發佈一項分析,指出自 2012 年起,達到相同 ImageNet 分類表現所需的神經網絡訓練計算量每 16 個月減半。與 2012 年相比,訓練至 AlexNet 水平所需的計算量已減少 44 倍,而 Moore’s Law 對應的成本改善為 11 倍。分析認為,對近期投入較多的 AI 任務,算法進展帶來的收益高於傳統硬件效率提升。
OpenAI 參與一份由 30 個機構、58 位共同作者撰寫的報告,列出 10 項提升 AI 系統相關主張可驗證性的機制。開發者可藉此提供 AI 系統安全、具保安性、公平或保障私隱的證據;用户、政策制定者及公民社會則可用來評估 AI 開發流程。
OpenAI 的研究指出,雙重下降現象會出現在 CNN、ResNet 和 Transformer 中。隨模型規模、數據量或訓練時間增加,性能會先改善、再變差,然後再次改善。這種情況常可透過謹慎的正則化避免,但其成因尚未完全理解,後續研究仍是重要方向。
推薦理由:研究在 CNN、ResNet 與 Transformer 中觀察到雙重下降,並指出性能會隨模型規模、數據量或訓練時間增加而先升、再降、再升。
OpenAI 發佈 Procgen Benchmark,提供 16 個易於使用的程序生成環境。該基準用於直接衡量強化學習智能體學習可泛化技能的速度。
OpenAI 推出 Safety Gym,這套環境與工具用於衡量強化學習智能體在訓練期間遵守安全約束的進展。
OpenAI 訓練兩個神經網絡,讓仿人機械手解開魔方。網絡完全在模擬環境中訓練,使用與 OpenAI Five 相同的強化學習程式碼,並結合新技術 Automatic Domain Randomization(ADR)。系統能應對訓練中未曾遇到的情況,例如被毛絨長頸鹿玩偶戳碰;OpenAI 指出,這展示了強化學習可用於需要前所未有靈巧度的現實世界問題。
推薦理由:這項工作以全程模擬訓練的兩個神經網絡讓仿人機械手解魔方,並用 ADR 應對訓練中未見情況,呈現強化學習應用於實體操作的方法。
OpenAI 使用人類回饋微調 774M 參數的 GPT-2,使模型在多項任務上匹配外部人類標註者的偏好。摘要任務需 60k 個人類標註,標註者偏好整句照抄輸入,模型因此學會複製;多種風格的續寫任務則需 5k 標註。OpenAI 指出,標註者的偏好並不總與自身一致,並希望藉由讓安全技術更接近「機器與人交談」的一般任務,提取人類價值資訊。
推薦理由:這項實驗對比摘要與續寫任務的標註需求,並呈現標註者偏好整句照抄輸入時,微調模型也會學會相同行為。
OpenAI 觀察到,智能體在簡單的捉迷藏遊戲中逐步發展出更複雜的工具使用方式。透過在新的模擬捉迷藏環境中訓練,智能體形成了六種不同策略及反制策略,其中一些是研究者此前不知道環境能支援的。這種簡單環境中自監督下湧現的複雜性,進一步暗示多智能體共同適應未來或能產生極其複雜且智能的行為。
OpenAI 開發出一種方法,用於評估神經網絡分類器能否可靠抵禦訓練期間未見的對抗攻擊。該方法提出新指標 UAR(Unforeseen Attack Robustness),評估單一模型面對未預期攻擊時的穩健性。OpenAI 指出,評估應涵蓋更多樣的未預見攻擊。
OpenAI 的政策研究指出,AI 業界合作制定安全規範,是促進負責任 AI 開發、確保系統安全且有益的重要條件。研究提出四項現時可用的策略:溝通風險與效益、技術協作、提高透明度,以及激勵標準。但競爭壓力可能引發集體行動問題,令 AI 公司在安全方面投入不足。