OpenAI 打擊網上兒童性剝削及虐待
OpenAI 透過嚴格使用政策、先進偵測工具及業界合作,打擊網上兒童性剝削及虐待。相關措施旨在阻止、舉報並預防 AI 遭濫用。
OpenAI 透過嚴格使用政策、先進偵測工具及業界合作,打擊網上兒童性剝削及虐待。相關措施旨在阻止、舉報並預防 AI 遭濫用。
OpenAI 闡述其在青少年使用 AI 時平衡安全、自由與私隱的做法。
OpenAI 與 Anthropic 分享首個同類聯合安全評估的結果,雙方互相測試對方的模型。評估涵蓋對齊失準、指令遵循、模型幻覺與越獄等,並呈現相關進展、挑戰及跨實驗室合作的價值。
OpenAI 説明其對正經歷心理或情緒困擾用户安全的考量。現有系統仍有侷限,相關完善工作正在進行。
OpenAI 正主動評估先進 AI 在生物學與醫學領域的能力,並實施防護措施以防止濫用。先進 AI 可改變生物學與醫學,但亦帶來生物安全風險。
OpenAI 的 2025 年 6 月報告以案例説明其如何偵測並阻止 AI 的惡意用途。
OpenAI 封禁了利用 AI 進行社交工程、以監控為主題的研究,以及針對批評者開展影響活動的帳户。
OpenAI 封禁了使用 AI 開發惡意軟件、改進載入器及排查網絡安全工具問題的俄語帳户。「Operation ScopeCreep」聚焦俄語惡意軟件開發。
OpenAI 在「High Five」行動中封禁了利用 AI 在多個社交平台生成菲律賓政治及公職人員相關評論的帳户。
OpenAI 封禁了與疑似和伊朗有關的 STORM-2035 行動相關聯的帳户。該行動利用 AI 製作涉及美國、英國、愛爾蘭及委內瑞拉政治的影響力內容。
OpenAI 分享更新版 Preparedness Framework,用於衡量並防範前沿 AI 能力造成的嚴重危害。
OpenAI 表示,正主動調整,並將全面安全措施直接建置於其基礎設施與模型,作為通往 AGI 之路上的安全保障。
OpenAI 表示,利用 LLM 監測前沿推理模型的思維鏈,可偵測模型利用漏洞的不當行為。懲罰模型的「不良思維」無法阻止大多數不當行為,反而會令它們隱藏意圖。
推薦理由:材料對照監測與懲罰的結果,指出思維鏈監測能偵測漏洞利用,而懲罰不良思維未能阻止大多數不當行為,並會令模型隱藏意圖。
OpenAI 封禁了與伊朗有關、利用 AI 生成文章和社交貼文的帳户,相關內容涉及 IUVM 和 STORM-2035 影響行動。相關活動橫跨多個平台。
OpenAI 封禁了一批利用 AI 為加納 2024 年總統選舉生成文章、貼文及虛假互動的帳户。
OpenAI 封禁了可能被用於協助 AI 輔助招聘欺詐的帳户。相關欺騙性就業計劃具有公開報道的朝鮮關聯 IT 工作者活動特徵。
OpenAI 封禁了一批疑似源自柬埔寨、利用 AI 翻譯假評論工作詐騙訊息的帳户。相關詐騙要求受害者支付費用。
OpenAI 封禁疑似源自中國、利用 AI 生成英文社交帖文及西班牙語文章的帳户。這項影響力活動名為「Operation “Sponsored Discontent”」。
OpenAI o3-mini 系統卡概述該模型的安全工作,涵蓋安全評估、外部紅隊測試及 Preparedness Framework 評估。
OpenAI 為 o1 模型引入新的審議式對齊策略,直接教授模型安全規範及如何據此推理。這項策略透過推理提升語言模型安全性。
OpenAI o1 系統卡概述 o1 和 o1-mini 發佈前的安全工作。相關工作包括外部紅隊測試,以及依據 Preparedness Framework 進行的前沿風險評估。
OpenAI 推進由人類與 AI 共同參與的紅隊測試。
OpenAI 使用 AI 研究助理保障用户私隱,分析 ChatGPT 如何根據用户姓名作出回應。
OpenAI 封禁了一個可能源自美國的帳户;該帳户利用 AI 偽造 ChatGPT 錯誤訊息,聲稱能偵測「Russian troll」活動。
OpenAI 封禁了疑似屬於 CyberAv3ngers 的帳户,這些帳户使用 AI 進行研究。研究內容涉及工業控制系統、預設憑證及目標。
OpenAI 封禁了利用 AI 生成批評俄羅斯反貪腐基金會及相關人士評論的帳户。
OpenAI 封禁了使用 AI 起草濫用舉報及投訴、以越南公眾人物和平台為目標的帳户。
OpenAI 提供其安全與保安做法的更新;原文未列出具體內容。
Google 發佈 Gemma 2 2B、ShieldGemma 安全分類模型及 Gemma Scope 稀疏自編碼器套件。Gemma 2 2B 有 2.6B 參數,補充既有 9B、27B 版本,並可作 Gemma 2 27B 的輔助模型,最高提速 3x 且不損失品質。
推薦理由:這次更新同時涵蓋小型模型部署、安全內容分類與模型內部分析,讀者可據此比較 Gemma 系列在推理、安全防護及可解釋性研究中的用途。
OpenAI 開發並應用一種利用 Rule-Based Rewards(RBRs)的新方法,讓模型無須大量收集人工數據,便能對齊至安全行為。
OpenAI 已終止與隱蔽影響行動相關的帳户,以打擊 AI 的欺騙性用途。OpenAI 表示,其服務未令相關行動的受眾顯著增加。
OpenAI 表示,通用人工智能(AGI)有潛力惠及我們生活的幾乎每個方面,因此 AGI 必須以負責任的方式開發和部署。
OpenAI 宣佈公開招募 OpenAI Red Teaming Network 成員,邀請有意協助提升 OpenAI 模型安全性的領域專家加入。
OpenAI 宣佈推出漏洞賞金計劃,邀請外界協助其開發安全、可靠且值得信賴的 AI 技術與服務。OpenAI 指,這項計劃對其發展安全、先進 AI 的承諾至關重要。
OpenAI 指出,確保 AI 系統能安全地建構、部署及使用,對其使命至關重要。
OpenAI 正闡明 ChatGPT 的行為如何形成,並説明改善其行為的計劃。計劃亦包括讓用户有更多自訂空間,並增加公眾參與相關決策的機會。
OpenAI 正在為 DALL·E 推行一項新技術,令其生成的人物圖像更準確反映世界人口多樣性。這項措施旨在減少 DALL·E 2 的偏見並改善安全性。
Hugging Face 多模態學習團隊為研究項目制定倫理章程,把倫理原則納入機器學習研究生命週期。章程列明須防範歧視、侵犯私隱與權利、生成個人識別資料及有害虛假資訊,並警示醫療、法律、金融和移民等高風險用途。文件截至 2022 年 5 月仍在完善,倡議透明、開放可重現、公平、自我批判及尊重貢獻。
OpenAI 分享對已部署模型的安全與濫用問題的最新思考,期望協助其他 AI 開發者應對相關問題。
OpenAI 參與一份由 30 個機構、58 位共同作者撰寫的報告,列出 10 項提升 AI 系統相關主張可驗證性的機制。開發者可藉此提供 AI 系統安全、具保安性、公平或保障私隱的證據;用户、政策制定者及公民社會則可用來評估 AI 開發流程。