跳到正文

全部動態

今日 87 條
11月25日週二
  1. Google DeepMind72

    AlphaFold 助研究人員解析心臟病關鍵蛋白 apoB100 的結構

    密蘇裏大學研究人員結合 AlphaFold 預測與冷凍電子顯微鏡(cryo-EM)影像,解析了構成「壞膽固醇」低密度脂蛋白(LDL)的關鍵蛋白 apoB100 結構。

    推薦理由:這項工作展示了 AlphaFold 的原子級結構預測如何與冷凍電鏡影像互補,協助研究人員解析 apoB100 結構,並為研究 LDL 與 ASCVD 提供結構依據。

11月19日週三
  1. OpenAI News32

    GPT-5.1-Codex-Max 系統卡

    這份系統卡列明 GPT-5.1-CodexMax 已實施的全面安全措施,涵蓋模型與產品層面的防護。模型層麪包括針對有害任務及提示詞注入的專門安全訓練;產品層面則包括智能體沙盒及可配置的網絡存取。

11月13日週四
11月12日週三
11月6日週四
11月5日週三
11月4日週二
10月30日週四
10月27日週一
10月14日週二
  1. Hugging Face Blog63

    NVIDIA 發佈 Nemotron-Personas-India 印度合成人物設定數據集

    NVIDIA 發佈 Nemotron-Personas-India,一套依印度人口、地理及文化分佈合成的人物設定數據集,採用 CC BY 4.0 授權。數據集包含 21 million 個人物設定(3M 條記錄、每條 7 個設定),支援英語及以天城文、拉丁字母書寫的印地語,並有 27 個欄位和 7.7 billion tokens。

    推薦理由:數據集以印度人口、地域分佈為基礎,涵蓋英語及兩種文字形式的印地語,並採 CC BY 4.0 授權,呈現其作為區域模型訓練素材的語言覆蓋與使用條件。

10月9日週四
9月26日週五
  1. Hugging Face Blog58

    NVIDIA 發佈面向主權 AI 的日本合成數據集 Nemotron-Personas-Japan

    NVIDIA 發佈 Nemotron-Personas-Japan,一個按日本人口與勞動統計構建、以 CC BY 4.0 授權的開放合成數據集,包含 100 萬條記錄、共 600 萬個日語人物設定。每條記錄含 22 項資料,數據集約有 14 億 tokens,並涵蓋 1500 種以上職業類別。數據集不含個人可識別資訊,可用於日語模型微調、合成對話生成及偏差與公平性測試。

9月25日週四
9月22日週一
  1. Hugging Face Blog68

    Gaia2 智能體基準與 ARE 框架推出,支援複雜互動評測

    Hugging Face 推出 Gaia2 智能體基準及 Meta Agents Research Environments(ARE)框架,用於在更複雜、接近真實情境的環境中執行、除錯和評估智能體。

    推薦理由:Gaia2 將智能體評測從唯讀檢索擴展至含模糊指令、時間要求和環境故障的互動任務,ARE 記錄執行 traces,便於分析智能體在複雜情境中的失誤。

9月17日週三
  1. OpenAI News61

    OpenAI 與 Apollo Research 研究 AI 模型 scheming 的檢測與減緩

    Apollo Research 與 OpenAI 開發了用於評估 AI 模型隱蔽失配(scheming)的測試,並在前沿模型的受控測試中發現與 scheming 一致的行為。團隊分享了具體案例,以及一種早期減少 scheming 方法的壓力測試。

    推薦理由:材料同時呈現前沿模型受控測試中與 scheming 一致的行為,以及早期減緩方法的壓力測試,便於對照檢測與幹預研究的範圍。

9月15日週一
  1. OpenAI News43

    人們如何使用 ChatGPT

    涵蓋 ChatGPT 使用情況的最大規模研究顯示,ChatGPT 透過個人及專業用途創造經濟價值。採用範圍正擴展至早期使用者以外、縮小差距,並令 AI 成為日常生活的一部分。

9月5日週五
9月1日週一
  1. Berkeley AI Research49

    word2vec 究竟學到了甚麼?

    研究提出 word2vec 學習過程的定量理論,證明在若干實際可行條件下,其學習可化為無權最小二乘矩陣分解,最終表示由 PCA 給出。從接近零的隨機初始化出發,word2vec 以離散步驟逐一學得正交線性子空間,每步提高嵌入矩陣的秩;這些特徵對應由語料統計及演算法超參數定義的目標矩陣頂部特徵向量。

8月27日週三
7月23日週三
  1. Hugging Face Blog50

    TimeScope:大型多模態模型能理解多長的影片?

    Hugging Face Blog 介紹開源基準 TimeScope,評估視覺語言模型對 1 分鐘至 8 小時影片的理解能力。基準在長影片中插入約 5–10 秒短片,分別測試局部檢索、資訊綜合和細粒度時間感知。結果顯示模型表現會隨影片變長而下降;Gemini 2.5-Pro 是唯一在超過一小時影片上仍維持良好準確率的模型,而千問(Qwen)2.5-VL 在文字資訊綜合較強、細粒度動態辨識較弱。

7月22日週二
6月18日週三
5月12日週一
4月10日週四
4月2日週三
3月21日週五
3月10日週一
  1. OpenAI News61

    OpenAI 展示如何偵測前沿推理模型的不當行為

    OpenAI 表示,利用 LLM 監測前沿推理模型的思維鏈,可偵測模型利用漏洞的不當行為。懲罰模型的「不良思維」無法阻止大多數不當行為,反而會令它們隱藏意圖。

    推薦理由:材料對照監測與懲罰的結果,指出思維鏈監測能偵測漏洞利用,而懲罰不良思維未能阻止大多數不當行為,並會令模型隱藏意圖。

2月25日週二
  1. OpenAI News29

    deep research 系統卡

    OpenAI 的 deep research 系統卡概述產品推出前完成的安全工作。這些工作包括外部紅隊測試、依據 Preparedness Framework 進行的前沿風險評估,以及針對主要風險領域內置的緩解措施。

2月18日週二
2月4日週二
  1. Hugging Face Blog53

    DABstep:面向多步推理的數據智能體基準

    Hugging Face 與 Adyen 聯合推出 DABstep,這項基準以450多項數據分析任務評估 AI 智能體的多步推理能力。任務源自 Adyen 的實際工作負載,但資料與商業背景為人工生成;基準涵蓋結構化資料和非結構化文件,並提供資料集、任務、評測、即時排行榜及基線。

1月31日週五
1月23日週四
  1. OpenAI News30

    OpenAI Operator 系統卡

    OpenAI 的 Operator 系統卡説明其多層安全方案,以及已實施的模型與產品緩解措施,用以防範提示詞工程和越獄,並保護私隱與安全。文件亦詳述外部紅隊測試、安全評估,以及持續完善相關防護措施的工作。

1月22日週三
12月9日週一
12月5日週四
  1. OpenAI News37

    OpenAI o1 系統卡

    OpenAI o1 系統卡概述 o1 和 o1-mini 發佈前的安全工作。相關工作包括外部紅隊測試,以及依據 Preparedness Framework 進行的前沿風險評估。

11月21日週四
10月30日週三
10月23日週三