跳到正文

全部動態

今日 7 條
5月10日週一
5月3日週一
4月20日週二
  1. Hugging Face Blog58

    Hugging Face 解説 BERT 在 CPU 上的推理擴展(第一部分)

    Hugging Face 首篇系列文章以 BERT 為例,測試並分析 CPU 核心配置、NUMA 親和性與多模型實例如何影響推理延遲及吞吐量。結果顯示,小型及中型問題使用單一 socket 通常延遲較佳,大型問題則可利用雙 socket;多實例方案的吞吐量接近線性擴展。文中舉例,8 核實例為 0.808$/h,48 核機器則為 4.848$/h,前者成本降低 6x。

4月16日週五
  1. Hugging Face Blog63

    Hugging Face 推出 Accelerate,簡化 PyTorch 分散式訓練與混合精度支援

    Hugging Face 推出 Accelerate,PyTorch 訓練腳本加入五行程式碼後,即可支援不同分散式設定及混合精度訓練。Accelerate 提供統一 API,準備模型、最佳化器及 DataLoader,並處理裝置配置和反向傳播。

    推薦理由:Accelerate 將 PyTorch 分散式訓練及混合精度所需樣板封裝成少量 API 改動,並提供統一啟動器,呈現減少訓練腳本跨環境改動的實作方式。

3月25日週四
3月23日週二
  1. Hugging Face Blog60

    Hugging Face 與 Amazon 宣佈戰略合作,推出 Amazon SageMaker Deep Learning Containers

    Hugging Face 與 Amazon 宣佈戰略合作,推出 Hugging Face Deep Learning Containers,讓用户可在 Amazon SageMaker 訓練 Hugging Face Transformer 模型。

    推薦理由:文章展示 Hugging Face 模型在 SageMaker 的訓練接入方式,並稱 SDK 擴展可把實驗設定與執行所需時間由數天縮至數分鐘。

3月12日週五
  1. Hugging Face Blog63

    如何使用 Hugging Face Transformers 微調 Wav2Vec2 英語語音辨識模型

    Hugging Face 教學示範如何使用 Transformers 將預訓練的 Wav2Vec2 base 微調為英語自動語音辨識模型。示範使用含 5h 訓練資料的 TIMIT,並在不使用語言模型的情況下以 CTC 訓練。模型在 TIMIT 測試集的 WER 為 0.221(22.1%)。

    推薦理由:這篇教學把資料清理、詞彙表與處理器設定、音訊取樣率處理、CTC 訓練及 WER 評估串成完整流程,並以 5h 的 TIMIT 訓練資料示範英語 ASR 微調。

3月4日週四
2月9日週二
1月26日週二
1月25日週一
1月5日週二
  1. OpenAI News74

    OpenAI 推出 CLIP,以自然語言監督學習視覺概念

    OpenAI 推出神經網絡 CLIP,讓模型透過自然語言監督高效學習視覺概念。只需提供待識別的視覺類別名稱,CLIP 即可套用於任何視覺分類基準,其零樣本能力類似 GPT-2 和 GPT-3。

    推薦理由:CLIP 將自然語言監督與視覺分類連接,並以類別名稱作為套用基準的入口,呈現其零樣本使用方式。

  2. OpenAI News71

    DALL·E:根據文字生成圖像

    OpenAI 訓練了名為 DALL·E 的神經網絡,可根據文字描述生成圖像,涵蓋自然語言能表達的多種概念。

    推薦理由:材料指出 DALL·E 可按文字描述生成涵蓋多種自然語言概念的圖像,清楚交代了其輸入形式與生成範圍。

12月29日週二
9月22日週二
9月4日週五
7月9日週四
6月20日週六
6月11日週四
5月5日週二
  1. OpenAI News55

    OpenAI 發佈 AI 效率分析:ImageNet 訓練所需計算量每 16 個月減半

    OpenAI 發佈一項分析,指出自 2012 年起,達到相同 ImageNet 分類表現所需的神經網絡訓練計算量每 16 個月減半。與 2012 年相比,訓練至 AlexNet 水平所需的計算量已減少 44 倍,而 Moore’s Law 對應的成本改善為 11 倍。分析認為,對近期投入較多的 AI 任務,算法進展帶來的收益高於傳統硬件效率提升。

4月30日週四
  1. OpenAI News71

    OpenAI 發佈 Jukebox 音樂生成模型,並公開模型權重與程式碼

    OpenAI 發佈 Jukebox,這是一個能以原始音訊形式生成多種曲風及藝人風格音樂的神經網絡模型,也能生成初階演唱。OpenAI 同時公開模型權重、程式碼,以及用於探索生成樣本的工具。

    推薦理由:權重與程式碼連同樣本探索工具一併公開,讓讀者可直接接觸模型資源,並瞭解其生成涵蓋多種曲風、藝人風格及初階演唱。

4月16日週四
4月14日週二
3月1日週日
  1. Hugging Face Blog60

    如何使用 Transformers 的不同解碼方法生成文字

    Hugging Face 的 Transformers 教程以 GPT2 示範如何實作多種文字生成解碼方法。文章介紹貪心搜尋、束搜尋、temperature、Top-K 及 Top-p 採樣,説明各方法對重複、流暢度與隨機性的影響,並指出沒有一種方法適用所有開放式生成場景。

    推薦理由:文章以 GPT2 和 Transformers 範例比較貪心搜尋、Beam search 與 Top-K、Top-p 採樣,呈現各方法在生成重複、流暢度與隨機性上的取捨。

1月30日週四
12月5日週四
  1. OpenAI News66

    OpenAI 研究指出 CNN、ResNet 與 Transformer 出現雙重下降現象

    OpenAI 的研究指出,雙重下降現象會出現在 CNN、ResNet 和 Transformer 中。隨模型規模、數據量或訓練時間增加,性能會先改善、再變差,然後再次改善。這種情況常可透過謹慎的正則化避免,但其成因尚未完全理解,後續研究仍是重要方向。

    推薦理由:研究在 CNN、ResNet 與 Transformer 中觀察到雙重下降,並指出性能會隨模型規模、數據量或訓練時間增加而先升、再降、再升。

12月3日週二
11月21日週四
11月5日週二
  1. OpenAI News78

    OpenAI 發佈 GPT-2 1.5B 參數版本及程式碼、模型權重

    OpenAI 發佈 GPT-2 分階段發布的最後一版,亦是參數量 1.5B 的最大版本,並提供可協助檢測 GPT-2 模型輸出的程式碼與模型權重。雖然自 8 月起已有更大型語言模型發布,OpenAI 仍按原計劃完成分階段發布,希望將完整流程作為未來強大模型開發者的測試案例。OpenAI 亦表示持續與 AI 社羣討論負責任發布。

    推薦理由:這次發布把 GPT-2 的分階段公開流程作為後續強大模型發布的測試案例,也説明提供程式碼與權重的用途是協助檢測模型輸出。

10月15日週二
  1. OpenAI News69

    OpenAI 以神經網絡訓練機械手解魔方

    OpenAI 訓練兩個神經網絡,讓仿人機械手解開魔方。網絡完全在模擬環境中訓練,使用與 OpenAI Five 相同的強化學習程式碼,並結合新技術 Automatic Domain Randomization(ADR)。系統能應對訓練中未曾遇到的情況,例如被毛絨長頸鹿玩偶戳碰;OpenAI 指出,這展示了強化學習可用於需要前所未有靈巧度的現實世界問題。

    推薦理由:這項工作以全程模擬訓練的兩個神經網絡讓仿人機械手解魔方,並用 ADR 應對訓練中未見情況,呈現強化學習應用於實體操作的方法。

10月11日週五
9月19日週四
  1. OpenAI News70

    OpenAI 以人類偏好微調 GPT-2

    OpenAI 使用人類回饋微調 774M 參數的 GPT-2,使模型在多項任務上匹配外部人類標註者的偏好。摘要任務需 60k 個人類標註,標註者偏好整句照抄輸入,模型因此學會複製;多種風格的續寫任務則需 5k 標註。OpenAI 指出,標註者的偏好並不總與自身一致,並希望藉由讓安全技術更接近「機器與人交談」的一般任務,提取人類價值資訊。

    推薦理由:這項實驗對比摘要與續寫任務的標註需求,並呈現標註者偏好整句照抄輸入時,微調模型也會學會相同行為。

9月17日週二
  1. OpenAI News56

    OpenAI 觀察到多智能體互動中湧現工具使用

    OpenAI 觀察到,智能體在簡單的捉迷藏遊戲中逐步發展出更複雜的工具使用方式。透過在新的模擬捉迷藏環境中訓練,智能體形成了六種不同策略及反制策略,其中一些是研究者此前不知道環境能支援的。這種簡單環境中自監督下湧現的複雜性,進一步暗示多智能體共同適應未來或能產生極其複雜且智能的行為。

8月22日週四
8月20日週二
  1. OpenAI News68

    GPT-2 六個月後續:OpenAI 發佈 774 million 參數語言模型

    OpenAI 發佈 774 million 參數的 GPT-2 語言模型,接續 2 月推出的 124M 小型版及 5 月分階段發佈的 355M 中型版。OpenAI 與合作夥伴及 AI 社羣研究模型可能遭濫用及帶來社會效益。OpenAI 亦發佈開源法律協議,方便組織之間建立模型共享合作,並公佈一份關於與更廣泛 AI 研究社羣協調發表規範經驗的技術報告。

    推薦理由:從 124M、355M 到 774 million 參數模型的分階段發佈,連同模型共享協議和發表規範協調經驗,呈現 GPT-2 後續開放與社羣協作的脈絡。

7月22日週一
  1. OpenAI News88

    Microsoft 向 OpenAI 投資 $1 billion,並合作建設 AGI 平台

    Microsoft 向 OpenAI 投資 $1 billion,並合作在 Microsoft Azure 建設可擴展至 AGI 的硬件與軟件平台。雙方將共同開發新的 Azure AI 超級計算技術,Microsoft 亦會成為 OpenAI 的獨家雲端供應商。雙方還將共同進一步擴展 Microsoft Azure 支援大規模 AI 系統的能力。

    推薦理由:這項合作涵蓋投資、Azure AI 超級計算技術開發與獨家雲端供應,呈現 OpenAI 建設 AGI 平台所涉及的資金、技術與雲端合作安排。

7月10日週三
  1. OpenAI News26

    OpenAI:為何負責任的 AI 開發需要安全合作

    OpenAI 的政策研究指出,AI 業界合作制定安全規範,是促進負責任 AI 開發、確保系統安全且有益的重要條件。研究提出四項現時可用的策略:溝通風險與效益、技術協作、提高透明度,以及激勵標準。但競爭壓力可能引發集體行動問題,令 AI 公司在安全方面投入不足。

6月5日週三
5月23日週四
5月17日週五