最新精選
第 181–194 條 · 共 194 條- Hugging Face Blog精選AI 評分6161
rinna Co., Ltd. 發佈 Japanese Stable Diffusion,這款文本生成圖像模型以日語標註圖片微調 Stable Diffusion,支援日語提示詞並生成反映日語文化圈的圖像。
推薦理由:文章拆解 Japanese Stable Diffusion 的兩階段微調流程,説明專用日語文本編碼器與聯合調整潛在擴散模型的作用,訓練數據約為 Stable Diffusion 訓練集的 1/20。
OpenAI 宣佈將其訓練的神經網絡 Whisper 開源。Whisper 在英語語音識別上的穩健性與準確度接近人類水平。
推薦理由:Whisper 的開源安排與英語語音識別表現並列,且以接近人類水平作比較,讓讀者可同時掌握模型發佈範圍與性能定位。
- Hugging Face Blog精選AI 評分8282
BLOOM 已正式發佈,這款具 176 billion parameters 的開放多語言大語言模型可生成 46 種自然語言及 13 種程式語言文本。最後一輪訓練歷時 117 days,並公開訓練中間 checkpoint 與 optimizer states,供研究者下載、運行及研究。
推薦理由:BLOOM 除模型外亦公開訓練中間 checkpoint 與 optimizer states,並提供下載及本地或雲端使用途徑,讓研究者能檢視模型行為與訓練過程。
OpenAI 發佈 GPT-3 和 Codex 新版本,讓模型可以編輯或插入既有文本內容,而非只接續文本。
推薦理由:新版本把 GPT-3 和 Codex 的操作從接續既有文本擴展到編輯或插入內容,清楚呈現兩種文本處理方式的差異。
OpenAI 表示,透過對齊研究訓練的 InstructGPT 比 GPT-3 更能遵循用户意圖,同時回答更真實、毒性更低。這些由人類參與訓練的模型已部署為 OpenAI API 的預設語言模型。
推薦理由:材料交代了 InstructGPT 相較 GPT-3 的改進方向、人類參與訓練方式及 API 預設部署,呈現對齊研究如何落到實際服務。
OpenAI 發佈改進版 Codex,這套 AI 系統可將自然語言轉換為程式碼,並自今日起透過 API 開放私人測試。
推薦理由:公告同時交代 Codex 的自然語言轉程式碼定位和 API 私人測試安排,讀者可掌握其用途與當時的接入範圍。
OpenAI 推出神經網絡 CLIP,讓模型透過自然語言監督高效學習視覺概念。只需提供待識別的視覺類別名稱,CLIP 即可套用於任何視覺分類基準,其零樣本能力類似 GPT-2 和 GPT-3。
推薦理由:CLIP 將自然語言監督與視覺分類連接,並以類別名稱作為套用基準的入口,呈現其零樣本使用方式。
OpenAI 訓練了名為 DALL·E 的神經網絡,可根據文字描述生成圖像,涵蓋自然語言能表達的多種概念。
推薦理由:材料指出 DALL·E 可按文字描述生成涵蓋多種自然語言概念的圖像,清楚交代了其輸入形式與生成範圍。
OpenAI 發佈 Jukebox,這是一個能以原始音訊形式生成多種曲風及藝人風格音樂的神經網絡模型,也能生成初階演唱。OpenAI 同時公開模型權重、程式碼,以及用於探索生成樣本的工具。
推薦理由:權重與程式碼連同樣本探索工具一併公開,讓讀者可直接接觸模型資源,並瞭解其生成涵蓋多種曲風、藝人風格及初階演唱。
OpenAI 發佈 GPT-2 分階段發布的最後一版,亦是參數量 1.5B 的最大版本,並提供可協助檢測 GPT-2 模型輸出的程式碼與模型權重。雖然自 8 月起已有更大型語言模型發布,OpenAI 仍按原計劃完成分階段發布,希望將完整流程作為未來強大模型開發者的測試案例。OpenAI 亦表示持續與 AI 社羣討論負責任發布。
推薦理由:這次發布把 GPT-2 的分階段公開流程作為後續強大模型發布的測試案例,也説明提供程式碼與權重的用途是協助檢測模型輸出。
OpenAI 發佈 774 million 參數的 GPT-2 語言模型,接續 2 月推出的 124M 小型版及 5 月分階段發佈的 355M 中型版。OpenAI 與合作夥伴及 AI 社羣研究模型可能遭濫用及帶來社會效益。OpenAI 亦發佈開源法律協議,方便組織之間建立模型共享合作,並公佈一份關於與更廣泛 AI 研究社羣協調發表規範經驗的技術報告。
推薦理由:從 124M、355M 到 774 million 參數模型的分階段發佈,連同模型共享協議和發表規範協調經驗,呈現 GPT-2 後續開放與社羣協作的脈絡。
OpenAI 創建 MuseNet,這個深度神經網絡可生成長達 4 分鐘、使用 10 種樂器的樂曲,並融合從鄉村音樂到 Mozart、The Beatles 的風格。
推薦理由:MuseNet 以數十萬個 MIDI 檔案的下一個 token 預測學習和聲、節奏與風格模式,並沿用 GPT-2 的通用無監督技術,呈現其音樂生成方法。
OpenAI 訓練出一個大型無監督語言模型,可生成連貫段落,並在多項語言建模基準上取得最先進表現。該模型無需針對特定任務訓練,亦能進行初步閲讀理解、機器翻譯、問答和摘要。
推薦理由:它把語言建模基準表現與閲讀理解、翻譯、問答和摘要能力集中在同一個無需針對特定任務訓練的模型中,呈現大型無監督語言模型的能力範圍。
OpenAI Five 是由五個神經網絡組成的團隊,已開始在 Dota 2 中擊敗業餘人類隊伍。
推薦理由:這則消息把 OpenAI Five 放在與 Dota 2 業餘人類隊伍對戰的場景中呈現,讀者可從勝負結果理解其神經網絡團隊的遊玩表現。