《華盛頓郵報》與 OpenAI 合作,將新聞內容接入 ChatGPT
《華盛頓郵報》與 OpenAI 合作,將新聞內容整合至 ChatGPT。用户可在 ChatGPT 中獲得相關內容的摘要、引文,以及指向原始報道的直接連結。
《華盛頓郵報》與 OpenAI 合作,將新聞內容整合至 ChatGPT。用户可在 ChatGPT 中獲得相關內容的摘要、引文,以及指向原始報道的直接連結。
BrowseComp 是一項面向瀏覽智能體的基準測試。
Booking.com 整合自身數據系統與 OpenAI 的大語言模型,提供更智能的搜尋、更快捷的支援,以及以意圖為導向的旅遊體驗。
Hugging Face Blog 公開兩款靜態嵌入模型,稱其 CPU 推理比常見嵌入模型快 100 至 400 倍,且多項基準保留至少 85% 表現。
推薦理由:文章公開兩款模型的訓練配方與資料集,並以 NanoBEIR 結果呈現靜態嵌入模型在 CPU 速度與檢索品質間的取捨。
Mistral AI 為 le Chat 推出多項免費 beta 更新,新增網頁搜尋、Canvas、文件與圖像理解、圖像生成及智能體功能。文件與圖像理解由 Pixtral Large 與一款實驗模型支援,圖像生成則採用 Black Forest Labs 的 Flux Pro。新功能將於未來數週逐步推出。
推薦理由:網頁搜尋、Canvas、文件與圖像理解、圖像生成及可分享智能體同列免費 beta,呈現 le Chat 將對話延伸至知識工作多個環節的產品方向。
OpenAI 推出 ChatGPT search,提供快速、及時的答案,並附上相關網頁來源連結。
推薦理由:ChatGPT search 提供快速、及時的答案並附相關網頁來源連結,材料呈現了它的核心搜尋回答形式。
Hugging Face 介紹 Daily Papers 頁面的功能,包括認領論文、提交社羣推薦論文、與作者討論,以及查看相關模型、數據集和示範。過去一年,Daily Papers 收錄超過 3,700 篇論文,訂閲者超過 12k;只有已認領論文的用户可提交論文,留言支援多種語言並提供內置翻譯。用户可在評論區輸入 @librarian-bot 獲推薦相關論文,亦可訂閲每日更新(週末除外)。
Hugging Face Blog 介紹 Hugging Face Hub 上 5 項常被忽略的工具,並以 Reddit 資料展示自動更新的視覺化語義搜尋流程。
推薦理由:文章以每日更新的 Reddit 資料為例,拆解 Hugging Face Hub 五項工具如何協作,從資料抓取、嵌入向量處理與事件觸發,直到視覺化語義搜尋。
OpenAI 正測試 SearchGPT,作為全新 AI 搜尋功能的臨時原型。它提供快速、即時的答案,並附上清晰且相關的來源。
Hugging Face 宣佈為 Dataset Search 加入四項功能,支援按資料模態、行數、格式及相容 library 篩選資料集。行數可設定最低和最高值;對於 metadata 未列出行數的超大型資料集,系統會根據前 5GB 內容估算總行數。新篩選條件可與 Language、Tasks、Licenses 及文字搜尋組合使用。
Hugging Face Blog 介紹 Matryoshka Embedding 模型的訓練與使用方法,並比較向量截短後與一般嵌入模型的表現。
推薦理由:文章把 Sentence Transformers 訓練方式與 STSBenchmark 實測相連,量化向量縮至原大小 8.3% 後仍保留 98.37% 表現。
Hugging Face Blog 示範如何使用 Transformers 和 Datasets 建立影像相似度檢索系統,透過模型產生嵌入向量並按餘弦相似度排序候選影像。
作者以 Sentence Transformers 和 Gradio 構建歌單生成器,透過對歌詞嵌入向量進行語義搜索,按文字提示找出相關歌曲。由於所選模型的最大序列長度為 512 word pieces,歌曲歌詞先按 verse 切分並逐段嵌入;設置 top_k=20 時,作者實測幾乎總能得到至少 9 首不同歌曲。
這篇入門指南以 Sentence Transformers 為例,介紹初學者如何理解文本嵌入向量與語義搜尋,並規劃首個自主機器學習項目。文章建議先盤點工具能力、挑選感興趣的資料集,再配合一項熟悉的輔助工具構思項目。
Hugging Face Blog 以 Medicare FAQ 示範語義搜尋流程,使用 Inference API 生成嵌入向量,再以使用者查詢比對相似 FAQ。示範選用 sentence-transformers/all-MiniLM-L6-v2 將 13 條 FAQ 編碼為 384 維向量,並把向量資料集上載至 Hub,以餘弦相似度找出最相近的 5 條 FAQ。
🤗 datasets 教程示範為 10,000 張來自 British Library 數碼化書籍的插圖建立文字搜圖流程。作者使用 sentence_transformers 的 CLIP 將圖片和文字提示詞轉成嵌入向量,再以 FAISS 檢索相似圖片;完整數據集網址為 https://doi.org/10.21250/db17。
OpenAI 在 API 新增嵌入向量端點,支援自然語言與程式碼任務。端點可用於語義搜尋、聚類、主題建模和分類。
推薦理由:新端點涵蓋語義搜尋、聚類、主題建模與分類,呈現嵌入向量在自然語言及程式碼任務中的應用範圍。
OpenAI 微調 GPT-3,讓它透過文字式網頁瀏覽器更準確地回答開放式問題。
Hugging Face Hub 為 Sentence Transformers 推出特徵擷取與句子相似度兩款小工具,並提供 Inference API 端點供程式調用模型。Hub 收錄超過 90 個預訓練 Sentence Transformers 模型,涵蓋超過 100 種語言,使用者可直接載入使用。
推薦理由:文章梳理 Sentence Transformers 模型接入 Hugging Face Hub 的分享與使用流程,涵蓋自動生成模型卡、互動小工具及 Inference API,並交代模型在 Hub 上的展示、調用與發現方式。