跳到正文
Google Research·· 3 小時前精選AI 評分65

Google Research 探討 AI 輔助提升工作表現能否培養律師專業判斷

Does better work always mean better workers?

AI 導讀

Google Research 團隊在一項刊於 NBER 的研究中,對 11 間知識產權律師事務所的 133 名律師進行為期三個月的現場實驗,評估 AI 專利撰寫助手對工作表現及專業判斷的影響。

推薦理由

研究把 AI 輔助下的專利撰寫表現,與撤除工具後的無輔助審閲能力分開測量,並比較初級及資深律師的差異,呈現即時增益與專業判斷培養的落差。

正文 · 繁體中文

判斷力正是資深專業人士有別於資歷較淺同儕之處。培養判斷力需要數千小時的在職學習,通常是透過參與相對例行、繁瑣但有助成長的工作來累積,而且往往會在經驗豐富的從業員指導下進行。然而,AI 已在改變在職學習的運作方式。一方面,放射科、商業問題解決、求職者的寫作和法律教育方面的實證研究顯示,若能審慎地將 AI 工具融入培訓流程,資歷較淺的從業員便能提升獨立工作表現。

另一方面,近期針對軟件工程師、管理顧問、高中生和臨牀醫護人員進行的實驗顯示,AI 雖然能暫時充當外骨骼,提升即時產出,但工具一旦撤除,這些提升往往無法持續。要了解 AI 如何削弱或提升專業能力,需要具備三項鮮少同時出現的條件:(1) 在日常專業工作中持續使用 AI 數月,而非數小時;(2) 在無法使用 AI 時,可信地評估用戶不依賴 AI 的判斷力;以及 (3) 由領域專家進行盲評。

在由National Bureau of Economic Research發表的研究「AI 輔助會提升還是削弱專業能力?來自一項為期三個月的專利撰寫田野實驗的證據」中,我們介紹了一項田野實驗,用以瞭解在高度倚重專業知識的知識產權法律行業中,使用 AI 如何影響短期生產力和長期技能培養。我們在十一間與 Google 有定期、非獨家業務往來的知識產權律師事務所,為 133 名律師隨機分配一款當時尚未發布的 Google Labs AI 專利撰寫助手工具的使用權;該工具現已成為 Gemini Notebook 的一部分。每間事務所三分之二的律師(「實驗組」)獲提前使用該工具的權限,其餘律師(「對照組」)則接受了一些 AI 使用培訓,但在為期三個月的研究期結束前不得使用該工具。

更好地與 AI 協作

使用 AI 協助 10 天後,我們向所有參與研究的律師發送一套由發明人提供、關於某項假設發明的資料,並要求他們撰寫專利文件。第 90 天時,我們以另一套模擬的發明人資料重複同一安排。在這兩個時間點,專利撰寫任務的表現均如預期般因 AI 而提升。第 10 天時,獲準使用 AI 工具令撰寫分數提高 0.34 個標準差;分數由獨立法律專家根據評分準則評定,當中以李克特量表評估五個不同的品質方面。這相當於在對照組分數的百分位排名中上升 10 點;至第 90 天,增幅升至 0.38 個標準差,相當於百分位排名上升 11 點。所有品質方面的提升都非常一致。值得注意的是,表現提升源於低分出現頻率下降、良好分數出現頻率上升,而優秀分數的出現頻率則沒有變化。具體而言,獲分配 AI 使用權的律師,其分數由最低五分位組轉移至中低及中間五分位組,但特別出色的分數數目並無明顯變化。初級律師的情況尤其明顯:他們的品質提升也伴隨顯著的時間節省(例如,在第 10 天的任務中,他們比對照組平均用時 124 分鐘快 18 分鐘)。

但專利律師的工作不止是撰寫專利;他們也會審核彼此的工作,找出可能令專利在法庭上無法強制執行的嚴重錯誤(有時稱為「專利褻瀆」),例如對發明的新穎性或範圍作出過度主張。因此,我們在第 90 天增加另一項任務,要求受試者修訂一份已有的假設專利文件(即手動標示並更正文件內容);該文件包含許多實質及文體方面的錯誤。這項測試任務反映資深律師日常運用的專業判斷;在這類工作中,他們通常沒有條件依賴 AI。重要的是,雖然實驗組律師獲鼓勵在撰寫任務中使用尚未公開的 AI 工具或任何其他 AI 工具,但所有人均不得在修訂任務中使用 AI,因此這項任務的分數可衡量他們的技能提升程度。在所有任務中,無論是撰寫還是修訂,我們都與第三方專利專業人士合作,按五個品質方面為提交作品評分:(1)可強制執行性、(2)準確性、(3)策略性模糊(即策略性界定專利權利要求的範圍)、(4)完整性,以及(5)清晰度。

AI 不再可用時

在第 90 天的修訂任務中,AI 助手不再可用,拉平差距的效果也隨之消失。在這項沒有 AI 協助的任務中,獲準使用 AI 工具的律師得分比對照組高出 0.32 個標準差(相當於百分位排名上升 9 點);但這項效果完全由資深律師帶動,他們的得分比對照組受試者高出 0.45 個標準差(相當於百分位排名上升 13 點),初級律師則沒有明顯改善。相反,初級律師的分數分佈出現兩極化:極低分增加、中等分減少、良好分增加,而優秀分則沒有增加。

這些結果對學習有甚麼啟示?獲準使用 AI 工具的資深人員,在過去三個月使用工具的過程中,明顯在專業判斷方面獲益甚多。不過,初級人員的情況則較為複雜。部分分數有所提升,顯示 AI 或能讓人跳級學習。另一些分數則出現在分佈較低的位置,顯示在某些情況下,AI 可以協助初級人員交出合格的工作;但他們在機器輔助下取得的較佳表現,並未轉化為更快掌握專業知識,而這些專業知識正是資深專業人士具備獨特價值的原因。

分析不同經驗水平的專業人士如何修改內容,有助瞭解他們如何運用生成式 AI 工具。在實驗組和對照組中,初級人員的提交內容都顯得拘泥於僵化的形式:他們由上而下逐項處理,往往花盡時間校訂影響較小的引言部分,還未處理主要專利權利要求便已用完時間。他們亦只着眼於表面上的同義詞替換,而沒有改善商業涵蓋範圍。即使初級人員發現了嚴重缺陷,也往往只留下描述性註釋指出問題,卻沒有直接作出修訂來修正缺陷。未獲協助的對照組初級人員同樣常見這種「只診斷、不執行」的做法,因此這反映的是初級人員原有的不足;即使他們依賴 AI 執行改寫三個月,這項不足仍未得到改善。

相比之下,接觸過 AI 的資深律師一貫受益。實驗組的資深律師比初級人員花更多時間修改文本,跳過影響較小的文字,從頭重寫權利要求,刪去可能無意中縮窄法律權利或限制保護範圍的措辭,並在不少修訂中明確指出相關法律原則。在後續訪談中,資深律師表示,他們並不把 AI 產出視為完成品,而是當作「邏輯審核員」。這減弱了他們對既有文字的依戀,並促使他們説明作出結構性修訂的原因和方式,從而啟動並磨礪他們的基礎專業知識。

後續方向

提升表現與培養持久的專業判斷力是不同目標。對初級專業人士而言,兩者尤其可能互相牴觸。基礎專業知識或許是缺失的一環,能讓 AI 輔助的反覆練習在職業生涯中轉化為成熟的專業判斷力。即使模型能力不斷提升,這種判斷力很可能仍然重要:律師在與法官、客戶及同事互動時,仍會運用自己的判斷力。他們並非在所有情況下都能依賴 AI 工具提供協助。當前 AI 發展階段的一項重要挑戰,是確保旨在提升今日工作成果的工具,不會妨礙初級專業人士成為我們明日所需的專家。

研究人員要在專業人士的工作環境中進行研究並不容易。我們的實驗只納入有限數量的專利律師,這反映出該領域頂尖專業人士的每小時收費高昂。我們只觀察他們三個月;相較於他們培養持久專業能力所需的多年時間,這段期間十分短暫。此外,過去一年模型能力和人們對 AI 的基本熟悉程度迅速提升(以及 AI 支援產品在法律領域的普及程度不斷增加),如果我們現在重新進行試驗,這些變化可能會影響結果。這些限制也帶來進一步研究的機會,其中一些方向是我們希望在未來數月跟進的。儘管如此,我們的研究帶來一項明確啟示:要了解 AI 協助對專業技能的影響,測試必須把使用工具帶來的影響,與用戶在沒有協助下的表現所帶來的影響分開評估。

致謝

衷心感謝共同作者 Josh Martin、Zanna Iscenko、Scott Strand、David Pearl 和 Melissa Ferere;以及 James Manyika、Ruth Porat、Kent Walker、Josh Woodward、Anu Madgavkar、Daniel Rock 和 Fabien Curto Millet 提供指導和支持;感謝 Google Labs 的 Tom Shane、Mauricio Carneiro、Johnny Jacobs、Victor Lavrenko、Yinghao Sun、Samuel Yang、Daniel Nishi、Eric Wang、Kevin Li、Hao Zheng 和 Franz Och 與我們合作進行這項實驗;感謝 Kiera Russell 提供產品使用權限及可信測試者支援;感謝 Steve Gong 和 Taylor Montgomery 提供法律指導及招募支援;並感謝我們在傳訊、市場推廣及研究網誌方面的合作夥伴,包括 Kerry McHugh、Zoe Ortiz、Emily Short、Joseph Mack、Esmeralda Cardenas 和 Leanne Trujillo,協助推動這次發布。

來源:Google Research · research.google