Google Research 探討 AI 輔助提升工作表現能否培養律師專業判斷
Does better work always mean better workers?
Google Research 團隊在一項刊於 NBER 的研究中,對 11 間知識產權律師事務所的 133 名律師進行為期三個月的現場實驗,評估 AI 專利撰寫助手對工作表現及專業判斷的影響。
研究把 AI 輔助下的專利撰寫表現,與撤除工具後的無輔助審閲能力分開測量,並比較初級及資深律師的差異,呈現即時增益與專業判斷培養的落差。
判斷力正是資深專業人士有別於資歷較淺同儕之處。培養判斷力需要數千小時的在職學習,通常是透過參與相對例行、繁瑣但有助成長的工作來累積,而且往往會在經驗豐富的從業員指導下進行。然而,AI 已在改變在職學習的運作方式。一方面,放射科、商業問題解決、求職者的寫作和法律教育方面的實證研究顯示,若能審慎地將 AI 工具融入培訓流程,資歷較淺的從業員便能提升獨立工作表現。
另一方面,近期針對軟件工程師、管理顧問、高中生和臨牀醫護人員進行的實驗顯示,AI 雖然能暫時充當外骨骼,提升即時產出,但工具一旦撤除,這些提升往往無法持續。要了解 AI 如何削弱或提升專業能力,需要具備三項鮮少同時出現的條件:(1) 在日常專業工作中持續使用 AI 數月,而非數小時;(2) 在無法使用 AI 時,可信地評估用戶不依賴 AI 的判斷力;以及 (3) 由領域專家進行盲評。
在由National Bureau of Economic Research發表的研究「AI 輔助會提升還是削弱專業能力?來自一項為期三個月的專利撰寫田野實驗的證據」中,我們介紹了一項田野實驗,用以瞭解在高度倚重專業知識的知識產權法律行業中,使用 AI 如何影響短期生產力和長期技能培養。我們在十一間與 Google 有定期、非獨家業務往來的知識產權律師事務所,為 133 名律師隨機分配一款當時尚未發布的 Google Labs AI 專利撰寫助手工具的使用權;該工具現已成為 Gemini Notebook 的一部分。每間事務所三分之二的律師(「實驗組」)獲提前使用該工具的權限,其餘律師(「對照組」)則接受了一些 AI 使用培訓,但在為期三個月的研究期結束前不得使用該工具。
更好地與 AI 協作
使用 AI 協助 10 天後,我們向所有參與研究的律師發送一套由發明人提供、關於某項假設發明的資料,並要求他們撰寫專利文件。第 90 天時,我們以另一套模擬的發明人資料重複同一安排。在這兩個時間點,專利撰寫任務的表現均如預期般因 AI 而提升。第 10 天時,獲準使用 AI 工具令撰寫分數提高 0.34 個標準差;分數由獨立法律專家根據評分準則評定,當中以李克特量表評估五個不同的品質方面。這相當於在對照組分數的百分位排名中上升 10 點;至第 90 天,增幅升至 0.38 個標準差,相當於百分位排名上升 11 點。所有品質方面的提升都非常一致。值得注意的是,表現提升源於低分出現頻率下降、良好分數出現頻率上升,而優秀分數的出現頻率則沒有變化。具體而言,獲分配 AI 使用權的律師,其分數由最低五分位組轉移至中低及中間五分位組,但特別出色的分數數目並無明顯變化。初級律師的情況尤其明顯:他們的品質提升也伴隨顯著的時間節省(例如,在第 10 天的任務中,他們比對照組平均用時 124 分鐘快 18 分鐘)。
但專利律師的工作不止是撰寫專利;他們也會審核彼此的工作,找出可能令專利在法庭上無法強制執行的嚴重錯誤(有時稱為「專利褻瀆」),例如對發明的新穎性或範圍作出過度主張。因此,我們在第 90 天增加另一項任務,要求受試者修訂一份已有的假設專利文件(即手動標示並更正文件內容);該文件包含許多實質及文體方面的錯誤。這項測試任務反映資深律師日常運用的專業判斷;在這類工作中,他們通常沒有條件依賴 AI。重要的是,雖然實驗組律師獲鼓勵在撰寫任務中使用尚未公開的 AI 工具或任何其他 AI 工具,但所有人均不得在修訂任務中使用 AI,因此這項任務的分數可衡量他們的技能提升程度。在所有任務中,無論是撰寫還是修訂,我們都與第三方專利專業人士合作,按五個品質方面為提交作品評分:(1)可強制執行性、(2)準確性、(3)策略性模糊(即策略性界定專利權利要求的範圍)、(4)完整性,以及(5)清晰度。
AI 不再可用時
在第 90 天的修訂任務中,AI 助手不再可用,拉平差距的效果也隨之消失。在這項沒有 AI 協助的任務中,獲準使用 AI 工具的律師得分比對照組高出 0.32 個標準差(相當於百分位排名上升 9 點);但這項效果完全由資深律師帶動,他們的得分比對照組受試者高出 0.45 個標準差(相當於百分位排名上升 13 點),初級律師則沒有明顯改善。相反,初級律師的分數分佈出現兩極化:極低分增加、中等分減少、良好分增加,而優秀分則沒有增加。
這些結果對學習有甚麼啟示?獲準使用 AI 工具的資深人員,在過去三個月使用工具的過程中,明顯在專業判斷方面獲益甚多。不過,初級人員的情況則較為複雜。部分分數有所提升,顯示 AI 或能讓人跳級學習。另一些分數則出現在分佈較低的位置,顯示在某些情況下,AI 可以協助初級人員交出合格的工作;但他們在機器輔助下取得的較佳表現,並未轉化為更快掌握專業知識,而這些專業知識正是資深專業人士具備獨特價值的原因。
分析不同經驗水平的專業人士如何修改內容,有助瞭解他們如何運用生成式 AI 工具。在實驗組和對照組中,初級人員的提交內容都顯得拘泥於僵化的形式:他們由上而下逐項處理,往往花盡時間校訂影響較小的引言部分,還未處理主要專利權利要求便已用完時間。他們亦只着眼於表面上的同義詞替換,而沒有改善商業涵蓋範圍。即使初級人員發現了嚴重缺陷,也往往只留下描述性註釋指出問題,卻沒有直接作出修訂來修正缺陷。未獲協助的對照組初級人員同樣常見這種「只診斷、不執行」的做法,因此這反映的是初級人員原有的不足;即使他們依賴 AI 執行改寫三個月,這項不足仍未得到改善。
相比之下,接觸過 AI 的資深律師一貫受益。實驗組的資深律師比初級人員花更多時間修改文本,跳過影響較小的文字,從頭重寫權利要求,刪去可能無意中縮窄法律權利或限制保護範圍的措辭,並在不少修訂中明確指出相關法律原則。在後續訪談中,資深律師表示,他們並不把 AI 產出視為完成品,而是當作「邏輯審核員」。這減弱了他們對既有文字的依戀,並促使他們説明作出結構性修訂的原因和方式,從而啟動並磨礪他們的基礎專業知識。
後續方向
提升表現與培養持久的專業判斷力是不同目標。對初級專業人士而言,兩者尤其可能互相牴觸。基礎專業知識或許是缺失的一環,能讓 AI 輔助的反覆練習在職業生涯中轉化為成熟的專業判斷力。即使模型能力不斷提升,這種判斷力很可能仍然重要:律師在與法官、客戶及同事互動時,仍會運用自己的判斷力。他們並非在所有情況下都能依賴 AI 工具提供協助。當前 AI 發展階段的一項重要挑戰,是確保旨在提升今日工作成果的工具,不會妨礙初級專業人士成為我們明日所需的專家。
研究人員要在專業人士的工作環境中進行研究並不容易。我們的實驗只納入有限數量的專利律師,這反映出該領域頂尖專業人士的每小時收費高昂。我們只觀察他們三個月;相較於他們培養持久專業能力所需的多年時間,這段期間十分短暫。此外,過去一年模型能力和人們對 AI 的基本熟悉程度迅速提升(以及 AI 支援產品在法律領域的普及程度不斷增加),如果我們現在重新進行試驗,這些變化可能會影響結果。這些限制也帶來進一步研究的機會,其中一些方向是我們希望在未來數月跟進的。儘管如此,我們的研究帶來一項明確啟示:要了解 AI 協助對專業技能的影響,測試必須把使用工具帶來的影響,與用戶在沒有協助下的表現所帶來的影響分開評估。
致謝
衷心感謝共同作者 Josh Martin、Zanna Iscenko、Scott Strand、David Pearl 和 Melissa Ferere;以及 James Manyika、Ruth Porat、Kent Walker、Josh Woodward、Anu Madgavkar、Daniel Rock 和 Fabien Curto Millet 提供指導和支持;感謝 Google Labs 的 Tom Shane、Mauricio Carneiro、Johnny Jacobs、Victor Lavrenko、Yinghao Sun、Samuel Yang、Daniel Nishi、Eric Wang、Kevin Li、Hao Zheng 和 Franz Och 與我們合作進行這項實驗;感謝 Kiera Russell 提供產品使用權限及可信測試者支援;感謝 Steve Gong 和 Taylor Montgomery 提供法律指導及招募支援;並感謝我們在傳訊、市場推廣及研究網誌方面的合作夥伴,包括 Kerry McHugh、Zoe Ortiz、Emily Short、Joseph Mack、Esmeralda Cardenas 和 Leanne Trujillo,協助推動這次發布。
來源:Google Research · research.google