Techapple.com
AI時代

ChatGPT 對話紀錄由真人審閱 OpenAI「Project Lily」聘數百名承包人員評分

據 404 Media 報導,OpenAI 內部設有名為「Project Lily」的評分項目,由真人審閱 ChatGPT 的對話紀錄,用以評估模型回應的質素。報導指出,OpenAI 為此聘請了數百名承包人員,職位名稱是「提示審閱員」(prompt reviewers)。

重點一覽

  • OpenAI 設有代號「Project Lily」的項目,由真人審閱 ChatGPT 對話紀錄。
  • 審閱員職位稱為「提示審閱員」,報導指 OpenAI 為此聘用數百名承包人員。
  • 審閱的對話經匿名化處理,但 OpenAI 承認過濾程序可能讓部分個人資料外洩,短對話尤其明顯。
  • 交予審閱員的對話版本附有「用戶記憶摘要」,內容或用戶的提問、興趣與所在地資料。

審閱工作內容

報導指出,「提示審閱員」的工作是查看經匿名化的真實對話,判斷 ChatGPT 的回應質素,包括回應是否真正解答問題,以及文字有否過度使用「AI 腔」、說教語氣、表情符號或諂媚語調等。審閱標準亦排除擬人化表達與陳述「個人」經驗,例如 ChatGPT 可以說「我找到一些資料」,但不可以說「作為一名廚師,我喜歡這樣做」或「我明白那種感受」。

一名審閱員形容這份工作「非常機械化」,但報導提到時薪超過 50 美元。該名審閱員亦表示,審閱指引不斷改變,而且經常自相矛盾。

私隱疑慮

報導指出,相關審閱員認為大部分用戶並不知道自己的對話會由他人閱讀。這一點尤其值得關注,因為不少用戶把 ChatGPT 當作朋友或心理諮詢對象,將私密內容寫進去讓系統閱讀。報導提到,在許多對話中,用戶甚至會要求 ChatGPT 保密。

據報,交予審閱員的對話會先經過匿名化處理,審閱員不會看到用戶名稱。不過 OpenAI 向 404 Media 承認,過濾程序可能讓部分個人資料通過,在較短的對話中尤其明顯。另外,交予審閱員的對話版本據報附有一份「用戶記憶摘要」,內含用戶提問與興趣的概述、情境資料,甚至可能包括所在地。

審閱重點不在事實準確度

報導指出,Project Lily 的評分重點在於回應的語氣與質素,而非核實對話內容的事實準確度。這個安排反映模型訓練與評估的分工,風格與語氣由人工評分調整,事實層面的準確度則另有處理方式。

資料來源:Tom’s Hardware

Shadow (TechApple.com 編輯)

擁有超過10年線上內容經營經驗,參予大量科技推廣活動,熱心於和大家分享最新科技資訊。 電郵:editor@techapple.com