[激發靈感]
[2023 年 12 月 11 日]
以負責任的方式打造生成式 AI 功能

重點整理
- 我們正在我們的 AI 功能和模型中內建防護措施,並且會在完成後推出以讓用戶享有更安全且令人愉快的體驗。
- 就像所有的生成式 AI 系統一樣,模型可能會回傳不準確或不適當的輸出內容。隨著功能不斷演進以及更多用戶分享意見回饋,我們將會持續地改善這些功能。
- 我們與政府、其他公司、學術界/公民社會的 AI 專家、家長、隱私專家/倡導者和其他人士合作制定負責任的原則。
這十幾年以來,Meta 一直是發展 AI 的先驅。我們為研究人員推出了超過 1,000 個 AI 模型、資料庫和資料集,包含我們與 Microsoft 合作提供的大型語言模型 Llama 2 最新版本。
在 2023 年 Connect 大會上,我們宣佈了幾項全新生成式 AI 功能,可讓用戶用來在平台上打造社交功能更多、更身歷其境的沉浸式體驗。我們希望此類生成式 AI 工具可透過各種方式協助用戶。請想像一群朋友一起規劃旅遊:在群組聊天室中,他們可以向 AI 助理徵求活動和餐廳建議。在另一個情況中,老師可以使用 AI 來協助為各個學生的不同學習風格量身打造課程計畫。
為了打造這項技術,必得擔起制定最佳作法和政策的重責大任。雖然生成式 AI 有許多有趣且創意十足的使用案例,但並非總是完美無缺。舉例來說,基礎模型可能會產生虛構的回覆,或加劇從其訓練資料學到的刻板印象。我們將過去十年來汲取的經驗整合到新功能中,例如透過通知讓用戶瞭解生成式 AI 的限制,以及使用完整性分類器來協助找出並移除危險的回覆。我們遵循 Llama 2《負責任使用指南》中概述的業界最佳作法打造新功能。
為了維持負責任 AI 的承諾,我們也對產品進行壓力測試來提高安全性,並定期與決策者、學術界/公民社會的專家和其他業界人士合作,來進一步以負責任的方式使用這項技術。我們將會逐步推出這些功能和測試版 AI。隨著技術不斷發展和對用戶在日常生活中如何使用相關技術的觀察結果,我們將繼續調整及改善這些功能。
我們如何以負責任的方式打造功能並優先考量用戶的安全?
Meta AI(由大型語言模型提供支援的助理)等支援新文字型體驗的自訂 AI 模型是以 Llama 2 為基礎所建立,並利用其安全和責任訓練方式。我們也一直針對今天宣佈的功能投資特定措施。
我們要與大家分享一項資源,其中會詳細說明為找出潛在漏洞、降低風險、提升安全性和強化可靠性所採取的措施。舉例來說:
- 我們正在透過紅隊演練,與內外部專家評估和改善對話式 AI。專門的專家團隊投入數千小時對相關模型進行壓力測試,尋找可能意想不到的模型使用方式,同時識別及修正漏洞。
- 我們正在微調模型。其中包括訓練模型來執行特定任務,例如搭配可提高提供實用回覆機率的指示來產生高品質圖像。我們也會訓練模型來提供專家背書資源以回應安全問題。舉例來說,AI 會推薦當地自殺防治和飲食失調組織來回應特定查詢,同時清楚表明無法提供醫療建議。
- 我們正在訓練模型瞭解安全和負責任準則。讓模型瞭解相關準則表示,模型在我們應用程式上向各個年齡層分享潛在有害或不當回覆的可能性較小。
- 我們正在採取減少偏見的措施。消除生成式 AI 系統的潛在偏見是一個全新的研究領域。和其他 AI 模型一樣,越多人使用功能並分享意見回饋,就越能幫助我們完善此作法。
- 我們已開發新技術來找出違反相關政策規定的內容。我們的團隊已經建立演算法,可在向用戶分享有害回覆前先加以掃描和排除。
- 我們在相關功能中內建了意見回饋工具。AI 模型並非十全十美。我們會將收到的意見回饋用於持續訓練模型,以提升安全成效及強化違反政策的自動偵測功能。我們也將透過 Meta 的長期抓漏獎勵方案,向安全研究人員開放新的生成式 AI 功能。

我們如何保護用戶的隱私?
監管機構、決策者和專家督促我們必須承擔保護用戶隱私的責任。我們攜手合作,確保打造出來的功能遵循資料保護的最佳作法和高標準。
我們認為用戶必須瞭解訓練生成式 AI 產品採用的模型所使用的資料類型。舉例來說,我們不會將您與親朋好友的私人訊息用於訓練 AI。我們可能會使用您的 AI 貼圖使用方式資料(例如要在聊天室中使用的貼圖搜尋),來改善我們的 AI 貼圖模型。若要進一步瞭解我們使用的資料類型,請參閱生成式 AI 的「隱私至關重要」貼文。
我們如何確保用戶知道新功能的使用方式並瞭解其限制?
我們在相關功能中提供資訊,以協助用戶瞭解與 AI 互動的情況和這項新技術的運作方式。我們會在產品體驗中指出,有可能會收到不準確或不恰當的輸出內容。

我們在過去一年來發佈了 22 張「系統圖卡」,以針對 AI 系統如何作出影響用戶的決定提供容易理解的相關資訊。我們今天要在 Meta 的 AI 網站上與大家分享新的生成式 AI 系統圖卡,一張說明產生文字(支援 Meta AI)的 AI 系統,另一張則介紹為 AI 貼圖、Meta AI、創意做圖和背景產生圖像的 AI 系統。相關圖卡提供互動式體驗內容,方便用戶瞭解調整提示會如何影響模型的輸出內容。
我們如何協助用戶知道圖像是否是使用我們的 AI 功能所建立的?
我們遵循業界的最佳作法來處理,因此用戶更難使用我們的工具散播錯誤資訊。透過 Meta AI、創意做圖和背景建立或編輯的圖像會附上可見的標記,讓用戶知道該內容是由 AI 建立的。我們也致力於開發其他技術,以在由 Meta AI 建立的圖像檔案中納入資訊,並打算隨著這項技術改善,將其使用範圍擴大至其他體驗。我們並未計畫對 AI 貼圖加入這些功能,由於 AI 貼圖並不寫實,因此不太可能誤導用戶認為其內容是真實的。
目前業界並沒有一般標準來規範識別和標記 AI 產生的內容。我們認為應該有所規定,因此希望透過 Partnership on AI 等論壇與其他公司合作制定。

我們採取哪些措施來阻止用戶利用生成式 AI 散播錯誤資訊?
AI 是我們處理錯誤資訊和其他有害內容的重要技術。舉例來說,我們開發了 AI 技術來比對與先前的查證內容幾乎重複的內容。我們也有名為小樣本學習(Few-Shot Learner)的工具,可更容易地調整來針對全新或不斷變化的有害內容類型快速採取行動,處理超過 100 種語言的相關內容。之前我們需要蒐集數以千計的範例,有時甚至需要蒐集數以百萬計的範例,才能建立規模足以訓練 AI 模型的資料集,然後加以微調來讓模型正常運作。小樣本學習(Few-Shot Learner)可僅依照少數範例來訓練 AI 模型。
相較於現有的 AI 工具,生成式 AI 可幫助我們更快、更準確地移除有害內容。我們已經開始透過依據我們的《社群守則》訓練大型語言模型(LLM),來協助判斷內容是否違反相關政策以測試此模型。相關初步測試結果指出,LLM 可達到比現有機器學習模型更好的成效,或者至少能夠強化小樣本學習(Few-Shot Learner)等模型,而且我們樂觀地認為,生成式 AI 未來將可以協助我們執行政策。
在收件匣中取得最新的商業資訊。
訂閱我們的每月電子報,即可取得 Meta 的最新資訊、分析數據、行銷趨勢和相關文章。


