合成資料可以減少對原始紀錄的依賴,也能補充受控測試用例。但資料不會僅僅因為由模型生成,就自動變成匿名資料。
說清生成機制
合成資料可能來自規則、模擬,或使用真實樣本訓練或提示的模型。隱私風險取決於生成器如何接觸敏感資料、是否可能記住原始紀錄,以及最終釋出了哪些輸出。
Google Research 介紹過將合成資料與聯合學習、差分隱私結合,用於行動裝置端語言模型適配的方法。差分隱私增加了形式化機制和隱私預算;普通生成過程並不會自動獲得這種保障。
測試隱私攻擊
檢查與源紀錄的完全匹配和近似重複、罕見屬性組合、成員推論,以及旨在誘導模型吐露記憶細節的提示詞。使用獨立保留的資料作比較。應遮蓋明顯的身份識別,但也要認識到,多個屬性組合仍可能用於關聯識別。
「未發現重複紀錄」是有用的證據,卻不是匿名性的證明。應紀錄攻擊方法、閾值,以及測試人員能訪問哪些資料。
按下游任務衡量實用性
將基於合成資料訓練的模型或分析,與適當的真實資料基線及獨立保留的真實評估集進行比較。按子群體和罕見情況報告表現。總體相似度很高,也可能同時缺失最關鍵的長尾情況。
避免使用生成資料的同一個生成器來評估資料。視覺上看著真實、文字表達流暢,並不能有力證明統計特徵或業務表現可靠。
有意識地控制覆蓋範圍
合成過程可能過度生成常見結構描述,並抹平異常。先定義必需的場景,再檢查分佈、標籤平衡、相關性和邊緣案例的覆蓋情況。保留由專家補充案例的途徑,包括歷史上未出現、但對安全至關重要的情況。
追蹤合成資料的生成鏈:生成器版本、提示詞或模擬器設定、種子資料的邊界、過濾器及釋出日期。可復現性有助於在下游模型出錯時排查原因。
對輸出同樣實施治理
明確誰可以生成、審批、共享和保留資料集。將源資料的訪問許可權與合成輸出的訪問許可權分開。根據適用規則審查輸出是否仍屬個人資料或受監管資料,而不是以「合成」這個技術標籤代替判斷。
合成資料是解決特定資料問題的工具。相關主張應說明生成機制、經過測試的隱私屬性以及測得的實用性,而不能只說「隱私安全」。
如何付諸實踐
先選擇一項與合成資料及其隱私侷限相關、範圍明確的工作流程。在改變系統之前,寫下一頁基線紀錄:目前的完成時間、品質檢查、常見失敗類別、升級處理路徑,以及對結果負責的人。選擇有代表性的樣本,而不只挑最簡單的例子。納入普通案例、困難的邊緣案例,以及至少一個正確做法是暫停或要求補充資訊的案例。
先讓候選方案與現有流程並行執行,再考慮替換現有流程。成功和失敗的輸出都要檢查,因為整體錯誤率降低,仍可能掩蓋新的高影響故障。紀錄每次測試所用的準確設定,並保留足以讓其他審查者復現結果的材料。試點結束時,應依據事先商定的閾值決定擴大使用、調整還是停止,而不是憑事後對最佳演示的印象做決定。
向供應商或內部團隊提出的問題
詢問支撐核心主張的證據是什麼、證據對應哪些系統和資料版本,以及排除了哪些條件。索取針對部署所涉語言、輸入型別和風險類別的結果。了解變更如何通知、迴歸問題如何發現,以及客戶如何匯出事件覆盤所需的紀錄。
還要詢問置信度低、依賴項故障或請求超出支援範圍時,系統會如何處理。可靠的產品應有明確的失敗狀態,而不只是給出措辭更漂亮的回答。責任歸屬也很重要:明確誰能暫停流程、誰批准例外,以及重大錯誤流入正式環境後由誰通知受影響使用者。
實用檢查清單
- 在選擇模型或工具之前,先定義使用者任務以及真正重要的失敗情況。
- 保留一個從真實工作中抽取的小規模、帶版本識別的測試集,包含棘手及對抗性案例。
- 為每次執行紀錄模型、提示詞、工具、檢索設定、資料版本、延遲和成本。
- 對不可逆、高影響或外部可見的操作,要求人員確認。
- 按類別審查失敗,而不只看平均分,並將迴歸案例納入測試集。
Meydo Journal 延伸閱讀
主要來源
- 合成與聯合方法:保護隱私的領域適配 — Google Research
