モデルインバージョン攻撃とメンバーシップ推測攻撃

更新日:

用語解説

AIモデルへの問い合わせ結果から、学習データに関する情報を推測するプライバシー攻撃です。

■ 試験で押さえるポイント

  • モデルが正しく応答していても、応答の確信度や差異が情報漏えいにつながることがあります。

  • モデルインバージョン攻撃 :出力から、学習データの特徴や元データを復元・推定します。

  • メンバーシップ推測攻撃 :特定データが学習データに含まれていたかを推測します。

  • 学習データを最小化し、機微情報を適切に処理します。

  • 出力する確信度や問い合わせ回数を制限し、差分プライバシーなどもリスクに応じて検討します。

音声で聞く

同じ分野の用語