AIエージェントへ仕事を任せるとき、「何でも毎回確認」では自動化になりません。
逆に「全部自動」では、1回の判断ミスがそのまま外部へ反映されます。
実務では、読む・下書きする・実行するを分けると設計しやすくなります。
読むだけと実行する操作は違う
メールを読む、ファイル一覧を見る、在庫を確認する。
これらは状態を変えない「読み取り」です。
一方、
- メール送信
- 投稿公開
- ファイル削除
- 購入確定
は外部の状態を変えます。
OpenAIの現行Workspace agents資料でも、メッセージ送信やレコード更新のようなセンシティブな操作の前に、人間の承認を必須にできる承認ゲートが案内されています。
送信・公開
メール、Slack、SNS、ブログ公開などは、一度外へ出ると回収が難しくなります。
AIには、
文面を作る
宛先候補を選ぶ
下書き保存する
まで任せ、送信・公開だけ人間確認にする方法があります。
削除・取消
ファイル削除、予約取消、データ削除は、元に戻せない可能性があります。
ゴミ箱から戻せる場合でも、期限や権限があります。
特に一括削除は承認対象にした方が安全です。
購入・返金
購入、決済、返金は金銭に直接影響します。
OpenAIのエージェント安全資料でも、購入など外部へ影響する操作ではユーザー確認を求める設計が説明されています。
カート追加までは自動、注文確定だけ確認、という分け方ができます。
権限・共有設定
共有リンク発行、公開範囲変更、管理者権限付与なども高リスクです。
情報漏えいは「ファイルを送る」だけでなく、「誰でも閲覧」に変更するだけでも起きます。
認証情報・機密情報の共有
パスワード、APIキー、本人確認情報などを別サービスへ渡す操作も承認対象です。
OpenAIの現行アプリ権限説明でも、別サービスへ影響する、機密情報を公開する、取り消しが難しい操作は追加確認の対象になり得るとされています。
「元に戻せるか」で判断する
迷ったときは、
- 外部に影響するか
- 元に戻せるか
- 金銭・権限・機密に関係するか
で考えます。
3つのうち1つでも重ければ承認を残します。
承認時は「何を実行するか」を見せる
「実行してよいですか?」だけでは不十分です。
確認画面には、
- 宛先
- 内容
- 金額
- 削除対象
- 変更前後の権限
など、確定後に変わるものを表示します。
AIエージェントの安全性は「AIを信用するか」だけではなく、失敗しても大事故にならない承認境界を作ることで上げられます。
参考
- OpenAI: Workspace agents for business
https://openai.com/business/workspace-agents/ - OpenAI Deployment Safety Hub: ChatGPT Agent System Card
https://deploymentsafety.openai.com/chatgpt-agent/threatmodel - OpenAI Help: Managing app permissions in ChatGPT
https://help.openai.com/en/articles/20001495-managing-app-permissions-in-chatgpt
