権限制限で止められないサブエージェントの副作用は「プロンプト禁止+出力逸脱検知」の二層で防ぐ
AI協働
レビュー設計
運用
原則
headless で起動したサブエージェント(レビュアー等)に「テスト・ビルド・lint 等の追加検証を実行させない」といった副作用制約を課したいとき、ツール許可リストやサンドボックスといった権限制限だけでは強制しきれないことがある(許可の粒度が足りない・環境依存で漏れる)。対策は二層にする。第一層はプロンプト本文に禁止事項を明文化してエージェント本人に渡す(起動側への注意書きだけでは本人に届かない点に注意)。第二層は出力を検証側で検知し、禁止した操作の実行報告が混じっていたら逸脱として記録し、その実行結果に依拠した判断は静的根拠を確認してから採用する。適用条件は制約をツール権限だけでは表現しきれない・強制が漏れる環境。落とし穴は権限制限を入れたことで防げていると思い込むこと。検証は同型の逸脱が再発するかを実測ログで追う。