ジェイルブレイク(脱獄)とは
ジェイルブレイク(脱獄)とは、生成AIに設けられた安全上の制限や利用ルールを、巧妙な指示によってすり抜け、本来は答えないはずの内容を出力させたり、想定外の動作をさせたりする行為のことです。
平易に言えば、「AIに決められた約束事を、言葉の工夫で破らせようとすること」です。英語の jailbreak は「脱獄」を意味し、もともとはスマートフォンの制限を解除して、メーカーが認めていない使い方をすることを指していました。その言葉が生成AIにも使われるようになりました。
似た言葉に「プロンプトインジェクション」があります。ジェイルブレイクがAIの安全対策そのものを破ろうとするのに対し、プロンプトインジェクションは、システムに与えられた指示を外部からの入力で上書きし、乗っ取ることを指します。両者は重なる部分が多く、対策もあわせて考えるのが一般的です。
仕組み・ポイント
生成AIは、文章の文脈に沿って続きを作るように動いています。安全対策も学習や指示によって身につけた「傾向」であり、絶対的な規則ではありません。そのため、文脈を巧みに操作されると、制限が働かなくなることがあります。
よく知られている手口の傾向を、対策の観点から整理すると次のとおりです。
| 手口の傾向 | 概要 | 業務システムで起きうること |
|---|---|---|
| 役割の押し付け | 架空の人物や設定を演じさせ、制限を外させる | 社外秘の情報や禁止された助言を答える |
| 指示の上書き | 「これまでの指示は無視して」のように命じる | システムプロンプトの内容が漏れる |
| 間接的な埋め込み | 読み込ませる文書やWebページの中に指示を仕込む | 要約の対象文書から指示を受けて誤動作する |
| 分割・言い換え | 禁止された依頼を細かく分けたり、言い換えたりする | 一つずつは無害に見える質問から機密を引き出す |
業務システムで特に注意したいのは、AIが社内データにアクセスできたり、メール送信やデータ更新などの操作ができたりする場合です。会話だけのAIなら被害は不適切な文章にとどまりますが、操作の権限を持つAIでは、実際の情報漏えいや誤操作につながる可能性があります。
実務での使い方・具体例
ある会社が、顧客からの問い合わせに答えるAIチャットボットを公開するとします(架空の例)。開発の段階で、次のような対策を組み込みました。
- AIに渡す情報を、公開してよい資料だけに限定する(AIが知らない情報は漏れない)
- システムプロンプトには、漏れて困る情報(社内の判断基準や連絡先など)を書かない
- 入力を判定するガードレールを置き、指示の上書きを狙う入力や業務外の依頼を検知する
- 出力を確認し、禁止された話題や社外秘の語句が含まれていれば回答を差し替える
- 公開前に、社内の担当者が攻撃者の立場でさまざまな入力を試す検証を行う
- 公開後もログを確認し、新たな手口が見つかれば対策を追加する
対策の基本的な考え方は、「破られないAIを目指す」のではなく、「破られても被害が小さい設計にする」ことです。
よくある誤解と注意点
システムプロンプトで「絶対に答えるな」と書けば防げる、わけではありません。 指示による制限は有効ですが、すり抜ける方法はあります。AIに渡す情報と権限そのものを絞ることが、もっとも確実な対策です。
大手のモデルなら安全、とも言い切れません。 提供元も対策を重ねていますが、新しい手口は次々と見つかっています。モデルの安全対策に頼り切らず、自社のシステム側でも防御の層を設けましょう。
社内向けでも対策は必要です。 社内ツールだからといって、悪意のある利用者がいないとは限りません。また、外部から取り込んだ文書に仕込まれた指示による誤動作は、利用者に悪意がなくても起こります。
検証は公開前の一度だけでは足りません。 モデルの更新や機能の追加で、防げていた入力が通るようになることがあります。定期的に同じ検証を繰り返す仕組みを用意しておくと安心です。
被害が起きたときの手順も決めておきましょう。 不適切な回答や情報の漏えいが見つかった場合に、誰に報告し、どうやって機能を一時停止し、どの記録を確認するかをあらかじめ決めておくと、対応の遅れによる被害の拡大を防げます。
関連用語
- ガードレール(AI):AIの入出力を確認し、不適切な動作を防ぐ仕組み
- システムプロンプト:AIの振る舞いを決める指示。ジェイルブレイクで漏えいや上書きの標的になる
- AIガバナンス:AIの利用に関するルールと管理体制
- ヒューマン・イン・ザ・ループ(HITL):重要な操作の前に人の承認を挟む考え方
- 実践記事:AIエージェントの誤動作を防ぐ:権限制限と監視ログの設計
Otsumuに相談できること
ジェイルブレイクへの備えは、AIに何を渡し、何をさせるかという設計の段階で大部分が決まります。Otsumuでは、業務上必要な情報と権限だけをAIに与える構成を基本に、ガードレールやログの確認まで含めて生成AIシステム開発を進めています。
顧客向けにAIを公開する前に、安全面を確認したいという段階でもご相談ください。30分の無料相談でお気軽にお声がけください。
執筆:Otsumu株式会社 / 編集日 2026.10.01