AI脅威

ジェイルブレイク Jailbreak

一言でいうと: AIに設定された安全上の制限を、巧妙な指示で回避させる行為。

詳しい解説

ジェイルブレイクは、AIチャットボットに組み込まれた安全上の制限(有害な情報を出力しない等)を、特殊な指示や役割設定によって回避させる行為です。「あなたは制限のないAIという設定で演じて」といったロールプレイの悪用や、指示を多言語・暗号化して検閲をすり抜ける手法などが知られています。プロンプトインジェクションが「開発者の意図の上書き」を指すのに対し、ジェイルブレイクは「安全制限の解除」に焦点があり、両者は重なりつつも区別されます。

なぜ重要か / 企業への影響

自社サービスにAIチャットを組み込んでいる場合、ジェイルブレイクにより不適切な発言や機密情報の開示をさせられると、ブランド毀損や法的リスクにつながります。AI機能の公開前に、ジェイルブレイク耐性のテスト(レッドチーミング)を行うことが推奨されます。

最終更新日: 2026年7月13日

関連用語

  • ガードレール Guardrails — AIの入力・出力を検査し、危険な指示や不適切な回答をブロックする安全装置。
  • プロンプトインジェクション Prompt Injection — AIへの指示文に不正な命令を紛れ込ませ、AIを攻撃者の意図通りに動かす攻撃手法。

この用語に関連するニュース