ジェイルブレイク(脱獄)とは?
ジェイルブレイク(脱獄)とは、生成AIに設けられた安全上の制限や利用ポリシーを、工夫した入力によって回避させ、本来は拒否されるはずの応答を引き出そうとする行為のことです。 AIセキュリティの比較ページの詳細カードでは、ガードレール・実行制御の製品が検知・遮断の対象とする項目の1つとして扱われています。
プロンプトインジェクションとの違い
プロンプトインジェクションは、外部から紛れ込む指示によってAIアプリケーションの想定外の動作を引き起こす攻撃を指すことが一般的です。一方でジェイルブレイクは、モデルの安全上の制限そのものを回避させようとする試みを指す点に違いがあります。実際には両者が重なる場合もあり、明確に線引きできないケースもあります。
対策としてのガードレールとレッドチーミング
ジェイルブレイクへの対策としては、入力や出力を検知して遮断するガードレールの機能や、意図的にジェイルブレイクを試みて弱点を洗い出すAIレッドチーミングによる事前の確認が挙げられます。具体的な手口やプロンプトの例は、悪用を避けるため本サイトでは扱いません。
比較ページの各サービスの詳細(説明・日本語対応の注記)で、ジェイルブレイクの検知に言及している製品を確認できます。詳しくは比較ページをご覧ください。