「InjecMEM」攻撃:単一プロンプトでAIエージェントの記憶に隠された指示を植え付ける新手法の脅威
AIエージェント記憶層への新たな攻撃「InjecMEM」の概要とメカニズム
上海交通大学とAnt Groupの研究者らは、単一のプロンプトでAIエージェントの記憶に隠された指示を植え付け、将来のクエリに対するシステムの応答に影響を与える新しい攻撃手法「InjecMEM」を発表しました。この技術は、「メモリストアへの読み取り/編集アクセスなしで、一度の対話のみでエージェントメモリシステムに対するターゲット型レッドチーミング攻撃パラダイム」と説明されています。
InjecMEMは、モデル自体ではなくAIエージェントの記憶層に焦点を当てています。これらのシステムは過去の対話を保存し、新しいクエリのコンテキストとして後でそれらを取得して再利用します。 攻撃は、通常のインタラクションを通じて悪意のあるコンテンツを記憶に挿入することで機能し、その後、それが取得され再利用されることを可能にします。 一度保存されると、注入された記録はエージェントの記憶の一部として扱われ、将来のタスク中に表面化する可能性があります。 後続のクエリが保存されたコンテンツに関連する場合、システムはその記憶を取得し、応答生成プロセスに組み込みます。
この手法は、過去の対話を保存し、将来のタスク中にそれらを再利用するAIエージェントを標的としており、最初のやり取りで導入された悪意のあるコンテンツが永続的に残り、後の出力に影響を与えることを可能にします。 研究では、MemoryOSと呼ばれる記憶システムとエージェントフレームワークMemGPTでこの技術を評価し、いくつかのドメインでテストを行い、注入された記録がどのように取得され、その後の応答に組み込まれるかを示しました。 MemoryOSにおいて、InjecMEMはベースライン攻撃を大幅に上回り、最大35.4%の検索成功率(RSR)と76.6%の攻撃成功率(ASR)を達成しています。
既存のプロンプトインジェクションとの違いと永続性の脅威
InjecMEMの最も重要な特徴は、その「永続性」にあります。従来のプロンプトインジェクション攻撃が現在の対話にのみ影響するのに対し、InjecMEMは攻撃者によって制御されたコンテンツがシステムの記憶に残り、後で再利用されることを可能にします。 この手法は「関連クエリのその後の応答を操作できる」とされており、その効果がセッションを越えて広がることを示しています。 この永続性は、記憶システムが関連性に基づいて過去の対話を取得する方法に起因しており、以前に保存されたコンテンツが類似のクエリが処理されるときに再浮上することを可能にします。
この問題の根底には、多くのチームがAIの記憶を「アプリケーションデータ」として扱っており、「セキュリティ上機密性の高い状態」として認識していないという懸念があります。 攻撃者が悪意のあるコンテンツを記憶に送り込み、システムがそれを信頼してしまうと、攻撃は現実のものとなります。 AIメモリは、AIシステムをステートレスなツールから学習する協力者へと変貌させ、強力な体験を可能にする一方で、AIシステムの攻撃対象領域を増加させます。 メモリがない場合、攻撃者は単一のプロンプトで目的を達成する必要がありますが、AIメモリがあれば、時間をかけて行動を徐々に形成したり、元のコンテキストがなくなってユーザーの意識が低下した後もエージェントの推論に影響を与えるメモリを植え付けたりすることができます。
技術的課題とAIセキュリティ防御への示唆
InjecMEMは、攻撃者が通常のユーザーのようにシステムと対話する制約された攻撃者モデルの下で動作し、メモリシステムへのアクセスや保存された記録を直接変更する能力を前提としていません。 これは、多くの企業システムが現在機能している方法を反映しているため、現実的な脅威と言えます。 研究者らは、この方法が標準的な対話チャネルを利用してコンテンツを導入し、システムがそれを保持し取得することに依存していると述べています。
この攻撃がもたらす主要な技術的課題は、AIモデルが開発者からの正当な指示と、ユーザーから入力される悪意のある可能性のある入力を本質的に区別できないという基本的なアーキテクチャ上の制限にあります。 大規模言語モデル(LLM)は、システム指示とユーザー入力の両方を自然言語テキストの連続したストリームとして処理します。 このため、AIプロバイダーが設定する従来のセキュリティガードレールは、入力される静的テキストをスキャンする傾向があるため、隠されたり遅延したりする指示を検出できない可能性があります。
AIの記憶を保護するためには、ストレージ、取得、モデルインタラクション、ユーザー制御を含む多層防御アプローチが必要です。 AIメモリをセキュリティ上機密性の高い状態として扱うことが不可欠であり、単純なアプリケーションデータとしてではなく、悪意のあるコンテンツが記憶に侵入し、システムがそれを信頼した場合に攻撃が実用的になるという認識を持つべきです。
開発者・エンジニア視点での考察
-
記憶システム設計の再考: AIエージェントの記憶システムを設計する際には、単なるデータストレージとしてではなく、セキュリティ境界として扱う必要があります。特に、過去のインタラクションが将来の振る舞いに与える影響を厳密に評価し、永続的な悪意あるコンテンツの挿入を防ぐメカニズム(例:記憶内容のサニタイズ、異常検知、ライフサイクル管理)を組み込むべきです。
-
プロンプト検証と入力サニタイゼーションの強化: InjecMEMのような攻撃は、プロンプトの注入と記憶への永続化を組み合わせるため、単一のプロンプトに対する一時的なフィルタリングだけでは不十分です。入力されるプロンプトだけでなく、記憶層に書き込まれるデータ自体も継続的にスキャンし、悪意のあるパターンや潜在的な指示を検出する高度なサニタイゼーションと検証ロジックを導入する必要があります。
-
エージェントの記憶内容の可視化と監査メカニズム: 攻撃の検出と事後分析を容易にするため、AIエージェントが「記憶」している内容(過去のインタラクション、学習データ、生成された内部状態など)に対する詳細な可視化および監査ログ機能を実装することが不可欠です。これにより、不審な記憶の定着や、それが将来の応答に与える影響を追跡できるようになります。
Source / 元記事
この記事について
この記事は、公開されているニュース、論文、公式発表、RSSフィードなどをもとに、AIが要約・補足調査・考察を行って作成しています。
元記事の完全な翻訳・逐語的な要約ではなく、AIによる背景説明や開発者向けの考察を含みます。
重要な技術仕様・価格・提供状況などは、必ず元記事または公式情報をご確認ください。


