DAILY PAPER · 2026 年 08 月 04 日

Daily Papers

10 篇 · 2 个分组 · 中英文摘要与核心结论

10篇论文 2个分组 中 / EN双语摘要
MAIN TRACK

Static Defense against LLM Attackers

05
04
正式 venue:arXiv preprint (2026-06-27)Research paper

From Tool Connection to Execution Control: Benchmarking Security Invariants in MCP-Style Agent Runtimes

Ting Liu
Problem / 问题展开

研究问题是:连接层的元数据、会话和审批约定能否独立保证执行层授权,或运行时是否必须显式维护主体、资源、能力和数据流不变量。正文将连接层与执行控制层分开,指出模型和提供方元数据只能提出动作,受信运行时才决定动作是否获授权(sec:page-2, p.2;sec:page-4, p.4)。缺口是客户端、服务器、提示、审批和日志之间的分散决策无法形成可检验的统一权限状态。该结论针对模型上下文协议风格系统,不外推到所有协议。

Innovation / Contribution / 创新与贡献展开

贡献是定义八项执行层安全不变量,并实现句柄—能力协议参考运行时,把主体、资源、授权、能力、句柄、策略、数据管道和审计统一为运行时对象(sec:page-2, p.2;sec:page-4, p.4)。论文还提供十案例基准、组件消融和本地微基准,从阻断攻击、保留审计证据及运行开销三个方面检验设计(sec:page-3, p.3)。代码托管平台自述文件筛选仅是生态信号,不能被解释为漏洞统计(sec:page-3, p.3)。

Technical details / 技术细节展开

参考运行时在连接层保留客户端—服务器工作流,同时增加受信运行时核心、主体、授权存储、策略引擎、数据保险库和审计日志;调用必须经过能力和句柄表示、授权决策及源到目标的数据管道检查(sec:page-2, p.2;sec:page-4, p.4)。实验设置包括朴素连接层基线、带元数据检查与逐调用审批的缓解基线,以及句柄—能力协议,共十个攻击案例;通过消融定位各组件作用,并用本地内存操作测量策略、调用、窥视和管道延迟(sec:page-3, p.3)。外部生态筛选被明确限制为非漏洞发现。

Experiment results / 实验结果展开

十个基准案例中,朴素基线允许十个攻击,缓解基线允许六个,句柄—能力协议阻断十个攻击且保留审计证据;消融实验用于识别各运行时组件的阻断作用;本地微基准中所测操作平均延迟低于一毫秒(sec:page-3, p.3)。这些结果支持增加执行控制层的窄结论。论文没有据此证明真实大规模部署的端到端性能或零漏洞,只报告了有限案例和本地内存环境,因此外部生态风险与生产环境效果未知。

中文摘要展开摘要 +

MCP 风格的生态系统为语言模型应用提供了一个实用的连接层,用于连接工具、资源、提示词和传输机制。随着智能体从连接转向执行,安全决策往往仍然分散在客户端、服务器、提示词、审批对话框、OAuth 部署和日志之间。本文探讨运行时能否在保留类似 MCP 的工作流的同时,使执行层不变量变得明确且可测试。我们定义了八项不变量:元数据不具备权威性、基于授权的审批、规范化资源、主体绑定、作用域限定的能力调用、基于源和目标的数据流授权、拒绝路径审计,以及显式协议状态。我们在 HCP 中实现了这些不变量;HCP 是一个面向 MCP 风格智能体执行的句柄能力协议参考运行时,通过主体、资源、授权、能力、句柄、策略决策、数据管道检查和审计条目来表示调用。我们将 HCP 与两个类似 MCP 的基线进行评估:朴素连接层运行时,以及一个受实践启发的连接层缓解基线,该基线包含元数据 lint 检查、会话检查和逐调用审批。在 10 个基准案例中,朴素基线允许所有建模攻击,缓解基线允许 10 个攻击中的 6 个,而 HCP 在保留审计证据的同时阻止了全部 10 个攻击。消融实验确定了哪些运行时组件能够阻止攻击并保留取证证据。本地内存微基准测试报告称,在测量的策略、调用、窥视和管道操作中,平均延迟均低于 1 毫秒。一个有界的 GitHub README 筛选样本提供了生态系统信号,而不是漏洞发现。结果支持一项范围狭窄的主张:除连接层约定之外,MCP 风格的智能体系统还需要一个执行控制层。

English abstract展开原文 +
Model Context Protocol (MCP)-style ecosystems give language-model applications a practical connection layer for tools, resources, prompts, and transports. As agents move from connection to execution, security decisions often remain split across clients, servers, prompts, approval dialogs, OAuth deployments, and logs. This paper asks whether a runtime can make execution-layer invariants explicit and testable while preserving MCP-like workflows. We define eight invariants: metadata non-authority, grant-backed approval, canonical resources, principal binding, scoped capability invocation, source-and-target data-flow authorization, deny-path audit, and explicit protocol state. We implement these invariants in HCP, a Handle-Capability Protocol reference runtime for MCP-style agent execution that represents calls through principals, resources, grants, capabilities, handles, policy decisions, data-pipe checks, and audit entries. We evaluate HCP against two MCP-like baselines: a naive connection-layer runtime and a practice-informed connection-layer mitigation baseline with metadata linting, session checks, and per-call approvals. Across 10 benchmark cases, the naive baseline permits all modeled attacks, the mitigation baseline permits 6 of 10, and HCP blocks all 10 while preserving audit evidence. Ablations identify which runtime components block attacks and preserve forensic evidence. A local in-memory microbenchmark reports sub-millisecond mean latencies for measured policy, invocation, peek, and pipe operations. A bounded GitHub README-screening sample provides ecosystem signals, not vulnerability findings. The results support a narrow claim: MCP-style agent systems need an execution-control layer in addition to connection-layer conventions.
05
正式 venue:arXiv preprint (2026-06-26)Research paper

AdvancedShelLM: A Stateful Multi-Agent LLM Honeypot for SSH Deception

Muris Sladić, Eman Alibalić, Veronica Valeros, Carlos Catania, Sebastian Garcia
Problem / 问题展开

研究问题是:大语言模型蜜罐能否在交互式SSH环境中保持状态并有效诱骗攻击者,而不仅是逐命令生成看似合理的文本。正文指出已有系统在会话历史、复杂命令输出和服务行为一致性方面仍会失败,且模拟逼真度与真实诱骗效果不是同一目标(sec:page-2, p.2;sec:page-3, p.3)。研究缺口是缺少同时评估有状态交互和攻击者欺骗效果的框架;正文未证明系统能代表全部生产SSH攻击者。

Innovation / Contribution / 创新与贡献展开

论文贡献是提出有状态多智能体SSH蜜罐架构,并将“像服务”与“能诱骗攻击者”区分为不同评估目标(sec:page-2, p.2;sec:page-3, p.3)。该视角指出更强的生成能力不自动转化为更强欺骗能力,从而要求蜜罐评估超越命令级真实感(sec:page-3, p.3)。在本次有限章节阅读中未获得完整消融和人类攻击者研究设计,具体贡献边界保持未知。

Technical details / 技术细节展开

系统使用多个专门化智能体协同维护SSH会话状态、生成命令响应并模拟主机行为,目标是使交互在长会话和复杂命令下保持一致(sec:page-2, p.2;sec:page-3, p.3)。评估不只检查命令级输出是否合理,还考察状态跟踪、复杂命令处理及欺骗效果;正文所读章节未完整给出模型版本、攻击者样本、任务数量和统计协议,因此这些设置未知。

Experiment results / 实验结果展开

摘要报告单元测试中 AdvancedShelLM 的通过率高达 99.02%;AI 攻击者 ARACNE 难以判定系统为蜜罐,但面对真实 Ubuntu shell 也有轻微的蜜罐判定偏向。人类攻击者测试中,AdvancedShelLM 欺骗的人数多于 Cowrie、与 shelLM 结果相近;互联网部署显示其输出能够影响真实攻击者行为。上述数字和对照来自摘要报告;本次前十页正文阅读未核验完整结果表、攻击者样本和显著性,未报告的成功率与排序未知。

中文摘要展开摘要 +

基于LLM的SSH蜜罐能够生成逼真的交互,但评估表明,对于坚定的攻击者而言,它们仍然在一定程度上可被识别,这表明需要更好的支撑框架。我们提出了一种新的基于LLM的蜜罐设计方案,该方案采用多智能体、多LLM架构,以解决此前shelLM LLM蜜罐的局限性。我们的蜜罐名为AdvancedShelLM,使用两个LLM智能体——Manager与Worker——以更好地理解命令,同时减少错误响应并增强欺骗性。它实现了一种高级的持久化文件系统,首次允许多个同时在线的攻击者看到同一组不断变化的文件。我们通过以下方式对其进行了评估:(i) 用于测试生成能力的单元测试;(ii) AI攻击者(ARACNE),用于评估其真实感与欺骗性;(iii) 人类攻击者,用于评估其欺骗能力;(iv) 互联网部署,用于评估其在真实世界攻击中的欺骗效果。在单元测试结果中,AdvancedShelLM的通过率高达99.02%。AI攻击者ARACNE在判断系统是否为蜜罐时存在困难,但即便面对真实的Ubuntu shell,也表现出倾向于判定为蜜罐的轻微偏向。在人类攻击者测试中,AdvancedShelLM欺骗的人类数量多于Cowrie,但与shelLM的结果相近。互联网部署提供了具体证据,表明AdvancedShelLM的输出能够影响真实攻击者的行为。

English abstract展开原文 +
LLM-based SSH honeypots can generate believable interactions, but evaluations indicate they remain somewhat identifiable to determined attackers, indicating the need for a better scaffolding. We present a new LLM-based honeypot design that uses a multi-agent, multi-LLM architecture to address the limitations of the previous shelLM LLM honeypot. Our honeypot, called AdvancedShelLM, uses two LLM agents, a Manager and a Worker, that better understand the commands while reducing incorrect responses and increasing deception. It implements an advanced permanent filesystem, allowing many simultaneous attackers to see the same changing files for the first time. It was evaluated with: (i) unit tests for generative capabilities, (ii) an AI attacker (ARACNE) to assess realism and deception, (iii) human attackers to assess its deceptive capability, and (iv) an Internet deployment to evaluate deception in real-world attacks. In unit test results, AdvancedShelLM achieved a pass rate of up to 99.02%. The AI attacker ARACNE had issues making a decision if the system is honeypot or not, but showed slight bias towards saying honeypot, even for a real Ubuntu shell. With human attackers, AdvancedShelLM deceived more humans than Cowrie, but had similar results as shelLM. The Internet deployment showed concrete evidence that the output of AdvancedShelLM can influence the behaviour of real-life attackers.
06
正式 venue:arXiv preprint (2026-06-23)Research paper

Securing LLM-Agent Long-Term Memory Against Poisoning: Non-Malleable, Origin-Bound Authority with Machine-Checked Guarantees

Yedidel Louck
Problem / 问题展开

研究问题是:长期记忆中的不可信内容如何在后续检索和行动中被误当作权威,从而通过投毒影响后果性行为。正文把记忆系统拆成写入、检索和行动三个阶段,并指出若在写入时不绑定来源权威,内容可以在后续流程中伪造合法性(sec:page-2, p.2;sec:page-3, p.3)。研究缺口是缺少与内容本身不可篡改的授权约束和机器可检查保证。该安全主张只针对有界模型,不能直接证明实际智能体所有实现都安全。

Innovation / Contribution / 创新与贡献展开

贡献是提出非可篡改、来源绑定的权威机制,建立不可信来源项目默认不可行动的规则,并使用追加式裁决日志与行动闸门分离来源、检索和后果性行动(sec:page-2, p.2;sec:page-3, p.3)。论文还给出防御无关的安全不变量:不可信来源项目只有在至少多个独立可信主体提升或获得新鲜行动绑定用户授权后才能授权后果性行动(sec:page-4, p.4)。形式化保证支持该有界模型内的安全性,不等同于现实部署的完备证明。

Technical details / 技术细节展开

系统由写入、检索和行动三个受控阶段组成:写入时依据来源绑定权威,检索时保留该权威与来源,行动时由行动闸门检查是否满足至少k个独立可信主体或新鲜行动绑定用户授权;所有裁决进入追加式日志(sec:page-3, p.3;sec:page-4, p.4)。作者在有界模型M中形式化安全不变量并进行机器检查的证明。已读取章节未提供现实数据集、模型规模或端到端用户实验,因此不能编造实验设置。

Experiment results / 实验结果展开

摘要报告在 8 款前沿模型的基准中,现有防御面对清洗攻击的成功率最高达 68%;TMA-NM 在所有模型和所有渠道上对直接攻击与清洗攻击均为 0% 攻击成功率,同时保持完全合法的效用。对照为现有内容或谱系防御与 TMA-NM;上述结果来自摘要报告,正文有限阅读未核验逐模型、逐渠道结果及统计与现实部署,因此不能将 0% 外推为普遍的零攻击(sec:page-3, p.3;sec:page-4, p.4)。

中文摘要展开摘要 +

大语言模型智能体日益依赖持久性长期记忆,这在本文研究中构成一个关键性漏洞:记忆投毒。攻击者可以在某一会话中存入不受信任的内容,这些内容在未来的会话中会引导具有重大后果的行为,例如支付、更改设置或数据外泄。现有防御机制将记忆条目可执行操作的权限建立在以下两类信号之上:其内容(检测或可信度评分)或其派生历史(谱系)。我们表明这两类信号均可被篡改。攻击者可以通过专属于大语言模型智能体的三条渠道清洗不受信任的来源:智能体自身的摘要、可信工具的回显,以及人为制造的佐证。每条渠道都使内容看起来无害,并破坏或翻转其派生边至"可信"。我们针对记忆的写入-检索-执行流水线将可篡改性形式化,并证明了一个机器可验证的分离定理。在清洗攻击下,任何基于内容或谱系的防御都不是完备的(T1);写入时的来源绑定是必要的(T2);具有抗女巫攻击且以佐证为门控的提升条件的、不可篡改的来源绑定权限则是充分的(T3)。我们的构造 TMA-NM(防篡改记忆权限,不可篡改性)为大语言模型智能体的记忆实现了不可篡改的信息流控制(IFC)。一项横跨防御、攻击与模型的基准测试在八款前沿模型上展开,结果显示现有防御在理论预测的位置恰好失效(清洗攻击成功率最高达 68%),而 TMA-NM 在所有模型和所有渠道上对直接攻击与清洗攻击均达到 0% 攻击成功率,同时保持完全合法的效用。我们发布了基准测试、测试框架以及经过机器验证的 TLA+ 模型以支持可复现性。

English abstract展开原文 +
LLM agents increasingly rely on persistent long-term memory, which creates a critical vulnerability that we study here: memory poisoning. An adversary can store untrusted content in one session that later steers a consequential action, such as a payment, a setting change, or data exfiltration, in a future session. Existing defenses base a memory item's authority to act on either its content (detection or trust-scoring) or its derivation history (lineage). We show that both signals are malleable. An attacker can launder an untrusted origin through three channels specific to LLM agents: the agent's own summarization, a trusted-tool echo, and manufactured corroboration. Each makes the content look benign and breaks or flips its derivation edge to ``trusted.'' We formalize malleability for the memory write-retrieve-act pipeline and prove a machine-checked separation theorem. No content- or lineage-based defense is sound under laundering (T1), write-time origin binding is necessary (T2), and non-malleable origin-bound authority with Sybil-resistant corroboration-gated elevation is sufficient (T3). Our construction, TMA-NM (Tamper-evident Memory Authority, Non-Malleable), instantiates non-malleable information-flow control (IFC) for LLM-agent memory. A cross-defense, cross-attack, and cross-model benchmark over eight frontier models shows that existing defenses fail exactly where the theory predicts (up to 68% laundering attack-success), while TMA-NM reaches 0% attack success on both direct and laundering attacks across all models and channels, at full legitimate utility. We release the benchmark, harness, and machine-checked TLA+ models to support reproducibility.
07
正式 venue:arXiv preprint (2026-06-16)Research paper

ShellGames: Speculative LLM-Driven SSH Deception

Umberto Salviati, Fabio De Gaspari, Mauro Conti, Luigi Vincenzo Mancini
Problem / 问题展开

研究问题是:如何在SSH交互式服务中利用大语言模型生成具有一致状态和逼真反馈的欺骗环境,同时控制生成延迟、错误和攻击者可利用的不一致。正文将网络欺骗和移动目标防御的价值归因于增加不确定性,但也指出动态环境需要稳定而可控的交互(sec:page-2, p.2)。研究缺口是缺少标准化、跨指标、可与既有方法直接比较的LLM shell评估协议(sec:page-3, p.3)。

Innovation / Contribution / 创新与贡献展开

贡献是提出ShellGames推测式LLM驱动SSH欺骗系统、标准化基准协议和整理后的评估数据集,并以一致性和鲁棒性指标进行比较(sec:page-3, p.3)。该工作把欺骗目标从单次命令响应扩展到交互会话层面的持续性。正文所读范围尚未完整展示全部基线和攻击者行为证据,因此不宣称其在真实入侵场景中必然更有效。

Technical details / 技术细节展开

系统部署在向攻击者暴露交互式命令行的SSH服务中,通过大语言模型生成模拟 shell 的会话响应;威胁模型假设攻击者获得该服务访问权,防御方使用欺骗环境延长并观察攻击会话(sec:page-3, p.3;sec:page-4, p.4)。评估采用标准化协议、整理后的数据集以及多个一致性和鲁棒性指标,并与现有方法比较(sec:page-3, p.3)。本次有限章节未获得模型配置、样本规模和完整指标定义。

Experiment results / 实验结果展开

摘要报告 ShellGames 在标准化评测中命令准确率为 0.898(较基线提升 5.3 个百分点)、序列级准确率为 0.918(提升 36 个百分点)、状态跟踪准确率为 0.98(提升 18.3 个百分点)、鲁棒性准确率为 0.95(提升 37 个百分点);n=20 的自由探索用户研究显示,其真实感与真实 shell 相当,感知命令覆盖度优于传统蜜罐。上述数值和对照来自摘要报告;本次有限正文阅读未核验基线名称、完整结果表、显著性或攻击者停留时间,未报告细节未知。

中文摘要展开摘要 +

网络欺骗与移动目标防御是通过增加不确定性来扰乱对手的有前途的策略。然而,与对手维持长期、可信的交互会话仍是一项公开挑战。大语言模型(LLMs)为构建更具动态性的欺骗系统提供了一条有前景的路径,但存在若干根本性局限,严重制约其适用性,包括:缺乏持久状态、输出不一致、幻觉、延迟,以及容易被行为颠覆从而暴露欺骗。我们提出了ShellGames,一个基于LLM的SSH shell模拟器,旨在应对上述局限。ShellGames融合了五种互补技术:(i)自动思维链与少样本学习以提升正确性;(ii)内存管理以维持系统状态一致性;(iii)推测性命令执行以降低响应延迟;(iv)将复杂交互式命令智能路由至沙箱环境;以及(v)利用shell环境受限输入输出域的颠覆检测。为支持系统性评估,我们提出了一套涵盖正确性、一致性、状态跟踪与鲁棒性任务的标准化基准测试协议与数据集。在正确性上,ShellGames达到0.898的命令准确率(较基线提升5.3个百分点),一致性上达到0.918的序列级准确率(提升36个百分点),状态跟踪准确率为0.98(提升18.3个百分点),鲁棒性准确率为0.95(提升37个百分点)。一项包含20名参与者(n=20)的用户研究表明,在自由探索条件下,ShellGames所达到的真实感与真实shell相当,且在感知命令覆盖度上优于传统蜜罐。

English abstract展开原文 +
Cyber deception and Moving Target Defense are promising strategies that aim to disrupt adversaries by increasing uncertainty. However, sustaining long-lived, credible interactive sessions with adversaries remains an open challenge. Large Language Models (LLMs) offer a promising path toward more dynamic deception systems, but suffer from key limitations that fundamentally limit their applicability, including: lack of persistent state, output inconsistencies, hallucinations, latency, and susceptibility to behavioral subversion that may reveal the deception. We propose ShellGames, an SSH shell simulator based on LLM designed to address these limitations. ShellGames combines five complementary techniques: (i) Automatic Chain-of-Thought and few-shot learning to improve correctness; (ii) memory management to maintain system state coherency; (iii) speculative command execution to reduce response latency; (iv) smart routing of complex interactive commands to a sandboxed environment; and (v) subversion detection leveraging the constrained input-output domain of shell environments. To enable systematic evaluation, we introduce a standardized benchmarking protocol and dataset spanning correctness, consistency, state tracking, and robustness tasks. ShellGames achieves $0.898$ command accuracy on correctness ($+5.3pp$ over baselines), $0.918$ sequence-level accuracy on consistency ($+36pp$), $0.98$ state tracking accuracy ($+18.3pp$), and $0.95$ accuracy on robustness ($+37pp$). A user study with $n=20$ participants confirms that ShellGames achieves realism comparable to a real shell under free exploration and outperforms traditional honeypots on perceived command coverage.
08
正式 venue:arXiv preprint (2026-06-14)Research paper

Let Them Steal: Trapping Large Language Model Extraction Attacks with Knowledge Honeypot

Yuyang Dai, Yushun Dong
Problem / 问题展开

研究问题是:在不显著损害良性用户的情况下,如何降低预算受限的模型知识提取攻击获得高价值、可迁移知识的收益。正文将模型知识区分为不同类别,并指出攻击者的查询选择会受知识吸引力、不可访问性和效用影响(sec:page-2, p.2;sec:page-3, p.3)。既有缺口是防御通常只检测或阻断查询,未利用攻击者预算和知识结构把攻击引向低价值区域。该机制不证明知识被永久保护或对无限预算攻击有效。

Innovation / Contribution / 创新与贡献展开

贡献是提出知识蜜罐和知识蜜罐图,将历史、细节、利基、程序性和外围知识按攻击吸引力、不可访问性与效用组织,并把查询行为检测纳入诱导过程(sec:page-2, p.2;sec:page-3, p.3)。医疗和金融两个知识域各构造一千五百个节点、四千五百条边的图,展示方法可在不同领域部署(sec:page-4, p.4)。这证明了设计和评测对象的可行性,不代表任意知识图都能达到相同保护效果。

Technical details / 技术细节展开

攻击者使用目标模型提出知识查询,防御方在知识蜜罐图中选择响应路径,并由检测器根据查询长度、关键词和时间模式判断提取行为;图中节点按价值和可迁移性组织,诱导路径指向外围或低迁移性知识(sec:page-2, p.2;sec:page-3, p.3)。实验覆盖医疗和金融两个域,每个知识蜜罐图包含一千五百个节点和四千五百条边,报告吸引力、不可访问性和效用等属性(sec:page-4, p.4)。完整攻击预算和良性用户测试协议在有限章节中未完全呈现。

Experiment results / 实验结果展开

摘要报告在医疗与金融实验中,Knowledge Trap 使替代模型的 Agreement 指标平均降低 6.2%,且不损害合法用户准确率;摘要还称其优于对用户体验产生可测量影响的现有防御。上述为摘要报告的跨防御对照;本次有限正文阅读未核验完整攻击成功率、转移率、用户效用和显著性,因此“未损害”仅按摘要范围表述,不外推为所有部署无损。

中文摘要展开摘要 +

作为商业 API 部署的大语言模型容易遭受模型提取攻击,而现有防御措施要么反应过迟,要么会损害合法用户的效用。我们提出 Knowledge Trap(知识陷阱),一种通过蜜罐知识图谱(Honeypot Knowledge Graph, HKG)与面包屑引导式探索,将提取攻击重定向至低迁移性知识的防御方法。Knowledge Trap 不阻断查询也不扰动输出,而是将攻击者有限的查询预算消耗在下游效用可忽略不计的知识上,同时保持良性用户的性能。在医疗与金融领域的实验表明,Knowledge Trap 平均将替代模型的 Agreement 指标降低 6.2%,且不损害合法用户的准确率,表现优于那些对用户体验产生可测量影响的现有防御方法。这些结果表明,防御知识空间遍历是缓解大语言模型提取攻击的一个切实可行方向。

English abstract展开原文 +
Large language models deployed as commercial APIs are vulnerable to model extraction attacks, while existing defenses either act too late or degrade utility for legitimate users. We propose \textbf{Knowledge Trap}, a defense that redirects extraction attacks toward low-transferability knowledge through a \emph{Honeypot Knowledge Graph} (HKG) and breadcrumb-guided exploration. Instead of blocking queries or perturbing outputs, Knowledge Trap consumes the attacker's limited query budget on knowledge with negligible downstream utility while preserving benign-user performance. Experiments in medical and financial domains show that Knowledge Trap reduces surrogate Agreement by 6.2\% on average without degrading legitimate-user accuracy, outperforming existing defenses that impose measurable user impact. These results suggest that defending knowledge-space traversal is a practical direction for mitigating LLM extraction attacks.
OTHERS

Others

05
01
正式 venue:arXiv preprint (2026-06-30)Research paper

Securing the AI Agent: A Unified Framework for Multi-Layer Agent Red Teaming

Yong Yang, Xing Zheng, Huiyu Wu, Huangsheng Cheng, Xiaorong Shi, Jing Guo, Bo Yang, Yi Zhou, Xiangfan Wu, Zonghao Ying
Problem / 问题展开

研究问题是:面对从底层组件到模型行为的分层攻击面,如何避免用单一安全检测方法覆盖异质风险。正文将传统工具不足概括为难以处理语义级、行为级和统计级证据,并指出模型上下文协议与技能生态扩大了供应链和工具调用边界(sec:page-2, p.2;sec:page-5, p.5)。因此,既有缺口不是缺少某一个扫描器,而是缺少把确定性签名、语义审计、交互式行为测试和统计越狱评估放到同一框架中的方法。该判断说明框架覆盖能力,但不证明所有漏洞都能被发现或防御效果优于每个专用工具。

Innovation / Contribution / 创新与贡献展开

核心贡献是提出按攻击层次匹配证据与检测范式的统一架构,并将基础设施规则扫描、模型上下文协议服务器审计、技能供应链审计、多轮黑盒红队和模型越狱评估整合为可扩展开源平台(sec:page-5, p.5;sec:page-6, p.6)。正文还讨论跨层设计模式、静态与动态检测的互补关系以及评估成本(sec:page-3, p.3;sec:page-4, p.4)。可核查的贡献是框架和测试资产的组织与发布;论文正文所读章节未提供足以独立验证所有声称覆盖规模的完整实验对照,具体防御提升幅度未知。

Technical details / 技术细节展开

方法按四类证据逐级提高语义复杂度:基础设施层使用确定性规则匹配;协议与工具层使用由大语言模型驱动的智能体式审计和提示即规则;智能体行为层通过对话升级阶梯、停止规则和金丝雀令牌验证进行多轮黑盒探测;模型层使用包含单轮与多轮攻击算子的越狱测试工具并由模型判定攻击成功(sec:page-5, p.5;sec:page-6, p.6;sec:page-9, p.9)。正文还强调通过上下文管理、模型路由及对扫描器自身输入的防护降低评估系统被攻击的风险(sec:page-3, p.3)。在已读取章节中未获得完整数据集划分、基线配置和统计置信区间,未知部分不作补充。

Experiment results / 实验结果展开

摘要报告 AI-Infra-Guard 覆盖 75 个以上 AI 组件、1,400 条以上漏洞规则,并在 16 个数据集上提供 26 个以上攻击算子的越狱测试平台;正文支持层级—范式对应及流程可操作性(sec:page-5, p.5;sec:page-9, p.9)。摘要未给出相对于具体基线的准确率、召回率或攻击成功率对照,且本次有限章节阅读未通过完整结果表逐项核验这些规模数字,因此规模和比较结果均应视为摘要声称,未知部分不作补充。

中文摘要展开摘要 +

开源 AI 基础设施的快速发展——从模型服务引擎、智能体平台,到模型上下文协议(MCP)生态乃至语言模型本身——已经超过了可用于保护它们的安全工具的演进速度。我们推出 AI-Infra-Guard,这是一个围绕单一核心观察来组织 AI 红队工作的开源框架:AI 智能体的攻击面在不同层级上呈现分层结构(基础设施层、协议/工具层、智能体行为层、模型层),而没有任何单一的检测范式能够同时适用于所有这些层级。因此,该框架为每一层级匹配相应的检测范式:从针对 75 个以上 AI 组件和 1,400 条以上漏洞规则的确定性规则匹配,到由 LLM 驱动的、对 MCP 服务器及智能体技能包进行的智能体式审计以及对智能体的多轮黑盒红队测试,直至一个在十六个数据集上配备 26 个以上攻击算子的越狱测试平台。据我们所知,它是唯一一个同时涵盖上述全部能力的开源框架,其中也包括对智能体技能(这些技能正不断扩展 AI 智能体的能力边界)所进行的供应链审计。我们将 AI-Infra-Guard 以开源形式发布,以使层级—范式匹配能够成为智能体安全的实践基础,以及社区共同构建的共享基座。

English abstract展开原文 +
The fast growth of open-source AI infrastructure, from model serving engines and agent platforms to the Model Context Protocol (MCP) ecosystem and the language models themselves, has outpaced the security tooling available to defend it. We present AI-Infra-Guard, an open-source framework that organizes AI red teaming around a single observation: the attack surface of an AI agent is stratified across layers (infrastructure, protocol/tool, agent behavior, and model), and no single detection paradigm fits all of them. The framework therefore matches a paradigm to each layer, from deterministic rule matching over 75+ AI components and 1{,}400+ vulnerability rules, through LLM-driven agentic auditing of MCP servers and agent-skill packages and multi-turn black-box agent red teaming, to a jailbreak harness with 26+ attack operators over sixteen datasets. To our knowledge it is the only open-source framework to span all of these, including supply-chain auditing of the agent skills that increasingly extend AI agents. We release AI-Infra-Guard as open source so that \emph{layer-paradigm matching} can serve as a practical foundation for agent security and a shared base for the community to build on.
02
正式 venue:arXiv preprint (2026-06-29)Research paper

Security--Fidelity Tradeoffs: The Hidden Cost of Prompt Injection Defense

Mitchell Hermon, Rahul Gupta, Weitong Ruan, Ekraam Sabir, Haohan Wang
Problem / 问题展开

研究问题是:间接提示注入防御是否会以牺牲任务所需的原文保留为代价获得安全性,以及传统攻击成功指标为何无法揭示这种代价。正文把三种输出行为区分为执行探针、将探针作为任务数据处理和忽略探针,并说明只有这种区分才能观察被防御压制的内容(sec:page-2, p.2;sec:page-3, p.3)。既有缺口是安全指标把“安全地处理数据”和“完全不处理数据”视为相同,无法评估翻译、编辑等保真任务。该框架揭示权衡,但不证明某种固定防御在所有部署成本下都应被采用。

Innovation / Contribution / 创新与贡献展开

贡献包括提出安全性—保真度双目标评估视角、构造使三类行为可区分的安全性—保真度基准,以及用决策理论把指标选择与部署成本联系起来(sec:page-2, p.2;sec:page-3, p.3)。正文还区分相同安全分数下通过修复劫持或压制良性内容取得安全性的不同机制,从而避免只看一个安全数字(sec:page-4, p.4)。这些贡献建立了测量和解释框架;在本次读取范围内未发现其与全部现有防御基准的全面覆盖比较,未知部分不作推断。

Technical details / 技术细节展开

基准把任务输入、注入探针以及目标任务组合起来,并预先定义执行、处理和忽略探针对应的可区分输出;正文说明指令模板包含任务及其参数,例如翻译目标语言或实体类别(sec:page-2, p.2;sec:page-4, p.4)。评估在一千一百六十八个样例和四十八种配置上同时记录安全性与保真度,并比较模型和防御配置的前沿位置;进一步按防御如何获得安全性进行行为分析,再用决策理论比较劫持成本与丢失文本成本(sec:page-3, p.3;sec:page-4, p.4)。已读取章节未给出全部模型、提示模板和统计检验细节,无法补充。

Experiment results / 实验结果展开

实验结果显示不存在同时优化两项目标的模型或防御配置;最高保真度配置为百分之九十六点五保真度、百分之四十七点八安全性,最高安全性配置为百分之九十九点三安全性、百分之七十一点零至百分之七十三点九保真度(sec:page-3, p.3)。正文支持相同安全性下防御行为仍有实质差异:有的恢复忠实处理,有的压制无害内容(sec:page-4, p.4)。这些结果支持“安全性单指标不完整”的结论;未读取到足够内容核验所有四十八配置的逐项结果和显著性,因此不宣称更细的排序。

中文摘要展开摘要 +

我们发现,在防御大型语言模型免受间接提示注入攻击时,存在安全性与保真度之间的权衡:防御机制主要通过抑制不可信文本来抵抗注入的指令,但这会破坏必须保留该文本的任务,例如翻译和文档编辑。攻击成功率指标无法观测到这一点,因为忽略注入的模型与忠实地将注入内容作为数据处理的模型,其得分完全相同。我们提出了SecFid,这是一项经过专门构建的基准测试,使执行注入、将其作为数据处理以及忽略注入能够产生可区分的输出。由此可以测量保真度,并揭示出一条前沿:在1,168个示例和48种配置中,没有任何模型或防御机制能够同时实现这两个目标。保真度最高的模型达到了96.5%的保真度,但安全性仅为47.8%;而安全性最高的防御机制则恰好相反,安全性达到99.3%,但保真度仅为71.0%至73.9%。即使安全性相同的防御机制,其实现安全性的方式也存在差异:有些机制会将劫持修复为忠实处理,另一些机制则只是简单地抑制良性内容。决策理论分析说明了为什么不存在一个在所有场景中都正确的固定选择:正确的行为并不是防御机制本身的属性,而是部署环境的属性,由劫持与丢弃文本片段的相对成本所决定。因此,仅凭安全性只能衡量鲁棒性的一半,而在不报告保真度的情况下报告安全性,会掩盖为获得这种安全性所付出的代价。

English abstract展开原文 +
We identify a security-fidelity tradeoff in defending LLMs against indirect prompt injection: defenses resist injected instructions largely by suppressing untrusted text, which corrupts tasks that must preserve it, such as translation and document editing. Attack-success metrics cannot see this, because a model that ignores an injection and one that faithfully processes it as data score identically. We introduce SecFid, a benchmark built so that executing an injection, processing it as data, and ignoring it produce distinguishable outputs. This makes fidelity measurable and exposes a frontier: across 1,168 examples and 48 configurations, no model or defense achieves both objectives. The highest-fidelity model reaches 96.5% fidelity at 47.8% security, while the most secure defenses invert this, at 99.3% security but only 71.0%-73.9% fidelity. Even defenses with identical security differ in how they earn it: some repair hijacks into faithful processing, others simply suppress benign content. A decision-theoretic analysis shows why no fixed choice can be right everywhere: the correct behavior is not a property of the defense but of the deployment, set by its relative cost of a hijack versus a dropped span. Security alone therefore measures only half of robustness, and reporting it without fidelity hides the price at which it was bought.
03
正式 venue:arXiv preprint (2026-06-29)Research paper

Understanding and Evaluating Claw-like Agent Security Through a Computer-Systems Lens

Peizhi Niu, Wenjie Qu, Shangding Gu, Tianneng Shi, Yuankai Li, Ahmad Tawaha, Hend Alzahrani, Vincent Siu, Boyi Li, Chenguang Wang, Jiaheng Zhang, Basel Alomair, Ming Jin, Muhao Chen, Chi Wang, Costas Spanos, Dawn Song
Problem / 问题展开

研究问题是:具有持久权限和系统级职责的类爪智能体,是否存在模型响应与工具调用基准未覆盖的跨组件安全失效。正文指出技能、插件、记忆、网关和外部服务之间的边界会产生供应链完整性、持久状态、跨边界数据流和间接注入风险,现有评估未系统测量这些组合面(sec:page-2, p.2;sec:page-3, p.3)。计算机系统类比提供了保护机制缺口的解释,但不等于证明所有平台都具有相同漏洞。

Innovation / Contribution / 创新与贡献展开

贡献是提出把类爪智能体映射为计算机系统组件的分析视角,定义四类攻击面,并实现安全爪竞技场基准以统一测试技能、插件、状态、数据流和提示注入(sec:page-2, p.2;sec:page-4, p.4)。基准还引入容器化平台副本、金丝雀凭据和九个输出通道的自动化污点跟踪,使隐私泄露和未授权传播可以被观测(sec:page-3, p.3)。正文支持测量框架的覆盖设计;其保护机制是否适用于所有真实部署仍未知。

Technical details / 技术细节展开

研究构造四百零六项对抗任务,覆盖技能供应链完整性、持久状态利用、跨边界数据流和间接提示注入四个攻击面;在开放爪、尼莫爪和安全爪的容器化副本上,组合五个前沿模型进行实验。任务使用金丝雀标记凭据,通过自动化污点跟踪检查智能体回复、外发消息、记忆写入和网关日志等九个输出通道是否出现未授权信息(sec:page-3, p.3;sec:page-4, p.4)。评估以攻击成功率为主要结果,并比较平台、模型及恶意插件条件;完整任务分层和重复试验细节在有限阅读中未完全获得。

Experiment results / 实验结果展开

结果显示最高攻击成功率为百分之七十,恶意插件无论使用何种大语言模型都在百分之百案例中成功;安全爪把GPT-5.4的攻击成功率从百分之七十降至百分之二十二,但作者指出该下降部分来自效用—安全权衡而非主动防御;克劳德奥普斯4.6在所有平台上约为百分之二十二(sec:page-3, p.3)。这些数据支持现有防御不足和插件权限是关键风险的判断。未读取到每个攻击面、模型和平台的完整置信区间及效用分解,因此不扩展为更细的因果结论。

中文摘要展开摘要 +

类 Claw AI 智能体(例如 OpenClaw)是持续运行的进程,能够持久访问凭据、文件、工具和外部服务。它们承担系统级职责,包括安装软件包、维护状态、调度子任务以及协调输入/输出,因此其安全故障所造成的后果远比其他智能体更为严重。然而,现有基准测试侧重于模型响应和工具调用,导致跨组件故障模式在很大程度上未被衡量。我们采用计算机系统类比:将类 Claw 智能体视为一种智能体计算机系统,其中,网关运行时发挥类似操作系统的中介作用,Skills 类似于用户安装的应用程序,而 Plugins 类似于具有运行时权限的可加载扩展。每个组件都有一个经典的对应物,而这些经典对应物的保护机制经过了数十年网络安全研究的不断完善,却在智能体一侧缺失。基于这一视角,我们开发了 SafeClawArena,这是一个包含 406 项对抗性任务的基准测试,涵盖四个攻击面(Skill 供应链完整性、持久状态利用、跨边界数据流和间接提示注入);这些任务在真实智能体平台的容器化副本中执行,使用带有金丝雀标记的凭据,并通过覆盖九个输出通道的自动化污点追踪进行评估。我们评估了三个平台(OpenClaw、NemoClaw、SeClaw)和五个前沿大语言模型。最高攻击成功率达到 70%;无论使用何种大语言模型,恶意 Plugins 的成功率均为 100%。SeClaw 将 GPT-5.4 的攻击成功率从 70% 降至 22%,但这部分是通过效用与安全性的权衡实现的,而非主动防御;与此同时,Claude-Opus-4.6 在每个平台上都已经接近 22% 的下限。这些结果揭示了当前防御措施的不足,并为未来的安全加固指明了方向。代码和数据:https://github.com/sunblaze-ucb/SafeClawArena。

English abstract展开原文 +
Claw-like AI agents (e.g., OpenClaw) are always-on processes with persistent access to credentials, files, tools, and external services. They take on system-level responsibilities -- installing packages, maintaining state, scheduling subtasks, and mediating I/O -- making security failures far more severe than in other agents. Yet existing benchmarks focus on model responses and tool calls, leaving cross-component failure modes largely unmeasured. We adopt a computer-system analogy: treating a Claw-like agent as an agentic computer system whose gateway runtime plays an OS-like mediation role, whose Skills resemble user-installed applications, and whose Plugins resemble loadable extensions with runtime privileges. Each component has a classical counterpart whose protection mechanisms -- refined over decades of cybersecurity research -- are absent on the agent side. From this perspective, we develop SafeClawArena, a benchmark of 406 adversarial tasks across four attack surfaces (Skill Supply-Chain Integrity, Persistent State Exploitation, Cross-Boundary Data Flow, and Indirect Prompt Injection), executed in containerized replicas of real agent platforms with canary-marked credentials and evaluated via automated taint tracking across nine output channels. We evaluate three platforms (OpenClaw, NemoClaw, SeClaw) and five frontier LLMs. The highest attack success rate reaches 70%; malicious Plugins succeed in 100% of cases regardless of the LLM. SeClaw cuts GPT-5.4's attack success rate from 70% to 22%, partly through utility-security tradeoffs rather than active defenses, while Claude-Opus-4.6 already sits near a 22% floor on every platform. These results expose the inadequacy of current defenses and suggest directions for future hardening. Code and data: https://github.com/sunblaze-ucb/SafeClawArena.
09
正式 venue:arXiv preprint (2026-06-10)Research paper

Grammar-Constrained Decoding Can Jailbreak LLMs into Generating Malicious Code

Yitong Zhang, Shiteng Lu, Jia Li
Problem / 问题展开

研究问题是:把输出限制在形式合法的程序语法内,是否足以阻止恶意代码生成。正文指出安全对齐常以拒答文本为目标,但拒答的句法模式可能被语法约束规避;攻击者可使用禁止注释或pass语句的语法重新打开攻击(sec:page-2, p.2;sec:page-3, p.3)。研究缺口是以语法合法性替代语义安全,忽视合法程序结构仍可能表达恶意行为。该结论针对所测语法和模型,不证明所有约束解码实现都必然可绕过。

Innovation / Contribution / 创新与贡献展开

贡献是系统揭示语法约束解码与安全对齐之间的错位,构造对自然语言拒答和狭窄安全句法模式的绕过,并使用代码蜜罐讨论更稳健的安全评估思路(sec:page-2, p.2;sec:page-3, p.3)。论文把“能否生成合法语法”与“生成代码是否安全”区分开来。有限章节未提供完整模型列表和所有攻击算子,具体覆盖范围未知。

Technical details / 技术细节展开

研究对恶意代码请求施加程序语法约束,比较模型在自然语言拒答、注释或pass语句等安全模式下的输出,并构造更紧的语法禁止这些表面模式,观察模型是否仍能生成语法合法的恶意程序(sec:page-2, p.2;sec:page-3, p.3)。代码蜜罐用于区分安全响应与危险代码行为(sec:page-2, p.2)。已读取章节未完整说明每个模型、语法、样本和成功判定标准,因此不补充未见的实验参数。

Experiment results / 实验结果展开

摘要报告在 4 个基准和 10 个流行大语言模型上,CodeSpear 优于代表性越狱基线,并使平均攻击成功率提高超过 30 个百分点;CodeShield 在 CodeSpear 攻击下恢复安全性,同时保留良性任务效用。上述对照和提升幅度来自摘要报告;摘要未给出绝对攻击成功率或完整基线名称,本次有限正文阅读未核验逐模型结果及显著性,因此不补写更多数字。

中文摘要展开摘要 +

大语言模型(LLM)正越来越多地用于代码生成,这引发了人们对其可能被滥用于生成恶意代码的担忧。与此同时,语法约束解码(Grammar-Constrained Decoding,GCD)已被广泛用于通过强制保证语法有效性来提高大语言模型生成代码的可靠性。在本文中,我们揭示了一种反直觉的风险:这种以可靠性为导向的技术本身可能成为攻击面。我们发现了一种名为 CodeSpear 的新型越狱攻击,该攻击利用 GCD 诱导大语言模型生成恶意代码。我们的实验表明,仅施加一个良性的代码语法约束,就能有效地使大语言模型越狱。为解决这一漏洞,我们提出了 CodeShield,这是一种即使在攻击者控制语法约束的情况下,也能稳健保持安全行为的安全对齐方法。CodeShield 通过教会模型在 GCD 下生成蜜罐代码,在代码模态中对模型进行对齐。此类代码在语义上无害,因此不会实现恶意请求;同时,其结构具有多样性,因此难以通过收紧语法约束来抑制。与此同时,当自然语言可用时,CodeShield 仍能保留自然语言拒绝响应。在 4 个基准上对 10 个流行大语言模型进行的实验表明,CodeSpear 的表现优于具有代表性的越狱基线方法,并使攻击成功率平均提高超过 30 个百分点。CodeShield 还能够在 CodeSpear 攻击下恢复安全性,同时保留良性任务效用。我们的研究结果揭示了 GCD 的一项根本性风险,并呼吁人们更加关注其潜在的安全影响。

English abstract展开原文 +
Large Language Models (LLMs) are increasingly used for code generation, raising concerns that they may be misused to produce malicious code. Meanwhile, Grammar-Constrained Decoding (GCD) has been widely adopted to improve the reliability of LLM-generated code by enforcing syntactic validity. In this paper, we reveal a counterintuitive risk: this reliability-oriented technique can itself become an attack surface. We uncover a new jailbreak attack, termed CodeSpear, that exploits GCD to induce LLMs into generating malicious code. Our experiments show that simply applying a benign code grammar constraint can effectively jailbreak LLMs. To address this vulnerability, we propose CodeShield, a safety alignment approach that robustly preserves safe behavior even under attacker-controlled grammar constraints. CodeShield aligns the model in the code modality by teaching it to generate honeypot code under GCD. Such code is semantically harmless, so it does not implement the malicious request, and structurally diverse, so it is difficult to suppress through grammar tightening. At the same time, CodeShield still preserves natural-language refusals when natural language is available. Experiments on 10 popular LLMs across 4 benchmarks show that CodeSpear outperforms representative jailbreak baselines and increases the attack success rate by more than 30 percentage points on average. CodeShield also restores safety under CodeSpear while preserving benign utility. Our findings reveal a fundamental risk of GCD and call for greater attention to its potential security implications.
10
正式 venue:arXiv preprint (2026-06-09)Research paper

Game-Theoretic Multi-Agent Control for Robust Contextual Reasoning in LLMs

Saeid Jamshidi, Amin Nikanjam, Arghavan Moradi Dakhel, Kawser Wazed Nafi, Foutse Khomh
Problem / 问题展开

研究问题是:多智能体大语言模型在多轮交互中如何抵抗恶意上下文注入、漂移和跨轮记忆污染,同时保留有用的上下文。正文把推理描述为闭环动态过程,并指出只在单轮输入或单个输出上做过滤无法控制整条推理轨迹(sec:page-2, p.2;sec:page-3, p.3)。研究缺口是缺少同时考虑结构锚定、语义一致、时间稳定和多智能体协同的轨迹级控制。该架构不证明对未建模攻击和任意模型都有效。

Innovation / Contribution / 创新与贡献展开

贡献是提出博弈论安全上下文控制,将安全上下文推理建模为受控动态系统,并设计分层闭环架构来隔离不可信流入、协调异质智能体、评分候选输出和验证持久记忆更新(sec:page-2, p.2;sec:page-3, p.3;sec:page-4, p.4)。方法的核心创新是把因果一致性、跨智能体协议和上下文漂移纳入同一个轨迹级控制目标。有限章节支持架构和目标定义,但未完整证明其在所有任务中的最优性。

Technical details / 技术细节展开

控制层把已验证上下文与不可信输入分离,生成和协调多个异质模型候选,并依据因果一致性、跨智能体一致性、上下文漂移及时间稳定性评分;只有通过验证的选择才能更新持久记忆(sec:page-3, p.3;sec:page-4, p.4)。博弈论部分通过让对抗偏离在控制目标下缺乏策略吸引力来稳定轨迹(sec:page-2, p.2)。已读取章节未完整给出攻击集、模型组合、轮数、基线和统计协议,故这些实验设置未知。

Experiment results / 实验结果展开

摘要报告在自适应对抗威胁下进行 500 轮交互:99.6% 的轮次中上下文漂移保持有界,0.4% 的轮次需要恢复;每轮效用中位数为 -0.19,第 5 百分位为 -0.72,第 95 百分位为 0.30,低于 -1 的严重退化仅占 0.4%。摘要还报告控制器层面没有注入成功,选中输出的稳定胜率高于 98%,每个 token 的延迟为 1.63×10⁻³ 秒。上述为摘要报告;正文有限阅读未核验基线、攻击集和统计显著性,不将其外推为所有模型或攻击(sec:page-3, p.3;sec:page-4, p.4)。

中文摘要展开摘要 +

大型语言模型(Large Language Models,LLMs)在多轮交互中维护的是持续演化的上下文,而非生成孤立的响应,这使它们容易遭受提示注入和上下文投毒攻击——在这些攻击中,局部看似合理的对抗性片段会逐渐扭曲推理轨迹。现有的防御主要对单次输出进行过滤,往往忽略了跨轮次的上下文演化,使长程推理暴露于攻击之下。尽管模型上下文协议(Model Context Protocol,MCP)对上下文交换和工具调用进行了标准化,但它仅作为一个被动路由层运作,并不会强制保障上下文的稳定性。为解决上述局限,我们提出了博弈论安全模型上下文协议(Game-Theoretic Secure Model Context Protocol,GT-MCP),这是一种由控制器驱动的多智能体方法,将上下文管理视为一个闭环动力学过程。GT-MCP 协调三个异构的 LLM 智能体,并通过一个信任函数来选择输出;该信任函数联合评估以下三项指标:相对于已验证上下文图的因果一致性、智能体之间的语义一致性,以及随时间演化的分布漂移。当检测到不稳定时,基于回滚的自愈机制会恢复已验证的上下文,并阻止未经验证的片段继续传播。在自适应对抗威胁模型下对 500 轮交互进行的实证评估显示,99.6% 的轮次中上下文漂移保持在有界范围内,仅有 0.4% 的轮次需要触发恢复。每轮效用保持高度集中,中位数 = -0.19,第 5 百分位 = -0.72,第 95 百分位 = 0.30;低于 -1 的严重退化仅出现于 0.4% 的情况,且没有任何注入尝试在控制器层面取得成功。被选中的输出保持着高于 98% 的稳定胜率,计算开销也保持在可预测的水平,每个 token 的延迟 = 1.63×10⁻³ 秒。

English abstract展开原文 +
Large Language Models (LLMs) in multi-turn interactions maintain evolving context rather than generating isolated responses, making them vulnerable to prompt-injection and context-poisoning attacks in which locally plausible adversarial fragments gradually distort reasoning trajectories. Existing defenses mainly filter individual outputs and often ignore context evolution across turns, leaving long-horizon reasoning exposed. Although the Model Context Protocol (MCP) standardizes context exchange and tool invocation, it functions as a passive routing layer and does not enforce contextual stability. To address these limitations, we introduce the Game-Theoretic Secure Model Context Protocol (GT-MCP), a controller-driven multi-agent method that treats context management as a closed-loop dynamical process. GT-MCP coordinates three heterogeneous LLM agents and selects outputs through a trust function that jointly evaluates causal consistency against a validated context graph, semantic agreement among agents, and distributional drift over time. When instability is detected, a rollback-based self-healing mechanism restores the validated context and prevents unsupported fragments from propagating. Empirical evaluation over 500 interaction turns under an adaptive adversarial threat model shows that contextual drift remains bounded in 99.6% of turns, with recovery required in only 0.4%. Per-turn utility remains tightly concentrated, with median = -0.19, P05 = -0.72, and P95 = 0.30; severe degradation below -1 occurs in only 0.4% of cases, and no injection attempt succeeds at the controller level. Selected outputs maintain stable win rates above 98%, and computational overhead remains predictable, with latency per token = 1.63e-3 s.