LLM SECURITY DIGEST

Daily Papers

LLM Security 论文日报、双语摘要与精读笔记。

TODAY 2026-08-04 10 篇论文 中英双语 · 核心总结 进入今日日报
01

LATEST DIGEST

今日论文速览

查看完整日报
2026-08 04 2026-08-04 · 10 papers 开始阅读
01 OthersSecuring the AI Agent: A Unified Framework for Multi-Layer Agent Red Teaming开源 AI 基础设施的快速发展——从模型服务引擎、智能体平台,到模型上下文协议(MCP)生态乃至语言模型本身——已经超过了可用于保护它们的安全工具的演进速度。我们推出 AI-Infra-Guard,这是一个围绕单一核心观… 02 OthersSecurity--Fidelity Tradeoffs: The Hidden Cost of Prompt Injection Defense我们发现,在防御大型语言模型免受间接提示注入攻击时,存在安全性与保真度之间的权衡:防御机制主要通过抑制不可信文本来抵抗注入的指令,但这会破坏必须保留该文本的任务,例如翻译和文档编辑。攻击成功率指标无法观测到这一点,因为忽… 03 OthersUnderstanding and Evaluating Claw-like Agent Security Through a Computer-Systems Lens类 Claw AI 智能体(例如 OpenClaw)是持续运行的进程,能够持久访问凭据、文件、工具和外部服务。它们承担系统级职责,包括安装软件包、维护状态、调度子任务以及协调输入/输出,因此其安全故障所造成的后果远比其他… 04 Main TrackFrom Tool Connection to Execution Control: Benchmarking Security Invariants in MCP-Style Agent RuntimesMCP 风格的生态系统为语言模型应用提供了一个实用的连接层,用于连接工具、资源、提示词和传输机制。随着智能体从连接转向执行,安全决策往往仍然分散在客户端、服务器、提示词、审批对话框、OAuth 部署和日志之间。本文探讨运…
02

DEEP READING

精读笔记

从“知道这篇论文”到真正理解它的机制、实验与局限。

FOCUS AREAS

持续追踪六个
LLM 安全方向

JailbreakPrompt InjectionPrivacyBackdoorAlignmentAgent Security