LLM SECURITY DIGEST
Daily Papers
LLM Security 论文日报、双语摘要与精读笔记。
01
查看完整日报 ↗
LATEST DIGEST
今日论文速览
2026-08
04
2026-08-04 · 10 papers
开始阅读 →
01
OthersSecuring the AI Agent: A Unified Framework for Multi-Layer Agent Red Teaming开源 AI 基础设施的快速发展——从模型服务引擎、智能体平台,到模型上下文协议(MCP)生态乃至语言模型本身——已经超过了可用于保护它们的安全工具的演进速度。我们推出 AI-Infra-Guard,这是一个围绕单一核心观…
↗
02
OthersSecurity--Fidelity Tradeoffs: The Hidden Cost of Prompt Injection Defense我们发现,在防御大型语言模型免受间接提示注入攻击时,存在安全性与保真度之间的权衡:防御机制主要通过抑制不可信文本来抵抗注入的指令,但这会破坏必须保留该文本的任务,例如翻译和文档编辑。攻击成功率指标无法观测到这一点,因为忽…
↗
03
OthersUnderstanding and Evaluating Claw-like Agent Security Through a Computer-Systems Lens类 Claw AI 智能体(例如 OpenClaw)是持续运行的进程,能够持久访问凭据、文件、工具和外部服务。它们承担系统级职责,包括安装软件包、维护状态、调度子任务以及协调输入/输出,因此其安全故障所造成的后果远比其他…
↗
04
Main TrackFrom Tool Connection to Execution Control: Benchmarking Security Invariants in MCP-Style Agent RuntimesMCP 风格的生态系统为语言模型应用提供了一个实用的连接层,用于连接工具、资源、提示词和传输机制。随着智能体从连接转向执行,安全决策往往仍然分散在客户端、服务器、提示词、审批对话框、OAuth 部署和日志之间。本文探讨运…
↗
02
DEEP READING
精读笔记
从“知道这篇论文”到真正理解它的机制、实验与局限。
FOCUS AREAS持续追踪六个
持续追踪六个
LLM 安全方向
JailbreakPrompt InjectionPrivacyBackdoorAlignmentAgent Security