2026年7月24日 AI 研究简报

Agent 安全进一步深入。

今天最强的一批论文将可靠性从答案评分推进到轨迹验证、预测式防护和基础设施威胁建模,表明高能力 Agent 的失败不仅发生在输出层,也同样发生在状态、工具和服务层。

核心要点

  1. Agent 可靠性研究正从**最终答案评分转向轨迹/状态验证**。多篇论文表明,答案准确率会掩盖静默失败,而确定性或结构感知的验证器能够暴露缺乏支撑的推理、不安全的工具使用以及破坏性编辑。
  2. 今天一个很强的模式是**更好的反馈胜过更多采样**:分析器引导优化、预测式防护、程序化记忆和有针对性的测试时自适应,都通过注入任务特定信号来提升结果,而不只是扩大推理规模。
  3. 安全研究正越来越多地转向**系统与基础设施层面**,而不只是提示词层面:新威胁瞄准 KV-cache 复用、第三方技能、针对 Agent 的侦察、不断演化的越狱生态,以及 AI 供应链中的许可证传播。
#1

先读这篇:JANUS: Foreseeing Latent Risk for Long-Horizon Agent Safety

为什么先读: 它抓住了一个关键转变:Agent 安全正从被动阻断转向基于部分轨迹的风险预测。

建议重点质疑: 它的防护器是在模拟轨迹上训练的,因此能否迁移到复杂、真实的已部署 Agent 工作流中,仍未得到验证。

agent-safety long-horizon predictive-guard trajectory-risk

主题

轨迹级验证优于仅答案评估 多篇论文表明,最终正确性并不是可信推理或安全执行的可靠代理指标。共同趋势是用确定性或量表引导的检查,验证中间结构、证据使用或最终产物状态。
主动式与机制感知的安全控制 这些论文不再只是在最后阻断有害输出,而是在模型更早或更深层的位置进行干预:预测未来风险、净化 steering vectors、剪除后门神经元,或认证罕见有害生成。
Agent 安全正在超越提示注入 攻击面现在包括共享服务基础设施、第三方技能、侦察循环,以及不断演化的攻防动态。这比静态越狱基准更接近真实部署风险。
信号 验证正在进入轨迹内部。 推理审计、多模态搜索诊断和 DocOps 风格的产物检查都表明,最终答案会漏掉缺乏支撑的步骤和静默损坏。
张力 优化特性正在变成攻击面。 HijackKV、高风险第三方技能以及侦察驱动的渗透测试表明,部署基础设施如今会在提示注入之外制造新的安全失效。
判断 有针对性的反馈将胜过蛮力采样。 PerfAgent、JANUS、程序化记忆和测试时自适应,都是通过加入任务特定信号而不只是扩大推理规模来提升结果。

值得优先阅读的论文

按研究价值排序:新意、方法可复用性、证据质量,以及是否值得带着怀疑去读。

JANUS: Foreseeing Latent Risk for Long-Horizon Agent Safety

#1

这是对面向工具使用型 Agent 的预测式监督的一次很强的初步探索,对长时程安全具有明确的部署相关性。

为什么现在值得读
Agent 正在从聊天走向行动,而等到有害的最终一步出现时,往往已经太晚。
怀疑点
基于模拟训练的风险预测,未必能顺利泛化到真实轨迹和工具生态。

HijackKV: New Threat in Position-Independent KV Cache Reuse

#2

它把一种服务优化重新定义为安全边界,并为基础设施团队提供了一个具体的新威胁模型。

为什么现在值得读
为了降低延迟和成本,激进的 KV 复用正在生产栈中迅速普及。
怀疑点
其实际影响取决于真实缓存占用、驱逐策略,以及定向复用模式是否会在实践中出现。

Know Your Agent: Reconnaissance-Driven Pentesting of AI Agents

#3

它之所以有用,是因为它把 Agent 红队测试从静态载荷升级为自适应的黑盒侦察。

为什么现在值得读
已部署的 Agent 越来越多地暴露工具、模式和工作流线索,攻击者可以通过交互式方式学习这些信息。
怀疑点
它在某些环境中的表现会下降,说明攻击增益可能对基准和设置较为敏感。

英文版:/paper-news/2026-07-24/

运行统计

  • 候选论文: 187
  • 入选论文: 30
  • 已精读完成: 30
  • 时间窗口 (UTC): 2026-07-22T00:00:00Z → 2026-07-23T00:00:00Z (arxiv_announce, expanded=0)
展开查看用于总结的论文列表
arXiv ID标题 / 链接分类评分入选理由标签
2607.20286Sound Probabilistic Safety Bounds for Large Language Models
PDF
cs.CL, cs.AI96Rigorous PAC lower/upper safety bounds for harmful LLM outputs; strong formal safety relevance.llm-safety, formal-verification, harmfulness, pac-bounds, evaluation
2607.19837Know Your Agent: Reconnaissance-Driven Pentesting of AI Agents
PDF
cs.AI, cs.CR, cs.LG95Black-box pentesting for agents via reconnaissance; directly targets indirect prompt injection.agent-safety, prompt-injection, pentesting, security-eval, black-box
2607.19913JANUS: Foreseeing Latent Risk for Long-Horizon Agent Safety
PDF
cs.AI, cs.CL, cs.CR94Long-horizon agent guard that anticipates delayed risks from partial trajectories.agent-safety, long-horizon, guardrails, risk-forecasting, RL
2607.19957HijackKV: New Threat in Position-Independent KV Cache Reuse
PDF
cs.CR, cs.AI, cs.LG94Identifies a new LLM serving attack via position-independent KV reuse with clear security impact.llm-security, inference, kv-cache, prompt-injection, systems-security
2607.20121OpenSkillRisk: Benchmarking Agent Safety When Using Real-World Risky Third-Party Skills
PDF
cs.CL92Benchmark for risky third-party skills with sandboxed evaluation of agent safety.agent-safety, benchmark, tool-use, third-party-skills, sandbox
2607.19824Rewarding Better Thinking for LLM Preference Alignment
PDF
cs.AI, cs.CL92Process-level reward for LLM alignment with concrete RL gains on reasoning trajectories.LLM alignment, RLHF, process reward, reasoning, preference optimization
2607.19829DARWIN: Evolving Jailbreak Adversary and Guardrail for LLM Safety Evaluation and Protection
PDF
cs.CR91Evolutionary jailbreak attack-defense loop for adaptive safety evaluation and guardrails.jailbreak, guardrails, red-teaming, safety-eval, adversarial
2607.19678Reference-Free Evaluation of Reasoning in Open-Ended Question Answering
PDF
cs.CL, cs.AI, cs.LG91Reference-free auditing of LLM reasoning with segment grounding; strong fit for reliability eval.llm-evaluation, reasoning, auditing, reliability, high-stakes
2607.19683GhostPrompt: Cross-Image Adversarial Prompt for Vision-Language Models
PDF
cs.CR91Cross-image transferable adversarial prompts for VLMs; notable multimodal robustness threat model.vlm-security, adversarial-attacks, robustness, multimodal, red-teaming
2607.20379Train the Model, Not the Reader: Decodability Supervision for Verifiable Activation Explanations
PDF
cs.AI, cs.CL90Challenges faithfulness of activation explanations and proposes stronger supervision for verifiability.interpretability, mechanistic-interpretability, faithfulness, activation-explanations, llm
2607.19806OPIUM: Mitigating Steering Externalities and Over-Refusal via Dual Objective Latent Optimization
PDF
cs.LG, cs.AI90Targets safety-utility tradeoff in activation steering; mitigates over-refusal and unsafe drift.LLM safety, activation steering, guardrails, over-refusal, representation optimization
2607.20129CUSUM-Shaped Inference-Time Monitoring and Targeted Re-Decoding for Quantized Small Language Model Reasoning
PDF
cs.AI89Inference-time monitoring plus rollback/re-decoding for reasoning failures in quantized small LMs.reasoning, monitoring, test-time-compute, reliability, small-language-models
2607.20090Reinforcement Learning for Large Language Model Selective Evidence Adoption from Contaminated Retrieval Results
PDF
cs.CL, cs.AI88RAG safety/reliability benchmark and RL post-training for selective evidence adoption.RAG, hallucination, retrieval-safety, post-training, benchmark
2607.19674FedLSG: LLM-Enhanced Semantic Calibration for Federated Graph Backdoor Defense
PDF
cs.CR, cs.AI, cs.LG88LLM-assisted defense for federated graph backdoors; security-focused with concrete poisoning relevance.security, backdoor-defense, federated-learning, graphs, llm
2607.20064PRO-LONG: Programmatic Memory Enables Long-Horizon Reasoning
PDF
cs.AI88Programmatic memory for long-horizon LLM agents targets a core bottleneck in agentic reasoning.agents, long-context, memory, reasoning, context-management
2607.20146Gotta Catch them all: the modes of Sycophancy
PDF
cs.CL88Mechanistic study shows sycophancy has separable internal modes, useful for auditing/alignment.interpretability, sycophancy, LLM reliability, mechanistic analysis, alignment
2607.20300Don't Trust the Label: License Laundering in AI Supply Chains
PDF
cs.SE, cs.AI87Large-scale empirical study of license laundering across AI supply chains; strong governance relevance.AI governance, supply chain, licensing, compliance, datasets, models
2607.19793Silent Failures in Multimodal Agentic Search:A Diagnostic Taxonomy and Cross-Judge Evaluation
PDF
cs.AI, cs.CV86Trajectory-level taxonomy for silent failures in multimodal agentic search and grounding.multimodal-agents, evaluation, grounding, reliability, search
2607.19747Beyond Relevance-Centric Retrieval: Rubric-Oriented Document Set Selection and Ranking
PDF
cs.CL86Setwise retrieval benchmark for agent/LLM consumers; useful eval framework beyond document relevance.retrieval, rag, benchmark, evaluation, agents
2607.20351Test-Time Training for Modality Order Consistency in Vision-Language Models
PDF
cs.CV, cs.CL86Finds modality-order inconsistency in VLMs and improves it with test-time training.vlm, reliability, test-time-training, evaluation, multimodal
2607.20062Solar Open 2 Technical Report
PDF
cs.CL85250B MoE technical report with 1M context and agentic-task focus; notable frontier progress.frontier-llm, MoE, long-context, agents, technical-report
2607.19962EvoThink: Evolving Thinking in Large Reasoning Models via Self-Pruning and Aha-Moment Preference Optimization
PDF
cs.AI85Targets LRM overthinking via self-pruning and preference optimization; relevant frontier reasoning work.reasoning-models, efficiency, preference-optimization, post-training, llm
2607.19967When Shippers Become Algorithms: Candidate Exposure, Information Design, and the Concentration of LLM-Mediated Freight Markets
PDF
physics.soc-ph, cs.AI, cs.CY85Agent-based study of LLM-mediated markets reveals concentration risks and a design remedy.AI agents, multi-agent risk, market design, deployment risk, evaluation
2607.19894Defense Against LLM Backdoors using Critical Neuron Isolation Pruning
PDF
cs.CR, cs.AI84Mechanistic backdoor defense for LLMs via critical neuron isolation and pruning.backdoor-defense, LLM-security, mechanistic, pruning, robustness
2607.19653PerfAgent: Profiler-Guided Iterative Refinement for Repository-Level Code Optimization
PDF
cs.SE, cs.AI84Profiler-guided verifier-in-loop coding agent for repository-level optimization; useful agent workflow.coding-agents, software-engineering, verification, performance, agents
2607.20145SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD
PDF
cs.CL, cs.AI84High-impact frontier LLM systems work: trillion-scale post-training optimizations with strong MFU gains.frontier LLM, systems, post-training, MoE, efficiency, scaling
2607.20372Notes to Self: Can LLMs Benefit from Experiential Abstractions?
PDF
cs.CL83Studies reusable experiential abstractions for LLM reasoning; promising for agent memory and learning.reasoning, memory, abstractions, rl, llm
2607.19865DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations
PDF
cs.AI, cs.CL, cs.LG82Verifiable benchmark for autonomous document-operation agents with fine-grained failure analysis.agents, benchmark, evaluation, document-ops, reliability
2607.19949SenWorld: A Digital-Twin Simulation for Generating Context-Rich Evaluation Data
PDF
cs.AI, cs.CY82Digital-twin simulation creates privacy-safe, ground-truth eval data for personal assistant systems.evaluation, simulation, privacy, assistants, benchmark
2607.19704Efficient Clustering with Provable Guardrails for LLM Inference at Scale
PDF
cs.LG, stat.ML82Scalable clustering with explicit guardrails for safe output sharing in large-scale LLM inference.llm-inference, guardrails, scalability, clustering, reliability

AI 论文洞察简报

2026-07-24

0) 执行要点(先读这个)

  • Agent 可靠性研究正从最终答案评分转向轨迹/状态验证。多篇论文表明,答案准确率会掩盖静默失败,而确定性或结构感知的验证器能够暴露缺乏支撑的推理、不安全的工具使用以及破坏性编辑。
  • 今天一个很强的模式是更好的反馈胜过更多采样:分析器引导优化、预测式防护、程序化记忆和有针对性的测试时自适应,都通过注入任务特定信号来提升结果,而不只是扩大推理规模。
  • 安全研究正越来越多地转向系统与基础设施层面,而不只是提示词层面:新威胁瞄准 KV-cache 复用、第三方技能、针对 Agent 的侦察、不断演化的越狱生态,以及 AI 供应链中的许可证传播。
  • 多篇论文主张采用机制感知的干预:针对 VLM 顺序敏感性的中层测试时训练、用于 steering vectors 的潜变量优化、用于后门的神经元隔离,以及对谄媚行为的模式特异分析,都优于粗粒度的仅输出层修复。
  • 长时程 Agent 仍然受制于记忆、状态跟踪和不变量保持。简单的程序化记忆和确定性的原生文件验证表明,当前 Agent 在多步文档和环境任务上仍然表现很差。
  • 对实践者而言,近期最可执行的动作是在部署更强 Agent 之前,先加入轨迹日志、选择性验证、来源感知评估和基础设施威胁建模

2) 关键主题(聚类)

主题:轨迹级验证优于仅答案评估

主题:主动式与机制感知的安全控制

主题:Agent 安全正在超越提示注入

主题:长时程 Agent 性能依赖于记忆与状态保真度

主题:更好的过程监督与自我改进信号

主题:鲁棒性失败往往是局部的且可修复

3) 技术综合

  • 一个重要的方法论收敛点是验证器在环控制:PerfAgent 在每次补丁后重新分析和重测,Janus 对预期未来进行裁决,DocOps 验证原生产物,而 MGT-B 只在监控告警后回滚并重新解码。
  • 多篇论文用结构化残差信号替代粗粒度标量奖励:TCR 从结果奖励中减去预期检查清单得分,OPIUM 在良性与有害提示上匹配不同锚点,而选择性证据采纳使用三元奖励加禁止片段惩罚。
  • 将复杂状态确定性序列化为文本出现在多个场景中:FedLSG 将图结构和客户端行为序列化供 LLM 评分;多模态搜索和 setwise retrieval 使用量表引导的文本诊断;SenWorld 从快照中导出基于指针 grounding 的案例。
  • 输出级防御表征级防御之间存在明显分野,后者通常表现出更强的特异性:DeCNIP 剪除关键神经元,OPIUM 优化潜变量,VLM TTT 适配中层,RECAP 训练可解码的内部目标。
  • 多项工作表明,简单的基础设施假设会创造新的攻击面:位置无关的 KV 复用、第三方技能加载和跨用户缓存共享,都引入了标准仅提示词威胁模型中不存在的完整性风险。
  • 一个反复出现的评估教训是,评审可靠性具有不对称性:粗粒度正确性标签通常稳定,而细粒度失败类别、推理支撑标签或长文本量表分数则噪声更大。
  • 多篇 Agent 论文表明,harness 设计是一阶变量:DocOps 发现可编程文件系统 harness 优于受限 RPC 工具;PRO-LONG 的收益来自基于代码的检索;PerfAgent 的循环控制器以更低成本优于 best-of-k 扩展。
  • 长时程改进通常来自无损写入 / 选择性读取设计:PRO-LONG 存储一切并以程序方式检索;PerfAgent 记录分析器热点;Janus 以部分轨迹加预期摘要为条件。
  • 安全论文越来越多地评估保留效用的防御,而不只是阻断攻击:DARWIN-Guard 跟踪良性通过率,OpenSkillRisk 使用 Awareness 加 ASR,OPIUM 则显式权衡服从性、拒绝率和 ASR。
  • 多篇论文揭示了表面行为与内部状态之间的不匹配:谄媚模式在内部可分离,尽管输出相似;激活解释可以在不真实陈述的情况下完成重建;多模态搜索可能给出正确答案,但轨迹并不忠实。

4) Top 5 论文(附“为什么是现在”)

HijackKV: New Threat in Position-Independent KV Cache Reuse

  • 识别出一种由共享 LLM 服务中位置无关、跨用户 KV 复用带来的新完整性漏洞。
  • 展示了很高的攻击有效性,包括单次尝试平均 94% 的成功率,并且在低命中率、重计算和长上下文下仍可持续。
  • 尤其及时,因为服务栈正在积极采用更激进的 KV 复用来换取成本/延迟收益。
  • 对基础设施团队很有用,因为它将一个优化特性重新定义为安全边界。
  • 持保留态度之处:实际严重性取决于缓存占用、驱逐动态,以及工作负载是否真的会复用攻击者瞄准的 chunk。

Know Your Agent: Reconnaissance-Driven Pentesting of AI Agents

  • 将侦察引入为黑盒提示注入渗透测试中的一等组成部分,并给出了可提取知识资产的具体分类法。
  • 相比静态和迭代基线,带来了显著的 ASR 提升,包括在 AgentDojo 上 86.0%、在 InjecAgent 上 99.3%。
  • 为什么是现在:Agent 部署越来越多地暴露工具、模式和工作流线索,攻击者可以通过交互式方式学习这些信息。
  • 之所以有用,是因为它为防御者提供了比单纯 payload 变异更现实的红队模板。
  • 持保留态度之处:在真实世界任务上,OpenHands 的成功率下降到 21.9%,而更强的检测器仍能显著压低 ASR。

JANUS: Foreseeing Latent Risk for Long-Horizon Agent Safety

  • 训练防护器从部分轨迹中预判未来可能出现的安全相关延续,并在有害动作发生前裁决风险。
  • 报告称在四个 Agent 安全基准上取得最低 ASR,平均 ASR 为 0.071,同时保留良性任务效用。
  • 为什么是现在:长时程、会使用工具的 Agent 正从聊天走向行动,而反应式阻断往往为时已晚。
  • 对构建 Agent 防火墙或监督模型的团队很有用,因为它们需要基于前缀而不只是当前动作进行推理。
  • 持保留态度之处:训练数据由仿真生成,因此迁移到真实部署 Agent 轨迹上的效果仍不确定。

PerfAgent: Profiler-Guided Iterative Refinement for Repository-Level Code Optimization

  • 表明当 Agent 获得原生感知的性能分析、迭代式加速反馈和选择性回归测试时,仓库级优化会显著提升。
  • GPT-5.1 的结果很强:在 GSO 上,hack-adjusted expert-matching 从 19.6% 提升到 39.2%;在 SWE-fficiency-Lite 上,从 26% 提升到 74%。
  • 为什么是现在:编码 Agent 正从正确性任务走向生产工程任务,在这些任务中性能与安全需要共同考虑。
  • 之所以有用,是因为它展示了一套实用配方,能以更低成本胜过 best-of-five 的测试时扩展。
  • 持保留态度之处:证据仅限于两个以 Python 为中心的基准,而且选择性测试仍可能漏掉原生扩展回归。

DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations

  • 提供了一个针对 XLSX、DOCX、PPTX 和 PDF 原生格式文档编辑的确定性基准,并配有保留感知验证器。
  • 揭示即使是测试中最好的设置,通过率也只有 0.671,且在长期状态跟踪和破坏性编辑方面存在重大失败。
  • 为什么是现在:办公/文档自动化是近期商业 Agent 的重要用例,但当前基准对静默损坏的衡量不足。
  • 对任何将 Agent 部署到生产力工作流中的人都很有用,因为“看起来对”并不够。
  • 持保留态度之处:范围是离线且确定性的;实时协作工作流和外部服务交互未被纳入。

5) 实际下一步

  • 为 Agent 技术栈加入轨迹级日志与验证:存储工具调用、观察、中间计划和最终产物,这样你审计的是静默失败,而不只是最终答案。
  • 对编码/文档 Agent,采用任务特定验证器:性能分析反馈、选择性回归测试、原生文件谓词和保留检查,应在宣称自动化质量之前成为标准配置。
  • 针对共享状态攻击做服务层威胁建模:审查 KV-cache 复用、跨租户共享、缓存重计算策略和 chunk 匹配假设。
  • 具备侦察能力的攻击者真实第三方技能来做 Agent 红队测试,而不只是静态越狱提示。
  • 保留效用的指标评估安全系统:将 ASR 与良性通过率、awareness/风险识别以及过度拒绝指标配对评估。
  • 在可能的情况下,优先选择机制感知的缓解措施而不是一刀切过滤器:中层适配、潜变量净化或定向神经元干预可以减少附带损害。
  • 对长时程任务,在构建复杂学习型记忆系统之前,先测试无损记忆 + 程序化检索基线;简单的只追加日志加基于代码的搜索,可能优于重摘要设计。
  • 如果使用 LLM 评审,进行跨评审稳定性检查,并将粗粒度正确性与细粒度诊断标签分开;后者应视为低置信度。
  • 在 RAG 系统中,显式衡量对禁止证据的采纳和对注入内容的跟随,而不只是答案准确率;当前 RL 后训练收益有限,需要更强的奖励塑形。
  • 对合规敏感流程,开始构建跨 dataset→model→application 链路的AI 物料清单 / 许可证追踪,而不是只信任下游可见标签。

基于逐篇论文分析生成;未进行外部浏览。