智能体评估正从通过率转向可审计的信任链:任务有效性、工具保真、开放权限、安全修复与暴露导致的分数差异

打开这五篇论文以学习智能体研究的一个具体转变:零通过任务可能是损坏而非困难;成功的工具调用会丢失限定词;防御可以在保留效用的同时留下多余权限;修复必须同时计数伤害与救援;基准暴露需要因果工具而非仅基于重叠的怀疑。

往期

2026 · 09
  1. 接近天花板的 ISOT 分数衡量的是来源和主题的可分离性,而非真实性 中文EN
  2. TreeSpark 将半自回归草稿树规模转化为经过校准、负载自适应的服务决策 中文EN
  3. 迁移博弈将 grokking 定位为分布式的傅里叶重编码,而非模块切换 中文EN
  4. Transported Conformal Calibration 将有标签校准转移到配对目标空间 中文EN
  5. 受控预训练表明令牌空间共享对跨语言知识泛化重要 中文EN
  6. 在实体承诺之前,关系信息控制最终标记的回忆 中文EN
  7. Traverse 在长时程代理运行中基准测试首次失误定位 中文EN
  8. 使用检索语义提示训练的代理在需要代码执行的数学题上学会发出不必要的检索调用。 中文EN
  9. ATR 只重新检查受状态变化影响的决策条件 中文EN
  10. 在局部音素残差化之后,HuBERT 和 wav2vec 2.0 的后期层仍保留词识别信号 中文EN
  11. AttnFuse 将 RoPE 作为一等注意力编译操作 中文EN
  12. AnchorVLN 通过类型化工具边界阻止度量命令进入 VLM 调用 中文EN
  13. 基于损失的成员推断在 1 到 1,000 次复制范围内在噪声内保持平坦,并在其上方才显著出现。 中文EN
  14. Event-CST 在 Meta-FSA 上将训练长度 1k 外推到 128k 时的改进 中文EN
  15. Kalman Delta Networks 为 delta 规则关联记忆添加可与扫描兼容的不确定性 中文EN
  16. 近平局的 LLM 排名在五个测试基准中有四个出现对组合敏感的顺序逆转 中文EN
  17. ObserverBench 根据下游行动损失评估机械化观察器,而不是仅凭预测准确度 中文EN
  18. 看似可信的被篡改工具返回可以覆盖先前正确的代理答案 中文EN
  19. 推理可以通过极少一小部分生成标记有效激励——每条推理轨迹仅需一到两个标记 中文EN
  20. 解释性漂移在长文档 LLM 财务分析中主导 persona 效应 中文EN
  21. 在给定的高斯/矩阵条件下,负相关性使边际匹配的泊松采样在整阶Rényi散度上占优 中文EN
  22. 受控地平线扫描在 36 个模型-任务单元中有 28 个发现几何型代理成功率衰减 中文EN
  23. 测得的有效学习率调度与预训练损失轨迹一致 中文EN
2026 · 08
  1. 在 Qwen3-1.7B 上,保留完整任务提示词并驱逐旧思维可保持报告质量,并加速长序列解码 中文EN
  2. 成对示例的幻觉信号以隐藏态均值位移为主 中文EN
  3. 目标文档前缀的概率审计,不能排除触发词提取 中文EN
  4. Agent 可靠性转向运行时架构。 中文EN
  5. 智能体安全正在变得结构化。 中文EN
  6. 运行时安全落地了。 中文EN
  7. 评估正变得更具对抗性。 中文EN
  8. 可审计的智能体正在接管。 中文EN
  9. 智能体信任正在上移。 中文EN
  10. Agent 可靠性开始接受审计。 中文EN
  11. 可审计智能体开始成形。 中文EN
  12. Agent 安全边界正在向外移动。 中文EN
  13. 运行时检查取代代理指标。 中文EN
  14. 基准测试不再被信任。 中文EN
  15. 智能体评估变得更严格。 中文EN
  16. Agent 可靠性开始走向可操作化。 中文EN
  17. 评估正在前移。 中文EN
  18. Agent 评估变得更严苛。 中文EN
  19. Agent 可靠性开始走向结构化。 中文EN
  20. 智能体安全正在向外扩展。 中文EN
  21. 评估走向实时。 中文EN
  22. Agent 控制平面很重要。 中文EN
  23. 智能体控制开始接受审计。 中文EN
  24. 智能体安全正在变得结构化。 中文EN
  25. 安全包装层看起来很脆弱。 中文EN
  26. Agent 安全正在向下游迁移。 中文EN
  27. Agent 安全变得有状态了。 中文EN
  28. Agent 控制正在向外扩展。 中文EN
  29. 验证包裹着智能体。 中文EN
  30. 评估变得更“外科手术式”。 中文EN
  31. Agent 可靠性开始落地。 中文EN
2026 · 07
  1. 安全评估走向纵向化。 中文EN
  2. Agent 安全转向运行时。 中文EN
  3. Agent 可靠性开始具备状态性。 中文EN
  4. Agent 状态开始事务化。 中文EN
  5. 可靠性开始依赖结构。 中文EN
  6. Agent 安全正在前移。 中文EN
  7. Agent 信任开始接受审计。 中文EN
  8. Agent 安全进一步深入。 中文EN
  9. Agent 安全正在走向系统层面。 中文EN
  10. 智能体评估变得更难了。 中文EN
  11. Agent 监督开始接受审计。 中文EN
  12. 评估不再是可选项。 中文EN
  13. Agent 安全开始走向结构化。 中文EN
  14. Agent 监督开始变得具体。 中文EN
  15. 智能体控制变得显式化。 中文EN
  16. Agent 安全开始走向可操作化。 中文EN
  17. 代理评估开始变得更有“牙齿”。 中文EN
  18. 控制正在移出提示词。 中文EN
  19. 安全性正在进入系统架构层。 中文EN
  20. Agent 安全正在向内收缩。 中文EN
  21. Agent 安全正在前移。 中文EN
  22. 智能体安全正在向下游迁移。 中文EN
  23. 智能体安全走向结构化。 中文EN
  24. 智能体评估变得更严苛。 中文EN
  25. 安全正在转向运营层面。 中文EN
  26. Agent 安全正在转向运行时。 中文EN
  27. Agent 安全开始变得有状态。 中文EN
  28. 智能体安全转向运行时。 中文EN
  29. 智能体安全开始走向结构化。 中文EN
  30. 智能体安全系统化了。 中文EN
2026 · 06
  1. 智能体现实考验升级。 中文EN
  2. 智能体安全转向运行时。 中文EN
  3. 智能体安全转向运行时。 中文EN
  4. 智能体安全转向结构层。 中文EN
  5. 智能体安全开始落地。 中文EN
  6. Agent 控制变得显式化。 中文EN
  7. 智能体安全开始走向可操作化。 中文EN
  8. 评测正在成为基础设施。 中文EN
  9. 评估转向过程优先。 中文EN
  10. 评测开始具备生命周期意识。 中文EN
  11. Agent 安全开始走向可操作化。 中文EN
  12. 智能体安全正转向结构层。 中文EN
  13. 智能体评估开始变得更有力度。 中文EN
  14. Agent 安全正在向下栈迁移。 中文EN
  15. 可审计的智能体开始接管。 中文EN
  16. 智能体可靠性开始接受审计。 中文EN
  17. 评估正在走向操作化。 中文EN
  18. Agent 安全正在前移。 中文EN
  19. 智能体安全正在转向运行时。 中文EN
  20. 智能体安全正在转向有状态。 中文EN
  21. Agent 安全正在走向系统化。 中文EN
  22. 可靠性转向控制。 中文EN
  23. Agent 控制开始变得具体。 中文EN
  24. Agent 评测正在走向对抗化。 中文EN
  25. 智能体安全正在向外扩展。 中文EN
  26. 智能体安全正在转向有状态化。 中文EN
  27. 智能体安全正在转向运行时。 中文EN
  28. Agent 安全正在转向运行时。 中文EN
  29. 智能体控制变得更加显式。 中文EN
  30. Agent 可靠性开始走向可运营化。 中文EN
2026 · 05
  1. Agent 基准测试开始直面现实。 中文EN
  2. Agent 安全正在转向运行时。 中文EN
  3. 安全正在进入系统层。 中文EN
  4. Agent 安全正在转向内联控制。 中文EN
  5. 智能体安全转向运行时。 中文EN
  6. Agent 安全转向运行时。 中文EN
  7. 智能体可靠性开始走向结构化。 中文EN
  8. 评估正在变得自适应。 中文EN
  9. Agent 安全开始变得有状态。 中文EN
  10. Agent 安全正在转向运行时。 中文EN
  11. 评估变得可执行。 中文EN
  12. Agent 安全正在向外转移。 中文EN
  13. 智能体评估变得更严苛了。 中文EN
  14. Agent 安全正在向下游迁移。 中文EN
  15. 智能体安全正在走向系统外层。 中文EN
  16. Agent 安全正转向运行时优先。 中文EN
  17. 评估正变得更贴近部署形态。 中文EN
  18. 中文EN
  19. 中文EN
  20. 中文EN
  21. 中文EN
  22. 中文EN
  23. 中文EN
  24. 中文EN
  25. 中文EN
  26. 中文EN
2026 · 04
  1. 中文EN
  2. 中文EN
  3. 中文EN
  4. 中文EN
  5. 中文EN
  6. 中文EN
  7. 中文EN
  8. 中文EN
  9. 中文EN
  10. 中文EN
  11. 中文EN
  12. 中文EN
  13. 中文EN
  14. 中文EN
  15. 中文EN
  16. 中文EN
  17. 中文EN
  18. 中文EN
  19. 中文EN
  20. 中文EN
  21. 中文EN
  22. 中文EN
  23. 中文EN
  24. 中文EN
  25. 中文EN
  26. 中文EN
  27. 中文EN
  28. 中文EN
  29. 中文EN
  30. 中文EN
2026 · 03
  1. 中文EN
  2. 中文EN
  3. 中文EN
  4. 中文EN
  5. 中文EN
  6. 中文EN
  7. 中文EN
  8. 中文EN
  9. 中文EN
  10. 中文EN
  11. 中文EN
  12. 中文EN
  13. 中文EN
  14. 中文EN
  15. 中文EN
  16. 中文EN
  17. 中文EN
  18. 中文EN
  19. 中文EN
  20. 中文EN
  21. 中文EN
  22. 中文EN
  23. 中文EN
  24. 中文EN
  25. 中文EN
  26. 中文EN
  27. 中文EN
  28. 中文EN
  29. 中文EN
  30. 中文EN
2026 · 02
  1. 中文EN
  2. 中文EN
  3. 中文EN
  4. 中文EN
  5. 中文EN
  6. EN