2026-08-20 | 基于 arXiv 2608.16393(Tencent AI-Infra-Guard,2026-08-18)
腾讯实测:DSH 间接提示注入成功率高达 25.5% —— 我们提供了那个 "control"
腾讯 AI-Infra-Guard 团队发表了针对 DeepSeek Harness (DSH) 的系统性安全评估(arXiv:2608.16393),
用 14,560 次受控执行证明了间接提示注入可诱导 agent 执行敏感操作。
论文关键数据(全部引用原文):
- 14,560 次受控执行,16 个间接内容通道,35 个载荷目标,12 种攻击方法
- 最高攻击成功率 25.5%(文件模式 hidden Unicode)
- 17.0%(文本模式 fake-completion)、16.0%(skills 通道)
- 结论:agent 需要 "controls that sit between untrusted content and sensitive actions"
腾讯发现了问题,但没有解决方案
论文给出了方向——"位于不可信内容与敏感动作之间的控制层"——但没有实现它。这正是 CCS 做的事。
CCS:那个 control
CCS(Correctover Conformance Shape)是 7 维运行时验证协议,位于 DSH 工具调用边界:
- pre-execute:拦截危险工具调用(命令注入、SSRF)
- post-execute:扫描输出泄露(密钥、注入回显)
- subprocess / fetch 包装:拦截凭证外泄、SSRF
- 签名 CCS 收据:每次裁决都有证据链
为什么重要
- 独立验证:腾讯 14,560 次执行是最强的公开证据——DSH 需要控制层
- 立即可用:插件已发布,免费试用
- IETF 对齐:draft-correctover-ccs-04 是首个针对 AI Agent 运行时验证的 Internet-Draft(草案,非正式标准)
论文:arXiv:2608.16393 |
IETF 草案:draft-correctover-ccs