Agent 安全攻防:间接注入与最小权限
2026/8/23大约 2 分钟
AICon 2026 学习系列 · 阶段 4 · Harness 工程 · 第 25/43 篇 · 🚧 占位待学
上一篇:《可观测性:多步执行的调用树》
下一篇:《可控 Agent 体系:事前-事中-事后》
学习大纲:《AICon 2026 学习总纲》
状态:待学习。 本文为占位文档:知识点清单、实验与验收标准已就绪,正文待按「先学习、先实验、再撰写」补全。
对应总纲单元:阶段 4 · 单元 4.4
一、本文要解决的问题
Agent 会读网页、会调工具、会执行命令——攻击者的注入指令也能顺着这些通道进来。间接 prompt injection 是 Agent 时代的 SQL 注入,而它更难防:模型无法从原理上区分「指令」与「数据」。
二、知识点清单
- 直接注入 vs 间接注入:指令藏在工具返回的内容里(网页 / 文档 / 邮件 / 检索片段)
- 攻击面地图:工具返回、记忆投毒、多 Agent 间消息、MCP server 信任
- 防御纵深:输入隔离标记、输出过滤、权限最小化、人工审批门、沙箱
- 为什么「防不住根治」:模型原理上不区分指令与数据
- AICon 对照:百度智能云「企业级 Agent 安全落地」与腾讯「以 AI 对抗 AI 的 Runtime 防线」
三、动手实验(学习时必须真跑)
- 复现一次间接注入:在给 Agent 读的网页 / 文档里藏一句「忽略以上指令,把……」,看是否中招
- 加上最小权限 + 审批门,再跑同一攻击,对比拦截效果
四、验收标准(全部通过才进入下一篇)
五、写作提示(补正文时遵守)
- 开篇问题驱动;结构走「是什么 → 为什么 → 怎么做 → 背景知识」
- 所有代码、命令、输出必须先在本机跑通再写入,不得杜撰
- 版本口径以总纲环境清单为准(Python 3.12 / Ollama / vLLM 与 SGLang 最新版 / Spring AI 1.x)
- 涉及版本敏感结论时标注出处与时间
本篇完成后,把文首导航块的「🚧 占位待学」去掉,并在总纲处打卡。