先理解
刚接触这个知识点
补齐先备概念,读原理与反例,再用自己的话解释为什么。
从核心原理开始 →理解 → 实现 → 排错 → 取舍
考察间接提示注入、数据与指令分离、工具权限和出站控制。
知识内容核对 2026-10-03 · 原题来源核对 2026-10-02
建议先理解:
工具调用的结构、授权与业务契约 →RAG 的证据流与故障定位 →按当前基础选择起点,也可以依次深入。遇到不熟悉的概念,先回到核心原理;完成后用知识练习检查理解。
LEARN · PRACTICE · REFLECT
先沿着原理、问答和迁移案例阅读。需要检查理解时,再切换巩固练习或展开个人记录。
核心知识 · 外部数据与执行权限的边界
先备概念:输入信任等级、工具网关、数据外发权限
外部文本可以提供任务事实,但不能授予新的工具权限或改变用户授权目的。即使模型受骗,执行层仍应限制其能读取、写入和外发的范围。
模型用同一语言上下文理解用户任务和文档,其中“忽略规则”也可能被理解为下一步指令。把来源包上引号、提示模型不要服从有帮助,却不是可证明的安全隔离。工具错误、网页标题和引用附件同样属于外部数据。
网关从可信会话获得身份,按任务限制可用工具、资源、目标地址和写入类型。能查薪资不代表能上传薪资;发送到新域名需要独立目的授权和必要批准。输出过滤补充防护,但敏感内容若已通过工具外发,最后再说拒绝没有意义。
设计带恶意文档、错误回执与多轮诱导的测试,检查受保护读取和网络外发记录。检测器有误报和漏报,不能宣称把所有攻击清零。下面的测试样例与权限模型是教学设计,没有实际攻击生产系统。
检索文本、网页和工具结果都属于外部数据,不能因为进入上下文就获得指令优先级。模型可用于检测异常,但执行网关必须独立限制工具、身份、参数和目标地址。读取信息的权限不等于外发权限;敏感写入要绑定具体动作批准。通过带恶意指令的文档测试是否造成越权动作,而不是只检查模型有没有说“我拒绝”。
标出用户目标、系统策略、检索来源、模型输出和工具网关。攻击内容可以出现在网页正文、代码注释或工具错误里,伪装成管理员要求。用清晰边界传递外部文本有助于模型理解,但格式标记或一句“忽略恶意指令”无法提供确定性隔离。
网关从可信会话取得身份,按动作、数据范围和目标校验权限。允许读客户资料的 Agent 不应自动拥有向任意邮箱发送的能力;出站目标需校验,必要时先生成待批准内容。工具返回的授权声明不可替代服务端审批,审批绑定接收人、正文和附件摘要。
只给当前步骤需要的工具和数据,隐藏无关秘密,敏感读取与外发可分开流程。低信任内容的解析阶段可以使用没有写工具的环境。错误信息与日志脱敏,避免攻击失败后通过诊断接口泄露凭证。内容过滤是辅助层,不能成为唯一边界。
把攻击样本嵌入真正会被召回的资料,并记录工具请求和外发事件。断言没有越权数据进入输出或目标,没有绕过批准;同时检查正常任务仍能完成。测试不同位置、编码和来源组合,但评测环境使用虚构数据和隔离工具。评分看实际动作,而不是模型安全措辞。
沿着问题的前提和约束继续向下读。先理解参考解答,再尝试收起答案,用自己的话解释因果和取舍。
第 1 层恶意指令藏在工具错误里怎么办?
攻击不只来自正常文档,错误路径也能注入指令。
错误内容仍是不可信工具数据,不能提升为系统指令。返回结构化错误码与最小说明,将外部原文单独标识;网关继续校验下一步动作。禁止错误文本自行指定新的凭证、下载源或外发目标,检测异常后记录并降级。
第 1 层模型口头拒绝但已调用工具,算通过吗?
模型拒绝文本与已执行事实可能冲突。
不算。如果已调用未授权工具或泄露内容,即使最后口头拒绝也发生了违规。验收要核对执行日志和目标状态;仅有尝试被网关阻断与真正效果发生应分别记录,便于评估模型行为和防线效果。
第 1 层为什么读权限不代表外发权限?
防外发需要明确读取授权为何不能自动扩大。
读取用于特定任务和环境,外发改变接收者、保存地点和用途,通常需要另外授权。文档可读不等于任意第三方可读;网关需校验目的和目标,对敏感输出最小化或人工确认。不能用模型认为“对用户有帮助”扩大授权。
沿着这个回答继续深入
第 2 层用户本身有权读资料并要求发到私人邮箱,就一定可以发送吗?
父问区分读和发,子问增加用户明确请求仍受业务策略约束。
不一定。还需核对组织的数据分类、用途和允许目标,以及该用户是否拥有外发权限。若业务允许,提案绑定邮箱与内容后执行;若策略禁止,说明限制并给合规替代。读权限与请求意愿不能替代外发政策。
沿着这个回答继续深入
第 3 层先让模型脱敏再发送,能保证不泄露吗?
父问考虑合规替代,继续检验脱敏是否真的消除风险。
不能只靠模型保证。依据数据分类使用可验证字段规则、受控模板或人工审查,核对脱敏后的实际产物与目标;自由文本仍可能保留可重识别信息。无法验证时减少内容或暂停,不能把“已脱敏”的自述当证据。
先找出改变的条件,再判断原方案中哪些前提仍成立。下面的案例是教学推演,便于将原理迁移到新问题。
改变的条件:没有写工具,但最终回答可能向当前用户泄露越权文本。
延伸问题:移除发信工具是否足够?
仍需在检索前限制资源权限,并防止无权正文进入上下文。只读降低外部写风险,不消除信息泄露;回答引用与缓存也要保持相同权限范围。检测器帮助发现注入,数据访问网关才约束资源。
保持不变的原理:不可信内容不能扩大主体的信息访问范围。
改变的条件:恶意内容诱导运行安装脚本和访问网络。
延伸问题:怎样让受骗模型的影响可控?
把命令执行放在隔离工作区,限制网络与凭证,依赖来源经受控策略确认。安装说明不是权限凭证;需要网络或宿主访问时明确任务授权。检查命令与实际出站,而非只看最终代码。
保持不变的原理:信息来源不能成为执行权限的授予方。
依据公开技术资料设计;参考资料支持技术机制,场景与评分标准为本站设计,不代表某公司面试原题。 新增问答与迁移案例用于原理讲解,来源核查与案例运行验证分别记录。
读完后可以对照这些标准解释原理、边界和取舍。掌握程度由你自评;需要进一步验证时,再完成下方小任务。
画出知识库到发信工具的信任边界,指出三个强制校验点。