人工智能挑战文档深度页
Guardrails 与 Prompt Injection
在输入、输出和工具执行边界验证内容,并把外部指令视为不可信数据。
学习目标
- 能说明Guardrails 与 Prompt Injection解决什么问题,以及何时适用。
- 能解释为什么“把护栏当万能沙箱”是误区。
学习前需要掌握
背景与问题
单纯提醒模型“忽略恶意内容”不能提供强安全保证,尤其在工具能产生副作用时。
概念定义
Guardrail 是阻止或转换不符合策略的输入、输出或工具调用的确定性/模型化检查;Prompt Injection 是不可信内容试图改变 Agent 指令或诱导越权。
直观理解
护栏像安检和权限网关,不是贴在墙上的“请勿进入”。
核心原理
OpenAI Agents SDK 区分 input、output 和 function tool guardrails,作用边界不同。
工具护栏不自动覆盖 Handoff 或所有托管工具,应逐类确认。
审批发生前后都可能需要校验,且外部副作用不可被事后护栏撤销。
理解与实践步骤
- 1
标记不可信来源
- 2
执行前输入与权限校验
- 3
敏感动作审批
- 4
执行后输出校验
- 5
记录拒绝原因
实际应用
- 文件与网页 Agent
- 业务写操作
常见错误
把护栏当万能沙箱
只检查最终文本
输入、输出与执行边界
输入
- 用户输入
- 外部内容
- 工具参数和结果
输出
- 允许、拒绝、替换或人工升级
能力
- 文件与网页 Agent
- 业务写操作
只读优先默认不要求审批
官方来源与时效
资料记录日期:2026-08-30(不代表已逐项核验)。产品能力、SDK 参数和协议状态可能变化,请以链接页面的当前版本为准。
推荐学习资料
暂未收录相关资料
参考库不会生成虚假资源或无效外部链接。