Guardrails 在 AI 语境中通常译为 “护栏” 或 “防护栏”。
Guardrails 在 AI 语境中通常译为 “护栏” 或 “防护栏”。它指围绕 AI 系统设置的一整套约束、检查、审批和熔断机制,用来确保 AI 的行为安全、合规、可控,并且不偏离既定目标。
可以类比成高速公路护栏:它不决定车往哪开,但能防止车辆冲出边界、翻车或撞墙。
在 Agentic AI 时代,Guardrails 的含义比传统聊天机器人更广。传统 LLM 的护栏主要管“输入和输出内容”;而 Agentic AI 还要管 行动、工具调用、权限、预算、多步流程和多智能体协作。
一、Guardrails 的主要层次
-
输入护栏
-
检测提示注入、越狱、恶意指令。
-
过滤敏感信息、违法请求、垃圾内容。
-
在 Agent 场景中,还要防止外部网页、邮件、文档里夹带恶意指令,诱导 Agent 越权。
-
-
输出护栏
-
过滤有害内容、偏见、歧视、暴力、色情等。
-
防止泄露 PII、密钥、内部数据。
-
校验事实性、格式、引用来源,减少幻觉。
-
确保输出符合业务规则,比如不能承诺超出权限的退款。
-
-
行动与工具护栏
这是 Agentic AI 最关键的护栏。-
工具白名单:只能调用被授权的 API、数据库、浏览器、代码执行器。
-
参数校验:调用工具前检查参数是否合法、是否越权。
-
权限边界:Agent 只能访问它该访问的数据和系统。
-
预算与速率限制:限制 token、金额、调用次数、执行时间。
-
沙箱与回滚:高风险操作先在隔离环境执行,支持撤销。
-
终止条件:循环、异常、不确定时自动停止或升级人工。
-
-
流程与人在环护栏
-
关键步骤必须人工审批,比如转账、发合同、删数据、推送到生产环境。
-
设置检查点、审计日志、可观测性。
-
异常时自动升级给人类,而不是让 Agent 自己“硬闯”。
-
-
多智能体与 A2A 护栏
在你前面问的 A2A 协作中,Guardrails 决定:-
哪些 Agent 可以互相发现和委派任务。
-
谁能调用谁的技能,委派边界在哪。
-
Agent Card 是否签名、身份是否可信。
-
跨组织消息是否加密、是否防篡改。
-
防止一个被污染的 Agent 通过 A2A 把恶意指令传播给其他 Agent。
-
二、和 MCP、A2A 的关系
-
MCP 让 Agent 能连接工具和数据源。
-
A2A 让 Agent 能互相通信和协作。
-
Guardrails 则决定:能不能连、能不能用、能用多少、出了事怎么办。
没有 Guardrails,MCP 和 A2A 越开放,风险越大。
三、常见实现方式
-
规则与策略引擎:例如“金额超过 1 万必须人工审批”。
-
分类器与安全模型:如 Llama Guard、内容安全 API。
-
LLM-as-a-Judge:用另一个模型审查输出或行动。
-
策略即代码:把合规要求写成可执行策略。
-
沙箱、权限系统、审计日志。
-
人类审批与升级机制。
作为产品名,Guardrails AI 是一个开源框架,用于验证 LLM 输出;NVIDIA NeMo Guardrails、Amazon Bedrock Guardrails、Azure AI Content Safety 等也提供类似能力。但作为通用概念,Guardrails 不限于某个产品。
四、核心挑战
-
安全与能力平衡:管得太死,Agent 什么都做不了;管得太松,容易闯祸。
-
延迟与成本:每步都检查会变慢、变贵。
-
绕过风险:提示注入、社会工程、多步推理可能绕过简单规则。
-
多智能体涌现行为:多个 Agent 互动后,可能出现设计者没预料到的行为。
-
责任归属:Agent 自主行动出错,责任在用户、开发者、模型提供商还是部署方?
总结:Guardrails 是 Agentic AI 从“ demo 能跑”走向“生产可用”的关键基础设施。 它让 AI 不只是“会办事”,而是“在边界内、可审计、可追责地办事”。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)