Guardrails 在 AI 语境中通常译为 “护栏” 或 “防护栏”。它指围绕 AI 系统设置的一整套约束、检查、审批和熔断机制,用来确保 AI 的行为安全、合规、可控,并且不偏离既定目标。

可以类比成高速公路护栏:它不决定车往哪开,但能防止车辆冲出边界、翻车或撞墙。

在 Agentic AI 时代,Guardrails 的含义比传统聊天机器人更广。传统 LLM 的护栏主要管“输入和输出内容”;而 Agentic AI 还要管 行动、工具调用、权限、预算、多步流程和多智能体协作。

一、Guardrails 的主要层次

  1. 输入护栏

    • 检测提示注入、越狱、恶意指令。

    • 过滤敏感信息、违法请求、垃圾内容。

    • 在 Agent 场景中,还要防止外部网页、邮件、文档里夹带恶意指令,诱导 Agent 越权。

  2. 输出护栏

    • 过滤有害内容、偏见、歧视、暴力、色情等。

    • 防止泄露 PII、密钥、内部数据。

    • 校验事实性、格式、引用来源,减少幻觉。

    • 确保输出符合业务规则,比如不能承诺超出权限的退款。

  3. 行动与工具护栏
    这是 Agentic AI 最关键的护栏。

    • 工具白名单:只能调用被授权的 API、数据库、浏览器、代码执行器。

    • 参数校验:调用工具前检查参数是否合法、是否越权。

    • 权限边界:Agent 只能访问它该访问的数据和系统。

    • 预算与速率限制:限制 token、金额、调用次数、执行时间。

    • 沙箱与回滚:高风险操作先在隔离环境执行,支持撤销。

    • 终止条件:循环、异常、不确定时自动停止或升级人工。

  4. 流程与人在环护栏

    • 关键步骤必须人工审批,比如转账、发合同、删数据、推送到生产环境。

    • 设置检查点、审计日志、可观测性。

    • 异常时自动升级给人类,而不是让 Agent 自己“硬闯”。

  5. 多智能体与 A2A 护栏
    在你前面问的 A2A 协作中,Guardrails 决定:

    • 哪些 Agent 可以互相发现和委派任务。

    • 谁能调用谁的技能,委派边界在哪。

    • Agent Card 是否签名、身份是否可信。

    • 跨组织消息是否加密、是否防篡改。

    • 防止一个被污染的 Agent 通过 A2A 把恶意指令传播给其他 Agent。

二、和 MCP、A2A 的关系

  • MCP 让 Agent 能连接工具和数据源。

  • A2A 让 Agent 能互相通信和协作。

  • Guardrails 则决定:能不能连、能不能用、能用多少、出了事怎么办。

没有 Guardrails,MCP 和 A2A 越开放,风险越大。

三、常见实现方式

  • 规则与策略引擎:例如“金额超过 1 万必须人工审批”。

  • 分类器与安全模型:如 Llama Guard、内容安全 API。

  • LLM-as-a-Judge:用另一个模型审查输出或行动。

  • 策略即代码:把合规要求写成可执行策略。

  • 沙箱、权限系统、审计日志。

  • 人类审批与升级机制。

作为产品名,Guardrails AI 是一个开源框架,用于验证 LLM 输出;NVIDIA NeMo Guardrails、Amazon Bedrock Guardrails、Azure AI Content Safety 等也提供类似能力。但作为通用概念,Guardrails 不限于某个产品。

四、核心挑战

  • 安全与能力平衡:管得太死,Agent 什么都做不了;管得太松,容易闯祸。

  • 延迟与成本:每步都检查会变慢、变贵。

  • 绕过风险:提示注入、社会工程、多步推理可能绕过简单规则。

  • 多智能体涌现行为:多个 Agent 互动后,可能出现设计者没预料到的行为。

  • 责任归属:Agent 自主行动出错,责任在用户、开发者、模型提供商还是部署方?

总结:Guardrails 是 Agentic AI 从“ demo 能跑”走向“生产可用”的关键基础设施。 它让 AI 不只是“会办事”,而是“在边界内、可审计、可追责地办事”。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐