从聊天机器人到AI Agent,软件开发正在进入新阶段
一、AI的下一步,不只是“回答问题”
如果说过去两年生成式AI最大的变化是“会回答”,那么现在更值得关注的变化是“会执行”。
传统聊天机器人通常是用户提出问题,AI生成答案。
AI Agent则进一步向前走了一步。
它可以根据目标拆分任务,调用工具,读取数据,执行操作,再根据执行结果继续下一步。
例如,一个软件开发Agent理论上可以读取项目代码、分析错误日志、修改代码、运行测试,然后根据测试结果继续调整。
这意味着AI开始从“信息生成器”向“任务执行者”转变。
8月10日,路透社报道,美国众议院民主党议员正在向Anthropic和OpenAI等公司询问与“失控AI Agent”有关的问题。报道提到,随着自主AI系统能力提高,其可能执行超出预期的操作,已经成为政策和产业关注点。(Reuters)
这对开发者而言尤其值得注意。
因为AI Agent真正复杂的地方,不是生成一段文字,而是它开始与真实的软件系统发生交互。

二、Agent和普通聊天机器人有什么不同
可以把两者简单理解成两个层次。
普通聊天机器人更像一个“顾问”。
你问它:“数据库为什么连接失败?”
它可能告诉你检查网络、账号、端口和权限。
而Agent更像一个“执行人员”。
它可能进一步读取日志,检查配置文件,执行诊断命令,再根据结果决定下一步。
这就带来了一个重要变化:
AI输出的影响范围变大了。
以前AI回答错一个问题,用户可能发现错误以后重新询问。
但如果Agent拥有修改文件、调用API、发送邮件或者执行程序的权限,那么一个错误判断就可能直接影响真实系统。
因此,AI系统的安全边界也发生了变化。
三、NIST为什么强调AI风险管理
美国国家标准与技术研究院(NIST)发布的AI风险管理框架,并不是针对某一家公司的产品,而是希望帮助组织在设计、开发、部署和使用AI系统时管理风险。
NIST强调,可信AI涉及有效性和可靠性、安全性、韧性、透明度、可解释性、隐私以及公平性等多个方面。(NIST)
这对于Agent尤其重要。
因为Agent不只是一个模型。
它实际上是:
“模型+上下文+工具+权限+数据+执行环境”。
其中任何一个环节出现问题,都可能影响最终结果。
所以,评价一个Agent不能只看它的Benchmark分数。
还应该看它能调用什么工具、拥有多少权限、如何处理异常以及能不能留下完整的执行记录。
四、开发Agent最容易忽略的一个问题:权限
假设一个Agent拥有以下权限:
“读取代码库。”
“修改代码。”
“访问数据库。”
“执行Shell命令。”
“调用外部API。”
从功能角度看,这个Agent非常强。
但从安全角度看,它也拥有非常大的操作范围。
如果模型判断错误,或者外部输入被恶意构造,Agent可能把一个普通任务扩大成严重事故。
因此,开发Agent时不能简单采用“给它全部权限,让它自己完成任务”的方式。
更合理的方法是建立权限边界。
例如:
第一层,只允许读取。
第二层,只允许修改指定目录。
第三层,涉及生产环境操作必须人工确认。
第四层,对高风险操作进行审计。
这种设计思想实际上与传统软件安全并没有本质区别。
只是过去执行程序的是人写好的代码,现在部分决策过程交给了AI。
五、工具调用比聊天更值得测试
开发传统API时,我们会测试:输入是什么?输出是什么?错误如何处理?
Agent系统还需要增加一个问题:
“它为什么决定调用这个工具?”
例如,一个Agent发现服务器日志出现错误。
它可能选择:读取配置文件;查询数据库;重启服务;发送通知。
这时候,开发者需要关注的不仅是最终答案,还要检查中间过程。
如果Agent选择了错误工具,即使最终输出看起来合理,也可能已经造成不必要的操作。
所以Agent测试不能只做结果测试。
还需要进行过程测试。
六、未来的软件开发可能变成“人管Agent”
这也是AI Agent真正有意思的地方。
过去的软件开发主要是:
“人写代码,机器执行。”
现在正在逐渐出现:
“人提出目标,Agent生成和执行部分任务,人负责审核。”
这并不意味着程序员马上消失。
恰恰相反,开发者的工作可能更加偏向系统设计、权限控制、测试和代码审查。
一个优秀的开发者未来不一定需要亲手写完所有代码,但需要知道:
Agent应该做什么;
不能做什么;
出了问题怎么停止;
如何验证结果;
如何追踪执行过程。
NIST的AI风险管理框架也强调,AI风险管理应该贯穿AI系统的设计、开发、部署、使用和测试评估过程,而不是等系统上线以后才处理。(NIST)
七、AI Agent真正的门槛不是“会不会做”
如果把AI Agent比作一名员工,那么模型能力相当于“聪明程度”。
但一个真正可以进入生产环境的Agent,还需要:“权限控制”“日志审计”、“异常处理”、“结果验证”、“人工确认”、“数据隔离”。
这些东西看起来没有模型参数那么性感,却决定了Agent能不能真正用于企业环境。
因此,未来AI Agent竞争可能出现一个非常有意思的变化。
第一阶段,比谁回答得好。
第二阶段,比谁完成任务快。
第三阶段,比谁在完成任务的同时更安全、更稳定、更容易控制。
对于开发者而言,真正值得学习的不是如何让Agent“什么都能做”,而是如何让Agent“只做应该做的事情”。
这可能才是AI Agent进入生产环境之后最重要的工程问题。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)