前几天,行业里两件大事撞在一起。嗯。

《人工智能拟人化互动服务管理暂行办法》正式施行,虚拟恋人、情感陪伴、诱导沉迷,全部写进红线。

同一天,豆包和千问关掉了用户自建智能体——你在上面花好几个晚上调出来的「AI助理」「虚拟搭子」,说没就没。再往前看,腾讯元宝早在6月30号就下了自建智能体入口,比这两家早半个月。

紧接着7月17日,世界人工智能大会(WAIC)在上海开幕,一直办到20号。场馆外人山人海,展台里反复出现一个词:交付。

图片

几件事时间挨着,但别混成同一天。连起来看,意思倒是通的——Demo 里吹过的牛,开始在真实世界里被验收。


Agent 是2026年声量最大的词,也是翻车最狠的词。

发布会上的演示永远丝滑:订机票、写方案、爬数据、发邮件,一条龙,掌声响起来,你会觉得「办公自动化」真的到了。回家自己试,十有八九卡在第三步——网页结构一变,它开始瞎编;权限不够,它假装搞定;链路一长,前面九步都对,最后一步把整个事搞砸。

36氪有篇文章说得挺损:评测分数看的是平均表现,用户体验看的是最差那一刻。Demo 是在无菌环境里跑短链路;你用的是脏数据、烂接口、随时会变的真实世界。链路每多一步,失败概率不是加,是乘。五步链路,每步成功率90%,整体也就59%;十步,35%。

所以你会看到一种怪现象:benchmark 年年破纪录,用户信任却试一次惊艳、用三次卸载。很多团队把钱全砸在「模型更强」上,输入容错、失败恢复、能力边界说明、出错降级,一样没做。模型越聪明,胡说八道时越像真的,反而更坑人。

真正跑起来的 Agent,共性反而是反直觉的:场景窄、权限低、人工确认多。Claude Code 不替你操控整台电脑,就死在编辑器里;企业里的 Agent 不敢放权,每一步要可审计、可回滚。嘴上喊 Autonomous Agent,身体在往 Human-in-the-loop 退。选工具别盯发布会,想一件事:它在你的场景里,搞砸一次,你付得起代价吗?


再说智能体下线。网上很多人喊「AI 倒退了」,其实没看清下线的到底是什么。

《办法》管的是拟人化、长陪伴、模拟人格的情感互动服务——虚拟恋人、虚拟亲属这类。但豆包和千问的做法是「一刀切」:整个「用户自建智能体」模块都关了,不只关恋人,你自己捏来写文章、做翻译的生产力型 Agent 也一并没了。千问7月10日先关拟人化类,15日智能体功能彻底下线;豆包留了缓冲,10月15日前还能导出历史对话,部分需求被导到字节旗下的「猫箱」App。

不等于 AI 整体倒退。豆包、千问主 App 里的对话、写作、问答这些通用能力还在,消失的是「自己创建、保存、调用一个专属 Agent」那套玩法。

平台为什么宁可全关?用户自建人格,UGC 审核压力太大;情感陪伴长会话、高 Token 消耗、低付费,账算不过来;再加上新规要求安全评估、防沉迷、2小时强制提醒、显著标明非真人——合规成本一叠上来,大厂选择直接把整块业务切掉,比逐个改造省事。

有意思的是,同样是「陪伴」,不同形态待遇差很多。如身机器人2026年4月底完成亿元 Pre-A,做养老护理场景,有实体、有机构验证、受众能框住,落在《办法》鼓励的「适老陪伴」方向里。另一边,优必选6月底发布的 U1 系列是消费级超仿真人形机器人,Lite 版11.98万起,Ultra 版88万、99万,全渠道订单破1.3万台——它走的也是陪伴路线,但是实体产品、仅面向成年人、有明确交付节点,和 App 里用户随手捏的 UGC 虚拟人格,合规逻辑完全不是一回事。

选 AI 产品,我觉得有个简单问题够用了:它想让你依赖它,还是用完即走?前者在 C 端会越来越难,后者——写作、检索、编程、数据分析——才是政策、资本、企业还在持续下注的方向。


WAIC 今年人气很高,但对我这种看热闹也看门道的人,更有意思的是 Token 这个词。

中国电信在7月18日的生态论坛上讲 Token 经营:星辰 TokenHub 做多模型统一接入,部门配额、成本归因、调用前脱敏,Token 安全路由器管合规。听着像 IT 的事,最终会落到每个工位——公司按部门发额度,用超了要批;敏感数据不能随便喂公网模型;老板问的不再是「你用没用 AI」,而是「省了几小时、错了几次、花了多少钱」。

国产算力芯片的比法也变了,不比谁 GPU 最强,比谁能把单次 Token 成本压下去。AI 能不能普及,不全看模型聪不聪明,看组织愿不愿、能不能把 AI 嵌进流程并把账算清楚。

很多公司2026年的真实样子我见过:老板买了企业版,IT 配了网关,业务不会用,数据各管各的,最后就是个带合规流程的高级聊天框,生产力一点没涨。智源研究院说产业应用正在滑进「幻灭低谷期」,我信。卡点不在模型,在「买 AI」和「用 AI」中间那堆脏活——权限、日志、回滚、评测、人机分工,腾讯趋势报告里管它叫 Harness Engineering,翻译过来就是:谁负责、出错了怎么办、效益怎么量。

「会不会用 ChatGPT」不够了。更值钱的是你能不能在自己岗位上画一张 AI 介入地图:哪些环节能自动化,哪些必须人签字,哪些数据能喂、哪些绝对不能,出错了谁兜底。会做这张地图的,通常不是 AI 专家,是最懂业务、又愿意动手试的人。


WAIC 上具身智能、人形机器人、机械臂展台围得水泄不通,智源也把「预测世界的下一个状态」写进趋势报告——AI 从预测下一个词,往预测物理世界下一帧走。

新故事当然激动人心。只是2023、2024 大模型 Demo 惊艳、落地翻车的剧本,2025、2026 Agent 又演了一遍。世界模型和具身智能,大概率还会再来一轮:视频里丝滑,产线上掉链子。不是唱衰,是规律。

值得跟的信号也不是「机器人又会后空翻了」,而是良率有没有真实提升、场景数据能不能回流、出事了谁赔谁改。你要是不做机器人、制造业、自动驾驶,现在不必焦虑要不要转行;但该更新的认知是:AI 的上限正从「说话」往「动手」扩。今天写报告,明天巡检仓库,后天跑完一套采购闭环——流程化、有 SOP、结果可观测的中层执行岗,冲击面会比很多人想的大。

比「会不会被替代」更要紧的问题:你手里有没有 SOP 化不了的东西——客户关系、异常决策、跨部门扯皮、对后果负责。


说个具体的事儿。有个做 HR 的朋友问我该不该焦虑,我没说「别慌 AI 替不了你」那套屁话,让她自己捋了一遍手头的工作:写 JD、筛简历、做面试纪要,AI 已经能干,而且干得比她快;但「这个团队缺什么性格的人」「两个都不错该留谁」「候选人犹豫时靠信任感把人谈下来」——这些 AI 只能搭把手,负不了责。

她捋完跟我说:我不是要跟 AI 比写 JD 的速度,是要决定还要不要把八成时间耗在低筹码的事上。

我觉得这话说到了点子上。AI 时代该焦虑的,不是「会不会被开除」,而是「是不是一直在做最容易被 Token 化的部分,还以为是自己的全部价值」。


如果把2026这些热点粗暴分个层:最上面是全能 Agent、虚拟恋人、通用 AGI,故事最大,兑现最难;中间是任务型助手、垂直 Agent、Token 管理,2026 真正在长的;下面是代码辅助、工业质检、养老照护、智驾,钱和订单在这里。越往上流量越大,越往下越实在。大多数文章在写最上面那层,你的时间最好花在中间和下面。

幻灭期和落地期撞在一起,噪音会很大——「人人都要学 Agent」「不学就淘汰」「这个工具改命」,这类话会刷屏。但机会也在:终于开始有人问「AI 在我这里值不值」,而不是只问「AI 能做什么」。第二个问题,才需要业务理解、工程常识和独立判断。

你觉得呢?

关注「AI小揭秘」,带你看透更多操作!

你用过最翻车的一次 AI 是什么情况?留言区聊聊。

本文参考:2026 WAIC 报道、智源《2026十大AI技术趋势》、腾讯《协同进化:2026人工智能十大趋势报告》、36氪 Agent 落地分析、五部门《人工智能拟人化互动服务管理暂行办法》及豆包/千问/元宝功能调整公开信息。

网络官方公开信息

往期精彩回顾:

AI写代码半年后,我们公司的代码已经没人能看懂了!

这几个灵魂拷问,你能抗住几个?

当所有人都用 AI 写代码,个人的护城河到底在哪里?

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐