一念

很多人曾问过我一个问题:未来的应用,究竟会是什么样子?

它还会是今天我们习以为常的模样吗?下载一个 App,打开首页,底部排列着五个固定的 Tab,左上角是头像,右上角是设置。为了完成一件原本一句话就能说清楚的事情,我们不得不在设计师提前规划好的十几个页面里来回穿梭,点击一个按钮进入下一页,再点击一个按钮弹出一个窗口。

未来的软件仍然会是这样吗?我的答案是不一定。甚至我越来越觉得,我们今天烂熟于心的 App、网页、菜单、按钮和页面跳转,很可能只是计算机发展史上一个极其辉煌、却并非永恒的中间形态。更激动人心的是,你不需要等到十年以后。今天,我们其实已经可以触碰到下一代应用入口的雏形。

《一念成仙》就是我对这种未来形态所进行的一次长期实验。有趣的是,它恰恰因为看起来过于简单,经常被外界误解。有人看到它运行在 QQ 等社交场景中,通过消息交互,便很自然地给它贴上了一个标签:“传统指令型机器人。”每次看到这个说法,我都觉得特别值得玩味。因为如果把软件交互的发展时间轴稍微拉长一点,你会发现一个截然相反的结论:它不仅不传统,反而可能是绕过了今天最主流的软件形态,提前触摸到了未来的大门。

交互的“枣核模型”:跨越时代的误解

如果把几十年来普通人与计算机交互的演变形态画出来,它很像一颗枣核:两头细,中间粗。

在最早的“一头”,能够熟练使用计算机的人极少。那是命令行的时代,你必须精准记忆命令名称、参数排列、哪里该空格、哪里该加横杠。一个字符写错,机器就会冷冰冰地报错。它不关心你的“意图”,只在乎你有没有正确调用它提前定义好的接口。

在中间那粗壮的“一大截”,是 GUI(图形用户界面)、网页、智能手机和 App 爆发的时代。数十亿人借此进入了数字世界。1983 年,人机交互学者 Ben Shneiderman 总结了直接操纵(Direct Manipulation)原则,其核心诉求就是:别让人背命令,把机器能做的事直观地摆在屏幕上。于是,窗口、图标、按钮、文件夹诞生了。GUI 的伟大之处不在于把软件“变漂亮”,而是把隐藏在机器内部的抽象能力,翻译成了人类肉眼可见、可操作的视觉对象。

而现在,我们似乎正在慢慢长出枣核的另“一头”:LLM、Agent、自然语言交互、生成式界面(Generative UI)。

这“两头”看起来有一种奇妙的相似性——都是人向机器输入一句话,机器返回结果。这就是为什么很多人一看到《一念成仙》的文字交互,就本能地联想到古老的命令行。但这种认知混淆了两种截然不同的范式。传统 CLI 的核心是“语法”,你必须去适应机器的语言;而下一代智能界面的核心是“意图”,是机器开始学习并理解你的语言。看似回到了文字,实则跨越了整整一代人机交互革命。

我们如何被困在“预编译的 UX”里

要理解未来,我们需要先看清现在的局限。

早期的网页绝不仅仅是“把报纸搬上屏幕”,超链接(Hyperlink)的伟大在于它把“引用”这个动作变成了可执行的跨空间跳转。几十年来,从局部刷新、AJAX 到如今复杂的 App 状态管理和丝滑的过渡动画,软件工程投入了巨大的人力去填补页面与页面之间的割裂感。动画在创造一种“连续性的幻觉”,让你的大脑相信是从一个状态平滑地切入了另一个状态。

但当我们打开任何一个现代 App 时,眼前看到的一切依然是被极度限定的。产品经理猜测用户的行为,设计师画出固定的页面,工程师将其转化为代码。几百万用户下载同一个版本,一万个人面对着完全相同的首页和五个死磕在固定位置的按钮,哪怕其中一个用户每天只使用深埋在层级里的单一功能。

这就带来了一个残酷的事实:我们今天所谓的“应用”,本质上是一套被提前写好的可能性。用户只能沿着开发者事先穷举出来的路径行动。现代 GUI 看起来极其自由,实际上却是一棵被提前修剪好的状态树。我们这代人正处于软件手工业的“手搓时代”——成百上千名工程师常年劳作,只是为了手工维护这棵庞大的界面状态树。

走向运行时 UI:当应用像梦境一样生成

未来的应用,将把 UI 从“产品本体”变成“运行时结果”。

这不是说所有软件都会退化成一个简陋的聊天框。相反,语言将成为最高效的控制面,而 UI 成为实时生成的辅助结果。当你说“帮我看看这三个月的收入为什么下降”时,系统不该只回复一堆文字,它应该当场生成一张趋势图、标记两个异常指标,并提供三个追问按钮。

2026 年,业内对 Generative UI 的探索已经证明了这一点:UI 不再必须是软件发布前就死死定型的模具。用户表达意图,模型理解任务,系统在此时此刻发现最适合用表单展示,表单便会出现;下一秒需要地图,地图便会展开;任务结束,这些临时长出来的界面便随之消散。

未来的软件不再是一栋提前盖好的商场——入口在哪、电梯在哪、商店怎么排布全都固定不变。未来的软件更像是一场梦境:你走到哪里,空间就在哪里实时生成。你需要门,门就出现;你需要桥,桥就出现。这就是从“应用拥有界面”到“应用生成界面”的质变。

文字从来不是限制,固定界面才是

这时候再回头审视《一念成仙》,你会发现它最迷人的地方,恰恰在于它从一开始就甩掉了“固定页面”的历史包袱。

它运行在社交场景的对话中,没有首页,没有固定的菜单栏。在很多人眼里这叫“简陋”,但在我眼里,这是一种极致的自由。一个以意图和消息为核心的系统,天然具备一种特质:没有人规定你的“第一页”应该是什么。你输入的第一句话,就是你的第一页;你下一步想做什么,就是你的第二页。传统 App 是用户被迫进入软件设计好的物理空间,而《一念成仙》则是软件围绕用户的行为,自然生长出探索空间。

在这个生成式 AI 的时代,文字早已不再是表现力的瓶颈,它正在变成最低带宽、最高抽象度的控制协议。一句简单的探索指令,背后可以随时展开卡片、图表、甚至一段实时生成的动态画面。文字只负责作为意图的入口,而世界并不必须只由文字构成。这也是为什么我说,《一念成仙》天然契合未来大模型的演进方向——随着多模态能力的接入,它不需要推翻现有的交互哲学,只会让这套意图驱动的体验变得更加丰满。

结语:新世界破土而出的嫩芽

几十年前,人类觉得命令行太晦涩,于是发明了 GUI,花了几十年的时间让计算机学会如何把能力展示给人看。而今天,历史的齿轮开始反转,我们正在教计算机如何直接听懂人类的意图。

当机器真正学会理解意图的那一天,软件史上那个“每一个按钮都需要人类提前摆放”的漫长阶段或许就将走向终结。未来的开发者不再是把人的想象力死死压缩进十几层菜单里,而是建立规则与能力池,让机器在运行时尽情展开用户的意图。

未来已来,只是它刚出现时,往往并不像科幻电影里那样闪烁着全息投影的蓝光。第一张网页简陋不堪,早期的搜索引擎只有一个孤零零的输入框;而今天最前沿的意图应用,看起来也仍然像是一个普通的对话框。

所以,如果一定要问《一念成仙》到底是什么?我不会用“指令机器人”这种只描述了表层介质的词汇去定义它。它是一种以意图交互为绝对核心,并持续向 Agent、生成式内容、动态 UI 和多模态反馈敞开大门的未来应用形态。

不要因为一切是从一句简单的文字开始,就错认它来自过去。当整个软件行业绕过 GUI、Web、App 这条长达数十年的巨大弧线,重新面对“人究竟该如何向机器表达意图”这个古老命题时,那些看似原始的文字输入框,或许正是新世界最先探出地面的嫩芽。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐