中科闻歌决策机 Decitron 拆解:MetaWorld 显式世界模型与 AutoABM 混合推理,AI 决策从「预测」走向「推演」
大模型最擅长的能力是生成文字,可现实世界的难题往往不在表达,而在决策。当一个系统同时牵涉多方利益、多种路径和持续变化的外部条件时,仅仅给出一个答案远远不够。决策者真正需要的,是把不确定的未来拆解成可比较的路径,再判断每一条路通向何处。这正是通用决策大模型试图填补的空缺。
复杂决策有三个难以绕开的特征,都超出问答式模型的能力边界。第一是多方博弈,国家、企业、市场、公众和监管者各带目标与约束行动,单方视角必然失真。第二是多路径演化,同组变量可导向不同结局,线性外推必失效。第三是状态持续更新,昨天的判断今天可能作废。这三者让决策无法靠一次推理收尾。
中科闻歌在六月五日发布通用决策大模型决策机,面向复杂事件与复杂系统的决策场景。官方明确表示,它不是聊天机器人,也不是搜索引擎。它能分析事件关联、模拟不同选择、推演可能未来。孵化于中国科学院自动化研究所的团队,把多年积累的社会计算与多智能体技术沉淀进了产品。
八月三日,决策机 Decitron 完整技术报告对外公开,首次系统披露了模型的技术底座。报告地址挂在 chinaxiv 预印本平台上。公开的三项核心贡献分别是显式世界模型 MetaWorld、SAO 形式化表示和 AutoABM 混合推理架构。这份报告把发布会上的笼统承诺,落实成了可以逐条检验的技术方案。它为工程团队提供了完整的实现依据。
九月三日,机器之心等多家科技媒体发布了对这份技术报告的深度解读,决策机再次成为当日焦点。媒体把注意力集中在它如何把世界建模、多智能体模拟与博弈求解整合进同一套框架,而不是又一篇刷榜新闻。对开发者来说,这比单纯的模型发布更有信息量。它回答的是架构问题,而不是参数问题。
全球首个通用决策大模型这个称谓,强调的是统一而非首创。世界模型、多智能体、博弈求解这些技术各自都出现过,把它们放进一套面向开放世界的决策框架才是真正的增量。这套框架形成持续建模、推演、求解和校准的完整闭环。通用二字意味着不同领域的问题都可以被转译成同一套计算结构。
决策机的技术底座由三根支柱构成,分别解决状态怎么表示、行动怎么推演、策略怎么求解的问题。MetaWorld 负责把现实世界转化为可计算的状态空间,SAO 负责把决策问题编码成可推理的结构,AutoABM 负责自动构建多智能体推演环境。三者首尾相接,形成所谓的四维混合推理能力。三个模块职责清晰,边界分明。
四维混合推理能力包含状态建模、因果推理、概率预测与多方博弈,全部融合在同一条链路上。大模型负责理解问题、识别主体、解释结果,求解器负责因果推断、概率更新与策略均衡,两者分工明确。这条链条的目标,是支撑人工智能从生成答案进一步走向推演世界。语义理解与数值计算各司其职。
整个系统按照持续建模、推演、求解、校准四个阶段循环运转,而不是一次性输出结论。建模阶段把现实整理成结构化状态。推演阶段让各方主体在状态上行动。求解阶段用形式化方法检验策略可行性。校准阶段用外部信号修正概率。每一轮循环都会留下可追溯的痕迹,供下一轮继续使用。
决策机要解决的,是传统问答式 AI 永远够不到的决策问题。问答模型给出的是此刻最可能的答案,决策机给出的是一组带概率的未来路径,以及每条路径成立的条件。判断依据从单次生成变成了持续更新的系统。这正是它与大模型产品最本质的分野。两者服务的是完全不同的决策场景。
MetaWorld 是决策机给出的显式世界模型方案,核心主张是状态必须看得见、算得动。传统大模型把世界知识压在参数里,每次回答都从隐式记忆中重新推断,状态既不可读也不可校验。MetaWorld 反其道而行,把推演所依赖的世界信息抽出来,整理成结构化、持久化、可计算的状态集合。决策的每一步都站在明确的状态之上。
提到世界模型,很多人会先想到 Sora、World Labs 或 V-JEPA 这类视觉方向的工作。它们建模的是像素、空间、物理与机器人环境,输出是连续的视频或运动轨迹。MetaWorld 关注的是另一类场景,包括经济、政策、企业竞争与地缘格局等开放系统。这类系统的主体、变量、关系和约束更加繁杂,根本无法用画面拟合。
开放系统的建模难点在于边界模糊且主体会主动改变规则。物理世界遵守固定定律,球抛出去轨迹可以精确计算。经济与政治系统则没有这样的守恒律,参与者的预期本身会改变结果。MetaWorld 必须把这类松散信息变成机器可操作的状态,同时保留足够丰富的语义。这正是它与物理世界模型最大的不同。
MetaWorld 维护的世界状态拆成三个层次,各管一段现实。Environment Layer 记录所有参与者共享的整体环境,例如局势阶段、资源价格、宏观约束与公共预期。Agent Metrics Layer 记录每个主体自身的资源、能力和目标进展。Relationship Matrix Layer 记录不同主体之间关系的变化,包括合作与对抗。三层叠加在一起,才能完整刻画一个多方博弈现场的全貌。
环境层解决的是公共背景的一致性问题,避免各方主体各自脑补不同的世界。局势处于升温还是降温阶段,资源价格处于高位还是低位,这些全局变量必须由环境层统一供给。推演时每个主体读取同一份环境快照,再基于自身指标做出反应。全局状态的一致性是多智能体模拟可信的前提。
主体层解决的是个体差异问题,把每个参与者的家底和目标显式登记在册。企业有现金流、产能与市场份额,国家有财政空间与民意约束,监管者有政策工具箱。这些指标会随推演轮次变化,主体层负责持续记账。只有个体状态可追踪,策略评估才能落到具体的资源约束上。
关系层解决的是互动结构问题,记录谁与谁合作、谁与谁对抗,也记录谁在观望。盟友关系可能因一次行动破裂,竞争格局可能因新玩家入场改写。关系矩阵的每个单元格都保存最新状态,供博弈求解时随时读取。关系变化往往是路径分叉的直接诱因,这一层决定了推演的方向感。
状态如何演化由因果 DAG 约束,而不是模型临场发挥。MetaWorld 在建模阶段就把变量之间可能的影响组织进有向无环图,形成显式的因果结构。推演过程中系统只更新节点状态与因果边的权重,绝不会每一轮重新生成一张因果图。这种约束让状态转移可解释、可审计,也防止推演在因果链条上失控发散。
有了三层状态与因果骨架,SAO 形式化表示开始发挥作用,它把决策过程编码成统一结构。State 描述当前世界处于什么状态,Action 记录各方主体在当前状态下的行动。Outcome 记录行动带来的收益、损失、成本与风险,包括可量化的财务影响。三段式结构覆盖了一次决策从前提到结果的完整闭环。
SAO 的巧妙之处在于 State 不是笼统的一句话,而是可以拆成更细的可量化状态。以局势升级为例,宏观层面可以记录升级发生的概率区间,微观层面可以记录各主体受影响的程度。颗粒度越细,后续的数值求解越有抓手。形式化的价值就是让模糊的决策描述变成可计算的精确对象。
SAO 的记录由 MetaWorld 持久化维护,让每一次决策都有据可查。State 不是一次性描述,而是随推演轮次持续更新的三维状态层。Action 也不是离散列表,每个主体在每个轮次都可以在约束范围内选择行动。Outcome 则累积记录每次选择带来的收益与风险变化。三段式结构让决策过程从黑箱变成了可回放的结构化日志。
这里有一个容易被忽略的细节,State 的颗粒度直接影响求解质量。如果状态只描述局势升温,推演就只能在定性层面打转。如果同时记录升温概率、各主体受影响程度、市场反应幅度与时间窗口,求解器就有了可操作的数值对象。SAO 的价值就在于给模糊的决策概念配上了可计算的刻度。
有了显式世界状态和 SAO 结构,下一步就是让各方主体在上面行动,这就是 AutoABM 的职责。传统基于主体的建模需要专家提前定义参与者、行为规则、环境变量与互动机制,换一个问题很多东西就要重新建模。AutoABM 把这一套自动化了,面对自然语言问题自动建模。系统提取参与者、目标、约束与行动空间,不再依赖人工。
AutoABM 的工作流程分为四步。第一步是结合外部证据识别参与者,确定谁在博弈中拥有决策权。第二步是提取每个主体的目标函数与硬约束,比如预算上限、资源限制或政策红线。第三步是抽象行动空间,列举每个主体在当前状态下能做什么。第四步是构建环境变量与因果关系,把它们挂接到 MetaWorld 的三层状态上。
完成建模后,AutoABM 开始自动构建多智能体推演环境,然后循环执行模拟。每一轮模拟中,各主体基于当前状态评估自身目标,选择行动,产生 Outcome,MetaWorld 据此更新状态。下一轮各主体在新状态上重新评估,周而复始。这种循环与聊天模型的单轮问答是两种完全不同的计算范式,也是决策机能力的根本来源。
推演产生的大量候选路径不能直接作为决策依据,还需要经过形式化求解器的检验。决策机内置了五类求解能力,分别是经典博弈、资源配置与优化、路径规划与调度、不确定条件下的概率推断和约束满足。每类求解器对应成熟的数学工具,大模型不再负责算术。这一层相当于给推演装上了合规检查器。
中科闻歌团队把超过两千个场景求解方法转化成了可量化计算的 AI 算子,覆盖了从微观经济到地缘博弈的广泛领域。在博弈问题上,系统内置了囚徒困境、猎鹿博弈、胆小鬼博弈、零和博弈等九类经典原子博弈。这些模型覆盖了一百四十四种 Robinson-Goforth 二乘二博弈拓扑。系统据此识别并求解不同的博弈结构。

在专测多智能体博弈能力的 TMGBench 基准上,决策机的表现相当扎实。均衡准确率达到百分之九十九点四,拓扑识别准确率百分之百,平均求解时间零点八秒,可解释性评分为四点三分,满分五分。这些数据表明,SAO 加 AutoABM 的组合在结构化博弈求解上具备工程可用性。它把推理质量从印象分变成了可复现的分数。
求解器与大模型的分工在设计上非常清晰,两者各管一段。大模型负责理解问题、识别主体、解释结果,它擅长的是模糊情境下的语义匹配。求解器负责因果推断、概率更新与策略均衡,它擅长的是数值计算与约束优化。两者之间通过 SAO 结构交换数据,语义层与计算层解耦,任一方升级都不影响另一方。
推演链条的最后一环是概率校准,它为候选路径分配可信的数值。系统结合模型推理结果和外部校准信号,为不同结果分配概率。校准依据包括预测市场信息、历史预测表现与概率评分规则。决策机输出的不再是可能发生什么的描述,而是带概率判断的未来地图,并且会随新证据继续更新。
评测数据最能说明决策机的真实定位,它在 PolyBench 上拿到三项 SOTA。终局预测准确率 FFA 达到百分之八十一点二,预期波动预测准确率 EVPA 达到百分之七十三点四,平均概率预测偏差 MSE 为零点八二二。三项指标均优于行业基线,综合表现超过了当前主流大模型。这说明它的推演不是语言包装,而是有数值支撑的。
除了公开数据集,团队还自建了事件预测集,覆盖七十四个高不稳定性事件。整个评测集包含三百七十个二元判断问题,时间跨度覆盖多个事件类别。在这些问题上,决策机的整体预测准确率达到百分之七十八左右。自建集的价值在于样本贴近真实决策场景,而不是标准题库里的固定题目。
在 LLM-NEWS 评测设置中,决策机在短期预测上优势最明显。针对三到三十天的短期组,决策机准确率达到百分之七十二点八。同组对比中,GPT-5.5 只有百分之三十五点四三,Claude-4.7 也只有百分之四十四点六二。这意味着在局势快速变化、历史规律难以沿用的场景里,结构化推演明显更占优,领先接近两倍。
进入中期和长期之后,决策机与纯大模型的差距逐渐缩小,这个现象值得单独讨论。短期预测靠的是对当前变量的敏锐捕捉与多主体推演,这正是决策机的长项。长期预测更依赖宏观规律与历史分布,纯语言模型反而能借助语料统计信息。差距分布恰好印证了决策机补的是短期决策这块短板。
团队还开展了为期一个月的全天候模拟实时事件推演测试,验证持续运转能力。该测试贴合真实市场节奏,重点考察系统在高频变量变化场景下的表现。测试关注的三个维度是持续推演、动态校准与风险识别,全部是生产环境最关心的问题。持续一个月的高频运转,检验的正是状态管理的稳定性。
X-Signal 全球信号追踪是决策机面向持续决策推出的配套能力,负责把推演接入现实信号流。演示场景中,系统把美联储降息议题保存为持续追踪任务,围绕它监测全球新闻、政策变动、市场信号与关键变量。一旦相关信号发生变化,系统不会重新生成整张报告。系统会在原推演结构上做增量更新。
信号驱动的更新机制包含三个动作,分别是自动更新路径、调整概率与重估触发条件。路径更新用新变量重新计算分支,概率调整用最新证据修正数值,触发条件重估则判断哪些假设已经失效。每一次更新的依据与结果都被完整保留下来。第一次判断与后来修正之间的差异,因此变得完全可追溯。
这种持续更新机制把一次推演变成了动态的判断系统,而不是静态的分析报告。用户随时可以看到判断链路上哪些环节被新证据改写,哪些环节依然稳固。对投资研究、公共治理这类需要长期跟踪的决策场景,这种能力比单次高准确率更实用。判断的生命周期从生成那一刻延伸到了事件结束。
输出层面,决策机自动生成两类报告,分别服务过程与结果。推演过程报告记录问题如何被界定、主体如何被识别、分支如何生成、概率如何变化。综合分析报告则直接给出条件化判断、时间窗口建议、监测指标与重估信号。两类报告叠加,既回答现在该做什么,也说明判断是如何演变来的。
复杂判断由此沉淀为可传播、可复盘、可追踪、可更新的决策资产,这是决策机与传统问答式 AI 的又一关键分野。问答模型给出答案后,推理过程往往随上下文一起蒸发。决策机的每一次推演、校准与修正都被结构化保存,可以被团队反复审视。决策资产化让 AI 的判断第一次具备了工程资产的属性。
把关键指标放在一起看,决策机在短期预测上的优势会更加直观。下表汇总了 LLM-NEWS 短期组的对比数据,以及 PolyBench 上的三项核心成绩。表格里的每一个数字都来自公开报道,可以直接回溯核对。看完这张表,再回头看它的架构设计,逻辑就完全对上了。有时候数字本身就是最好的论证。
| 评测项 | 决策机 Decitron | 对比基线 |
| LLM-NEWS 短期准确率 | 72.80% | GPT-5.5 35.43%,Claude-4.7 44.62% |
| PolyBench FFA | 81.20% | 优于行业基线 |
| PolyBench EVPA | 73.40% | 优于行业基线 |
| PolyBench MSE | 0.822 | 优于行业基线 |
抽象架构讲到这里,不妨用一段真实可运行的 Python 代码来还原核心思想。下面的程序实现了两个主体的重复博弈,用 SAO 结构记录每一轮的状态与结果。它把 State、Action、Outcome 三个概念落到了具体的数据结构上。这段代码可以直接复制运行,没有任何外部依赖。运行它只需要 Python 标准库就够了,不需要安装任何第三方包。
from dataclasses import dataclass, field
@dataclass
class Round:
a_action: str
b_action: str
a_payoff: int
b_payoff: int
PAYOFF = {('C', 'C'): (3, 3), ('C', 'D'): (0, 5),
('D', 'C'): (5, 0), ('D', 'D'): (1, 1)}
def tit_for_tat(history):
return 'C' if not history else history[-1].b_action
def always_defect(history):
return 'D'
def main():
history = []
a_strategy, b_strategy = tit_for_tat, always_defect
total_a = total_b = 0
for r in range(1, 6):
a = a_strategy(history)
b = b_strategy(history)
pa, pb = PAYOFF[(a, b)]
history.append(Round(a, b, pa, pb))
total_a += pa
total_b += pb
print(f'round {r}: a={a} b={b} -> ({pa},{pb})')
print(f'total: a={total_a}, b={total_b}')
if __name__ == '__main__':
main()
运行这段代码,会看到五个回合的完整记录。第一轮以牙还牙选择合作,而永远背叛者直接背叛,收益被大幅拉开。从第二轮开始,以牙还牙学会了报复,双方陷入持续的相互背叛。最终累计收益定格在四比九,背叛策略在有限回合里占了便宜。这就是博弈结构对路径演化最直观的演示。
把这段小程序放大到决策机的规模,差异在于主体数量与求解深度。真实系统里有成百上千个主体、三层状态与因果图约束,每一轮还要经过形式化求解器的检验。但核心思想完全一致,即显式记录状态、让主体按规则行动、用结果更新世界。理解这个最小实现,就理解了决策机的推演内核。
当然,决策机并非没有工程挑战,显式建模的代价首先体现在状态质量上。MetaWorld 的世界状态依赖信息来源的完整性与可信度,信息缺失会直接传导到推演结果。因果 DAG 的构建也需要专业经验,错误的关系假设会导致路径系统性偏移。这些环节决定了决策机的输出上限,比模型本身的推理能力更关键。
另一个挑战是通用与深入的平衡,跨领域框架容易在专业场景里流于表面。决策机用两千多个求解算子覆盖广泛场景,但每个领域仍有自己的特殊规律。团队后续需要持续扩充算子库与领域知识,才能守住通用框架的护城河。这也是所有通用平台型产品共同面对的长期课题。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)