一句话导读:《回到原点》给出的答案是"能,但有三个条件=三篇论文"。本文是第二篇条件的首次实测汇报——** Paper B(连接组约束的价值学习)**:我们把雄性果蝇中枢神经系统的 99.8 万条蘑菇体连接边、分布编码多巴胺、门控资格迹、受体级慢变量装进了一个 CPU 上能跑的学习器,然后看着它以可预言的方式塌缩了三次。三次塌缩各值一篇论文的半个章节:迹决定学习速度(2 倍),门控决定保持(衰退 0.28 vs 0.59),而"符号条件化行为"在稠密特征+线性读出的架构下根本无法自举——这是通往世界模型的第一个实证路标。


0. 当前坐标:三篇论文走到哪了

先交代进度,细节全部在后文:

论线内容状态
A 基准(FlyBrainScore)果蝇全脑活动预测基准数据管线 v0→v0.6 全通,等第二只蝇下载完→基准 v1 上线
B 方法(NGC-FLY)连接组×分布多巴胺×门控迹×受体慢变量本文:数据侧完备 + 机制证据收官(10 种子正式网格 + 双协议切换 + 具身接入)
C 验证(DCA-Verif)欺骗成本不对称+双通道验证双试点完成,通道分工被实测修正(下一篇讲)

一句话:B 线的机制证据侧基本收官,本篇所有数字都是我们机器上第一手跑出来的。


1. 数据侧:99 万边连接组里先做尽职调查

动手写学习器之前,先把 maleCNS(Janelia 2026 年 9 月发布的雄性果蝇全中枢连接组,CC-BY)的蘑菇体部分拆开看了个底朝天:

  • 规模:KC(Kenyon Cell,嗅球投影神经元的下一站)4,064 个、15 个类型;MBON(蘑菇体输出神经元)97 个、37 类型;DAN(多巴胺神经元)340 个、27 类型。KC→MBON 学习骨架 998,478 条边。
  • 数字对得上生物:每个 MBON 平均读 631 个 KC 的输入、7.1 个 DAN 类型的调制——教科书里"KC 稀疏投票、DAN 广播评价信号"的图景,在连接组层面是能点出具体突触的。
  • 递质全核实:KC 100% 胆碱能,MBON 分胆碱/谷氨酸/GABA 三群(50/26/21),DAN 338/340 确认多巴胺能——直接从突触伴侣表读出,不是文献转述。
  • 区室名白捡:aL/bL/b’L/gL(垂直叶/水平叶区室)直接从突触位点坐标归属,区室级 DAN→MBON 调制矩阵和 KC→MBON 骨架矩阵一次成型——这正是"受体级慢变量按区室作用"(Science 2026-08 的发现)所需要的计算载体。

一个待验证的意外:KC→KC 有 64 万条边、KC→DAN 有 14.5 万条边——教科书里这两个通路几乎不存在。第一步核验(群体纯净性 + 99.92% 同侧投射)显示不是注释错误,体量远超文献记载。是雄性特异?是新技术灵敏度?与 hemibrain 雌性数据对照后才能下结论,先挂起,不进模型。

方法论插一句:调研阶段的"空白"判定按月失效,但连接组数字不会失效——一手统计 > 文献转述,这是我们把数据侧做在写代码前面的原因。


2. 学习器:NGC-FLY 的四个机制组件

架构(细节见预注册草稿):

观测 → 固定随机投影 → KC 层(k-winner 8%, honoring 生物稀疏率)
     → KC→MBON(掩码=真实连接组) → MBON → 策略头 + 分位价值头(K=5)
DAN 通道:每区室 δ^τ = r + γV^τ(s') − V^τ(s),分位 pinball 更新
门控迹:λ(t) = λ_base·σ(a·u+b),u = 分位区间宽 + |δ| 指数滑动
受体慢变量:m_c 按区室使用率相对再分配,乘性门控策略读出学习率

四个组件各自对应一个生物学事实:k-winner 对应 KC 的 8% 稀疏响应;分位价值头对应分布编码多巴胺(Dabney, Nature 2020——不同 DAN 放大误差的不同分位);门控迹对应"不确定性调制的可塑性窗口";受体慢变量对应受体状态依赖重塑。每个组件可以单独关断——这就是消融实验的分组依据。

任务是一个 25 步的延迟奖励门控:拉杆→延迟 5 步→门开 2 步→进入得奖。拉杆动作本身没有即时奖励——没有迹的学习器在原理上就跨不过那 5 步延迟。


3. 第一次塌缩:正式网格的三轴分解

10 种子 × 5 配置的正式网格,修掉环境 bug 后重跑(旧环境的"E4b 全塌"结论已如实降级——那是一个窗口 off-by-one 的伪影,见第 6 节)。这次我们不只看终值,把每条学习曲线拆成**学习(前 1000 回合)/ 峰值 / 保持(末 1000 回合)**三轴:

配置学习峰值保持衰退保持塌缩
E3 门控迹+分布RPE(全量)0.7140.9080.281(最小)2/10
E4 固定 λ=0.950.5980.8660.594(最差)6/10
E4b 无迹0.372(最慢)0.7350.4485/10
E5 标量 RPE+门控0.4410.7620.3253/10
E6 无受体慢变量0.7550.9500.4423/10

三条结论,每条都比"谁分高"有意思:

① 迹的必要性 = 学习速度,不是最终能力。 无迹学习器(E4b)前 1000 回合的成功率是全量配置的一半(0.37 vs 0.71),但峰值也能到 0.74——修正后的环境里存在"门开了就进去"的反应式奖励通路,无迹的学习器靠它最终也能及格。迹买的是到达曲线的斜率。

② 门控迹 = 保持。 全量配置从峰值只掉 0.28,固定高 λ 掉 0.59,保持塌缩 2/10 vs 6/10。固定的高迹在长延迟任务里累积失控——不确定性门控的真正身份是稳定器,这是预注册预测 P1(信用归因)之外的新叙事点。

③ 普遍晚期衰退是新发现。 所有配置从峰值掉 0.28–0.59,包括"先学到 0.83 再塌到 0.00"的个例。软最大策略读出没有探索底线:动作被抑制 → 资格迹失去支持 → 权重永不更新 → 探索无法恢复的吸收态。我们在另一个环境里独立复现了同一病理(见第 5 节),并验证了它的解药(ε 探索地板)。

另外 E6≈E3(受体慢变量在单任务里中性,0.755 vs 0.714)——这与预注册判断一致:受体慢变量的检验条件不在单任务。


4. 第二次塌缩:切换协议的 null 与具身线的水平效应

受体慢变量什么时候才有行为差异?我们做了两个独立协议:

m105 抽象协议(任务 A/B 交替,情境线索经连接组掩码绑定到不同区室组):全修复版 8 种子,切换恢复迟滞 E3 71±50 vs E6 69±48 回合(n=60/59 次切换)——null。

MuJoCo 具身协议(轴孔插入 × 五感 24 通道 × 棱镜镜像变体:变体 B 视觉 x 通道取反、本体不动,“同一视觉观测→相反动作”,教科书级 prism adaptation):8 种子,迟滞 62±25 vs 58±25(n=56/56)——还是 null。

速度上两次独立复现 null,我们差点把受体慢变量记为"惰性元件"收工。但具身线的另一个度量翻出了东西:全程成功率 E3 是 E6 的 2.0 倍(0.054 vs 0.027),种子级 Mann-Whitney AUC = 0.70,而两组的衰退幅度几乎相同(前→后半窗 −0.028 vs −0.026)。机制检验干净:E3 的区室增益变量 m 打满再分配量程(跨区室极差 1.000),E6 恒 0——操纵确实生效。

所以修正后的假设是:受体慢变量提供的是变体 regime 下的更高技能水平(水平效应),既不是切换速度,也不是特异的抗衰退。机制候选很诱人:m 的区室相对再分配=策略读出上的软混合专家,即使行为还没完全条件化,部分变体偏好已经受益。效应量中等(AUC 0.70),n=16 的定谳实验在写本文时正在过夜跑。这是 P4 之外第二条 E6 判别通路,也是"受体级可塑性怎么影响行为"这个 Science 2026-08 发现的第一份计算回答尝试。


5. 第三次塌缩:符号条件化根本无法自举(诚实边界,也是路标)

具身线最深的坑花了我们 7 轮配置迭代,值得单独讲。

棱镜变体的核心行为是符号条件化:视觉误差为正时向左推、为负时向右推——同一观测维度、相反的最优动作。诊断发现两个层面的死锁:

  1. k-winner 的绝对值门吃掉符号:|P·obs| 对 ±输入对称。实测 MBON 活动与位置的相关高达 0.825,但 KC 胜者集合在正负位置间只有 3 种——符号信息在最前置的一层就没了。解法是生物带来的:把误差拆成 ON/OFF 双通道(果蝇 LMC 的整流通路),符号变成"哪条通道在响",k-winner 可分。
  2. Wpi 需要 W 的特征、W 需要 Wpi 的梯度——策略权重需要表征特征来定向,表征权重需要策略梯度来分化。m105 抽象任务能逃逸,因为它的关键信号是单侧的(拉杆回声专线);而"符号条件化"是双态的,在稠密 MBON 特征 + 线性策略读出 + 资格迹执行者的架构下没有自举路径。

这不是调参失败,是架构边界。它恰好指向《回到原点》里 RQ1 的核心判断:下一个必要的机制层是学习型世界模型/规划器——条件化策略需要一个能对"误差状态→动作后果"做内部推演的模块,而不是更花哨的迹。负结果指路,比正结果值钱。


6. 调试战役精编(十个教训,每个都有数据)

机制研究的大部分时间不在"想机制",在"证明自己没被骗"。本轮最有复用价值的十条:

  1. 零阶保持伺服会周期-2 振荡:对象时间常数 12ms ≪ 控制周期 50ms 时采样环不稳定——伺服必须每仿真步重算;
  2. 奖励尺度的可学门槛:策略梯度对 0.005–0.02/步量级的信号有响应(实测),0.001–0.004/步的塑形会被价值噪声完全淹没;
  3. 绝对值特征提取层吃符号(见上,ON/OFF 整流是果蝇教的);
  4. 软最大+资格迹的冻结吸收态:动作不被选→迹无支持→权重不更新→永不恢复。ε 探索地板 + 迹视野拉长(λ_base=1.0、γ=0.98,视野约 50 步)联合解除;
  5. 塑形奖励的游走吸引子:对称的正负塑形噪声会自我强化成"只游走不行动";
  6. 没有触发的惩罚是纯噪声:伺服推力 2N 从未超过 2.5N 的碰撞阈值——两个版本实验结果逐位相同才暴露;
  7. 回合间忘记 reset:切换实验的每个"回合"退化成 1 步,旧结论作废;
  8. 旗标读取顺序:成功旗标在读之后才 reset,成功率恒 0 的假象跑了两组实验才被抓到;
  9. 窗口 off-by-one:门衰减先于进入判定执行,声明的 2 步窗口实际只有 1 步——正式网格为此整个重跑;
  10. 环境 bug 会制造"干净的科学结论":旧环境里"E4b 10/10 塌缩 vs E3 0 塌"的漂亮分离是伪影。修正环境后结论更弱但更真——宁可结论弱,不要结论假。

7. 下一步

  • n=16 的水平效应定谳(跑着);
  • 探索地板对普遍晚期衰退的消融——如果 ε 地板消除晚期塌缩,"稳定器"叙事就完整了:门控管迹、地板管策略;
  • KC→KC/KC→DAN 体量反常与 hemibrain 对照(挂起项);
  • 下一层机制:把 RQ1(学习型世界模型)接进具身线,攻"符号条件化自举死锁"。

C 线(验证栈)的实测更刺激:校准后的语义通道对物理漂移一次都不响,"加通道至少不亏"被证伪——见下一篇。


附:关键参考

  • Male Drosophila CNS connectome(CC-BY 开放)— male-cns.janelia.org / Cell 2026
  • FlyWire 全脑连接组 — Nature 2024
  • 分布编码多巴胺 — Dabney et al., Nature 2020
  • 受体状态依赖重塑 — Science 2026-08
  • 前置阅读:本系列第 3 篇《回到原点》(三篇论文的规划与设计宪法)

声明:本文所有实验数字为作者本机第一手测量(CPU、多种子、脚本随工件存档),样本量与诚实边界已在文中标注;n=16 定谳与文献对照进行中,结论以正式论文为准。转载请注明出处。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐