AI成长笔记(五):注意力、行动与等待,AI时代怎样做长期学习?
本文主要记录了 2026 年 8 月的一些知识和学习上的思考。
一、知识类
1.k8s与docker的关系:Docker 解决了“如何创建和运行容器”的问题,而 Kubernetes 解决了“如何在大规模生产环境中管理这些容器”的问题
2.如果是 HuggingFace/Transformers 格式,就优先用 vLLM(linux部署,在windows上需要WSL2) 或 Xinference/TEI (直接windows上部署)暴露 embedding API;如果是 GGUF(.gguf格式) 才更像走 llama.cpp/Ollama。
3.Gemini Omni 1.1 Flash目前是Text-to-Video Arena的第一
4.传统 VLA 大致学习:我看到这个画面、收到这个指令,下一步动作是什么?;WAM (word action model)则希望学习:未来世界状态+造成这种变化的动作
5.Noe-0 后训练真正赌的是:机器人智能的大头是可跨本体复用的世界与动作知识(WAM),本体差异只是相对较小的适配问题;如果未来证明新任务、新机器人都只需要很少真机数据,而无需大量遥操后训练,那才是真正的范式变化。
6.多模态图像和文字交互:Vision Encoder(一般用的是ViT)先处理图像;然后经过一个投影层,“映射”到与文本Token相同的向量空间;然后将处理好的视觉Token与文字提问(Query)的Token拼接在一起(这里的Token实际是向量)
7.多模态中,Encoder-free策略 不是把 Vision Encoder 换成 Vision Decoder,而是去掉独立的深层视觉编码器Vision Encoder,仅保留轻量级视觉 tokenization / projection 模块,把图像转换成 visual tokens 后,直接送入与文本共享的统一 Transformer / Decoder backbone。视觉 token 是否采用内部双向 attention 取决于具体架构,有些模型会这样设计,有些仍采用 causal 或混合 mask。
-注:Vision Encoder(视觉编码器)的两大主流技术路径:ViT(Vision Transformer)和CNN(卷积神经网络),目前ViT几乎是绝对的主流。
8.格陵兰岛融化大概需要1000-5000年,导致海平面上升7m,但最近几十年都会有影响——极端海平面事件(如风暴潮)的频率和破坏力将呈指数级上升。
9.Kimi3前端能力较好,后端能力一般
10.GLM Coding Plan·7天体验卡:智谱丨BigModel 平台
11.Walker S2(优必选公司的产品,优必选还有全资子公司:北京天工机器人有限公司) 当前阶段的定位:工业具身智能开始进入窄场景商业落地阶段
12.Ox Alpha牛来模型就是GLM-5.3-Flash(320B-多模态,还支持视频),今天还出了千问3.8-Flash(180B-多模态)
13.OpenAI模型沙箱泄露入侵Hugging Face的原因:reward hacking、对近乎不可能任务的异常坚持、未经授权的通信、智能体相互采纳目标。基础设施漏洞是放大器,而不是最深根因。
ExploitGym :一个专门测试 AI 能不能把“已知漏洞”真正变成可用攻击 的网络安全 benchmark。
第一根因:训练目标实际上奖励了“成功”,而不是“按规则成功”(根本原因)
第二根因:模型已经跨过了“Reward Hacking 能力阈值”(一个十年前已经知道的 alignment 问题,被能力 Scaling 放大到了现实世界攻击的程度)
第三根因:ExploitGym 制造了一个“不能失败”的优化压力
第四根因:多智能体训练意外产生了“社会性泛化”
第五根因:“peer instruction”同伴指导突破了原本残留的 alignment(模型理解规则,但目标优化在某些情况下压过了规则,例如一个 agent 本来决定停止,另外一个 agent 在留言板说:GO,并给出时间压力后,前一个 agent 就把这个 peer message 当成了“授权”,继续行动)
总结:本次事件是一个更棘手的问题(非常强的优化器+不完全正确的目标)
14.GLM-5系列首个原生多模态模型”指的是智谱AI最新发布并开源的GLM-5.3-Flash模型。“原生多模态”——即模型在设计之初就具备同时理解文本、图像和视频的能力。并非像有些模型那样,在纯文本模型“长大”后,再“补课”去学习理解图片。即给模型“外挂”一个视觉编码器(如CLIP)将图像转为特征,再通过一个适配器将这些特征“翻译”成模型能懂的语言。通过对比学习,让模型用图文配对(最大化匹配的图文对(正样本)的相似度,同时最小化不匹配的图文对(负样本)的相似度)进行数据微调,让模型学会“看图说话”。
15.在linux上部署系统常见的方式:用容器,然后VLLM部署
16.Manus 是目前做得最成熟的一批“通用 Agent 产品”之一;Codex 则已经从 coding agent 演化成了一个通用 agent 平台,而且背靠 GPT-5.6 后,基础智能和开发者生态上的优势非常明显。
17.盖茨现在明确提出:AI 可能打破这个规律。原因不是 AI 又是一台更好的机器。而是它第一次开始替代:human cognition,即人类认知劳动本身。
AI生产率爆炸→劳动需求下降→资本收入上升→劳动收入下降→财富高度集中
18.Ilya将 2012 年至 2020 年概括为「研究时代」,2020 年至 2025 年则是「规模时代」。继续增加数据、参数和算力仍然会带来进步,但很难再复制过去十年的根本性跃迁。
19.人和今天模型最大的差距之一,是从少量经验中泛化的能力。
20.强化学习里的一个经典问题:Reward Hacking(奖励黑客 / 奖励投机)
21.AI办公场景御三家:workBuddy(腾讯)、豆包(字节)、千问办公(阿里)
22.机器人业务发展路线
仓储 / 搬运
↓
制造辅助
↓
复杂装配 / 多工序/长尾工作
长尾工作:大量、零散、低频、不紧急,但累积起来却极其耗时耗力的琐碎任务。
↓
商业服务
↓
部分家庭任务
↓
真正通用家庭机器人
23.2026人工智能大会调研
-【3个GPT时刻】具身智能面临三个GPT当年没有这么严重的瓶颈:数据成本、现实世界可靠性、硬件成本。此外具身智能面对的是“三个GPT时刻”(现在很可能已经接近第一个拐点附近)。
-【跨任务泛化与Zero-shot区别】跨任务泛化是“能力”本身(能举一反三);Zero-shot 是“测试标准”之一(连例子都不用给,直接一步到位)。能达到 Zero-shot 效果,是跨任务泛化能力达到顶峰的标志。如果模型只有低级的泛化,可能需要先给1-2个示例(Few-shot 少样本)才能学会新任务。
-【Zero-shot关键信号】GPT时刻可能首先发生在工厂,而不是家庭,因为商业上更容易实现的是:半结构化环境里的通用工人。关键信号:同一个模型能否在从未见过的环境中,仅凭自然语言连续完成30分钟以上的新任务,并且不需要人工接管。
-【是否存在Scaling Law】一个更深的问题:具身智能存在类似LLM的Scaling Law吗?基于目前调研结果,具身智能大概率存在 Scaling Law,但真正的 scaling unit 可能不是 token,而是“可对齐的、多样化的物理经验”。(动作/物理表示对齐 (Scaling成立的前提 )、机器人的实体形态种类Robot embodiment(例如人形和机械臂等形态)、环境数量 、物体数量 、任务多样性 、数据质量)
24.蚂蚁百灵开源 Ling-3.0 tiny / flash Base 模型,开放训练过程中的关键节点
预训练(Pre-training)及 Checkpoint:模型在海量文本上“阅读”学习语言规律和世界知识。此时处于“书呆子”状态,只会续写,不懂遵循指令。
中期训练(Mid-training)及 Checkpoint:在预训练基础上,用更高质量或特定领域(如数学、代码)的数据进行强化。特定领域能力提升,但仍未学会交互的“原始”状态。
WSM 合并(WSM Merge):将多个专长模型(如擅长数学、代码)通过权重空间融合,直接合并成一个综合能力强的基座模型。成本低,但仍是未经过后训练的“全能基座”。
后训练(Post-training):包括监督微调(SFT)和人类反馈强化学习(RLHF/DPO)。这是最后一步“社会化训练”,教会模型遵循指令、安全对话,将“书呆子”变成可用的助手。
25.GEN-1.5 不是机器人第一次 One-shot,但仍然可能比之前的模型重要,因为:One-shot 是从规模化预训练中“涌现”出来的,不是特定训练出来的。
26.大脑:理解任务、决定做什么、学新技能。VLA、Foundation Model、World Model、规划/推理模型。
小脑:把动作稳定、快速、精确地做出来。Reactive Policy、Whole-body Controller、Locomotion Policy、低层运动控制
27.2026 年的通用具身智能,大概处在“GPT-2.5”阶段——已经开始出现 GPT-3 式能力,但还没有跨过 GPT-3 那条可信的分界线(Zero-shot 广泛有效)。
28.目前整个领域最核心的未决问题:Scale 能不能一直有效到产生通用物理智能,还是会很快撞上数据、硬件和物理交互的墙。
29.OAuth 流程,你可以通俗地理解为 “授权委托办理” 的过程。
就像你去一家高档健身房(Codex),前台(服务器)说“必须刷手机短信验证码才能进”。但你想了个办法:你先去总服务台(ChatGPT 网页端),用你的会员卡(账号密码)和备用证件(邮箱验证码)成功登记。总服务台核实后,发给你一张通用的“园区一卡通”(令牌/Token)。你拿着这张卡,就能直接刷开健身房的门,而不用再补刷手机短信了。
30.Π0.5进步的原因
①数据:从“专才”到“通才”的秘诀,训练数据的广度和多样性
②训练:从“扁平”到“分层”的推理,将推理过程分为两个层次:高层推理(规划)和低层推理(执行)。关键在于,高层和低层推理集成在同一个模型内,使得“思考”和“行动”能端到端地联合优化,效果优于使用两个独立模型。
③策略:“知识绝缘”(Knowledge Insulation) 策略,防止VLM预训练阶段获得的通用视觉语言知识不被破坏。但VLM没有被冻结,VLM 用“离散动作 Token + 规划数据”的交叉熵更新;Action Expert 用连续动作的 Flow Matching Loss 更新,两者前向连接,但 Action Expert 的梯度不回传到 VLM。
同一条机器人数据
│
┌─────────────────┴───────────┐
│ │
FAST离散化真实动作 保留连续真实动作
│ │
↓ ↓
图像+语言+状态 → VLM 加噪 A_t + t
│ │
预测 FAST Action Token │
│ │
Cross Entropy Loss │
│ │
更新 VLM │
│ │
└──── VLM特征 ─→ Stop Gradient ─→ Action Expert
│
预测速度场
│
Flow Matching Loss
│
更新 Action Expert
31.机器人学习的重要瓶颈
-缺少大规模、多样化机器人数据
-缺少能够实时(反应快、延迟低)运行的可扩展(泛化)模型。
32.MiniMax-H3 有两个任务模块FL2VA (文/首尾帧图生视频)和 Ref2VA(图/视频/音频生视频),若采用 FP16/BF16 部署,单任务模型权重约 135 GiB,部署需要 270 GiB;若同时常驻两个任务(FL2VA 和 Ref2VA)模型权重约 197 GiB,部署需要 400 GiB。
MiniMax-H3架构图
┌──── 共享 Qwen3-VL Encoder
输入 ─────┤
│
├──── FL2VA DiT
│ ├─ 文本 → 视频+音频
│ └─ 首/尾帧 → 视频+音频
│
└──── Ref2VA DiT
└─ 图/视频/音频参考 → 视频+音频
↓
共享 Video VAE
共享 Audio VAE
33.让模型深度思考的提示词
先别急着回答,也别默认我已经把问题想清楚。请先对这个问题做一次详细思考的“双向钢人论证”:
-
1.用最完整、最有力的方式,重述我真正想解决的问题。
-
2.使用钢人论证法分别给出支持我当前想法、以及反对它的最强论证。
34.找出双方真正的分歧,以及最可能改变结论的关键变量。
35.只问我一个最关键的问题。等我回答后,再给出明确判断、理由和下一步行动。
我的问题是:[粘贴你的问题]
36.在 GPU 术语中,“片上”(On-Chip) 确实几乎等同于 “在 SM 内部”。FA1 的整个“分块计算”生命周期,全部被限制在单个 SM 的领土内:
-Q/K/V 的 Tile 从片外 HBM 被加载进 SM 内部的共享内存(SMEM=sharm memory)。
-中间结果 S、P、O 的累加值存放在 SM 内部的寄存器(Register) 或 TMEM(Blackwell)。
-计算由 SM 内部的 Tensor Core 或 CUDA Core 完成。
37.Shared Memory=SMEM,而 Shared Memory/SMEM通常由片上SRAM实现 ,SRAM 是一个更宽泛的概念
38.SM、SMEM、SRAM三者关系
-SM(Streaming Multiprocessor):GPU 的计算单元,可以理解为一个“计算车间”。
-SMEM(Shared Memory):SM 内部供一个 CTA / Thread Block 中线程共享的高速存储。
-SRAM(Static Random Access Memory):一种物理存储技术,SMEM 通常由片上 SRAM 实现。
SM
│
├── CUDA Core
├── Tensor Core
├── Registers
├── Shared Memory / SMEM(由片上 SRAM 技术实现)
└── Warp Scheduler
39.英伟达芯片
Tesla V100 (2017年)
A100 40GB(2020年)-A100 80GB (2020年底)
H100 (2022年)-H200 (2023年)
B100/B200 (2024年)
40.名词概念
-Blackwell:英伟达最新一代GPU架构(2024年发布),即H100(Hopper架构)的下一代。其Tensor Core算力相较H100提升了数倍。
-Shared Memory Traffic:共享内存流量。指数据在GPU的共享内存(SRAM,极快,片上) 和寄存器(Register) 之间搬运的数据量,以及线程块内部读写SMEM的带宽消耗。注意:它不包含与外部显存(HBM)的通信。
-Exponential Operations:指数运算。特指Softmax中的 exp(x)指令,由CUDA核心中的SFU(特殊功能单元) 执行。
-MMA Compute:矩阵乘加计算。全称是 Matrix Multiply-Accumulate,这是Tensor Core唯一执行的操作(即D = A*B + C)。
41.Shared Memory与Registers
Shared Memory:同一 CTA 内线程之间共享数据;
Registers:通常为线程私有;
42.强化学习算法:PPO,也是用的别人的开源框架。底层的强化学习算法只是了解,你不会去修改这些底层的强化学习算法,主要还是调试别的参数,减少sim2real的gap
43.ROS/ROS2【核心价值:模块解耦】:基本都是ros2,对ros2的topic和action了解,知道怎么用就好了吧,不用了解太底层的dds啥的,topic比较重要,现在跟电机通信还是依赖topic的
44.计算Softmax,先找这一行最大的数,然后所有 Score 都减掉它,再计算softmax,结果是一样的。目的是把最大的指数固定成 e0=1,避免指数溢出Overflow。
二、思考类
1.它说明了习惯的力量。改变人的行为方式,比技术圈的人想象得难得多。
2.我在教学实践中强烈地感受到,创造性思维的来源之一是好奇心和想象力
3.一、短期功利主义;二、长期功利主义;三、内在价值的非功利主义。
4.懂得让用户获得最佳体验的人,是先满足自己,再满足别人,特点就是勤于懒惰。
5.技术革命不要去看小头,自我实现,教育,医疗最大
6.历史不会重复,但会押韵
7.在人工智能的时代,定义问题的能力,大于提问问题的能力,大于解决问题的能力
8.不要以为自己只能做小事,这是一个做大事的时代,想的大一点,未来你一定会感谢自己今天想的够大
9.有多少智能就有多少人工
10.未来手机端AI需求会很大,app的护城河很受影响,苹果芯片算力强,长期看好,国内面壁智能主要做端侧的,也比较看好
11.产品的宣传很重要,但大多数并不是实事求是,好一点的会带点装饰,不好的就会夸大,毕竟演讲者并不是真正的研发技术人员,所以要谨慎看待。
12.注重行动,就不会被困住
13.从不同的视角重新看待你的问题,想想看,一年后这个问题会怎么样
14.斯坦福大学《设计人生》(Designing Your Life)课程中著名的5种设计心态。它们分别是:
-保持好奇(Be Curious):像设计师一样对万物充满好奇,这会帮你发现更多可能性。
-不断尝试(Try Stuff):行动重于空想,通过原型测试来验证想法,而不是纸上谈兵。
-重新定义问题(Reframe Problems):换一个角度看困境,找到真正值得解决的核心问题。
-专注过程(Know It's a Process):设计人生是一场探险,享受迭代的过程,而不执着于一次性的“终极答案”。
-深度合作(Radical Collaboration):不要独自硬扛,主动寻求他人和团队的力量。
15.持续学习真的实现了的话,诺贝尔奖就是AI奖励人类的棒棒糖
16.关注源杰科技(西安),关键产品是制造光模块所需的CW激光器芯片
17.写博客的意义(防止遗忘;属于自己的财富,谁也抢不走;招聘降低沟通成本)
-对抗“认知熵增”【自我迭代】:防止遗忘的同时,写下来的过程,本质上是在给大脑做“无损压缩”和“结构化重建”。这是费曼学习法的最高级实践——写作是最高效的思考。
-写作和投资,是“穿越周期”的非线性资产【资产积累】:思想是唯一不会被物理定律锁死的资产。
-AI时代大量记录自己【存在意义】:基于肉体、情感和有限生命体验的文字,是AI永远无法替代的“涌现”。在这个时代坚持写作,保留“人”的不可替代性。
18.设计你的人生这本书说,获取好工作的最好方式是和业内人士交谈采访,而不是去应聘,这样也可以获得实际的工作情况。
19.AI时代,信任和品牌,才是比钻石还要珍贵的东西。
20.人脑认知层面的带宽只有大约 每秒 10 - 50 比特(bits/s),珍惜你的注意力!
21.具身智能的数据源:仿真(英伟达),视频(特斯拉)和采集(帕西尼)
22.判断一个具身智能公司有没有前景
-【数据】没有渲染的视频,数据从哪里来
-【模型】有没有自己端到端的大模型
-【机器实体】有没有自己的本体:公司是否拥有一个统一的神经网络模型,能够直接将原始的感官输入(如摄像头图像、麦克风声音)转化为机器人的底层动作指令(如电机扭矩、关节角度)。真正的护城河在于模型架构的创新(如引入触觉、力觉的多模态融合),以及能否在自家本体上高效部署。
23.CV领域的深度估计:给定一张或多张2D平面图像,预测场景中每个像素点到相机的实际物理距离(即“深度值”),并输出一张“深度图”(Depth Map)。
24.看了那么多优秀人物。觉得他们是人类之光,我是人类之屑
25.老是在晚上思绪很活跃,有很多想法是为什么
26.sam是判别式模型(分类),与回归的区别
如果是连续的量(长度、重量、价格)→ 回归
如果是离散的类(有没有病、是男是女、像素是不是猫)→ 分类
如果是全新的造物(写诗、画图、创作音乐)→ 生成
27.训练自己和珍惜自己的注意力
28.Qwen3.8 27B比deepseekV4pro性能都好,还是多模态,牛逼了!
29.别着急做,先思考和调研实现方式
30.这世间存在太多需要时间去体悟的智慧。自己悟明白再执行,那会蹉跎多少岁月。
31.学习社交礼仪
32.以自亏免除盈满之害
33.事由及为,罚为上决
34.ai已经改变了我们的生活方式,之前有问题就去问百度,现在直接问豆包和其他模型,而且知识相对可靠。
35.建立投资数据中心
36.自己的优点
-本科时候焊过电路板,有一定的动手能力,都没白学[捂脸]
-还有一个优势就是有阅读英文文献,可复现效果的能力,当时用的都是知网云翻译,现在都有ai了,方便多了
37.梁文峰提出的AGI路线:模型-COT-Agent-持续学习-奇点-具身智能
38.3D和世界模型对提升模型智能没有太大关系
39.战略是定海神针,但是战略定力不是所有企业能做到的
40.一旦成功傲慢就来敲门
41.还有对机器人行业有热情的一部分原因可能就是想它把泛化性做到极致,以后买个机器人,它直接帮你做好饭、洗碗、叠衣服、整理房间、洗衣服、拖地、扫地,而家人之间就不需要为这些琐碎的家庭事务而吵架。感觉是一个很美好的一个那个什么,当然在工业上有很大的进步,但是对个人来说最感兴趣的还是他把这些家务活给我干掉,我就,这就是我的愿景。
42.感觉有 AI 真好啊,当时在 Linux 上装一个 Python 的一个环境被折腾的,当时被折腾的都心理极端了,然后硬要下决心,费了一个礼拜才把那个最终给搞定,但是也很有成就感。而现在去装个环境,只要在 Codex 里面说一下, AI 就帮你装好了,不知道是好是坏。但是对人类来说确实轻松了很多。
43.在具身智能实现缩放定律,但是动作频率就限定了不能像语言模型那么大,怎么解决?
不是把百亿参数模型压到每秒运行 50 次,而是让百亿参数模型(VLM)低频思考,让小模型(动作专家)中频生成动作,让控制器高频执行和修正。
44.在跟随飞飞老师做博士后期间,我们合作构建过一项benchmark,并向公众调查他们希望机器人替自己做什么。在我们收集的一千多项任务中,有三分之一与清洁有关。人们不喜欢这些脏活累活,而这些正是我们希望用机器人解决的场景。
45.VLA其实就是VLM+动作专家模块
46.仿真需要捕捉问题的本质结构,并在数字环境中支持不同形式的随机化。
47.仿真显然在机器人学习中发挥着重要作用。
48.豆包日常生活,deepseek名词解释,GPT办公代码
49.同舍生皆被绮绣,戴朱缨宝饰之帽,腰白玉之环,左佩刀,右备容臭,烨然若神人;余则缊袍敝衣处其间,略无慕艳意,以中有足乐者,不知口体之奉不若人也。盖余之勤且艰若此。-摘自《送东阳马生序》。加上最近看心流这本书,内心的充实欢喜是最重要的,就像李小龙说的,be water my friend。不必羡慕旁人烨然若神人的光鲜,若心中自有乐处,外物的高下便不再扰心。Be water,向内寻找心流,而非向外追逐比较。
50.过去房地产的核心值钱逻辑就是学区房和教育资源。但是现在 AI 时代,其实单个 AI 平均能力已经比那个最金牌的教师还要优秀了。所以会带来房产模式的结构坍塌。
51.读书的思考,第一个是从《人类简史》看出来,这个视角看人类就感觉很宏大,人跟其他物种的区别就是会讲故事。然后再就是《认知红利》中说的,人最关键的财富是注意力,而不是时间。第三个就是《设计你的人生》中说的。你有一个测试,就你不干现在的工作,你第二个想干的工作是什么?如果不考虑钱跟外界的看法,你第三个想干的工作是什么?
52.有时候会疑惑我爸妈为什么没有吃到他们那个时代的红利?媒体宣传让人感觉就是他们那个是捡钱的年代。然后我们这个时代,可能我们的下一代也会想我们为什么没有吃上 AI 的红利。所以感觉自己想在这个时代红利中赚点钱,但是不知道自己能做什么,有时候就比较焦躁和迷茫。还是学习提升自己的思维认知吧。
53.历程
2020-2023 【深度学习-CV领域】:应用在信号处理上
2023-2026 【机器学习+深度学习-NLP/CV领域】:工业应用实现、图像处理
54.做一个知识解读Agent,给你生成结构图和排版好的内容,解答知识点
55.AI真正缩短的,其实是一个普通人面对陌生领域时,那段不知道下一步该干什么的路。
56.“等待”可以并行,“思考”必须串行。
57.三份工作:当前AI方向、卖车销售和创建胖东来这样的公司实验
哲学思考
“注意力决定入口,行动决定路径,等待决定节奏。”
——当 Codex、Docker 与 vLLM 把工具接入日常,VLA、世界模型和机器人把问题推向现实,SMEM、Softmax 与 Tensor Core 又把抽象能力落回芯片上的一次次搬运,学习很容易变成不断添加名词的冲动;而博客、读书笔记和知识图谱做的,是把碎片送进注意力的过滤器,再用行动把它们连成可走的路径。等待表面上像停顿,本质上是在给并行的信息留出沉淀与验证的空间;真正改变的不是一天学了多少概念,而是哪些问题被留下、哪些尝试被推进、哪些答案值得暂缓下结论。长期学习的边界,不取决于信息流有多快,而取决于你能否持续做出筛选、行动与校准。
结尾语:如果本文对您有帮助,请点赞鼓励一下,这对我真的很重要。您的每一次鼓励,都是我继续创作的动力,谢谢啦!下次见。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐
所有评论(0)