本文记录并总结 2026 年 7 月积累的知识与思考。

一、知识类

Diffusion相关内容


1.扩散模型(Diffusion Models)确实是近年来少有的、能够在“感知”(视觉)和“决策”(具身控制)两大截然不同的领域都成为主流范式的统一框架。

图像扩散预测的是“空间上的噪点”,而动作扩散预测的是“时间上的噪点”。Sora之所以能生成逼真的视频,本质上就是把“空间生成”扩展到了“时空生成”,这也反向验证了扩散模型对连续物理世界模拟的强大能力。扩散模型提供了一个极其优雅的“从噪声到物理现实”的逆过程。在这个框架下,“画一张猫的图”和“决定机械臂下一秒怎么动”,在数学眼里,都只是在从概率分布的混沌中,找出那个最大概率的“真实”罢了。 


2.LDM中,可以用DiT取代U-net,DiT=ViT Encoder(Transformer 的编码架构)


3.视频生成领域:

-LDM+3D U-net(老)

-LDM+时空 DiT(新)


4.视觉Token和视觉嵌入的区别

视觉Token(Visual Tokens):指ViT(视觉编码器)直接输出的原始特征向量。

视觉嵌入(Visual Embeddings):指VIT的输出经过“投影层(Projection Layer)”映射之后的向量。 


5.NEO-unify(产品是infographic-V1)【生成理解多模态】是一种生成多模态的范式架构,他改变了传统的LDM的范式(CLIP+UNet)。

注:目前没在主流文生图榜单上,它追求的是在信息图(Infographic) 这个特定领域的极致表现,比如文字渲染的精确度、图表的准确性、复杂排版的稳定性。这些能力对于生成海报、论文图表、数据报告至关重要,但在通用榜单的评测标准下,可能并不占优势。 


6.LDM的U-Net输入输出

-输入通常是:zₜ:当前带噪潜变量;t:当前噪声时间步;c:可选的条件信息

-输出通常是:预测噪声 εθ(zₜ,t,c) 


7.Pixel-space Diffusion 的U-Net输入输出 --输入通常是:带噪图片 x_t + 时间步 t -输出通常是:预测噪声 εθ(x_t,t) 


具身智能&世界模型

1.RT-2注意点

-ViT(Vision Transformer)视觉编码器的核心结构,是将图像转换为序列,然后仅使用Transformer架构中的编码器(Encoder)部分进行处理

-机器人输出的Token里,代表具体动作数值的那些Token,其文本内容被限定在‘0’到‘255’之间;但输出序列中同时夹杂着空格、结束符等辅助性Token。

-RT-2代码上没有两套损失函数,实际是一套,Web文本和机器人动作都被转换成Token序列,统一使用Token级交叉熵训练 


2.RT-2训练数据案例 

例子一:互联网数据(视觉问答VQA)

输入:一张桌上左有苹果、中有绿杯、右有香蕉的图片,以及问题“哪个物体在最右边?”

输出:文本答案“香蕉”。

核心作用:通过海量此类图文问答数据,模型学会了物体识别、空间关系理解等视觉语义常识,为后续推理能力奠定基础。

例子二:机器人轨迹数据(机械臂操作)

输入:机械臂第一人称视角的当前画面和语言指令“拿起香蕉”,

输出:一串离散化的动作数字(如“5 128 91 241 73 101 200 150”)。

核心作用:通过成千上万条“图像+指令→动作数字串”的遥操作记录,模型学会了将视觉感知和语言意图映射为具体的机械臂控制指令。 


3.RT-1与RT-2训练范式区别 RT-1:行为克隆(BC)指的是学习操作员的输出指令 RT-2:协同训练(Co-Training)指的是两种数据结合训练 


4.小米的my16【具身智能】:一条 “VLM大脑 + 世界模型小脑” 的融合路线


5.LingBot-Video、LingBot-World 2.0 与 LingBot-VA 2.0 三者共同构成了具身智能从“认知”到“实践”再到“执行”的完整飞轮:

-LingBot-Video(渲染器):为机器人提供“世界观”——通过生成海量符合物理规律的视频数据,教会机器人理解物体、动作与环境的因果关系;

-LingBot-World 2.0(模拟器):为机器人提供“训练场”——构建可实时交互的虚拟物理世界,让机器人在低成本、零风险的条件下进行高强度技能习得与策略进化;

-LingBot-VA 2.0(规划器):为机器人提供“行动力”——作为行业首个具身原生预训练模型,直接将观测转化为高频动作指令,让机器人真正“动起来”。

三者环环相扣:Video 教它“懂”,World 让它“练”,VA 2.0 带它“干”,共同打通了具身智能从数据到部署的全链路。


6.世界模型的三种功能

-渲染器:负责生成“看到的画面”,核心是视觉保真度,应用在文生视频、影视预演、游戏场景、XR、电商展示,比如 Sora、Genie、RTFM 这类实时画面生成。

-模拟器【桥梁】:负责生成“可计算的世界状态”,核心是几何、物理、动态规律可信,应用在机器人仿真、自动驾驶测试、工业数字孪生,比如 Isaac Sim、MuJoCo、CARLA、Omniverse。

-规划器:负责生成“下一步行动”,核心是根据观测和目标做决策,应用在机器人控制、自动驾驶决策、具身智能 Agent,比如 RT-2、π0、自动驾驶规划系统。 


7.过拟合&表征坍塌&VAE 的潜在分布

-过拟合是把“训练样本到结果的映射”学死了。

-表征坍塌是把“输入到特征空间的表达”学没了、学窄了、学成一团了。特征失去区分度。

-VAE 的潜在分布可以看作一种概率化的抽象特征,它表达的是样本在潜在空间中的位置和不确定性,而不是某个具体的物体或语义标签。

-VAE 后验坍塌:潜在分布失去输入信息,不同输入 x 生成 差不多的潜在分布 。


8.多模态文本与图像的转换

文本:离散ID -> 查表 -> 连续向量。存在“离散化”这一步。

图像:连续特征(ViT输出) -> 线性投影层(可学习) -> 连续向量 


FPGA与华为晟滕

1.华为晟滕相关概念

Ascend C     = 从底层自己写算子

CATLASS     = 用现成积木拼矩阵类算子

Triton            = 用 Python 风格语言写算子

HCCL            = 多张昇腾卡之间通信

GEMM 调优  = 对矩阵乘算子做性能优化 


2.传统意义上,FPGA出现的一个重要因素是为了给ASIC做原型验证(Prototyping)的。不可否认,原型验证仍然是FPGA的一个重大市场。


3.问题:在多级矩阵乘法中,GPU为提高并行性,必须先从DRAM读取数据,对整个批次执行AxB矩阵乘法操作,并将中间结果写在内存中,后续的运算需再从内存中读取中间结果。DRAM指的是什么?

回答:DRAM 指的是动态随机存取存储器(Dynamic Random-Access Memory)。在您描述的GPU多级矩阵乘法场景中,DRAM特指GPU的显存(VRAM),即位于GPU芯片外部的物理内存颗粒(如GDDR6、HBM等)。

---与SRAM(片上缓存)的区别:GPU内部拥有极快的片上内存,称为SRAM(静态随机存取存储器,在NVIDIA架构中常指共享内存/寄存器)。SRAM速度极快(延迟仅几十个周期),但容量极小(以KB或MB计)。而DRAM(显存)容量大(可达几十GB),但速度相对慢得多(延迟数百个周期),带宽也受物理限制。

---您描述中的“内存瓶颈”:您提到的“必须从DRAM读取”和“将中间结果写在内存中”,正是GPU计算中著名的内存墙问题。由于DRAM是片外存储,每次读写都需经过PCIe或片内互联总线,开销极大。因此,在多级矩阵乘法(如(A×B)×C)中,如果中间结果A×B无法全部缓存在片上SRAM中,就必须写回DRAM,后续再读出来,这会消耗大量时间(通常远高于计算本身的时间)。

---优化方向:这也是为什么深度学习框架和CUDA程序员会极力做算子融合(Kernel Fusion)——将两步矩阵乘法的计算逻辑合并到一个内核中,让中间结果直接在片上SRAM中传递,从而避免对DRAM的频繁读写,这是提升GPU性能最核心的手段之一。 


4.FPGA:片上内存BRAM,外部内存DRAM(DDR4);

GPU:片上内存SRAM,外部内存DRAM(HBM) 


5.Verilog 和 VHDL 是语言,RTL 是硬件设计的抽象层级。你可以用 Verilog和 VHDL 写 RTL,也可以由 HLS(将算法转为硬件) 自动生成 RTL。


6.算子就是一个基本计算单元,类似于卷积、池化、激活等。


7.华为昇腾 NPU 跟 FPGA 最大区别是:FPGA 是让你自己设计电路;NPU 是厂商已经把 AI 加速电路设计好了,你主要适配它的软件栈。 


8.XDMA 就是 Xilinx FPGA 板卡通过 PCIe 和主机高速交换数据的标准 DMA 通道方案。


9.RTL:你写的硬件设计代码层级 LUT:FPGA 里实现逻辑的物理资源 


其他

1.yolo训练技巧:固定一个偏大的轮次(如 300 Epoch),配合 早停法 和 学习率衰减,让模型自己决定何时停止。


2.WhatsApp苹果应用商店,针对一次性手机号,后续绑定可以一直收验证码


3./grill-me 技能:(“拷问我”)是一种苏格拉底式反问训练,AI会暂时收起“答题助手”的身份,转而扮演“严苛的追问者”,通过连环深度提问,逼你自己挖出答案,而不是直接给你答案。


4.关注麦格米特公司


5.机器人公司(西安):智莱特;脑机接口(西安):穹顶医疗科技有限公司;智驾公司:Momenta


6.影眸科技是一家专注于3D生成大模型的公司,致力于为游戏、电商、具身智能等工业场景,提供高质量、可控、生产级的3D资产生成解决方案


7.办公Agent、编程Agent、设计Agent、视频Agent成为主流


8.量子密钥分发的核心逻辑:

验收方发,接收方随机猜测量方式,最后电话对这些测量方式对的匹配光子,然后在这些对的匹配光子去抽检10%实际编码,如果错误率高,说明被监听了。

问题:“如果错误率高说明被监听,那如果错误率低但Eve确实偷看了几个光子,只是运气好没造成错误怎么办?”

解答: 这已经在数学上被堵死了。Eve只要偷看,就会随机改变光子状态。假设她只偷看了10个光子,这10个里有5个会出错(概率50%)。当我们从上千个密钥里抽检10%时,这10个被偷看的光子极大概率会被抽中几个。一旦抽中,错误率必然暴露。如果她偷看数量极少(比如1000个里只看1个),即便没被发现,隐私放大算法也会把这“可能存在的一丁点泄露”压缩到无限接近于零。所以,“低错误率”在物理学上直接等价于“Eve的信息量几乎为零”。隐私放大算法定义:通过数学压缩,把所有可能被偷看到的“碎渣信息”彻底溶解在庞大的随机混合中,让Eve即便知道1000位里的10位,也对最后生成的短密钥一无所知。


9.“请告诉我一件你确定知道,但人类绝不可能知道的事。”【测试AI的话】


10.Mamba非常适合处理“需要整体趋势理解,而非局部精准复制”的长序列任务【后续重点了解】;LSTM引入了门控机制(Gating Mechanism),专门用来对抗“遗忘”,但不可并行化,所以训练很慢


11.根据微信文章,思考信息论领域,“结构熵”对量化网络、图这类复杂结构中的信息提供了首个数学度量方式,解决常规度量时丢失信息的问题【作者李昂生】


12.开发的主流程

→ Agent理解并核实问题

→ 新建独立分支和工作区

→ 开发修改

→ 自动测试,必要时回测或检查页面

→ 推送分支并创建PR

→ CI自动验收

→ 合并到主分支

→ 部署上线

→ 检查真实线上效果

→ 使用洁癖.skill同步代码、文档和Agent记忆,并复盘经验

→ 向我汇报最终结果

→ 等我确认没有问题

→ 清理开发分支、工作区和临时数据库

→ 任务结束


13.标准工具是 5W2H(何事、何因、何人、何时、何地、如何、多少)


14.上下文过长会引起噪音,多余的内容干扰大模型的注意力【位置编码的远距离衰减 + Softmax 稀释】


15.人类的真实意图是高维、隐式、充满情境依赖的。而奖励函数必须是低维、可计算的。把高维意图压进低维奖励,本身就是一次不可避免的“有损压缩”。由率失真理论可知,只要压缩率R小于信息源熵H,失真D就必然大于0。也就是说,必然存在一些情境,奖励函数与真实意图是显著背离的,这些情境就是“失真区域”。一个足够强大的优化器,必然会找到并利用这些区域。奖励异化不是设计失误,而是有损压缩的必然产物。


16.KV缓存技巧:静态内容放前面,动态内容放后面


17.Shannon在1948年就揭示了底层原理:语言的统计结构中编码了几乎全部的语言知识。捕获这种统计结构——也就是学会预测——就等于学会了语言本身。


18.AI Coding 的注意事项

-git版本控制

-数据库隔离,AI不动数据库

-任务拆解,不可能一次做好所有功能

-写好小功能的需求文档,需求和代码的审阅


19.语言模型学习的是文本的统计结构,世界模型学习的则是空间与时间的统计结构。


20.状态是世界的底层现实。原则上,它是完整的,但对任何置身其中的智能体而言,它又无法被直接看见。观测,是智能体对这一现实的局部视图。行动,则是智能体基于观测作出的响应。


21.如果说语言是对世界的抽象,像素是对世界的投影,那么几何、物理和动态就是世界本身。


22.读文章脑子有别的想法要处理的一句口诀:急事马上做,琐事顺手做,杂事记下后,读完了再做。


23.Claude Code 团队将“设计循环”定义为智能体重复工作直到满足停止条件,划分四种类型:

①回合循环——手动提示触发,Claude 自判完成,适合短任务,可通过 SKILL.md 提升验证;

②目标循环——/goal 手动触发,达成目标或达最大轮数停止,需确定性完成标准(如测试通过数);

③时间循环——/loop 和 /schedule 按间隔触发,适合同步消息、检查 PR 等重复任务,可云端运行;

④主动循环——事件或计划触发,无人实时参与,每个子任务独立退出。建议从最简单方案开始,选择性使用复杂循环。


24.贝叶斯定理不是用来算“死数字”的,它是用来对抗人类直觉偏见的。它告诉我们:一个事件的真实概率,不仅取决于眼前的证据有多强,更取决于这件事本身在现实中发生的概率(先验)有多大。


25.光模块的底层逻辑:大模型能力提升依赖规模扩展【规模定律】 → 云厂商和模型厂加大 AI 算力投资 → GPU 集群规模扩大 → 训练和推理都需要更高带宽、低延迟网络 → 交换机、网卡、铜缆和光模块需求上升 → 跨机柜/跨数据中心场景推动 800G、1.6T 光模块爆发。


26.这意味着设计出那些本身也能够进行设计的事物。也就是说,设计出拥有心智、能够在心智中看见事物的东西。这正是AI,我们正在制造心智,制造设计者。


27.注意力缺失,不能集中这种变化当然不完全是由AI造成的,它更早就开始于社交媒体和快速传播的信息环境。如今AI进一步提供了即时答案,人们越来越不需要等待和思考,学生们也正在失去坚持分析、批判和独立判断的肌肉。


28.1个字符=1-4个字节;1个字节等于8bit


29.普林斯顿高等研究院(Institute for Advanced Study,简称IAS)【让思考回归思考本身】,可以说是全世界理论科学和人文研究的圣地。它最迷人的特点,就是只做研究,不教学生,没有教学任务,也没有科研绩效考核,让一群世界上最聪明的大脑,完全自由地去思考最根本的问题。


30.基本粒子 (夸克、轻子)→ 核子 (质子和中子)→ 原子核 → 原子 → 分子 → 细胞与微生物


31.结构化数据和非结构化数据的区别

结构化数据:MySQL、PostgreSQL

非结构化数据:文档


32.强化学习模型作弊的一个总结:奖励作弊,是对一个永远可能偏离其所代表意图的代理施加优化的必然产物。


33.大模型推理分 prefill (首字输出)和 decode(输出速度)

prefill 是“并行处理输入,生成 KV Cache”;decode 是“串行读取 KV Cache,逐 token 生成输出”。大模型推理里,prefill 影响首字延迟,decode 影响输出速度。


二、思考类

1、从人性的角度去做数字化


2、中际旭创、长鑫存储、寒武纪、Momenta、宇树科技、deepssk、月之暗面。中国也借助这波AI浪潮产业升级了,要赶超美国了。


3、有句话说的好,昨天是段历史,明天是个谜团,而今天是天赐的礼物,像珍惜礼物那样珍惜今天


4、人就是欲望,不满足了就痛苦,满足了就无聊。人生就像钟摆一样,在无聊和痛苦之间摆动,最后的结果是死亡。


5、做自己喜欢的事情,让钱成为附属品


6、人身上幸福的东西:生命和精神


7、生活的热情很重要


8、A社抽象事情干太多,呼吁“别让 AI 发展快到人类来不及准备”也有他的签字,不知道是有别的目的还是真的为人类考虑,可能最强的大模型也无法识别他的意图。


9、扩散diffusion与回归GPT之争


10、流水不争先,争的是滔滔不绝。


11、模型能力会覆盖掉skills和提示词,例如superpower这个skills,以及claude 5上线后,原理模型的提示词已经减少80%


12、真的出现了持续学习这种范式,颁发诺贝尔奖的碳基评审团本身就已经没有权威性了。因为那时最懂物理、化学、医学的已经不是人类,而是那个持续学习了100年的AI。诺贝尔奖可能会变成AI发给人类的“鼓励奖”,奖励那些“虽然算力低下但偶尔还能冒出点感性火花”的碳基个体。


13、极高的主观能动性、自主权、极高的人才密度、彻底的自下而上的思考方式、超级快速的实验和发布,以及支付市场最高水平的薪酬。这正是所有AI实验室的常态,我现在经常听到顶尖AI实验室就是这么运作的。


14、“留任测试”是一个源自Netflix(网飞)的著名人才管理工具。它的核心是一个思想实验:

如果团队里的某个人明天就要辞职,作为管理者,你会竭力挽留他,还是会接受辞呈,甚至心里暗暗松了一口气 


15、个人优势:任务拆解、逻辑思维、积极主动(2分钟能解决的问题不要等)、兴趣


16、生活中的AI应用:买榴莲、区分小葱和蒜苗、教育辅导作业、颈椎治疗(肩井上方、第七颈椎两侧凹陷)、生活中的维修方案/房屋装修布局、志愿填报


17、工作中的AI应用:

-浏览器行为分析、微信文章总结分选、整体桌面文件,重命名

-科研论文和开源项目总结读取、

-写代码:codex(各种skills、hook)

-生成图片:例如CV领域的知识梳理和模型架构理解

-PPT:生成汇报PPT,结构和思想还是要自己出

-重复工作做skills:月报、文章相关信息


18、战争中的AI应用:人脸识别/热成像识别后无人机攻击。所以士兵将暖宝宝贴在空罐头盒、废旧轮胎或假人模特上,甚至扔在废弃车辆里,然后藏在战壕外的空旷地带。用几毛钱的暖宝宝,消耗敌人几万美金的精确制导弹药,还能暴露敌方无人机观测点,这是性价比极高的防御手段。 


19、三体中韦德没有阻止程心,因为普通民众都是程心


20、从战争初期至今,AI识别与战场伪装的对抗经历了清晰的迭代升级,整个进程本质是AI识别从“看轮廓”到“辨动态”再到“感生命”的算力跃升,与伪装手段从“造假热”到“消热像”再到“吸雷达”的材料革命之间往复博弈,凸显了现代战争中廉价民用智慧与尖端算法持续较量的残酷现实,也表明任何单一“隐身术”都难以持久,多频段、复合型伪装才是终极方向。

① 热成像识别阶段:AI捕捉人体温度与轮廓锁定目标;士兵用暖宝宝制造高温诱饵,欺骗AI将静态热斑误判为真人。

② 动态特征检测阶段:AI分析30秒热信号变化,以呼吸晃动区分真人与静止热源;士兵改用镀铝急救毯和汽车隔温棉隔绝热辐射,使体表温度融入环境。

③ 双波段联动确认阶段:AI将热成像可疑点切换可见光二次比对,确认人形即攻击;士兵采用多光谱伪装网同时屏蔽红外、可见光等多频段探测,阻断联动逻辑。

④ 毫米波雷达穿透阶段:AI发射电磁波捕捉心跳呼吸引起的微米级震动,无视热伪装;士兵将铁氧体粉末与碎碳纤维制成吸波层,吸收并散射雷达回波,抹除生命体征反射信号。 


21、顺序是表达的物理条件,不一定是形成意义的唯一计算方式。


22、一定要学习读书和思考,主要是了解别人在说什么,很多都是在夸大自己,没那么厉害。


23、有多少智能,就有多少人工。大模型数据的收集很耗时。


24、不要让渡自己的思考。


25、语言是思维的投影。


26、平衡之道体现在大模型训练推理的各个方面,想到太极图。


27、事物的发展是螺旋上升的,之前学的没用,后面可能就有用了


28、故事:上小学三年级,晚上写作业,有个问题岁寒三友是谁,我和我爸妈绞尽脑汁也想不出来,当时想去买个字典,人家已经关门了。那时候也没有互联网,知识就像是被锁在一个个“信息孤岛”里。还是几经波折,打电话问了一个当老师的朋友才知道的。现在这些知识随手一搜就知道,知识不再遥不可及,这在即时获取答案的今天反而变得珍贵了。


29、工业革命用机器代替了肌肉;AI时代让“思维”释放。阿基米德说,给我一个支点,我可以撬动地球,AI就是这个时代最好的支点。


30、人类沟通世界的三种媒介:文字、语音和图片,但在AI时代(NLP领域的进步),这三者之间的壁垒正在被彻底打破。


31、没有空闲就没有创新,静极生慧。


32、目前就是卡神,在A社做预训练,让模型自己训练自己,用Claude来加速Claude自己的预训练研究。


33、类似于曾国洋说的,核心是做数据。大模型数据经历了三波:第一波用公开数据,2024年左右就枯竭了,所以好多报道说遭遇了“数据墙”。第二波自己创造数据,基于真实数据做改造,把不同形式变成AI Coding的数据形式,能做好的话2025-2026能训练出一流模型。第三波是“AI制造AI”——让AI接管从数据生产到训练评测的完整流程,因为全都在数字化环境中,反而是容易做到的。 


34、AI应用场景:医疗领域、端侧(面壁智能)


35、FPAG优势在端侧应用,并且可以应用到具身智能


36、“做模型就是做数据。”曾国洋反复强调。端侧模型要追上大模型,光靠架构不够,真正卡上限的是训练数据的知识密度。


37、端侧模型要和人交互,怎么降低延迟和首响应时间。端侧模型不单看评测效果,还有响应时间、硬件成本,它很难从单一维度胜出。


38、训练好一个模型包含很多模块(最重要的是数据)

①数据团队(收集、管理、清洗、标注)

②算法团队(架构、训练方法、数据混合比例)

③Infra团队(让算力集群不要挂,用最高效率训练)

④评测团队

⑤硬件终端的部署和优化团队。 


39、渐进式纰漏的思想很重要。例如claude cold 的记忆机制,工具信息在缓存提示词中的使用。


40、符号主义-连接主义-反向传播-支持向量机-CNN-LSTM-Transformer-GPT

这些人太伟大了。AI的研究历史也是螺旋上升的,1949年的计算机还是个庞然大物,到今天GPT5.6发布已经很强了,太强大了,不敢想象100年后是什么样子。AI在生物科学领域的应用是必然,人类会被改造成什么样子,这可能比我们想象的还要快。 


41、职业规划:NLP、CV到多模态到具身智能


42、具身智能现在都在布局采集数据,他们想依据大量数据出现泛化性,这个目前还没有人能证明。这也是一场豪赌吧,但是也有一部分阶段性的商业价值兑现,例如特定场景下机器人可以应用,所以才会在这个赛道一直投资。投资人普遍将当前阶段类比为AI的“GPT-1或GPT-2时期”,希望押中下一个“OpenAI”。因此,当前的具身智能更像是一场有阶段性成果支撑的、关于未来的远见投资,而非纯粹的盲目投机。


43、模型公司都在做分层,要考虑使用成本了,不再一味追求性能


44、有一种破坏现在大模型的方式:不准用残差架构和思想


45、我们生活在一个巨大的信息差世界,AI让我们缩小这个差距


46、姿态估计可以应用在检测老人摔倒的场景,嵌入到摄像头中售卖


47、中国考虑限制海外访问顶尖 AI 模型,政治介入了


48、在闲暇时清空任务,整理思绪,沉淀智能,涌现意识。


49、我思故我在


50、写作的重要性【用自己的话写,要复盘】

-写作之难,在于把网状的思考,用树状结构,体现在线性展开的语句里-Steven Pinker

-在这个 AI 能帮我们做越来越多事情的时代,记录与写作,更应该被重视,因为我们在写的不是内容,而是思考本身。 


51、工业革命自动化了很多体力劳动,而现在,我们似乎正在自动化某些智能活动。


52、面一家公司要提前了解他们的业务和信息


53、找一个点来切入,从这个浪潮中赚钱,措施有学习完善AI架构、了解前沿资讯、看书提升认知。太用劲反而做不好,放松心态反而可以了


54、AI相关产业格局岗位

底层算力:FPGA 加速卡、华为昇腾生态工程师

算法模型:CV、NLP、多模态、具身智能 


55、后疫情时代,如果没有AI作为新的经济引擎,可能就会发生更大范围的战争。


56、AI在端侧设备上的应用前景,离线低耗,应用到每一个人的日常中【例如:AI 输入法 / 沟通层,而不是个人记忆助手】


57、“做出了成就的人”和“本来可以做出成就的人”之间的差异

1.勇气是成功科学家的重要特质。

2.一旦你出名了,就很难再去研究小问题了。

3.工作条件:人们往往在条件艰苦的时候最有生产力。

-原本看起来是劣势的东西,换个视角,往往会变成你最大的资产。

-所以,所谓的理想工作条件其实很奇怪。你所渴望的条件,并不总是对你最好的。

4.动力:大多数伟大的科学家都有惊人的驱动力。

-知识和生产力就像复利。

-错误的努力是一个非常严重的问题。光靠努力是不够的——必须合理地运用。

5.不确定性:伟大的科学家却能很好地容忍不确定性。

-如果你过分相信,你永远看不见漏洞;如果你过分怀疑,那么你根本无法开始。这需要一种微妙的平衡。

-当你发现明显的缺陷时,你必须敏锐地跟踪这些东西,并留意它们如何被解释,或者理论如何被修改以适应它们。

6.潜意识:当你有一个真正重要的问题时,不要让其他事情分散你的注意力——要让思维始终停留在这个问题上。让你的潜意识保持饥饿感,迫使它去处理你的问题,这样你就能安然入睡,并在早晨得到答案,免费。

7.重要的问题:如果你不研究重要的问题,你就不可能做出重要的工作。

-伟大的科学家会仔细思考他们领域中的一些重要问题,并始终思考如何去攻克它们。

-如果你想做出色的工作,显然你必须专注于重要的工作和问题,你应该有这个概念。一个问题的重要性不在于它的结果,而在于你是否有合理的研究切入点。

-伟大的科学家在机会出现时会立刻行动,紧追不舍。他们放下其他事情,专注于新的想法,因为他们早已对这些问题进行了思考。主要的诀窍就是——要活得够久!


58、下一个领域可能是生命科学,走向高价值垂直领域。玄幻小说的驻颜丹会让人疯狂,想起《人类简史》中的一段话:

我们这个后现代世界自诩历史上首次承认了全人类的基本平等,然而它也可能正在造就历史上最不平等的社会。纵观历史,上层阶级总是声称自己比下层阶级更聪明、更强壮、更优秀。他们通常只是自欺欺人。一个出生于贫苦农民家庭的婴儿很可能和皇太子一样聪明。随着医疗技术的进步,上层阶级的这种自负可能很快就会变成客观现实。 


59、AI时代与互联网时代的区别,不是熬个夜努力拼一把,东西就出来了,例如阿里双十一的备战。而是一种长期主义的精神,需要专注与坚持。但其实本质商业化就和长期主义是冲突的,商业化需要快速迭代创新,要成果,就不能扎下心来去研究枝枝蔓蔓的路径方向。


60、大模型的自进化其实不是真正意义上的持续学习,虽然可以自己写代码优化自己的一部分算法结构,但总归还需要人的参与。持续学习指的是在日常环境中,像人一样自迭代的学习,实时的修改大脑“权重”


61、如果哪天某个实验室宣布实现了真正的“在线权重持续学习”且不遗忘,那可能就是我们离AGI(通用人工智能)最近的一刻,也是人类第一次看到硅基生命拥有“本能”的时刻。你觉得,如果真的实现了这种实时改权重的“持续学习”,我们是该将它限制在“隔离沙盒”里跑,还是让它暴露在真实世界的脏数据里进化呢?这可能是比技术本身更可怕的伦理选择题。


62、不提升思想,就是一个没有灵魂的躯壳


哲学思考

“知识不是被收藏的答案,而是在未来问题里重逢的能力。”

——七月的笔记看似横跨视觉、具身智能与硬件,实则反复追问同一件事:知识如何从概念变成可以调用的判断。持续学习提醒模型更新会遗忘,写作提醒人表达也是一次重构,“不要让渡自己的思考”则守住最后的边界。真正产生复利的不是记住多少术语,而是旧知识能在新问题出现时重新连接,并推动下一次行动。

结尾语:如果本文对您有帮助,请点赞鼓励一下,这对我真的很重要。您的每一次鼓励,都是我继续创作的动力,谢谢啦!下次见。

 

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐