登录社区云,与社区用户共同成长
邀请您加入社区
人工智能#具身智能#VLA#大模型#AI。智能体入门:核心概念理解。AI智能体搭建(1)
Atlas不只是生成下一帧画面,而是试图把图像、视频、镜头和 3D 空间装进同一个模型。
很多同学最近都听过“GPT-4o当厨师”“Claude 3.5写代码帮你调试机器人”这些酷炫的新闻,这些背后的核心角色就是智能Agent和大语言模型(LLM),而LLM的基石又是Transformer架构。那到底什么是Agent?Transformer怎么就让Agent从“只会按固定指令跑的笨机器人”变成了“能自主思考、灵活决策的小助手”?Transformer在Agent的哪些环节(环境感知、记
本文介绍了Transformer架构及其在机器人领域的应用。核心内容包括:1. 自注意力机制原理与数学实现,包括QKV矩阵计算、多头注意力和位置编码;2. Transformer相比RNN/LSTM的优势,及其在视觉任务中的扩展(如ViT和BEVFormer);3. 在机器人控制中的典型应用(Decision Transformer、RT-2等);4. 面试常见问题(复杂度、与CNN对比等)。文章
今天从零复现了 Transformer 编码器,包括多头注意力、前馈网络、位置编码和残差连接等核心组件。通过动手实现,对自注意力机制有了更直观的理解。理解了自注意力的计算流程和缩放点积注意力的原理。掌握了多头注意力的拆分与拼接逻辑。能够独立实现一个可运行的 Transformer 编码器。明白了 Transformer 在 VLA 中承担跨模态融合和动作解码的关键角色。
作为AI产品经理,你是否经历过这些场景?技术团队说"模型容量不够",你却不知道这和token拆分有什么关系用户抱怨对话机器人答非所问,你只能让工程师"再优化下算法"看到Vision Transformer在CV领域大杀四方,却不敢在需求会上提图像功能这些痛点背后,都藏着一个关键技术——Transformer。它早已不是程序员的专属玩具,而是每个AI产品经理必须掌握的"第二语言"。今天,我不堆公式、
自2017年推出以来,Transformer已迅速成为在各种自然语言处理任务上实现最先进结果的主导架构。Transformers 已经被用来编写真实的新闻故事,改进谷歌搜索查询,甚至创造出讲笑话的聊天机器人。在本指南中,作者Lewis Tunstall、Leandro von Werra和Thomas Wolf(拥抱Transformers 的创始人之一)使用亲身实践的方法来教你Transform
Hugging Face 是一家总部位于纽约的聊天机器人初创服务商,专注于NLP技术,拥有大型的开源社区。尤其是在github上开源的自然语言处理,预训练模型库 Transformers,已被下载超过一百万次,github上超过24000个star。Transformers 提供了NLP领域大量state-of-art的预训练语言模型结构的模型和调用框架。自2017年推出以来,Transforme
LingBot-VLA 面对的是 VLA 落地时最现实的一组矛盾:单一本体数据容易做出局部效果,却很难覆盖不同机器人;把多本体数据直接混在一起,又会遇到相机、关节维度、动作空间和数据质量不一致的问题。作者没有引入更复杂的世界模型,而是沿着数据规模、统一动作表示、训练效率和空间表征四条线推进,最终训练出一个约 4B 参数的通用双臂 VLA。上图把这项工作的重点放在了一张图里。左侧是 9 种本体和约
人类视频数量大、场景丰富,采集成本也比机器人遥操作低得多,但人和机器人长得不一样、运动方式不一样,动作空间更不一样。过去的方法通常要做视觉域对齐、手部重定向或专门的跨本体模块。需要提前说明:论文没有给出这套人类数据处理、共训练配方和 benchmark 的官方源码。
随着加密数字货币市场的全球化与碎片化发展,不同交易所之间、不同链上协议之间的价格差异为套利者创造了持续的机会窗口。本文系统性地探讨了基于人工智能技术的加密数字货币套利策略体系,涵盖价差监控、自动交易执行、Gas费优化及闪电网络集成等核心模块。文章深入分析了CCXT、Web3.py、闪电网络等技术栈在套利机器人开发中的实际应用,并结合2025—2026年市场最新数据,评估了各类套利策略的收益表现与风
π0.5 要解决的不是让机器人在熟悉场景里把某个动作做得更漂亮,而是一个更难落地的问题:机器人换到从未见过的厨房或卧室,面对新的物体、布局和任务组合,能否只根据一句“清理厨房”完成十几分钟的连续操作。Physical Intelligence 的答案不是单纯增加目标机器人数据,而是把跨本体机器人数据、高层子任务标注、网页视觉语言数据和人类口头指导放进同一套 VLA 训练流程,再由同一个模型先用语言
Transformer 本质上是一个模型,即输入一个序列,输出也是一个序列,输出的长度由模型自己决定。Seq2seq 的典型应用场景应用场景说明语音识别将声音讯号转换为文字机器翻译将一种语言的文字转换为另一种语言语音翻译将声音讯号直接转换为指定语言的文字文本到语音合成(TTS)将文字转换为语音聊天机器人问答与对话生成句法分析将句法分析树转化为序列输出多标签分类每个对象可能同时属于多个类别,输出类别
VLA 模型 #具身智能 #人工智能进阶 #视觉语言动作模型。5.1 最小 VLA 的 PyTorch 实现(教学)5.2 使用 OpenVLA 进行真实推理(生产实践)三、为什么 VLA 对具身智能至关重要(理论)VLA:驱动具身智能迈向通用的关键引擎。二、VLA 是什么:从三模态统一说起。3.3互联网知识迁移,放大泛化能力。3.4数据飞轮:仿真与真实高效协同。3.1统一表征,打破"模块鸿沟"3
本文分析了Tesla Optimus和DeepMind RT-2两大前沿机器人技术方案。Tesla采用纯视觉BEV+Transformer架构,将自动驾驶技术迁移至人形机器人,通过多摄像头实现3D环境理解,并创新性地使用员工视频替代传统训练数据。尽管在动态交互方面取得突破(如武术对练),纯视觉方案仍面临未知物体识别等挑战。Google的RT-2模型则展现了强大的跨模态迁移能力,通过将机器人动作编码
本文复盘了一个企业内部AI助手开发中的关键教训:生产级Agent必须学会做减法。团队最初设计了一个能自动分析代码报错的飞书机器人,采用纯Agent自主决策方案,结果发现处理复杂问题时需要50-100次工具调用,耗时长达10-15分钟,完全无法满足即时通讯场景需求。核心问题在于Agent缺乏方向感,盲目搜索效率低下。解决方案改为两阶段策略:先用混合检索(BM25+向量)快速定位问题相关文档和代码区域
原始输入中的每个 token 是一个 512 维向量。XWiQXWiKXWiVXWiQXWiKXWiV不同 head 使用不同的投影矩阵,因此它们得到的 64 维表示也不同。可以将其理解为:每个头都使用一套不同的坐标系统重新描述同一个 token。词义信息;位置信息;动作信息;指代信息;实体信息;上下文信息。某个头的投影可能组合出更适合表示动作关系的特征,另一个头的投影可能形成更适合表示指代
本文是一篇AI核心术语扫盲指南(系列第一篇),旨在帮助读者掌握大语言模型(LLM)的基础概念。文章从AI技术发展脉络切入,重点解析了Transformer架构、注意力机制、Token/Embedding/Vector三大核心概念,并解释了Context Window、Prompt等关键术语。通过实际案例和对比表格,文章揭示了LLM的本质不是简单的聊天机器人,而是能够对语言本身建模的概率预测系统。掌
从“预测下一个Token”到“预测下一个物理状态”——AI的范式革命。#AI范式革命#大模型Token 预测#世界模型#具身智能。一、Token预言家的高光与局限。四、具身智能:预测即行动。五、虚实融合的AGI路径。三、从概率到因果的跃升。二、转向预测物理状态。
要让一个人工智能模型控制汽车、机械臂、人形机器人和灵巧手,需要同时解决两个相互独立的问题。第一个问题是:这属于动作接口或动作表示问题。典型方案包括:第二个问题是:这属于模型主干架构问题。典型方案包括:这两个问题是正交的:动作表示≠Transformer 架构\boxed{\text{动作表示}\neq\text{Transformer 架构}}动作表示=Transformer 架构例如:本文先
具身智能的“1万台生死线”:为什么工厂先于家庭迎来机器人。一、那道“生死线”:万台交付为何是脱虚向实的门票。#万台生死线#工厂确定性#家庭模糊性#账本对比。四、冰火两重天:工厂账本与家庭账本的残酷对比。三、家庭的模糊性:当机器人面对满地玩具和猫。五、万亿家庭的曙光:必须先跨过工厂这道坎。二、工厂的确定性:在混乱中找标准答案。
摘要 本文深入解析Transformer中的注意力机制,重点拆解了Scaled Dot-Product Attention的工作原理。注意力函数被抽象定义为将查询(query)、键值对(key-value pairs)映射为输出的过程,其中输出是值的加权和,权重由查询与键的兼容性函数计算。作者的具体实现采用点积作为兼容性函数,并引入关键的缩放因子√dk(dk是键的维度):先计算查询与所有键的点积,
先搞清楚 LLM 是什么、Token 是啥、上下文窗口为啥会爆、GPT / DeepSeek / Qwen 这些名字各代表哪一派。不用背参数表,知道「选模型就像选数据库——没有万能,只有合不合适」就行。大模型时代,程序员最忌两种极端:只刷概念不动手——背了 RAG 定义,从没自己切过文档、建过向量库。一头扎进 Transformer 数学——公式推导完,API 还没调通。Transformer 和
视觉语言模型与RGB-D感知的三条进化主线 Transformer确立范式后,视觉感知技术沿三条主线发展: 效率优化:通过窗口注意力(Swin Transformer)、CNN回潮(ConvNeXt)和工程加速(FlashAttention)降低计算复杂度,解决O(n²)瓶颈。 语义升维:视觉语言模型(VLM)如CLIP、LLaVA将封闭式分类升级为开放式理解,实现语言指令驱动的多模态感知,推动机
这两段在做一件事:先交代 Transformer 沿用了序列转导任务中久经检验的,再逐层说明它在这个骨架内部具体堆了哪些模块、怎么连接。这不是摘要,而是正文的方法描述段落,方法描述段落有自己的组织逻辑,通常是:先说"我和前人共享什么结构"(定位),再说"我在这个结构里换了什么、怎么搭"(细节)。
该项目提供的100+模板覆盖了从简单聊天机器人到多代理协作系统的完整谱系。今日新增Star数最高(+4,349),显示出开发者对开源创意工具的强烈需求,尤其是在CapCut等商业工具主导的市场中。项目反映了开发者对AI辅助编程的成熟态度——不再满足于"能跑就行",而是追求工程规范、测试驱动和代码质量。项目将多位传奇投资者的策略编码为AI代理,虽仅供教育用途,但展示了AI在量化投资领域的探索方向。以
很多人第一次听到“Agent”这个词时,最容易把它理解成“更聪明的聊天机器人”。这个理解只对了一半。Agent 确实建立在大模型之上,但它的重点不是“会说”,而是“会做”。它不是只回答你一句话,而是能围绕一个目标持续推进:拆解任务、调用工具、观察结果、修正计划、保存状态,最后把事情做完。如果把普通聊天模型比作“会表达的脑子”,那 Agent 更像“带着记忆和手脚的执行系统”。它不只回答“这是什么”
开源模型长上下文竞争白热化(1M token 成为新标配)、Agent 从概念走向落地(桌面协作平台、具身智能套件相继发布)、API 语义化加速(金融、网关等垂直领域 API 开始适配 LLM 原生调用)。开发者可重点关注 GLM-5.2 开源权重、DeepSeek-V4 论文细节及 OpenCoWork 1.0 的本地部署方案。
一阶最优性条件
本文适合有一定Python Pandas基础,但又对机器学习/数据分析感兴趣又不熟悉的朋友们。
遥感影像目标检测:从CNN(Faster-RCNN)到Transformer(DETR)
报错问题:TypeError: FormatCode() got an unexpected keyword argument ‘verify’步骤4.修改文件configs/_base_/dataset/coco_instance.py。步骤3:修改文件configs/_base_/default_runtime.py。在项目跟目录,新建目录data/coco,将下载的资源直接放到文件夹中。步骤
2.Transformer 作为一种创新的神经网络结构,深受欢迎。采用 Transformer 编码器对光伏、负荷数据特征间的复杂关系以及时间序列中的长短期依赖关系进行挖掘,可以提高光伏功率、负荷预测的准确性。基于Transformer的数据多变量时序预测Matlab代码,可直接运行,适合小白新手。1️⃣、运行环境要求MATLAB版本为2023b及其以上【如果没有可私信我,我赠送】2️⃣、评价指标
这篇超长的文章(部分是评论,部分是探索)是关于 GPT-5 的。我们分为上和下两部分。但它的内容远不止于此。它讲述了我们对下一代人工智能模型的期望。它讲述了即将出现的令人兴奋的新功能(如推理和代理)。它讲述了 GPT-5 技术和 GPT-5 产品。它讲述了 OpenAI 面临的竞争业务压力以及其工程师面临的技术限制。
本文开发了Reasoning3D,一个简单而有效的基线方法,可以理解并执行复杂的命令,以对3D网格的特定部分进行分割,具有上下文理解和推理输出,用于交互式分割。随机收集了来自3D建模网站SketchFab的3D模型,并使用这些实际中的3D模型进行评估,并让志愿者给出“隐含”的分割命令。图6和图1展示了一些示例。在这里,受解决了3D生成中类似挑战的研究[16,17,52,54,60,72]的启发——