登录社区云,与社区用户共同成长
邀请您加入社区
本文通俗解析Agent核心原理:它不是简单回答问题的聊天机器人,而是能自主规划、调用工具、迭代执行的“办事智能体”。关键在于LLM+目标+工具+记忆+循环+安全边界。适合多步判断、信息动态变化的任务,如订票、调研;固定流程则用脚本更高效。推荐从最小循环起步,掌握ReAct、计划执行、反思纠错三种思维模式,重视工具安全与上下文管理。最后以“研究助手”练手,覆盖完整闭环。
2026年,具身智能导航领域迎来关键转折:模型正向通用化演进,但研究基础设施仍陷于“手工作坊”困境。清华THUNLP联合OpenBMB开源的SimpleNav,以统一数据协议、可复用训练配置与跨平台评测体系,回应“复现成本高于创新”的行业痛点。它不追求刷榜,而是构建可追溯、可复现的研究闭环——将数据转换、模型训练、评测验证标准化为一次配置即可完成的流程。通过引入LeRobotv3格式、BATS采样
一、重磅炸弹!机器人自己写代码,程序员要慌了?这绝对是具身智能领域的里程碑式突破!2026年4月4日,英伟达官方正式开源了全新机器人框架 CaP-X。它最颠覆的能力
检测完成后对机器人说一句“说说我的健康状态怎么样”,即可获得健康数据的语音播报,实现健康守护与贴心陪伴的双重体验。上纬新材旗下消费级具身智能品牌启元机器人联合杭州飞阔科技有限公司(以下简称“飞阔科技”)亮相蚂蚁阿福展台,现场展示双方在健康领域的应用落地成果,为个人机器人开拓健康服务新场景树立新标杆。未来,启元机器人将持续开放产品能力,携手更多行业生态伙伴深耕具身智能场景化落地,共建开放繁荣的个人机
TABLES (METRICS (这一定义中有三点值得注意。1. 一旦通过声明表之间的关系,后续查询便不再需要手动编写 Join。2. SYNONYMS 和主要提供给语言模型使用,而不是提供给数据库引擎计算。用户说“purchase year”或“year”时,对应buy_year;用户说“gear brand”“brand”或“make”时,对应品牌维度;用户提到“float”或“Handing
这个项目的根本意义不是"便宜的雷达",而是第一次把(包括原理图、PCB、FPGA信号处理、固件、GUI)打包开源。它的坐标系不是消费电子,而是原本只有国防承包商和顶级高校才能触及的技术栈——而 AERIS-10 把进入门槛从 $250,000 压到了 $5,000–$15,000,降幅超过 95%。这是一次。过去十年里,SDR(软件无线电)社区已经在将单通道接收系统民主化,但相控阵始终因为移相器、
的尝试。理解它的参照系不应该是"又一个 Python 加速库",而应该是当年 LLVM 出现时对编译器生态的重塑——Mojo 的创始人 Chris Lattner 正是 LLVM 和 Swift 的缔造者。
AI Agent 数据分析的价值,不在"会不会答",而在能不能把数据变成行动。企业落地的正确路径是:先选一个高价值场景试点,同步建设统一语义层、安全治理与经验沉淀能力,在一个受控闭环内证明价值后,再向更多角色、更多业务域规模化扩展。ThinkingAI 基于十年数据智能积累与 2026 年发布的 Agentic Engine 企业级 AI Agent 平台,已服务全球超 1500 家企业、接入产品
本文推荐《AI 数据分析极简入门》,提出零基础者也能用 AI 完成数据分析的五步法:明确目标整理数据、AI 辅助清洗、描述统计、自然语言生成图表、结合业务解读输出报告。核心结论是 AI 降低门槛,把重复劳动交给机器,把思考留给人。全书强调"学会提问"比编程数学更重要,并提醒务必人工复核 AI 结果,适合运营、财务、学生及创业者入门。
微软 AI-For-Beginners(GitHub 仓库,MIT 协议,目前 50k+ Stars)于 2021 年由微软研究员 Dmitry Soshnikov 主导发布。放进当下的时间坐标来看,它的定位是——它不是 GPT-4 那种技术突破,也不是某种颠覆性学习方法论,而是在"AI 教育资源过于碎片化"这个问题上,提供了一套结构严密的系统解答。
OpenCodeReview(简称 OCR)是阿里集团将其内部 AI 代码评审系统对外开源的产物,官方声称已在内部服务数万名开发者、识别数百万个缺陷,历经两年以上规模化验证。这件事在 AI 代码审查工具的发展脉络里,代表的是一次,而不是范式突破——它的核心价值在于:承认纯 LLM/纯 Agent 架构在代码审查场景下存在系统性缺陷,并用"确定性流水线 + Agent 混合架构"加以弥补。这是一个典
市面上标榜「AI知识管理」的工具越来越多,但各自的侧重点差别很大。有的偏会议场景,有的偏碎片记录,有的主打音视频转笔记。看起来都在做同一件事,实际用下来体验完全不同。👉我挑了四款关注度比较高的工具,从知识管理的角度做了对比。同一个B站分享视频,分别用四款工具处理,聊聊实际感受。
本文对比测试了五款音视频转笔记工具(通义听悟、Ai好记、得到大脑、听脑AI、飞书妙记),从输入来源、转录质量、思维导图、导出兼容性四个维度进行评估。结果显示:通义听悟擅长会议实时转写;Ai好记支持多平台链接解析,可生成图文笔记和交互式思维导图;得到大脑适合得到生态用户快速记录;听脑AI在专业术语识别和内容结构化方面表现突出;飞书妙记深度整合飞书办公生态。不同工具各有侧重,用户可根据会议记录、学习笔
GitHub 大神开源的 18 万 Star 的 Skills 仓库揭秘!手把手教你安装使用,带你看懂这套 AI 编程标准操作流程,包括 grill-me 需求拷问、TDD 测试驱动开发、Bug 诊断、AI 辅助学习、大项目规划、代码架构改进等核心技能,把经典软件工程方法论变成 AI 能执行的指令。
本文通俗讲解了太空辐射对芯片的两类危害:TID(总剂量效应)是长期累积的慢性损伤,类似皮肤光老化;SEE(单粒子效应)是瞬时高能粒子撞击导致的突发故障。传统抗辐照方案依赖特殊材料和金属屏蔽,成本高昂。文章重点介绍了双路冗余技术,通过并行电路和自动切换机制,用标准工艺实现抗SEE,以及基于超薄二维材料的本征抗辐照方案,二者分别从电路架构和材料层面突破传统技术瓶颈,兼具实用性和前瞻性。最后通过对比表格
本文系统介绍了从RTL到GDS的芯片设计全流程,涵盖前端设计、后端设计及验证环节。随着制程演进至7nm以下,芯片设计复杂度剧增,2亿门级SoC设计周期需18个月。文章通过AI加速芯片案例,展示了RTL编码、功能验证、逻辑综合和物理设计的关键技术与挑战,并提供计数器设计的完整代码示例。对比显示,现代自动化设计方法较传统方法效率提升3倍,功耗降低30-45%。建议建立规范编码风格、早期时序约束和自动化
InfiniteTalk 是一个基于(Sparse-Frame Video Dubbing)的全新框架,能够以音频为驱动,生成的说话人视频。它不仅同步嘴唇动作,还能同步一句话总结:InfiniteTalk = 无限时长 + 精准唇同步 + 全身动态协调 + 双模式生成。
Excalidraw通过集成大语言模型,实现从自然语言到手绘风格图形的智能生成,大幅提升团队协作效率。借助结构化输出与精准提示工程,AI能快速将口头描述转化为可编辑流程图,降低非专业用户门槛,同时保障隐私与用户控制权,推动可视化创作的民主化。
ESP-Brookesia是乐鑫科技推出的嵌入式GUI开发框架,深度融合AI大模型能力,重塑人机交互体验。该框架基于ESP-IDF,支持语音交互、动态表情和智能UI适配,显著提升开发效率,适用于智能家居、车载设备等物联网场景。
当前,AI大模型、具身智能、端云协同等技术加速演进,全球机器人市场规模持续扩张,据IDC预测,2029年将突破4000亿美元。移远通信打造的端云融合AI Agent方案,通过创新的端云协同架构,为机器人带来了智能决策的能力:关键指令优先在端侧处理,复杂任务则自动切换至云端,有效解决了机器人场景中“端侧算力有限、云端响应延迟”的痛点。随着机器人产业进入“规模化落地”的关键阶段,移远通信将持续深耕技术
本文详细介绍了基于insightface的人脸识别系统从部署到优化的全流程实战经验。涵盖模型转换、量化压缩、多模型融合等关键技术,以及x86、ARM和边缘设备的跨平台部署方案,帮助开发者构建高性能、高准确率的AI人脸识别系统。
本文详细介绍了如何在迅为RK3588开发板上利用6TOPS NPU全流程部署YOLOv8目标检测模型,包括环境搭建、模型转换、性能优化及工业级应用实战。通过具体代码示例和避坑指南,帮助开发者高效实现AI图像识别在工业质检、智慧工地等场景的落地应用。
本文深入解析了AI滑块拼图背后的核心技术,重点揭秘了动态图像分割算法与A*最优路径搜索算法如何协同工作。通过内容感知分割生成独特拼图块,并利用启发式搜索快速计算还原步骤,共同构成了滑块验证与智能拼图游戏的技术基石。
2025 龙蜥大会到底有哪些新亮点?
Bili2text是一款开源工具,可将Bilibili视频自动转换为可编辑文本。它基于Python开发,整合了Whisper语音识别模型和FFmpeg等工具,支持视频下载、音频提取、智能分割和语音转文字全流程处理。该项目已获得1100+星标,具有GUI界面,适用于内容创作、教育、研究等场景。开发者计划持续优化模型、扩展多语言支持并完善功能。
在大模型训练时代,模型参数规模动辄数百亿甚至上万亿,传统的 FP32 单精度训练 已经无法满足显存和速度的需求。混合精度(Mixed Precision Training)技术通过在保持模型精度的同时使用更低位数的浮点格式(如 FP16、BFLOAT16),有效减少显存占用、提升吞吐量,已经成为深度学习训练的“标配”。
本文介绍了高斯过程回归(GPR)在半导体晶体管IV特性分析中的应用。通过三个模块化的案例演示,展示了如何从有限噪声数据中预测完整IV曲线:1)数据生成与对数预处理;2)GPR模型配置与训练;3)预测结果可视化与评估。结果表明,GPR能有效捕捉指数级变化的电流特性,并提供95%置信区间的不确定性量化,但高电压区域存在欠拟合。文章还提出了增加数据密度、调整内核参数等优化建议,为后续的工艺参数优化和产量
AI-Media2Doc是一款开源视频/音频转文本工具,支持本地部署,提供多种文档风格转换功能。该工具基于AI大模型开发,具有隐私保护、智能截图、字幕导出等特性,可生成小红书、公众号、思维导图等多种格式内容。安装需配置Docker和火山引擎相关参数,支持自定义Prompt和访问密码设置。工具完全免费开源,适合需要高效处理音视频内容的用户,同时文章还分享了AI大模型学习路线和免费资源获取方式。
摘要:本文提供了一套为期6个月的提示词系统学习路径。第1个月掌握基础提示词写作;第2个月学习结构化提示词;第3个月掌握角色设定和示例驱动技巧;第4个月学习不同领域的专业提示词;第5个月学习提示词优化与调试;第6个月进行综合应用与创新实践。每个阶段都包含明确的学习目标、实践任务和检验标准,并附有辅助学习资源和常见问题解决方案。通过循序渐进的学习,帮助学习者从提示词入门到精通,最终能熟练运用提示词解决
阿里云发布Qwen3-235B-A22B-Instruct-2507-FP8模型,采用分离式架构专注指令响应,性能显著提升。该MoE架构模型激活22B参数,支持256K上下文,在数学推理、编程等测试中超越竞品。社区反馈积极,期待即将发布的Thinking模型实现深度推理能力。这一更新标志着开源AI向专业化分工发展,为工业应用提供新可能。
Stacking算法是一种集成学习方法,通过"两层模型接力"提升预测精度。它先训练多个不同类型的底层模型(如决策树、回归模型等)获取数据特征,然后将这些模型的预测结果作为新特征输入上层模型进行最终预测。该方法优势在于显著提升模型性能和高灵活性,但存在训练复杂度高和过拟合风险。文章通过电商销量预测案例形象展示其应用,并提供了Python代码示例详细解析实现过程。Stacking算
通过 Dify 平台,我们可以轻松实现 AI 智能客服机器人的私有化部署 😎。只需简单的几步操作,就能搭建出一个功能强大的智能客服系统,为用户提供更加优质的服务 🤗。还等什么,赶紧动手试试吧!
今日推荐一款可以碾压manus的一款开源力作,字节跳动开源的UI-TARS(GitHub 星标已经破了15K)。截至 2025 年 4 月,项目已发布 v2.3.5 版本,累计贡献者超 200 人,文档页面日均访问量突破 8000 次UI-TARS 是新一代原生 GUI 代理模型,旨在利用类似人类的感知、推理和操作能力与图形用户界面 (GUI) 无缝交互。
1. 进入 Demo 页面后,首先在「Identity Image」处上传包含人脸的照片,然后输入 Prompt,并在「Model Version」处选择模型版本,这里默认使用「aes_stage2」以获得更好的图文对齐和生成效果,如需更高的 ID 相似度,请尝试「sim_stage1」。3. 选择「NVIDIA RTX A6000」以及「PyTorch」镜像,OpenBayes 平台提供了 4
介绍如何在 CPU 上使用 llama.cpp 推理 671B 版本的 DeepSeek R1,以及实际效果。
相比于 Sealos 应用商店一键部署,在 Devbox 开发环境中部署更方便我们随时修改源码,而且可以通过 Cursor 直接连到开发环境中,利用 AI 来帮助我们修改源码。如果你想基于该项目做二次开发,那么这种部署方式再合适不过了。当然,代价就是部署步骤复杂了点,需要敲一点命令行。如果你只想快速部署该项目,没有开发需求,那么使用Sealos 应用商店部署是最快的方式。
引领智能算力,助力行业创新。
Slurm 是一个开源、容错、高度可扩展的集群管理和作业调度系统,适用于大型和小型 Linux 集群。Slurm 的操作不需要修改内核,而且相对独立。作为集群工作负载管理器,slurm 有三个关键功能。首先,它在一段时间内为用户分配对资源(计算节点)的独占和/或非独占访问权,以便他们能够执行工作。其次,它提供了一个框架,用于在分配的节点集上启动、执行和监视工作(通常是一个并行作业)。最后,它通过管
Edge-TTS,由微软推出的这款免费、开源的AI工具,为用户带来了丰富多样的中文语音体验。它不仅支持多种中文语音语色,还能实现流畅自然的语音合成。
本文是一篇关于加快语言大模型推理速度的综合指南。从硬件优化到各种解码技巧,文章介绍了各种优化策略,旨在帮助读者更好地理解和优化LLM的性能。相信不论是这一领域的初学者或是专家,都能从中有所收获。在我的上一篇文章()中,手动实现了一个Transformer。该文使用了经典的自回归采样器,大致如下:这种推理方法非常巧妙,深入探究了语言大模型的工作原理:它们是自回归的,消耗自身的输出。对于玩具模型(仅有
还有就是栅格的输出范围,这个范围z最初是根据输入矢量数据自动提取的,当然您可以修改,修改后工具会自动计算合适的栅格高度和宽度。具有矢量数据转换为栅格数据的功能,可以将矢量数据(包括点、线、面)转换为栅格格式。【参考模版】如果您有一份参考模版数据,从可以选择这个数据,工具会参照这个栅格数据的行数、列数及坐标系生成栅格数据。对于生成栅格数据的波段和波段顺序是这样设置的,点输出波段设置,可以设置生成波段
机器学习在智能可穿戴设备中的应用1. 背景介绍随着科技的不断发展,智能可穿戴设备已经成为我们日常生活中不可或缺的一部分。从智能手表、智能手环到虚拟现实头显,这些设备能够实时监测我们的生理指标,并根据用户的行为模式提供个性化的服务和建议。而机器学习作为人工智能的核心技术,在这些智能可穿戴
人工智能(Artificial Intelligence),是一个以计算机科学(Computer Science)为基础,由计算机、心理学、哲学等多学科交叉融合的交叉学科、新兴学科,研究、开发用于模拟、延伸和扩展人的智能的理论、方法、技术及应用系统的一门新的技术科学,企图了解智能的实质,并生产出一种新的能以人类智能相似的方式做出反应的智能机器,该领域的研究包括机器人、语言识别、图像识别、自然语言处
以下是机器学习项目的关键步骤: 收集数据 训练模型 即A到B映射 然后派送模型 在这些步骤中, 通常会有很多的反复更改完善的过程, 也就是说微调或者是使模型变得更好用 或者是即使寄出模型之后, 你还要继续收集新的数据, 使你能让产品变得更好
通义千悟-阿里通义千问系列
智能边缘计算网关力求打造一个开放式、可扩展、二次开发升级的智能型AI终端,硬件基于arm的CPU,2T算力的NPU,具备更低的功耗,更高的性能,同时扩展多路外围接口,如RS232、485、CAN等,系统采用嵌入式Linux操作系统,提供更稳定的运行环境。系统支持接入音视频设备,支持协议包含Onvif、rtmp、rtsp、GB28181等;系统目前支持开发语言:Java、C&C++、Go、Lua、P
随着城市交通流量的不断增长,道路的安全隐患也越来越多。交通更加拥堵,尤其是在城市地区。不仅仅是驾驶,而且在大城市停车对每个人来说都变得越来越具有挑战性。结合智能物联网安防摄像头和AI视频分析的智能交通监控可帮助交通主管部门、交通规划人员和高速公路运营单位更全面、系统地监控和了解交通道路及驾驶行为。我们可以从视频数据中获得宝贵的分析数据,以此优化交通流量并最大程度地降低安全事故风险。用于交通安全和管
HALCON 21.11:深度学习笔记---有监督训练(6)HALCON 21.11.0.0中,实现了深度学习方法。不同的DL方法有不同的结果。相应地,它们也使用不同的衡量标准来确定网络的“表现如何”。在训练一个网络时,不同的模型会有不同的行为和缺陷,我们将在这里进行描述。训练中的验证当涉及到网络性能验证时,需要注意的是,这不是一个纯粹的优化问题(参见上面的“网络和训练过程”和“设置训练参数”部分
原文标题:6 Ways Machine Learning will be used in Game Development机器学习正在改变几乎每个行业,从农业中的作物规划到医疗保健中的癌症诊断。 这些主题通常会得到更广泛的讨论,因为它们已经产生了切实的,对人类有益的影响。 对于游戏行业而言,不幸的是,游戏开发中的机器学习仍处于起步阶段,而且还没有以同样的方式成为头条新闻。 在本文中,我探讨了机..
什么是K近邻算法引例假设有数据集,其中前6部是训练集(有属性值和标记),我们根据训练集训练一个KNN模型,预测最后一部影片的电影类型首先,将训练集中的所有样例画入坐标系,也将待测样例画入然后计算待测分类的电影与所有已知分类的电影的欧式距离接着,将这些电影按照距离升序排序,取前k个电影,假设k=3,那么我们得到的电影依次是《He’s Not Really Into Dudes》、《B...