登录社区云,与社区用户共同成长
邀请您加入社区
想让 AI 判断一台设备有没有异常,光盯着当前的温度读数可远远不够。温度升高,既可能是设备故障的前兆,也可能只是负载增加后的正常反应。要做出准确判断,AI 得看懂过去一段时间的温度变化曲线,看看振动、电流有没有跟着一起异常,甚至还要翻出这台设备近期的检修记录,查查同类型号之前有没有出过类似问题。
FastAPI 的高级用法可以为开发人员带来许多好处。它能帮助实现更复杂的路由逻辑和参数处理,使应用程序能够处理各种不同的请求场景,提高应用程序的灵活性和可扩展性。在数据验证和转换方面,高级用法提供了更精细和准确的控制,确保输入数据的质量和安全性。它还能更高效地处理异步操作,提升应用程序的性能和响应速度,特别是在处理大量并发请求时优势明显。此外,高级用法还有助于更好地整合数据库操作、实现数据的持久
本文介绍了图形用户界面(GUI)的发展历程、核心要素及其影响。GUI源于20世纪60年代施乐公司PARC研究中心的创新,后经苹果和微软推广普及。文章详细解析了窗口、菜单、图标和对话框等GUI基本组成元素,并指出GUI通过降低学习门槛和提高操作效率,极大推动了计算机技术的普及应用。作为现代人机交互的核心技术,GUI仍在持续演进,未来将与人工智能等新技术结合,创造更智能便捷的交互体验。
本文介绍了三种前端JS调用后端API的方法:XMLHttpRequest、jQuery Ajax以及axios和fetch。XMLHttpRequest是原生API,兼容性好但代码繁琐;jQuery Ajax简化了调用流程但需要引入额外库;axios和fetch基于Promise,支持async/await语法,是现代前端开发的首选方案。每种方法各有优劣,开发者可根据项目需求选择最合适的实现方式。
眼控技术通过光学装置和图像算法实现用眼睛控制设备,解放双手。主要方法包括侵入式搜索线圈法、眼电图法、非侵入式瞳孔-角膜反射法等。ErgoLAB系统将眼动状态转化为交互信号,应用于网页、APP、车载等场景,支持实时数据分析和多模态交叉研究。眼控在军事等领域可提升操作效率,系统提供热区分析、AOI统计等可视化工具,并支持与其他生理数据融合分析,优化人机交互体验。
相比机械化、自动化的突破点在于,能够模糊容忍,如搜索引擎可纠正“德玛西亚杯”为“德玛西亚(电竞赛事)”,具有情境感知能力,如智能家居根据用户历史行为动态调整温度(如22:00自动降温至睡眠模式)。下一代系统需在概率可解释性(如贝叶斯神经网络显式输出不确定性分布)与规则可验证性(如形式化验证的自动驾驶安全兜底)之间找到平衡,最终实现“可信的不确定性”——既能创新交互体验,又保留关键场景的可控性。总之
在物联网快速发展的今天,微信小程序与蓝牙设备的交互已成为智能硬件开发的重要场景。本文将基于官方蓝牙 API,详细讲解小程序连接蓝牙设备的完整流程,涵盖从适配器初始化到数据收发的全链路操作。
本篇文章介绍了 effet.js 框架的开发历程,这是一个基于 facemesh.js 的人脸识别与交互工具,旨在提升 Web 应用的智能化用户体验。文章涵盖了框架的核心功能,包括人脸登录、打卡和睡眠检测等,以及在开发过程中遇到的技术挑战和解决方案
1.背景介绍机器人开发人机交互与多模态交互1. 背景介绍随着机器人技术的发展,人机交互(Human-Robot Interaction, HRI)成为了机器人系统的一个重要组成部分。多模态交互(Multimodal Interaction)是一种利用不同类型的输入和输出信息进行交互的方法,例如语音、手势、视觉等。在机器人领域,多模态交互可以提高机器人与人类的沟通效率和准确性。在机器...
1.背景介绍沉浸式交互(Immersive Interaction)是一种人机交互(Human-Computer Interaction, HCI)方法,它旨在为用户提供更自然、直观和沉浸式的体验。在过去的几年里,随着虚拟现实(Virtual Reality, VR)、增强现实(Augmented Reality, AR)和混合现实(Mixed Reality, MR)等技术的发展,沉浸式交互..
在我的理解中,生活场景里应该是这样,首先,用户找到开发人员要求要制作一个什么样的软件,告知开发者自己这款软件的用意,双方达成一致,随后制作组开始制作整体流程规划,之后是具体开始工作,软件制作的差不多以后,找到用户验收,用户首先对软件整体状态进行感知,随后,我们开发者具体对用户感知的内容量化、具体化、专业化,之后对整体项目从用户的感知对自己的项目模型进行评估,以便后续按用户感知要求近一步改进,或进行
这是一篇由清华团队于2021年5月份发表于CHI上面的一篇高质量论文。题为:在具有向下摄像头视觉的 AR 眼镜上实现手对脸手势交互的文章,介绍了 FaceSight,就是一种⽤于 AR 眼镜的基于计算机视觉的手对脸手势感应技术。 它将红外摄像头固定在 AR 眼镜的桥架上,以提供对下⽅⾯部和手部行为的额外感知能力(图 1)。检测手脸接触,并训练卷积神经网络(CNN)模型对手对脸手势进行分类。输入特征
手机人机交互原理详解
计算机图形学_华中科技大学_中国大学MOOC(慕课)1.1 初始图形学计算机图形学:研究怎样利用计算机来显示,生成和处理图形的原理,方法和技术的一门学科.相关学科计算机视觉和数字图像处理数字图像处理输入与输出都是图像信号例如PS发展历史50-70年代为第一阶段建立学科地位70-90年代为第二阶段光栅图形学90-现在为第三阶段 真实感图形学第一阶段阴极射线管 CRT/Cathod Ray Tube.
人机交互的软件工程方法 课堂笔记
项目场景:在调试项目时发现STM32F407驱动83848芯片时以太网初始化失败问题。问题描述:具体表现为:板子上电不插网线,等程序跑起来后再插入网线怎么也连接不上。上电前插入网线使用正常。原因分析:查了一些网上说明都是指向了此处初始化失败。static void ETH_MACDMA_Config(void){/* Enable ETHERNET clock */RCC_AHB1PeriphCl
1. 什么是Apache Zeppelin在正式进入Apache Zeppelin的正题之前,我们必须先了解两个概念。REPLREPL全称是Read Evaluate Print Loop,交互式解释器环境,通过交互式界面接收用户输入,交互式解释器读取输入内容并对它求值,返回结果,并重复此过程。Jupyter NotebookJupyter Notebook(早期叫IPython not...
想象一下,你正在和一个超级聪明的机器人聊天。你们聊得很开心,从天文地理聊到日常生活。但突然,机器人问了你一个五分钟前你已经回答过的问题,或者完全忘记了你们之前讨论的内容。这时候你会是什么感觉?肯定会觉得这个机器人不够聪明,对吧?这就是我们今天要解决的问题:如何让智能体(也就是那个"机器人")在和我们频繁交流的过程中,既能记住重要的信息,又不会因为信息太多而变得混乱。让你理解什么是智能体的上下文管理
我们会先回顾从 Jarvis 到现在的智能助手交互演变,分析传统交互的局限;接着拆解 Vision Pro 带来的空间计算核心特征,以及这些特征如何重新定义 Agent 的“能力边界”;然后我们会重点讲解空间计算 Agent 的核心交互范式——从“指令驱动”到“情境共生”,从“单一模态”到“多模态融合”,从“被动响应”到“主动预判”;此外,我们还会深入技术底层,讲解实现空间计算 Agent 需要的
"灵活的微信交互"指机器人不只会按固定规则回复,还能根据不同场景选择不同回复策略。结合AI后,交互灵活度来自3个机制:场景识别、动态回复、多模态适配。
前面聊的 Agent 大多在"打字",而真实世界的人机交互是"看、听、说、动"。这一篇讲 Agent 的三张新面孔:语音交互、GUI 操作(Computer Use)和机器人操控(VLA)——它们对应着无人零售场景里最刚需的三件事:语音客服、自动巡检后台、理货机器人。
本文以一份完整的「战术档案」形式,记录如何基于魔珐星云 XmovAvatar SDK 的参数流架构,使用 React + Vite 从零搭建一个面向 FPS 游戏场景的具身交互智能应用——「三角洲行动 · 道具解读」。文章涵盖魔珐星云控制台配置、数字人形象定制、SDK 前端集成、道具数据建模与语音播报联动等全链路开发流程。通过本文,读者可以了解游戏场景下具身交互智能的轻量化落地方案:数字人战术教官
具身交互智能,是让 AI 从「屏幕里的文字」走向「有形象、能开口、会表达」的关键一步。本文记录一次具身交互智能的轻量落地:在一张「实时数据播报」仪表盘页面上,接入魔珐星云 TTS 服务,搭建一套名为「实时语音播报系统」的具身交互智能应用。区别于带 LLM 对话的复杂应用,本项目是纯 React + TypeScript 的轻量实现:多数据源(交通、天气、新闻、系统告警)实时汇聚,播报引擎自动排队、
的功能不是孤立的,单接口只能解决单点问题。把多个独立接口按工程目的组合起来,就能从"能发消息"扩展到"能驱动业务"。本文按组合层次拆解3层组合,每层解决一个工程问题,层间是叠加关系不是替换关系。
本文聚焦机器人产品化中的人机交互(HRI)设计,指出交互体验对产品成败的关键影响。文章系统梳理了三大交互模式(示教/命令/自主)及其适用场景,强调状态反馈需包含任务进程、完成度和后续动作三要素。在错误处理方面提出分级策略和用户友好提示原则,并详细阐释安全交互设计的核心要求:意图预告、急停机制、恢复确认及ISO标准下的速度/功率限制。最后针对面试常见问题,对比了机器人交互与传统软件的本质差异,突出物
买粉底很容易踩坑:专柜BA推荐未必适配肤质,网上美妆笔记五花八门,别人的好用方案放到自己脸上就卡粉、浮粉、假面。如果有数字美妆顾问,你说出肤质、痛点和预算,直接给到底妆搭配、妆前护肤、上妆技巧,这就是具身交互在美妆线下门店的落地思路。
网上能搜到各种训练计划,"新手四周增肌计划""八周减脂方案",但这些计划有一个共同的问题:它们假设所有人都是同一个模子出来的。第三个是健身房焦虑。一个站在大屏里的教练形象,用对话的方式了解你的情况,给你一份量身定制的方案——这件事的成本可以低到每次几块钱。健身行业的问题不是"没有好的训练方法",而是"好的训练方法到不了需要它的人"。去年一个做社区运动中心的朋友找到我,说想做一个"AI健身教练",放
微信机器人要实现稳定的自动化交互,底层依赖4类接口能力——每类解决一个机器人核心环节的问题,缺一类功能就不完整。本文按机器人功能环节拆解这4类能力。详见。
3 种范式按交互深度递进——单向推送范式是"广播"(机器人说用户听)、事件响应范式是"问答"(用户问机器人答)、闭环对话范式是"对话"(双向多轮交互)。按交互需求选择范式,而非一开始就用最复杂的闭环。从趋势看,AI 大模型会让闭环对话范式的构建门槛降低——大模型负责理解和决策,Eyun 负责感知和执行,但 3 种范式本身不会消失,因为不同场景需要不同交互深度。
不是说数据团队不重要了,而是简单的问题不用排队了,数据分析师可以把时间花在更有深度的分析上。大模型解决了AI的分析推理能力,Agent解决了分析流程的自动化编排,具身交互智能解决的是"让分析结果以面对面对话的方式送达"的问题。工具换了好几茬,从Tableau到帆软再到自研平台,仪表盘越做越漂亮,但有一个问题一直没解决——高管看了报表之后问"为什么",数据团队要花好几天才能给出答案。仪表盘的设计逻辑
选它的原因是中文理解能力强,书法领域的知识覆盖面也还可以——从基本笔画的讲解到碑帖的赏析,从握笔姿势到书法史,通义千问都能给出比较靠谱的回答。视频里老师写得好,但你跟着写的时候,你的笔画和视频里的差距在哪里,视频看不出来,也没法告诉你。视频教程是单向的,你看完了要自己消化。但书法的很多细节——笔锋的角度、运笔的速度、提按的力度——这些东西光看是不够的,需要有人在你写的时候实时给反馈。你写了一个字觉
具身交互智能在这个场景的价值,不是替代汽修师傅,而是在车主和师傅之间搭一座桥——让车主在进店之前就能获得专业、透明的初步诊断,让沟通从"我啥也不懂你看着办"变成"我知道大概什么问题咱们聊聊方案"。如果你对具身交互智能在垂直场景的落地感兴趣,或者想在自己的业务里试试类似方案,可以到星云官网看看文档和SDK,上手门槛比想象中低。具身交互智能,简单理解就是:AI不再只是一个聊天框,而是有了"身体"——它
而一个温和的、像真人一样的数字人,用平稳的语气说"这个情况很常见,不用太担心",这种安抚是文字给不了的。那些"宝宝便便颜色正不正常""这个月该打什么疫苗"的问题,不需要挂号排队,数字人随时可以解答。具身交互智能,简单说就是:一个有形象、能对话、会感知的数字人,它不只是屏幕上一行行冷冰冰的文字,而是你能看到它的表情、听到它的声音、跟它像真人一样交流的 AI 服务。跟传统的聊天机器人不一样,具身交互智
微信机器人不是单一接口的简单调用,而是一条从"感知—理解—决策—执行"的流水线。按职责切分,这条流水线可以分为4层,Eyun 接口承担其中感知层和执行层,中间两层由开发者自建。本文按4层架构拆解接口分工,更多接口规范见。
金融类数字人项目,优先约束交互延迟、打断能力两个指标。金融场景用户对响应速度敏感,延迟超过1秒,体验和信任感会明显下降。端侧渲染方案不需要大量GPU服务器,对于多点位网点部署,成本优势比较突出。官方地址:https://xingyun3d.com/?
当客户走进门店,看到一个"人"在微笑着和他打招呼、耐心地问他的需求、用通俗的语言解释复杂的保险条款——这个体验和一个冷冰冰的表单界面是完全不同的。客户进店后,可以先和AI聊,了解自己的需求和适合的产品类型,然后再决定是否和真人代理人深入沟通。客户要输入"我今年35岁,年收入20万,有一个3岁的孩子,房贷还有120万"这么一段信息,打字需要两三分钟,很多人打到一半就不想打了。当然,数字人不是来替代代
你问它"这件青铜器上的饕餮纹有什么含义",它需要给出准确的考古学解释,同时语言不能太干巴巴——毕竟是博物馆,需要一些叙事感和画面感。"数字人给他讲了陶俑的表情含义,讲了唐代的丧葬文化,讲着讲着,小男孩突然说:"那它活着的时候是不是也很开心?当数字人在讲一件文物的故事时,它的语气会有起伏,表情会有变化,这些细节加在一起,构成了"听一个人讲故事"的沉浸感。具身交互智能在博物馆场景中的价值,是把"信息展
三个月前,我和一个做美妆电商的朋友合作,在他的直播间部署了一个AI数字人主播。直播间用户习惯了"随时插嘴"的交互方式,大约40%的弹幕互动发生在数字人正在说话的时候。电商直播数字人这个方向,技术已经可用了,但远没有到"躺着赚钱"的程度。延迟1秒左右,能用,但每月费用大几千,而且不支持自定义大模型,话术灵活性不够。他的需求是:做一个数字人主播,能覆盖凌晨0点到早上8点的时段,至少能完成基础的产品讲解
在“工业大模型 × 具身智能(Embodied AI) × 柔性控制”深度融合的现代化智能工厂语境下,多模态具身交互方法(Multimodal Embodied Interaction Methods)已彻底超越了传统“屏幕UI点击、键盘敲击或语音指令转文字”的平面局限。制造现场具有“物理环境高噪声、多轴机械轨迹复交、工艺机理容错率为零”的刚性红线。
在心理健康场景中,数字人说话的语气比内容更重要——同样一句"我理解你的感受",用机械的语调说出来和用温和的语调说出来,效果天差地别。”“这种感觉很常见,你不是一个人。一个有形象、有声音、有表情的AI,和一个纯文本的聊天框,在情绪支持场景中的差距是巨大的。我做这个心理健康数字人实验的初衷,是想验证一件事:当AI不仅有文字,还有声音、表情和眼神的时候,它对人的情绪支持效果会不会不一样?星云SDK在这个
在模拟对练场景中(比如销售话术练习),学员说完一句话,"客户"几乎立刻就能回应,这个节奏感很重要——延迟一高,对话的自然感就没了。大模型解决了AI的理解和推理能力,Agent解决了任务编排能力,而具身交互智能解决的是"让AI成为一个可以面对面交流的伙伴"的能力。星云SDK在这个技术栈里扮演的角色很清晰:它不是大模型,不是Agent框架,它是交互层——负责让AI有形象、有声音、有表情,能和学员进行自
这里有个细节:招生咨询的意图比较集中,我做了一个意图分类的前置层,把问题分成"专业介绍""分数线查询""校园生活""招生政策"四个类别,分别路由到对应的知识库子集。星云SDK是魔珐科技做的具身交互智能平台,它的作用是把大模型的文字输出变成一个3D数字人的实时播报——包括语音、口型、表情和肢体动作。需要改进的点:一些非常具体的问题(比如"某省某年某专业录取的最低分是多少"),知识库覆盖不够细,需要持
在政务场景中,群众问"怎么办护照",数字人不仅在说,旁边的屏幕还可以同步展示办理流程图。大模型补上了思考能力,Agent补上了任务调度能力,而星云这类具身交互平台补上了最后一环——让AI有形象、有声音、有表情、能实时互动。具身交互智能,就是三层加在一起的结果——AI不只能在云端思考,还能在终端上以可视化的形态,和人进行实时的、双向的、有温度的交互。最近技术圈有个趋势越来越明显:大模型的能力已经足够
大模型:火山方舟 Doubao(豆包)大模型星云 SDK 核心能力:3D 形象渲染、语音驱动(TTS + 唇形同步)、全双工实时对话、打断控制()、speak流式播报等落地终端:银行理财大屏 / 社区金融服务终端 / 企业员工福利咨询屏 / 校园金融教育互动台最终交互效果:用户随时开口打断 → 数字人秒级响应 → 预算规划智能推荐 → 消费分析与风险防范实时联动。
掰开了讲。很多人把"数字人"和"具身交互智能"混为一谈,差得远。传统数字人就是一段会动的录播——嘴唇在动,本质还是单轮"你问我答",不能打断、不能插话。而具身交互智能强调的是"在场":AI 拥有可视化的拟人载体,同步输出语音、神态、肢体动作,支持全双工实时对话与随时打断,真正适配客厅、健身房这些线下终端。感知层负责实时捕获用户状态——语音输入、打断信号。铁律健身里由 Web Speech API
这两年服务过电商、教育、医疗、制造业4个行业的客户,对接完回头看,我发现微信API进入各行业的姿势正在分化出3种新方式。以前大家接入微信就是"做个机器人自动回复",现在玩法明显变了——有的嵌进行业软件里当通知通道,有的做日常伴随服务,有的直接搭整套行业平台。这3种进入方式背后是不同的集成深度和业务定位,选对方式直接影响落地效果。下面把3种方式的进入逻辑、行业案例和对应Eyun API讲清楚。想对照
现在整个生态已经往"合规化、平台化、创新化"走了,像Eyun平台这类提供标准化API的服务,让开发者能把精力从"怎么搞定接口"挪到"怎么做出好产品"上。如果你也在折腾微信生态,别再盯着"模仿微信功能"那条老路了。对话式、社交化、跨平台、AI融合、数据驱动,这5个方向随便挑一个深挖,都比跟风做第100个自动回复机器人强。创新这事儿,方向比努力重要。