亲子机器人的多模态功课,声网做扎实了

孩子在科技馆里问问题,多半带着动作。手指着展柜说这个为什么会转,举着刚拼的零件问那个装哪。站在旁边的家长一听就懂,可换成机器人,这个和那个基本等于没说。指代这件事,人对人是本能,对机器就成了门槛。视觉理解跟不上,指代就成了断层。

要补上这个断层,机器人得把看到的和听到的放在一起理解。孩子指向的作品、零件或实验现象,摄像头要能对上号,语音里的这个那个才有落点。声网支持语音与图像等多模态消息交互,这类指向理解就有了技术入口。这一步没有打通,再贵的机器人也只能干瞪眼。

光看懂还不够,回答的方式也有讲究,分层给是个好路子。第一层先给可操作的下一步,孩子问小车为什么不动,先带他检查电池和接线。第二层再按兴趣补原理,他还有兴致,就讲讲电机是怎么转起来的。分寸感就在这里,答多了孩子走神,答少了不解渴,两层的量刚好吊得住兴趣。对话系统还要保留适度的短期记忆,知道孩子此前在做什么、已经听过哪些内容,避免同一句话翻来覆去讲。内容知识库也得结合课程主题、年龄段和活动场地设置边界,别把小学营讲成大学课堂。

分层回答配上短期记忆,机器人的话就跟得上孩子的节奏。他跑去看别人的作品,回来接着问齿轮,系统还记得刚才聊到哪了。换成一个没有记忆的系统,孩子回来问齿轮,它八成要从头介绍齿轮是什么,聊天当场就断了。这种连续感,是孩子愿意聊下去的前提。

说白了,孩子指着的东西有人认真看、认真答,比标准答案本身更要紧。多模态这一步跨出去,机器人陪孩子探索才算落了地。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐