本文介绍了arXiv网站中人机交互(Human-Computer Interaction)领域的研究热点,通过图文并茂的方式,分析了近期该领域的研究热点与最新趋势,帮助读者跟踪人机交互领域的前沿进展。

推文作者为王一鸣,审校为龚裕涛和黄忠祥

一、领域介绍

人机交互,是一门研究系统与用户之间的交互关系的学问。系统可以是各种各样的机器,也可以是计算机化的系统和软件。人机交互界面通常是指用户可见的部分。用户通过人机交互界面与系统交流,并进行操作。小如收音机的播放按键,大至飞机上的仪表板,或发电厂的控制室。人机交互界面的设计要包含用户对系统的理解(即心智模型),那是为了系统的可用性或者用户友好性。

论文官网:https://arxiv.org/list/cs.HC/recent

二、论文汇总

表1中汇总了本次热点分析所收集的50篇论文的标题以及研究方向,方便读者参考。

表1 50篇论文的标题以及研究方向

论文标题

研究方向

Learning to Use AI for Learning: How Can We Effectively Teach and Measure Prompting Literacy for K-12 Students?

面向K-12学生的AI学习能力培养,研究提示素养的教学方法与衡量方式

Prompt Orchestration Markup Language

设计用于规范和优化提示编排的标记语言,提升与大语言模型的交互效率

LLM-Powered Virtual Patient Agents for Interactive Clinical Skills Training with Automated Feedback

利用大语言模型构建虚拟患者,实现交互式临床技能培训并提供自动化反馈

Mind & Motion: Opportunities and Applications of Integrating Biomechanics and Cognitive Models in HCI

探索生物力学与认知模型在人机交互中的融合机遇与实际应用场景

Bend It, Aim It, Tap It: Designing an On-Body Disambiguation Mechanism for Curve Selection in Mixed Reality

为混合现实环境设计基于身体的消歧机制,优化曲线选择交互体验

"My Dataset of Love" A Preliminary Mixed-Method Exploration of Human-AI Romantic Relationships

采用混合研究方法,初步探索人类与AI之间浪漫关系的特征与可能性

"Can You See Me Think?" Grounding LLM Feedback in Keystrokes and Revision Patterns

将大语言模型的反馈与用户按键行为及文本修订模式关联,提升反馈合理性

koboshi: A Base That Animates Everyday Objects

设计可使日常物品实现动画效果的底座,拓展普通物品的交互功能

Visuo-Tactile Feedback with Hand Outline Styles for Modulating Affective Roughness Perception

通过手部轮廓风格的视觉-触觉反馈,调节用户对粗糙感的情感感知

Large Language Models as Visualization Agents for Immersive Binary Reverse Engineering

将大语言模型作为可视化代理,应用于沉浸式二进制逆向工程场景

Data Work in Memory Institutions: Why and How Information Professionals Use Wikidata

研究记忆机构中信息专业人员使用Wikidata进行数据工作的原因与方式

The Social Context of Human-Robot Interactions

分析人类与机器人交互过程中的社会背景因素及其对交互的影响

Exit Stories: Using Reddit Self-Disclosures to Understand Disengagement from Problematic Communities

借助Reddit用户自披露内容,研究用户从问题社区脱离的行为与原因

Beyond Human Judgment: A Bayesian Evaluation of LLMs‘ Moral Values Understanding

采用贝叶斯方法,评估大语言模型对道德价值观的理解能力,突破人类判断局限

Reactive Semantics for User Interface Description Languages

为用户界面描述语言设计反应式语义,优化界面设计与交互逻辑

Uncertainty Tube Visualization of Particle Trajectories

设计管状图可视化方式,呈现粒子轨迹的不确定性信息

Towards Human-AI Complementarity in Matching Tasks

探索在匹配类任务中实现人类与AI互补协作的路径,提升任务效果

When AI Writes Back: Ethical Considerations by Physicians on AI-Drafted Patient Message Replies

分析医生对AI起草的患者消息回复的伦理担忧与考量因素

Human Digital Twin: Data, Models, Applications, and Challenges

梳理人类数字孪生的核心数据、构建模型、应用场景及面临的挑战

Choosing the Right Engine in the Virtual Reality Landscape

研究在虚拟现实技术生态中,如何为特定需求选择合适的VR引擎

At the Speed of the Heart: Evaluating Physiologically-Adaptive Visualizations for Supporting Engagement in Biking Exergaming in Virtual Reality

评估基于心率的生理自适应可视化对VR骑行健身游戏用户参与度的支持效果

Ashes or Breath: Exploring Moral Dilemmas of Life and Cultural Legacy through Mixed Reality Gaming

通过混合现实游戏,探索生命与文化遗产相关的道德困境议题

Using AI for User Representation: An Analysis of 83 Persona Prompts

基于83个角色提示词,分析利用AI实现用户表征的方法与效果

The Future of Tech Labor: How Workers are Organizing and Transforming the Computing Industry

探讨科技行业劳动力的未来发展,以及工人组织方式对行业变革的推动作用

Towards Adaptive External Communication in Autonomous Vehicles: A Conceptual Design Framework

构建自动驾驶汽车自适应外部通信系统的概念设计框架

Organization Matters: A Qualitative Study of Organizational Dynamics in Red Teaming Practices For Generative AI

采用定性研究方法,分析生成式AI红队实践中的组织动态影响

Say It, See It: A Systematic Evaluation on Speech-Based 3D Content Generation Methods in Augmented Reality

对增强现实中基于语音的3D内容生成方法进行系统性评估

fCrit: A Visual Explanation System for Furniture Design Creative Support

设计fCrit视觉解释系统,为家具设计提供创意支持与方案解读

When motivation can be more than a message: designing agents to boost physical activity

设计超越单纯信息传递的激励智能体,提升用户身体活动积极性

System-driven Interactive Design Support for Cloud Architecture: A Qualitative User Experience Study with Novice Engineers

针对新手工程师,开展系统驱动的云架构交互设计支持的用户体验定性研究

Sketchar: Supporting Character Design and Illustration Prototyping Using Generative AI

开发Sketchar工具,利用生成式AI支持角色设计与插画原型制作

iTrace: Click-Based Gaze Visualization on the Apple Vision Pro

在Apple Vision Pro上实现基于点击数据的眼动轨迹可视化工具iTrace

Playing telephone with generative models: "verification disability","compelled reliance", and accessibility in data visualization

研究生成式模型在数据可视化中引发的“验证障碍”“强制依赖”问题及可访问性优化

RPKT: Learning What You Don‘t -- Know Recursive Prerequisite Knowledge Tracing in Conversational AI Tutors for Personalized Learning

在对话式AI辅导中实现递归先验知识追踪,支持个性化学习路径规划

Two Sides to Every Story: Exploring Hybrid Design Teams' Perceptions of Psychological Safety on Slack

探索混合设计团队在Slack平台协作时对心理安全感的感知差异

Behavioral and Symbolic Fillers as Delay Mitigation for Embodied Conversational Agents in Virtual Reality

采用行为与符号填充方式,缓解虚拟现实中具身对话智能体的交互延迟问题

XR-First Design for Productivity: A Conceptual Framework for Enabling Efficient Task Switching in XR

构建XR优先的生产力设计概念框架,实现XR环境中高效的任务切换

FairVizARD: A Visualization System for Assessing Multi-Party Fairness of Ride-Sharing Matching Algorithms

开发FairVizARD可视化系统,评估共享出行匹配算法的多方公平性

Seeing the Many: Exploring Parameter Distributions Conditioned on Features in Surrogates

探索代理模型中基于特征条件的参数分布,并通过可视化方式呈现

Investigating VR Accessibility Reviews for Users with Disabilities: A Qualitative Analysis

对面向残障用户的VR可访问性评论进行定性分析,挖掘用户需求与问题

Insights from Interviews with Teachers and Students on the Use of a Social Robot in Computer Science Class in Sixth Grade

通过师生访谈,获取社交机器人在六年级计算机课堂应用中的洞察

Deformation of the panoramic sphere into an ellipsoid to induce self-motion in telepresence users

将全景球变形为椭球体,诱导远程呈现用户产生自运动感知

Reliability, Embeddedness, and Agency: A Utility-Driven Mathematical Framework for Agent-Centric AI Adoption

构建基于可靠性、嵌入性与能动性的效用驱动数学框架,支持智能体中心AI采纳

E3RG: Building Explicit Emotion-driven Empathetic Response Generation System with Multimodal Large Language Model

利用多模态大语言模型构建明确情感驱动的共情响应生成系统E3RG

Unlearning Comparator: A Visual Analytics System for Comparative Evaluation of Machine Unlearning Methods

开发Unlearning Comparator可视化分析系统,用于机器遗忘方法的比较评估

Towards SISO Bistatic Sensing for ISAC

探索面向ISAC(感知与通信一体化)的单输入单输出双基地传感技术

Cyber Risks to Next-Gen Brain-Computer Interfaces: Analysis and Recommendations

分析下一代脑机接口面临的网络风险,并提出相应的风险应对建议

"My productivity is boosted, but ..."Demystifying Users‘ Perception on AI Coding Assistants

剖析用户对AI编码助手的感知,包括生产力提升效果及潜在顾虑

RealTalk: Realistic Emotion-Aware Lifelike Talking-Head Synthesis

开发RealTalk系统,实现具备情感感知的逼真说话人头像合成

Into the Wild: When Robots Are Not Welcome

研究机器人在实际场景中不被接受的情况及用户排斥行为原因

三、热点分析

图1 近期arXiv人机交互领域论文标题的词云图

图1为基于近期arXiv人机交互领域论文标题的高频关键词生成的词云图,可视化展现了机器学习领域的研究热点、方法与趋势。其中,“AI”(人工智能)、“visualization”(可视化)、“reality”(现实)是出现频率最高的三个关键词,其中reality又包括virtual reality(虚拟现实)和mixed reality(混合现实)。作为现在最热门的技术,AI也在人机交互领域展现了强大的影响力。可视化以及虚拟现实等技术都是人机交互领域经典的方向,都值得关注。“user”(用户)、“agent”(代理)、“feedback”(反馈)这些关键词的高频出现表明近期的研究方向更多的转向使用机器来辅助用户,同时更加重视用户反馈。随着各式各样的AI工具的出现,如何正确的辅助用户并提高用户体验,是人机交互的研究者们重点研究的问题。此外,“patient”(病人)、“student”(学生)、“social”(社会)、“moral”(道德)等词汇的出现则表明如今更多的研究者在研究特定应用领域下的人机交互问题,例如智慧医疗和智慧教育。而由机器所产生的社会和道德问题同样也值得引人深思。

结合上述分析以及论文标题,可以概括出四个热门的研究方向,供读者参考。

1. 教育场景中的人工智能

例如“Learning to Use AI for Learning: How Can We Effectively Teach and Measure Prompting Literacy for K - 12 Students?”以及“RPKT: Learning What You Don’t -- Know Recursive Prerequisite Knowledge Tracing in Conversational AI Tutors for Personalized Learning”这两篇论文聚焦于教育场景。在K-12教育阶段,如何有效教授学生利用AI进行学习,以及衡量学生的提示素养成为关键问题。而对话式AI辅导中的递归先验知识追踪,旨在实现个性化学习。这反映出当下人机交互在教育领域的热点趋势:借助AI技术,打破传统教育的固定模式,根据每个学生的知识掌握情况和学习进度,量身定制学习路径,从而提升学习效率与质量。AI技术将成为教育领域的重要力量,为推动教育公平、实现因材施教提供强大的助力。​

2. 医疗领域的创新应用

医疗行业也因人机交互技术的进步而迎来变革。例如“LLM - Powered Virtual Patient Agents for Interactive Clinical Skills Training with Automated Feedback”提出利用大语言模型驱动的虚拟患者智能体,为临床技能训练提供交互式学习环境并自动反馈。这有助于医学生在模拟场景中反复练习,提升实践能力。这显示出人机交互在医疗培训方面的热点方向,即通过构建高度逼真的虚拟医疗场景,让医学生在无风险的环境中积累经验,缩短从理论学习到临床实践的差距,为未来医疗服务培养更优秀的专业人才。​

3. 混合现实的深入发展

人机交互领域中的混合现实或增强现实技术也是一大热点,例如“Bend It, Aim It, Tap It: Designing an On - Body Disambiguation Mechanism for Curve Selection in Mixed Reality”以及“Say It, See It: A Systematic Evaluation on Speech - Based 3D Content Generation Methods in Augmented Reality”等论文展示了丰富的研究成果。前者设计了用于混合现实中曲线选择的身体上消歧机制,后者对基于语音的增强现实3D内容生成方法进行了系统评估。作为一种可以将虚拟信息与真实世界深度融合的技术,混合现实技术当下的研究热点在于如何优化交互机制,让用户在混合现实环境中能够更自然、便捷地与虚拟元素进行交互,无论是通过身体动作还是语音指令,从而提升用户体验,推动混合现实技术在娱乐、教育、医疗等领域的广泛应用。​

4. 情感与伦理维度的考量

人机交互中的情感考量与伦理问题也成为研究热点。例如“’My Dataset of Love’ A Preliminary Mixed - Method Exploration of Human - AI Romantic Relationships” 探索人类与AI的浪漫关系,“Beyond Human Judgment: A Bayesian Evaluation of LLMs’ Moral Values Understanding”对大语言模型的道德价值观理解进行贝叶斯评估,“When AI Writes Back: Ethical Considerations by Physicians on AI - Drafted Patient Message Replies”则关注医生对AI生成的患者消息回复的伦理考量。随着人机交互的日益深入,人们不仅关注技术的功能性,更在意机器是否能理解人类情感,以及在交互过程中是否遵循道德伦理准则。如何让AI在情感交互上更加细腻、真实,同时确保AI应用符合人类的道德观念,成为人机交互领域亟待解决的重要课题。​

四、总结

人机交互领域的发展正呈现出多元化的特点。从教育到医疗,从混合现实到情感伦理,各个方向的研究百花齐放,共同推动着人机交互技术的不断突破。伴随着人工智能时代的到来,人机交互技术在当下的地位正在不断提升,值得大家重点关注。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐