从交互到感知:眼动,成为机器读懂人的核心信号

八月的长沙,暑气正盛。

湖南佳兴世尊酒店的会议大厅里,数百位来自全国高校和科研院所的学者围坐在一起,讨论的并不是某个具体算法或某款产品,而是一个更底层的问题:当机器越来越智能,它究竟该如何"感知"人?

这是第二届中国人机计算大会(HMCC 2026)暨第二十二届和谐人机环境联合学术会议(HHME 2026)的现场。大会由中国计算机学会主办,湖南大学承办,以"人机协同"为核心主题。七鑫易维作为大会赞助单位,也带着自己的眼动追踪技术和产品来到了长沙。

三天的会议,几十场报告和论坛,反复出现一个关键词:感知”。

这并非偶然。当人机关系从"人操作机器"走向"机器协同人",一个绕不开的问题浮出水面:机器要想真正与人协同,首先得"看见"人——看见人的注意力在哪里,看见人在关注什么,看见人没有说出口的意图。

而眼动,恰恰是打开这扇门的钥匙。

 

"交互"走向"感知"

过去几十年,人机交互的核心命题是"人如何更好地操作机器"——键盘、鼠标、触屏、语音,本质上都是人向机器发出指令。

但本届大会传递出的信号明显不同。

本届大会的多场主题报告,都将“感知—理解—交互—协同”作为重要议题。

中国科学院院士、长安大学校长李树涛在《多模信息融合感知与人机智能交互》报告中指出,多模态信息融合感知与人机交互面临多模态信息异构、情感认知不一致以及意图表达多样模糊等问题,并介绍了多模态图像融合、多模态情感分析、多模态行为意图理解、视觉问答智能体等关键技术及其在智能驾驶、医疗健康、无人装备等领域的应用。在这一技术体系中,眼动所提供的信息具有一个非常独特的价值—它不是单纯记录“人做了什么”,而是进一步提供“人在看什么、关注什么、如何在视觉信息之间进行切换”等行为线索。


为什么是眼动?

在所有感知人的途径中,眼动是一个特殊的存在。

语音告诉你人"说了什么",手势告诉你人"做了什么",面部表情可能透露人的情绪状态。但眼动记录的,是更底层的信息——人在看什么、关注什么、如何在视觉信息之间切换,以及在这个过程中,注意力是如何分配的。

 

这些信息,往往是人自己都意识不到的。

 

在传统研究中,了解一个人的视觉注意,通常依赖问卷、访谈或事后回忆。但回忆是不可靠的——人很难准确说出自己在看某张网页或某个场景时,目光究竟停留了多久、按什么顺序移动。眼动追踪则直接记录这些行为,转化为注视点、视线路径、注视时长等可量化数据。

这意味着,原本隐性的视觉行为,第一次变得可计算、可分析、可建模。

当这些数据与语音、动作、环境等其他模态融合时,机器对人的理解就能从"动作识别"进入更细粒度的行为分析。这也是为什么,在以人为中心的计算、具身智能、可穿戴计算等方向中,眼动追踪正从单一的数据采集工具,逐渐演变为连接"人"与"智能系统"的感知接口。


从研究工具到感知基础设施

如果把时间线拉长,眼动追踪的角色正在发生一次根本性的转变。

 

在实验室时代,眼动仪是研究人员的工具——固定在桌面上,精密但昂贵,服务于心理学实验和认知科学研究。研究者用它回答"人是如何加工视觉信息的"。

但今天,眼动追踪正在走出实验室,进入真实世界。

在移动场景中,眼镜式眼动仪让人在自然行走、操作、交流的同时完成数据采集——被试者甚至不需要意识到自己正在被记录。在需要高精度视觉行为记录的神经科学和运动科学中,高速眼动产品能够捕捉到肉眼无法分辨的微眼动和快速眼跳。在屏幕交互和用户体验研究中,便携式眼动仪让研究者可以在真实的办公环境、零售场景或车载环境中,记录人面对屏幕时的视觉行为。

这些并不是抽象的产品分类,而是真实的研究场景。面对不同的人机计算问题,研究者需要的"感知窗口"也不同——有时需要固定场景下的高精度,有时需要移动场景下的自然性,有时则需要极端条件下的高速记录。

 

七鑫易维正是沿着这条路径构建了自己的产品体系。从桌面式到便携式,从眼镜式到XR设备,覆盖的不仅是产品形态,更是从实验室到真实世界的不同研究场景。其技术能力中强调的高精度、低延迟和高可用率,指向的也是同一个目标:让眼动数据足够准确、足够实时、足够可靠,以至于可以被信任、被依赖、被集成进更大的人机系统。

当眼动数据的质量达到系统级要求时,它的角色就不再是"研究工具",而是"感知基础设施"——就像摄像头之于自动驾驶,麦克风之于语音助手,眼动追踪正在成为智能系统感知人的基础能力之一。


当眼动遇上AI、XR与空间计算

大会的另一条线索,是技术趋势的加速交汇。

 

《原生全模态大模型》报告讨论了文本、图像、视频、音频的统一建模;"大模型时代的智能协同"论坛则关注从感知到服务、从单点智能到系统协同的路径。对于这样的智能系统,未来真正重要的不只是模型能处理多少数据,更在于能否获得足够真实、连续、能反映人状态的感知数据。

 

眼动,正是这样一类天然的信号源。

XR和空间计算中,眼动的价值已经得到验证。注视点渲染通过追踪用户视线,只对视野中心区域进行高精度渲染,大幅降低算力消耗;眼控交互让用户用目光完成选择和操作;在虚拟社交中,眼动数据甚至可以还原真实的眼神交流。七鑫易维在XR领域的方案已覆盖这三个方向。

智能驾驶中,车载DMS通过眼动追踪实时监测驾驶员的注视方向、疲劳状态和分心行为,是眼动技术走向大规模量产的标志性场景。

教育与认知研究领域,眼动数据能够揭示学习者的注意力分布、阅读策略和认知负荷,为个性化教学提供数据依据。在医疗场景中,眼动追踪已应用于辅助沟通、认知评估和康复训练。

当这些场景开始同时需要"感知人"的能力时,眼动追踪就不再局限于某一个垂直领域,而开始成为横跨AI、XR、智能驾驶、机器人和具身智能的共性技术需求。

这正是七鑫易维在展台上想要传递的信息:眼动追踪不是某一类设备的功能,而是下一代人机系统的感知底座。


十七年,只做一件事

七鑫易维的故事,在这个背景下变得清晰起来。

2009年成立,至今十七年。在国内眼动追踪领域,七鑫易维是最早进入并持续坚持的公司之一。从核心算法、硬件设备到数据分析和行业应用,形成了完整的技术链路。高精度、低延迟、高可用率,加上自主可控的国产化能力和全球知识产权布局——这些技术指标的背后,是十七年的持续投入。

十七年时间,眼动追踪从一个冷门的科研仪器领域,逐渐走到AI、XR、智能驾驶具身智能的技术交汇点上。七鑫易维的产品也从科研眼动仪,扩展到眼镜式移动设备、XR眼动模组、AI眼镜方案和行业解决方案。

这不是运气,而是判断。

当行业还没有意识到"感知人"会成为人机协同的瓶颈时,七鑫易维已经在做这件事了。而当大模型、空间计算和具身智能开始集体呼唤感知能力时,眼动追踪的技术积累,恰好站在了这个交汇点上。

对于快速发展的中国人机计算产业而言,眼动追踪的意义不仅在于应用场景的增加,更在于核心技术的自主掌握。


让机器"看见"人

会议展台上,许多参展人员体验了七鑫易维的aSee Pro Plus高精度眼动仪。当他们完成屏幕阅读任务时,自己的注视轨迹被实时记录下来——看了哪里、停留多久、注意力如何转移,都被清晰地呈现在屏幕上。

很多人盯着热力图看了很久,都会说一句:“原来我的眼睛是这样看东西的。”

这看似简单的一句话,恰恰揭示了眼动追踪更大的价值:让人看见自己的注意力,也让机器开始看见人的注意力。

过去,人机交互更多依赖键盘、鼠标、触控等主动操作,由人去适应机器。而随着AI的发展,机器正在获得越来越强的计算和理解能力,人机交互也开始从“让人适应机器”,走向“让机器理解人”。

而理解人的第一步,是感知人。

眼动正是其中一个重要信号。人的视线并不是随机移动的,它与注意、兴趣、认知、判断和行为决策紧密相关。通过眼动追踪,机器能够持续获取人的视觉行为信息,知道用户正在看什么、关注什么、什么时候转移注意力,以及面对不同信息时产生了怎样的反应。

当这种能力被集成到不同终端中,眼动就不再只是实验室里的研究工具,而开始成为机器感知人的一种基础能力。

小到AI眼镜,机器可以通过眼动知道用户正在关注哪里,并进一步结合AI实现注视点交互、注视点渲染,让设备的响应更加贴近用户当下的意图。在更具身的交互场景中,眼动也可以与头部姿态、手势、语音等多模态信息结合,让机器不仅“看到人看哪里”,更进一步理解“人想做什么”。

延伸到平板、电脑等智能终端,眼动可以帮助机器理解用户正在浏览什么、哪些内容真正吸引注意,从而让交互从“点击后响应”逐渐走向“感知后响应”。当这种感知能力进一步进入具身智能系统,机器就可以将人的视觉注意与环境信息结合起来,判断用户当前关注的目标,并辅助机器人完成取物、操作、协作等任务,让“理解人”真正进入行动层面。

再到智能座舱,眼动能够参与驾驶员注意状态与视觉行为的感知,帮助系统判断驾驶者正在关注道路、仪表还是其他区域,让座舱具备更接近人的感知能力。

而在具身智能这一新兴赛道中,眼动追踪则可以成为机器学习“如何观察、如何关注、如何行动”的重要数据来源。通过采集人在真实任务中的注视位置、视线转移和视觉关注顺序,可以为具身智能模型提供更贴近人的视觉行为数据,帮助机器学习人是先看什么、再看什么,以及看到什么之后采取什么行动。从而让具身智能的训练,不只是学习环境中的“物”,也开始学习人的视觉习惯与行为逻辑。

AI眼镜、平板、电脑到智能座舱,再到具身智能训练,终端和应用场景不断扩展,但背后的逻辑正在变得越来越清晰:眼动让机器获得了一个理解人类视觉行为的重要窗口,也让“感知人”从终端交互进一步延伸到了智能机器的训练与学习。

这也是七鑫易维十七年来持续深耕的方向——推动眼动从“研究工具”走向“机器的感知能力”。

当眼动真正融入机器,交互的下一步,或许不再只是“人告诉机器我要什么”,而是机器能够从人的视觉行为中,提前理解:我正在看什么,我在关注什么,以及我真正想要什么。

2026年8月26日 10:35