多模态数据集支撑下的 VR 晕动症识别研究:基于脑连接图表示的对比学习方案

 

 

 

你是否有过这样的体验,戴上 VR 设备沉浸式玩游戏、学技能,没一会儿就头晕恶心、浑身不适?这种 “VR 晕动症”(Cybersickness)是制约虚拟现实普及的关键痛点,它源于视觉感知与身体运动的感官冲突,严重影响用户体验。北京航空航天大学联合清华大学研究团队发表于《IEEE Transactions on Visualization and Computer Graphics》(IF=6.5)的这项研究,提出了一种基于脑连接图表示(BCGR)的多模态对比学习方法,成功实现了晕动症的高精度识别,为解决这一难题提供了全新思路!

 

 

摘要

VR 晕动症(Cybersickness)严重影响 VR 用户的舒适度与沉浸感,利用生理、视觉和运动数据实现晕动症的有效识别,是缓解该问题的关键前提。然而,现有方法多采用直接的跨模态特征融合,因未能充分建模模态间的内在关系,导致识别准确率受限。本文提出一种用于晕动症识别的多模态对比学习方法:首先,引入创新的脑连接图表示(Brain Connectivity Graph Representation, BCGR),该图结构表示可捕捉跨模态的晕动症相关连接模式,并构建三类 BCGR 实例 —— 基于 EEG 信号的 E-BCGR、基于视频和运动数据的 MV-BCGR,以及通过所提标准化分解算法得到的 S-BCGR;其次,提出连接约束对比融合模块,通过图对比学习将 E-BCGR 与 MV-BCGR 对齐到共享特征空间,同时以 S-BCGR 作为连接约束提升表示质量;此外,构建了包含同步 EEG、视频和运动数据的多模态晕动症数据集,以推动该领域的进一步研究。实验结果表明,该方法在准确率、灵敏度、特异性和曲线下面积(AUC)四大关键评估指标上,均优于现有最先进方法。
 

 

相关研究现状

1. 视频数据驱动方法:聚焦视觉刺激,忽略个体差异

 

视觉刺激是引发晕动症的核心诱因(感官冲突理论核心),这类方法直接从 VR 视频中提取关键特征实现识别。研究人员会捕捉视频中的运动轨迹、深度信息、光学流等,通过卷积神经网络(CNN)、3D-CNN 等模型建模,验证了视觉内容与晕动症的强关联性。但这类方法仅关注客观视频特征,忽略了用户对视觉刺激的个体差异化反应,实际场景中识别准确率易受影响。
 
2. 生理信号驱动方法:直接反映神经状态,单模态易受干扰
 
这类方法借助 EEG、GSR、心率等生理信号,直接捕捉晕动症引发的身体状态变化。其中 EEG 因能反映多脑区协同异常等核心神经活动,成为研究热点 —— 通过傅里叶变换提取功率谱密度特征、结合 LSTM 模型等,实现了一定的识别精度。此外,个性化生理模型已被证实能提升识别效果,但单一生理模态易受环境噪声、个体生理波动干扰,且无法体现视觉刺激与身体运动的交互作用。
 
3. 运动数据驱动方法:量化身体动作,缺乏场景关联
 
运动数据直接反映用户在 VR 中的身体反馈(如头部运动、眼动、位置姿态),与前庭系统感知紧密相关。研究通过支持向量机、位置姿态估计算法等,挖掘运动参数与晕动症的关联,甚至发现眼动、视动后震颤(OKAN)等可作为晕动症易感的客观指标。但这类方法仅依赖运动参数,难以关联虚拟环境的视觉特征,无法全面解释晕动症的发生机制,识别场景受限。
 
4. 多模态融合方法:多源数据互补,融合机制不足
 
为克服单模态局限,多模态融合成为主流方向,常见组合包括 “EEG + 头部运动” 和 “视频 + 眼动 + 皮肤电”“头部运动 + 视觉复杂度” 等。方法上,研究人员采用 LSTM 网络、注意力机制、深度融合层等整合多源特征,证实了多模态数据的互补价值。但核心瓶颈未解决:多数方法仍停留在简单的特征拼接或堆叠,未能有效建模模态间的内在协同关系;同时对个体差异的考量不足,导致模型泛化能力和识别精度难以突破。
 
综上,现有研究已验证视频、生理、运动三类数据与晕动症的关联性,但单模态覆盖不全、多模态融合低效的问题,仍需更创新的技术方案破解 —— 这也正是本研究的核心突破点。

 

 

核心创新

1. 创新脑连接图表示(BCGR):让多模态数据 “说同一种语言”

 

研究首次提出脑连接图表示(Brain Connectivity Graph Representation, BCGR),将不同模态的数据统一编码为符合脑连接逻辑的图结构,实现跨模态的有效对齐。BCGR 包含三个关键实例。
① E-BCGR:基于 EEG 信号构建,捕捉与晕动症相关的脑功能连接模式。研究按性别分组训练动态图卷积网络(DGCNNs),减少组内差异,让连接模式更稳定;
② MV-BCGR:通过神经先验注意力编码器(NPAE),将视频(视觉刺激)和运动数据(身体动作)映射为脑连接图结构。NPAE 利用神经科学先验知识,强化运动皮层、视觉皮层等关键脑区的连接特征,让非神经数据也能贴合脑加工机制;      
图 1. NPAE 的详细架构。输入为视频数据、光流数据以及通过视频数据计算得到的运动数据,三者经编码器编码后,再通过先验注意力机制处理,最终输出 MV-BCGR。
 
 
图 2. 基于 10-20 系统的脑区可视化呈现,其中中央区域及其对应节点用红色标记,顶叶区域及节点用绿色标记,枕叶区域及节点用蓝色标记。
 
③ S-BCGR:通过标准化分解算法(SDA)从 E-BCGR 中提取共性特征,剔除个体特异性噪声,保留晕动症相关的核心连接模式,为多模态融合提供统一约束。
这种图结构表示的优势在于:既符合大脑的神经连接特性,又能让不同模态的数据在同一维度下融合,解决了传统特征融合 “语言不通” 的问题。
图 3. 按性别分组的 E-BCGR、构建的 S-BCGR 及其差异
 
2. 连接约束对比融合(CCCF):让多模态特征 “深度协同”
 
为了最大化多模态数据的互补价值,研究设计了连接约束对比融合模块(CCCF)。首先通过对比学习,将 E-BCGR(脑电)和 MV-BCGR(视频 + 运动)对齐到共享特征空间,最大化正样本相似度、最小化负样本干扰;以 S-BCGR 为连接约束,通过度中心性约束和二进制约束,确保融合后的特征既保留各模态优势,又符合脑连接的生理逻辑;最终输出的融合特征经过 MLP 分类器,实现晕动症的精准识别(判断是否出现晕动症)。
 
3. 多模态数据集构建:为模型训练提供高质量支撑
 
研究团队构建了首个包含同步脑电图(EEG)、视频和运动数据的晕动症数据集,解决了该领域数据匮乏的问题。
 
(1)虚拟环境设计
研究基于 Unity 引擎搭建了 25m×25m 的沉浸式户外虚拟场景,场景中随机分布红色目标球体,受试者需通过手柄导航寻找 20 个目标完成任务。系统通过调节移动速度、加速度等参数诱导晕动症,同步记录数据及症状发生时段。
图 4. 设计的虚拟环境中的一个视角
 
(2)实验设备
VR 交互设备:Pico 4 Ultra 头显(单眼 90Hz 刷新率,105° 视场角)+ 双手柄,提供流畅沉浸式体验;
EEG 设备:Smarting Pro 32 通道设备(mBrainTrain, Serbia,南京尖创科技为该产品中国区代理商),500Hz 采样率,电极阻抗全程控制在 5kΩ 以下,确保神经信号高质量采集;
视频采集:通过 Pico 开发者平台录制第一视角视频,60 帧 / 秒帧率 + 3840×2160 分辨率,完整还原视觉刺激;
运动数据:借助 Unity 内置接口采集,30Hz 频率,记录位置、速度、加速度、旋转运动等关键参数。
同步方案:采用硬件触发标记,实现三类数据的毫秒级对齐,解决跨设备数据不同步的核心问题。
 
图 5. 数据集收集与清洗流程
 
(3)受试者
29 名健康成年人(17 男 12 女,年龄 21-26 岁),均有 VR 使用经验,排除极端晕动症易感人群,最终 28 人完成实验。
 
(4)数据采集流程
基线校准:实验前先进行 5 分钟基线记录,受试者静息观看黑屏,后续数据均基于基线进行校正,消除个体差异;
同步启动:受试者按下手柄扳机键,同步触发 EEG、视频、运动数据录制,确保时间戳一致;
症状标注:受试者出现晕动症状时,长按扳机键直至症状缓解,精准标记症状发生时段;
实验时长:单轮实验 5-7 分钟,因导航参数、目标分布等存在随机差异,时长略有浮动,受试者可随时因不适退出(最终 1 名受试者因严重不适数据被排除,有效数据来自 28 人)。
 
(5)数据清洗
基础处理:剔除低质量数据(信号伪影、运动畸变)和缺失数据,通过四分位距(IQR)法移除异常值;
模态专属预处理:EEG 数据经重采样(128Hz)、乳突参考、0.1-30Hz 带通滤波、独立成分分析(ICA)去伪影;视频数据标准化为 30 帧 / 秒、256×256 分辨率,剔除黑屏、参数设置界面等无效片段;运动数据下采样至 30Hz,统一编码格式;
同步与对齐:通过硬件触发标记完成三类数据的时间戳对齐,分段为 1 秒时长的样本,确保多模态数据一一对应;
类别平衡:训练集划分时采用分层采样,保留晕动症事件的代表性分布,避免模型偏倚。
 

 

实验结果

研究通过留一交叉验证(LOOCV)评估模型性能,并与 7 种现有顶尖方法对比,结果十分亮眼。
 
1. 核心指标
 
模型准确率达 84.17%,特异性 84.18%,AUC(曲线下面积)高达 92.22%,相较于现有方法,准确率提升 0.54%-11.95%,AUC 提升 0.86%-18.71%;

 

2. 消融实验

 
模态消融:三模态(EEG + 视频 + 运动)融合的性能远超单模态和双模态组合,证明多模态数据的互补性;其中,视频模态单独表现最佳(准确率 78.71%),EEG 与运动数据组合的互补性最强(准确率 79.49%);
模块消融:移除 S-BCGR、NPAE 或 CCCF 任一模块,模型准确率均下降 2%-4%,证实三大核心模块的不可或缺性。
图 6. 应用 NPAE 前后 MV-BCGR 邻接矩阵的可视化
 
3. 可视化验证
 
S-BCGR 的有效性:成功过滤了前额叶等与晕动症无关的脑区连接,保留了运动皮层、视觉皮层的核心连接模式;
NPAE 的增强效果:显著放大了视频和运动数据中与脑功能相关的连接特征;
CCCF 的融合效果:将原本混杂的跨模态特征分离为清晰的 “晕动症” 与 “非晕动症” 聚类,决策边界显著提升。
 
                                         图 7. 初始特征与经 CCCF 模块得到的特征对比
 

 

本文提出了一种用于 VR 晕动症识别的多模态对比学习框架,核心以脑连接图表示(BCGR)为基础 —— 构建 E-BCGR(EEG 信号)、MV-BCGR(视频 + 运动数据)、S-BCGR(标准化共性特征)三类实例,搭配连接约束对比融合(CCCF)模块将跨模态特征对齐到共享空间,有效整合了神经、视觉、运动三类核心数据的互补价值。实验结果显示,该方法在准确率(84.17%)、灵敏度(85.09%)、特异性(84.18%)和 AUC(92.22%)四大指标上均显著优于现有最先进方法,其中准确率提升 0.54%~11.95%,AUC 提升 0.86%~18.71%,充分验证了其在多模态晕动症识别中的有效性。同时,研究也指出了现有局限:受数据采集方案限制,数据集仅包含 “晕动症有无” 的二分类标签,无法支持严重程度预测;受设备条件约束,未纳入皮肤电、眼动等对晕动症评估有重要作用的生理信号。未来将通过非侵入式标注或实验后自我评估收集连续标签,纳入眼动、皮肤电等更多生理模态,并在多样化自然 VR 场景中采集数据,进一步提升模型的预测能力、可解释性与实际应用适配性。

 

文献来源:Wang, P., Li, M., Wang, Z., Liu, Y. J., & Wang, L. (2025). Multimodal Contrastive Learning for Cybersickness Recognition Using Brain Connectivity Graph Representation. IEEE Transactions on Visualization and Computer Graphics.

 

南京尖创科技有限公司
 
 
 
 
 
 
 
 

     一家科研设备供应商及科研技术服务公司,公司致力于为神经科学和脑科学及运动领域研究提供卓越的解决方案及后续技术服务。我们的产品线涵盖了近红外脑成像系统、便携式脑电设备、生理多参数仪器、眼动仪、电刺激设备、生物力学跑台以及自行车训练台等领域,为用户提供高品质、高性能的科研工具

 

 
主要客户
 
 
 
 
 
 
 
 

    南京尖创科技有限公司秉承质量至上,精益求精的服务理念,现已为北京大学,北京师范大学,复旦大学,浙江大学,中国科学技术大学,南京大学,天津大学,深圳大学 ,南京理工大学,东南大学,河南大学,北京理工大学,西安交通大学,中国兵器集团兵器研究所,中国电子科技集团等超过五十所国内高校和科研院所提供了完备的产品服务


 

图片
 

 

打造公司的核心竞争力,成就专业的行业品牌,提供有价值的行业服务。

首页    产品出版物    多模态数据集支撑下的 VR 晕动症识别研究:基于脑连接图表示的对比学习方案