Neurophotonics | NiReject:迈向功能性近红外光谱(fNIRS)的自动化坏道检测

 
 

 

功能性近红外光谱(functional near-infrared spectroscopy, fNIRS)近年来在认知神经科学、发展心理学与临床研究中迅速普及。由于其非侵入性、对运动相对友好以及能够应用于自然情境与多年龄人群,fNIRS 已成为 EEG 与 fMRI 之外的重要脑功能研究工具。然而,与这些优势并存的,是一个长期困扰研究者的核心问题——信号质量,尤其是坏道(bad channels)的识别。

 

Gerloff 等人在 2024 年发表于 《Neurophotonics》的论文"NiReject: toward automated bad channel detection in functional near-infrared spectroscopy" 中,系统性地探讨了坏道检测在 fNIRS 研究中的作用,并提出了一种新的自动化解决方案 NiReject。本文不仅提出方法,更重要的是首次以大规模实证与仿真研究,回答了 “坏道是否真的会影响研究结论” 、“现有方法是否可靠” 、“机器学习是否能带来实质性改进” 等关键问题。

 

一、

研究背景

 

 1.1 fNIRS 信号质量控制的核心瓶颈与技术突破方向

 

功能性近红外光谱(fNIRS)作为新兴无创光学神经成像技术,因适配日常场景、覆盖全人群及全年龄阶段的优势,已成为脑科学研究的核心工具。但其信号易受生理噪声、设备干扰、被试运动等多类因素影响,产生无法可靠分离大脑活动与噪声的 “坏道”,这类通道会给后续分析引入偏差,可能导致错误科研结论。当前主流检测方式存在显著局限:人工视觉检查主观性强、成本高,难以适配规模化研究;基于阈值的自动检测方法相关研究稀缺,无法应对复杂噪声场景,因此 fNIRS 领域迫切需要自动化、精准化的坏道检测方案。

 

1.2 传统检测方法:主观局限与技术瓶颈并存 

 

当前 fNIRS 坏道检测的主流方式仍依赖专家人工视觉检查,通过事后分析信号特征判定通道质量。该方法的核心缺陷在于主观性强,评估结果易受专家经验水平、指导标准及个人认知差异影响,且随着设备光极数量增加与样本量扩大,人工检测的时间成本与经济成本显著上升,已难以满足规模化研究需求。

为实现自动化检测,学界开发了基于统计指标的传统方法,核心逻辑是通过手动设定固定阈值区分可接受信号与异常信号。这类方法包括基于单一指标的变异系数(CoV)、头皮耦合指数(SCI)检测,以及结合多指标的 Phoebe 算法、信号质量指数(SQI)等组合方案。但传统自动检测方法仍存在显著局限:阈值设定依赖主观判断,需根据实验场景调整;多数指标仅能捕捉信号的少数特征,难以覆盖坏道的多元成因;检测性能稳定性不足,普遍存在假阳性率偏高的问题,实际应用价值受限。

 

1.3 机器学习技术:未被充分开发的潜力领域

 

机器学习技术的飞速发展,为坏道检测提供了新方向 —— 它无需手动设定阈值,能捕捉更复杂的数据模式,在多个领域的异常检测中表现突出。根据对专家标注数据(即 “地面真值”)的需求不同,相关算法可分为三类:无监督算法无需标注即可应用,人力成本低;半监督算法结合部分标注数据与无监督学习表征,既能利用专家经验,又能检测新型坏道;监督算法需大量标注数据训练,在小规模数据集上表现优于传统方法,但标注成本极高、可扩展性差。

遗憾的是,这些潜力在 fNIRS 领域尚未充分释放:无监督和半监督算法完全未被应用,仅有少数研究探索了监督算法,自动坏道检测的相关研究整体极为稀缺。

 

1.4 技术落地挑战:技术适配与评估难题

 

为填补领域空白,研究团队开发了可解释机器学习方法 NiReject,其基于多元累积分布函数的尾概率实现坏道事后检测,具备融合先验知识、提供可解释离散分数、支持无监督与半监督学习的核心特性。研究通过对比 17 种主流检测方法(含 6 种传统阈值法、11 种跨领域机器学习方法),结合 2 个独立标注真实数据集与模拟数据集,系统评估 NiReject 在不同场景下的性能,核心围绕四类问题展开:真实数据集表现、不同坏道现象适配性、数据集特征影响、混合方法实用性。总而言之,我们旨在通过以下问题,探究不同检测方法的性能、成本效益和实用性。

Q1:传统方法、无监督方法和半监督方法在真实数据集上的坏道检测表现如何?

Q2:不同坏道现象下,各检测方法的表现如何?

Q3:数据集特征(尤其是污染率、标注工作量和标注误差)对检测性能的影响如何?

Q4:整合人工反馈循环的混合检测方法,能否克服半监督方法的实际应用挑战?

 

二 

NiReject算法的实验设计

 

2.1 数据集设计:真实 + 合成双轨验证

 

实验采用 “真实数据集 + 合成数据集” 的双轨设计,确保检测方法在实际场景与受控条件下均能得到充分验证。

真实数据集选用两个独立标注的公开 fNIRS 数据集(R22 和 N21),累计包含 29,924 条信号,其中 R22 涵盖 34 名儿童和 68 名成人,采用 Hitachi ETG-4000 设备,10Hz 采样率,22 个前额叶通道,坏道污染率 4.22%;N21 涵盖 20 名儿童和 20 名成人,采用 NIRx NIRSport 设备(南京尖创科技为 NIRx 设备中国区代理商),7.81Hz 采样率,16 个前额叶与颞顶叶通道,坏道污染率 9.38%,两个数据集均经专家独立标注和一致性检验,剔除无效信号。

合成数据集则基于 fNIRS 信号物理生成机制构建 14 个数据集(S1-S14),S1-S13 分别聚焦尖峰、偏移、信号丢失等 5 类核心坏道现象,S14 模拟混合坏道场景,新增 9 个短距离通道,所有合成数据集均含 3 个静息块和 2 个任务块,坏道污染率均为 10%,信号结构与真实数据集一致,为精准评估不同坏道类型的检测效果提供可控基准。

 

2.2 模拟信号生成:优质信号与坏道现象构建

 

为深入分析检测方法的性能变异性,研究团队基于参考文献核心函数调整生成机制,模拟了包含真实生理特征与坏道现象的 fNIRS 信号。优质信号由四部分组成:加入空间和时间相关的白噪声,融入心率、呼吸和 Mayer 波等生理振荡并随机分配相位,通过卷积典型血流动力学反应函数编码神经激活信号,同时包含可通过伪影校正处理的常规噪声。针对 10% 的模拟信号(y=1),额外加入 5 类核心坏道现象:尖峰(振幅N(7,2),持续时间N(0.2 s,0.1 s),发生频率分 6、36、60 次 / 分钟)、单向 / 双向偏移(振幅N(4,2),发生频率分 12、24、36 次 / 分钟)、信号丢失(振幅为 0,持续时间分 1、5、10 秒)、跨发色团异常生理振荡(改变两波长心脏相关振荡耦合相位Δφphysio=−0.7),以及 S14 专属的混合坏道现象,所有坏道现象均时空随机分布,确保模拟信号的生态有效性。

 

图 1. 四种模拟的坏道现象。(a)尖峰、(b)偏移和(c)信号丢失采用线图呈现;(d)跨波长异常耦合通过小波相干性在时频空间中可视化,该异常耦合在心脏相关频段表现出低相干性。

 

2.3 检测方法选型:17 种对比方法 + NiReject 系列

 

为全面验证 NiReject 的创新优势,研究团队选取了 fNIRS 领域及跨领域的 17 种代表性检测方法作为对比基准,形成 “传统方法 - 跨领域方法 - 创新方法” 的三维对比体系。

fNIRS 领域传统检测方法共 6 种,均基于统计指标设定固定阈值,包括变异系数(CoV)、信噪比(SNR)、头皮耦合指数(SCI)、峰值功率、Phoebe 算法(组合 SCI 与峰值功率)和信号水平,均采用文献标准参数,广泛应用于主流 fNIRS 分析工具箱。

跨领域检测方法共 11 种,涵盖距离和密度型检测器(角度基异常检测 ABOD、k 近邻 k-NN 等 5 种)、无监督机器学习检测器(主成分分析 PCA、孤立森林 IFOREST 等 4 种)、半监督机器学习检测器(极端梯度提升异常检测 XGBOD、基于自编码器的 FEAWAD 等 2 种),均为其他领域表现优异但未应用于 fNIRS 的成熟方法。

 

2.4 创新检测器:NiReject 系列(无监督、半监督、混合版)

 

研究团队开发的核心检测方法 NiReject,基于多元累积分布函数的尾概率构建,兼具先验知识融合能力与结果可解释性,适配不同标注需求场景。

无监督 NiReject 无需专家标注,通过尾概率估计、受限尾概率质量特征提取、增强质量特征生成和确定性检测分数计算四大步骤,结合先验知识避免异常优质信号误判,输出可解释分数。

半监督 NiReject 基于无监督版本扩展,先对全量特征空间执行无监督步骤生成质量特征,融入通道空间位置信息形成表征,再以部分标注数据训练 XGBoost 分类器(适配不平衡数据),平衡专家经验与检测精度。

混合 NiReject 整合人工反馈循环,先通过无监督 NiReject 计算全量信号质量分数和二元分数,按分数分层随机推荐信号供专家标注,直至标注坏道与初始检测坏道比例达预设阈值(如 30%),再用标注数据训练半监督 NiReject,大幅降低标注成本。

 

图 2. 开发的 NiReject 方法示意图:(a)无监督版、(b)半监督版及(c)混合版 NiReject 分别展示了各算法步骤的流程框架;(d)无监督 NiReject 的质量指标示例,直观呈现了该算法如何提供检测确定性相关信息,以及检测器对特定信号做出决策所依据的特征。

 

2.5 实证评估:参数、指标与四大核心实验

 

实验采用标准化参数设置,所有对比方法使用默认参数并公开存储,NiReject 及跨领域方法采用统一输入特征集(含正弦信噪比与失真比、局部峰值比、CoV、SCI、心脏振荡峰值功率与中心频率等),确保公平对比。

测试集采用分层训练 - 测试分割(60% 训练、40% 测试),保持坏道比例一致,每个评估重复 10 次以降低偶然性,真实数据集以专家标注为 “地面真值”,合成数据集则先验已知坏道标签。

评估指标构建三维体系,核心性能指标以精确率(惩罚假阳性,适配不平衡数据)和 ROC-AUC 为主,稳健性指标采用精确率 - 召回率 AUC(AUC-PR),成本效益指标量化标注量与反馈成本。

围绕四大核心研究问题设计实验:Q1 基于 R22 和 N21 真实数据集,对比所有方法的检测表现并通过贝叶斯符号秩检验判断差异显著性;Q2 利用 S1-S13 合成数据集,评估不同方法对特定坏道现象的适配性;Q3 通过调整 R22 数据集的污染率(1%-50%)、标注量(0%-60%)和标注误差(0%-60%),测试方法稳健性;Q4 基于 S14 混合坏道数据集,验证混合 NiReject 的实用性及对不同专家标注的适配性。

 

三、

实验结果

 

3.1 前期基础:坏道检测的影响与领域现状

 

3.1.1 坏道检测对后续分析的关键影响

 

通过模拟数据集 S14(混合坏道现象)验证发现,坏道会严重扭曲 fNIRS 信号分析结果。在个体水平,未进行坏道检测时,血流动力学响应函数的均方误差(MSE)高达 80.04×10-12,而有效剔除坏道后 MSE 降至1.05×10-12,信号与理想响应函数的贴合度显著提升;在群体水平,基于广义线性模型(GLM)的分析显示,精确坏道检测能揭示前额叶皮层显著的左侧偏侧化效应,而未检测坏道时,16 个长距离通道中有 4 个通道的显著性消失、2 个通道显著性降低,1 个通道 P 值升高,直接导致研究结论偏差。

 

图 3. fNIRS 中的坏道检测:(a)基于 100 名被试的模拟信号,通过平均波形分析和 GLM 群体分析,结合 MSE 量化指标,证实坏道检测能显著提升血流动力学反应函数的拟合精度,有无检测的分析结果差异明显;(b) fNIRS 信号质量控制的现有检测方法应用现状;(c)明确了各类检测方法的工作流程特征,强调其对人工专家标注的依赖差异,且所有检测需在后续处理前完成信号的剔除或保留决策。

 

3.1.2 领域当前实践现状

 

对 2022 年引用量前 100 的 fNIRS 研究进行结构化文献检索发现,68% 的研究未报告任何坏道检测流程,仅 32% 的研究提及相关方法。当前主流检测方式以视觉检查(12%)、信噪比(SNR,11%)和变异系数(CoV,8%)为主,未发现任何研究应用无监督或半监督机器学习方法,仅有 2 项近期研究尝试了监督式机器学习。此外,研究报告透明度极低:仅 20% 的研究公开了检测参数,7% 报告了剔除的信号数量,3% 提及剔除的被试数量,仅 1 项研究提供了通道位置等详细剔除信息,领域标准化程度亟待提升。

 

3.2 Q1:真实数据集上的检测性能对比

 

基于 R22(坏道污染率 4.22%)和 N21(坏道污染率 9.38%)两个独立标注的真实数据集,所有方法的性能通过 10 次重复实验的均值与标准差量化,并经贝叶斯符号秩检验(差异 > 0.01 且可信度 90%)验证显著性。

核心结果显示,半监督 NiReject 以精确率排名 1.0 的表现脱颖而出,其精确率在 N21 和 R22 数据集中分别达到 72.94%±14.02% 和 76.93%±4.50%,与排名 2.0 的 XGBOD 性能无实际差异,但显著优于其他方法;头皮耦合指数(SCI)作为传统阈值法的代表,虽 ROC-AUC 表现突出(R22 数据集 85.26%±0.49%),但假阳性率高,精确率仅 13.45%±0.25%,实际实用性有限。无监督 NiReject 在无监督方法中表现最优,精确率(N21:39.95%±5.08%;R22:35.65%±3.90%)接近半监督方法 FEAWAD(排名 3.0),且显著优于孤立森林(IFOREST)、局部离群因子(LOF)等其他无监督算法。

运行时间方面,无监督 NiReject 跻身四大最快检测器之列(R22 数据集训练时间 1.15s、推理时间 3.57s);半监督 NiReject 的训练与推理效率远超同类方法,R22 数据集训练时间 44.40s、推理时间 3.00s,而 XGBOD 的训练时间长达 946.85s、推理时间 392.49s,差距达一个数量级。

 

图 4. 两个真实 fNIRS 数据集上的检测性能。

 

3.3 Q2:不同坏道现象下的适配性表现

 

利用 S1-S13 合成数据集(分别聚焦尖峰、偏移、信号丢失等 5 类单一坏道现象)的评估结果表明,传统阈值法和跨领域方法均存在明显的场景局限性:SCI 和 CoV 仅对 3 类坏道现象敏感,峰值功率(PeakPower)和 Phoebe 算法几乎无法可靠检测任何坏道类型,信号水平(SignalLevel)仅对单向偏移有响应。

唯一例外是 NiReject 系列算法,其中无监督 NiReject 是所有检测方法中唯一对所有 5 类坏道现象(尖峰、单向 / 双向偏移、信号丢失、跨发色团异常生理振荡)均保持高灵敏度的方法,其 ROC-AUC 和精确率在不同坏道强度下表现稳定,这也是其在真实数据集上性能卓越的核心原因。其他跨领域方法(如 HBOS、PCA)虽在部分现象中表现尚可,但均无法覆盖全部坏道类型,难以适配真实场景中复杂的信号污染情况。

 

 

图 5. 各坏道现象下的性能表现:展示了(a)ROC 曲线下面积(ROC-AUC)和(b)精确率在模拟数据集(S1-S13)上的彩色编码检测器结果。Y 轴表示性能指标值,X 轴对应每种坏道现象的不同强度等级。误差线代表标准误。仅无监督版 NiReject 对所有坏道现象均表现出敏感性。

 

3.4 Q3:数据集特征对检测性能的影响

 

3.4.1 污染率变化的影响

当真实数据集 R22 的坏道污染率在 1%-50% 范围内调整时,半监督 NiReject 是唯一性能随污染率提升而稳步优化的方法,其 ROC-AUC 和精确率均呈现持续上升趋势;XGBOD 在污染率 > 5% 后性能显著退化,ROC-AUC 大幅下降且波动剧烈,精确率在污染率 10% 达到峰值后持续回落;传统阈值法 SCI 的 ROC-AUC 保持恒定,但精确率的提升仅源于真实坏道数量增加,假阳性率并未降低,本质上未改善检测可靠性;无监督机器学习方法普遍对高污染率敏感,性能随污染率升高而明显下降。

3.4.2 标注量变化的影响

对半监督方法而言,标注量(γ,训练集中标注坏道占总坏道的比例)对性能有显著影响:半监督 NiReject 和 XGBOD 在 γ≥30% 时达到性能饱和,AUC-PR 不再明显提升;FEAWAD 仅需 3%-6% 的标注量即可达到性能峰值,但整体 AUC-PR 远低于前两者,无法满足高精度检测需求。这一结果为实际应用提供了明确指导:半监督 NiReject 只需标注 30% 的坏道即可充分发挥性能,大幅降低标注成本。

3.4.3 标注误差的影响

所有半监督检测器对专家标注误差均具有一定耐受性:当标注误差≤15% 时,半监督 NiReject、XGBOD 和 FEAWAD 的 AUC-PR 基本保持稳定,无显著下降;但当误差 > 15% 后,所有方法的性能均急剧下滑,其中 FEAWAD 的抗干扰能力相对最弱,而半监督 NiReject 和 XGBOD 仍保持相对更优的稳定性,表明其对少量标注误差的鲁棒性更强。

 

 

图 6. 不同数据集特征下的性能评估:该图包含四个线图,误差线代表标准误。

 

3.5 Q4:混合 NiReject 的实用性验证

 

基于 S14 混合坏道数据集的评估显示,整合人工反馈循环的混合 NiReject 表现优异:与无监督 NiReject 相比,其 ROC-AUC 和精确率均显著提升,其中在两位专家标注下,精确率分别从 43.33%、44.0% 提升至 62.43%、84.75%,ROC-AUC 从 72.22%、72.67% 提升至 89.20%、84.75%。

 

混合 NiReject 的核心优势在于极低的标注成本:两位专家仅需分别标注 14.8% 和 21.32% 的信号,即可达到理想性能,远低于监督式方法 75% 的标注需求。此外,专家标注的精确率(95.56%、72.78%)虽高于混合模型,但混合 NiReject 平衡了检测性能与人力成本,且可解释性强,为实际研究提供了 “高精度 + 低成本” 的最优解。

 

图 7. 基于含已知可接受通道和坏道的合成数据,对混合检测系统及专家评分的性能评估:(a)利用人工反馈循环的混合版 NiReject,其精确率和 ROC-AUC 较无监督版 NiReject 均有提升。每种检测器均包含两个实例,分别基于评估者 I(蓝色)或评估者 II(绿色)参与的采样。(b)两位评估者的评分性能:与混合版和无监督版检测器相比,人工专家评分对合成生成坏道的检测性能更高,但不同评估者之间的性能存在差异。

 

四、

总结

 机器学习驱动的 NiReject 系列算法为 fNIRS 坏道检测提供了可靠的自动化解决方案,显著超越传统阈值法与现有跨领域机器学习方法。在真实数据集上,半监督 NiReject 以精准率排名第一的表现脱颖而出,无监督 NiReject 则在无标注场景下展现出接近部分半监督方法的性能,且两者均具备高效运行优势,训练与推理时间远低于同类算法。关键优势在于 NiReject 是唯一对所有 5 类核心坏道现象(尖峰、偏移、信号丢失等)保持高灵敏度的方法,而传统阈值法仅对特定噪声有效,这也是其在复杂真实场景中表现卓越的核心原因。此外,半监督 NiReject 在 1%-50% 的污染率范围内性能稳步优化,仅需 30% 的标注量即可达到性能饱和,且对 15% 以内的标注误差具有耐受性,平衡了检测精度与实际应用成本;混合 NiReject 通过人工反馈循环,仅需标注 14.8%-21.3% 的信号即可接近全标注效果,大幅降低了人力成本。

 

该研究不仅填补了 fNIRS 领域无监督与半监督机器学习坏道检测的空白,还为领域标准化提供了关键支撑 —— 提出的坏道检测报告模板,明确了检测方法、参数、坏道比例等核心报告要素,提升了研究的透明度与可重复性。同时,研究也指出了现有局限:传统阈值法的阈值选择缺乏统一标准,年龄差异对检测性能的影响尚未系统探索,短距离坏道对长距离通道的干扰仍需针对性解决方案。未来研究可聚焦三大方向:开发适配不同年龄群体的专用检测模型,探索短距离坏道的单独检测方法,整合视频、加速度计等多模态数据提升运动伪影识别能力,并推动在线实时检测版本的开发,以适配脑机接口、神经反馈等动态场景。

 

参考文献:Gerloff, C., Yücel, M. A., Mehlem, L., Konrad, K., & Reindl, V. (2024). NiReject: toward automated bad channel detection in functional near-infrared spectroscopy. Neurophotonics, 11(4), 045008-045008.

 
南京尖创科技有限公司
 
 
 
 
 
 
 
 

     一家科研设备供应商及科研技术服务公司,公司致力于为神经科学和脑科学及运动领域研究提供卓越的解决方案及后续技术服务。我们的产品线涵盖了近红外脑成像系统、便携式脑电设备、生理多参数仪器、眼动仪、电刺激设备、生物力学跑台以及自行车训练台等领域,为用户提供高品质、高性能的科研工具

 

 
主要客户
 
 
 
 
 
 
 
 

    南京尖创科技有限公司秉承质量至上,精益求精的服务理念,现已为北京大学,北京师范大学,复旦大学,浙江大学,中国科学技术大学,南京大学,天津大学,深圳大学 ,南京理工大学,东南大学,河南大学,北京理工大学,西安交通大学,中国兵器集团兵器研究所,中国电子科技集团等超过五十所国内高校和科研院所提供了完备的产品服务


 

图片
 

 

打造公司的核心竞争力,成就专业的行业品牌,提供有价值的行业服务。

首页    产品出版物    Neurophotonics | NiReject:迈向功能性近红外光谱(fNIRS)的自动化坏道检测