03_公众号推文
EEGManyPipelines同一份 EEG 数据168 个团队的结果能差多大把同一份 EEG 数据交给 168 个团队要求他们检验相同的三个假设最终没有任何两条完整流程完全相同。更重要的是分析团队带来的 ERP 波形变异与参与者间变异处在相近尺度但平均仍有 76.9% 的团队对效应存在形成共识。摘要EEGManyPipelines 计划汇集了 396 名研究者组成的 168 个团队让各团队使用本实验室的常规流程独立处理同一份连续 EEG 数据并检验三个 ERP 假设。结果显示团队在滤波、参考、伪迹处理、通道与时间窗选择及统计方法上广泛分歧根据各团队提交的预处理数据统一计算差异波后团队间变异与参与者间变异总体处于相近尺度。参考方式、高通截止频率及坏成分选择方式分别解释了三个假设差异波变异的 53%、75% 和 51%而流程选择对团队报告 p 值的解释率只有 0%–13%。尽管底层波形高度分散三个假设平均仍有 76.9% 的团队认为效应存在。研究表明定性结论的共识可以与效应估计的不确定性同时存在完整报告流程、代码和连续效应指标是理解这种不确定性的前提。背景多分析者研究通常把同一份数据交给不同研究者用来观察分析选择如何改变结论。但既往不少项目提供的是已经整理或处理好的数据原始团队作出的滤波、清理和数据准备决定早已嵌入其中。研究者只能比较后续统计模型无法看到完整数据处理流程的差异。这也可能解释为什么此前一些多分析者项目只能解释不足 10% 的结果变异。EEG 特别适合检验这一问题。从连续电位到最终 ERP研究者需要决定高通和低通设置、参考方式、分段时机、基线校正、坏段与坏通道处理、ICA 成分选择以及分析哪些电极和时间窗。这些选择并非彼此独立执行顺序也会改变数据。EEGManyPipelines 因此没有规定统一管线而是要求团队使用自己日常真正采用的流程。图 1 各团队的 EEG 预处理与分析选择。A 为预处理步骤B 为三个假设对应的分析步骤C 为标准化熵指数数值越接近 1表示团队选择越分散。来源Cesnaite 等原文图 1。方法原始数据来自 33 名参与者完成连续再认记忆任务时的 EEG。参与者观看人造或自然场景图片并判断图片是首次出现还是重复出现。EEG 使用 BioSemi ActiveTwo 记录包括 64 个头皮电极、两个乳突电极和眼电通道原始采样率为 1024 Hz。分发前数据被参考到 POz、降采样至 512 Hz 并转为 BIDS但没有进一步清除伪迹。168 个团队检验三个假设。H1 比较人造与自然场景的 N1H2 比较新旧图片在额中央通道 300–500 ms 内的电位H3 比较旧图片命中与漏报不限制通道和时间。团队需要提交二元结论、统计结果、流程问卷、分析代码或 GUI 操作说明以及逐试次预处理数据。指导委员会还把问卷与代码进行核对出现不一致时以代码为准因此不仅能够比较团队自己报告的 p 值也能使用统一方法重新计算 ERP 差异波。结果没有两条完整流程完全相同团队最常使用 EEGLAB、MNE-Python 和 FieldTrip但在参考、高通截止频率、ICA 算法、坏成分选择、参与者排除和统计模型上都存在明显分歧。H1、H2 中是否跨通道平均和是否进行多重比较校正几乎达到最大分歧。即使 H2 已明确规定额中央区域和 300–500 ms仍有团队分析规定区域或时间窗之外的数据。作者还根据步骤之间的转移概率定义了一条典型顺序即高通、低通、分段、基线校正和片段排除。各团队与该五步顺序的平均 Levenshtein 距离为 4.69说明多数流程在步骤增删或顺序上都有较大偏离。不过典型只表示常见并不表示这条流程在方法学上最好。多数团队确认效应但得到的不是同一种波形三个假设平均有 76.9% 的团队认为效应得到支持。从二元结论看这似乎是相当稳定的共识。但当研究者进一步比较 p 值、显著通道、时间窗和统一计算的差异波时结果出现了明显分散。H3 因假设开放团队报告的显著位置和时间范围最广H1、H2 即使约束更明确团队选择仍不完全一致。图 2 三项 ERP 假设的团队确认率、p 值分布、显著通道、时间窗和差异波。F 面板中每条线代表一个团队根据自身预处理数据得到的条件差异。来源Cesnaite 等原文图 3。二元共识因此不能被理解为团队得到了相同结果。以 H1 为例研究统一定义人造场景减自然场景的 N1 差异。使用平均参考或乳突参考的团队通常得到正向差异保留 POz 参考的 25 个团队却得到相反方向。也就是说同一数据和同一假设在不同参考下不仅振幅会改变条件差异方向也可能翻转。团队间变异与参与者间变异处于相近尺度研究者在 CPz 比较了 H1 总平均 ERP 和差异波的两类变异。一类是先跨团队平均再观察 33 名参与者之间的差异另一类是先跨参与者平均再观察不同团队之间的差异。两类波形变异整体处在相近尺度。对于 H1 差异波 300 ms 之后的晚期部分平均团队方差为 0.19平均参与者方差为 0.34此时参与者差异仍更大。图 3 CPz 通道总平均 ERP 与 H1 差异波在参与者间和团队间的变化。右列为两类方差的时间进程。来源Cesnaite 等原文图 4。这一结果并不是说所有 EEG 研究中分析者与参与者必然贡献相同方差。数据质量、任务、效应类型和评价通道都会改变比较结果。它提供的是一个描述性基准至少在这份数据和这项 ERP 分析中分析流程带来的差异已经大到不能被视为次要技术细节。参考、滤波和成分选择解释了 51%–75% 的差异波变异团队自己报告的 p 值很难由流程变量解释。H1 模型解释率为 13%H2 没有变量优于空模型H3 只有是否跨空间平均进入模型解释率为 4%。p 值同时受到统计方法、样本与试次排除、显著结果选择和报告方式影响因此不容易追溯具体预处理决定的作用。使用统一方法计算连续差异波后关系变得清楚得多。H1 的参考方式和是否用插件选择坏成分解释了 53% 的差异波变异H2 的参考方式和高通截止频率解释了 75%H3 的同类模型解释了 51%。H2、H3 中较低高通截止频率通常对应更大的慢 ERP 条件差异。H1 中使用插件选择坏成分的团队得到更大的差异波但这只是观察性关联不能据此证明自动分类一定比人工判断更准确。图 4 不同流程选择对应的中位差异波。H1 比较参考方式及坏成分插件使用H2、H3 比较参考方式和高通截止频率灰色区域为取平均的时间窗。来源Cesnaite 等原文图 5。上述解释率还需要结合实际样本理解。168 个团队完成了分析但 51 份时序数据因未分段、无法打开或缺少关键信息而不能统一处理。最终差异波回归中H1 纳入 96 个团队H2、H3 各纳入 83 个团队。模型使用同一数据进行逐步 BIC 选模没有独立样本验证因此 53%–75% 是当前样本内的描述性解释率不是因果效应也不是新数据上的预测准确率。讨论这项研究最核心的结果是定性共识与定量分散可以同时存在。多数团队能够对三个经典 ERP 效应是否存在形成一致判断但这种一致并没有消除波形幅度、时间、空间和方向上的不确定性。如果研究只报告显著或不显著许多真正由流程产生的差异就会被隐藏。作者因此建议把分析流程视为研究设计本身而不是数据采集后的技术附录。参考方式、高通设置和伪迹成分选择等关键决定应接受稳健性检查论文应同时报告连续效应指标而不是只给出二元显著性结论原始与预处理数据、代码和足够详细的步骤顺序也应被共享。分析软件还可以自动生成机器可读的方法记录减少论文描述与实际代码之间的偏差。这些结果不能直接转换成一套推荐参数。研究只使用一份数据、33 名参与者和三个相对经典的 ERP 假设分发数据也已经参考到 POz 并降采样。它没有检验静息态频谱、功能连接、微状态或临床分组分析。典型流程同样不等于正确流程较大的差异波也不自动表示结果更接近真实效应。要判断哪条管线更准确还需要在真实信号和伪迹已知的模拟数据中验证。结论EEGManyPipelines 计划显示同一份 EEG 数据可以对应大量合理但并不相同的处理与分析路径这些路径足以产生与参与者差异同量级的波形变异。尽管多数团队仍能确认经典效应参考、滤波和成分选择会显著改变差异波部分情况下甚至改变效应方向。研究没有给出唯一正确的 EEG 管线而是说明完整记录流程、检查关键分支并报告连续波形是评价结果稳健性不可缺少的一部分。参考文献Cesnaite E, Algermissen J, Vinding MC, et al. Many Pipelines, One Dataset: Analytic Flexibility and Its Impact in EEG Research. User-supplied manuscript; journal and DOI not provided.数据https://brainlife.io/project/6863bf5c1521e536327bfea751项目材料https://osf.io/c5hyt分析代码https://github.com/EEGManyPipelines/Main_Paper/tree/main