伊利诺伊大学厄巴纳-香槟分校首次构建儿童步态视频数据集

这项由伊利诺伊大学厄巴纳-香槟分校(University of Illinois Urbana-Champaign)、PediaMed AI公司、深圳市儿童医院、香港理工大学及香港科技大学(广州)联合完成的研究,于2026年8月1日以预印本形式发布在论文平台arXiv上,编号为arXiv:2608.00371v1,研究方向归属于计算机视觉(cs.CV)领域。感兴趣的读者可通过该编号直接检索完整论文。
一个孩子走进诊室,步态有些怪异——左脚微微内扣,膝盖好像始终无法完全伸直。经验丰富的儿科医生会立刻捕捉到这些细节,判断背后可能隐藏的神经系统问题。然而,全球大多数基层医院和诊所根本没有这样的专家,也没有动辄数十万元的三维步态分析设备。孩子的问题就这样被错过了,直到症状加重才被发现。
这支研究团队试图用一台普通摄像机和人工智能算法,替代那套昂贵笨重的专业系统,让任何医院都能"看懂"孩子走路这件事。
一、为什么孩子走路这件事如此重要,却又如此难以分析
在儿科临床实践中,步态分析绝不是一件可有可无的事情。孩子的走路方式,几乎是医生判断神经发育是否健康的一面镜子。脑瘫、偏瘫、髋关节发育不良、特发性趾行(也就是习惯性用脚尖走路)、创伤性脑损伤……这些疾病在早期都会在步态上留下印记。医生一旦能早早识别这些"异样走法",就能更早干预,孩子的康复效果会好得多。
更进一步说,随着脑机接口(BCI)和神经假肢技术的快速发展,步态质量已经成为衡量"功能恢复效果"的重要指标——换句话说,医生要通过孩子走路的姿态,判断那个帮助他们重获行走能力的装置到底有没有真正发挥作用。
那么,现有的方法为什么不够用呢?目前临床上主流的精确步态分析方法有两类:一类是三维运动捕捉系统,需要在专用实验室里安装数十个摄像头和反光标记点,就像给孩子的全身贴满小镜子再拍摄,场地要求极高,成本也极高,只有大型医疗机构才能负担;另一类是惯性测量单元(IMU),就是把传感器固定在孩子身上,通过感知加速度和角度来还原运动轨迹。但问题在于,很多孩子,尤其是年龄小的孩子,根本不愿意接受这些"装备"——设备本身有时甚至会改变孩子走路的方式,让测量结果失真。
于是,目前大多数临床场景里,医生只能靠肉眼观察来评估孩子的步态,而这种主观判断的准确性因人而异,不同医生看同一个孩子可能得出不同结论。
研究团队看到了一个突破口:普通RGB摄像机——就是智能手机或运动相机——能不能完成这件事?
二、专门为孩子建立的步态视频数据集:CGV数据集从无到有
要让人工智能学会"看懂孩子走路",首先得有足够多的真实数据。但翻遍已有的步态数据集,几乎都是成年人的走路视频,专门为儿童临床步态设计的数据集几乎为零。这就好像要教一个人识别苹果,结果拿出来的练习册上全是橙子的图片——不是说没有参考价值,但差距太大,学出来的东西会严重跑偏。
这支研究团队因此从头开始,构建了一个名为"儿童步态视频数据集"(Children Gait Video Dataset,简称CGV)的全新资源。在正式启动数据收集前,研究团队获得了合作医院伦理委员会的审批,批准编号为202106202,整个采集过程符合严格的儿科伦理标准。
数据来自110名儿童患者,年龄跨度从2.6岁到16.6岁,平均年龄约8.4岁,标准差约3.14岁,覆盖了儿童神经运动发育的关键窗口期。数据集中男孩占约58.2%,女孩占约41.8%,性别分布相对均衡。这110名孩子涵盖脑瘫、创伤性脑损伤、髋关节发育不良、内八字、特发性趾行等多种诊断。
采集流程经过精心设计:在一条8米长的步道末端,架设一台主摄像机捕捉"冠状面"视角(即从正面或背面拍摄孩子);在步道侧面架设第二台摄像机,朝向步道中段,捕捉"矢状面"视角(即从侧面拍摄)。侧面摄像机的位置经过精确计算,确保能完整拍到步道中间4米范围内的行走过程,保证每名孩子至少完成2至3个完整步态周期。每段视频时长约3至5秒,以60帧每秒的高帧率拍摄,最终形成1185段视频,共计339,236帧,分辨率为1920×1080的2K画质。
这个数据集之所以特别,不仅仅在于它是儿童的数据,更在于它携带了丰富的临床标注。每段视频都由经验丰富的儿科医生进行步态评分,参照的是国际通行的"爱丁堡视觉步态评分系统"(Edinburgh Visual Gait Score,简称EVGS)。为了验证评分的可靠性,研究团队邀请了另一位儿科医生进行独立复评,计算两位医生之间的组内相关系数(ICC),达到了0.93——这是一个相当高的一致性指标,说明标注结果具有良好的客观性。作为对照,那位参与复评的儿科医生作为"人类基准",其平均评分准确率为93.8%,这也为后续AI算法的性能提供了一个有意义的参照天花板。
在隐私保护方面,研究团队采取了多层措施。所有视频在发布前都经过不可逆的去识别化处理:先通过RetinaFace系统自动检测人脸,再用SAM 3(Segment Anything with Concepts)进行精确分割,对所有可识别区域施加马赛克滤镜,并由两名人工标注员逐帧人工核查,确保100%的处理效果。公开发布的数据仅包含孩子的姿态序列,而非原始视频。数据集使用CC BY-NC 4.0许可证发布,明确禁止将其用于训练大规模基础模型,防止数据被滥用于生成式AI。
三、用什么标准来评分:爱丁堡视觉步态评分系统详解
评分系统本身值得专门介绍,因为它直接决定了研究的精细程度。EVGS把人走路时的身体动作拆解成17个具体的观察项目,分别针对脚部、踝关节、膝关节、髋关节、骨盆和躯干在步态周期不同阶段的表现进行评估,并且对左右两侧分别打分,因此一个孩子实际上有34个评分项。
这17个项目大致可以理解为:脚怎么落地(是脚跟先着地、全脚掌还是脚尖?);脚后跟何时离地;支撑期踝关节向前弯曲的程度;后脚跟在冠状面是否向内或向外倾斜;脚在支撑时向内还是向外旋转了多少;摆动腿离地时脚是否真的抬离了地面;摆动期踝关节的角度;膝盖朝向是否正前方;支撑末期膝盖是否能充分伸直;终摆期膝盖位置是否正常;摆动峰值时膝盖弯曲幅度;支撑期髋关节是否充分后伸;摆动期髋关节向前抬腿的幅度;支撑中期骨盆左右倾斜程度;支撑中期骨盆前后旋转角度;支撑期躯干在矢状面的前倾后仰程度;以及躯干横向摆动幅度。
每个项目都采用三分制评分:0分代表正常(在正常均值的±1.5个标准差范围内),1分代表中度偏差(偏离正常均值1.5至4.5个标准差),2分代表重度偏差(超出4.5个标准差)。由于数据集中打出2分的情况相对稀少,为了让机器学习任务更加稳健,研究团队将1分和2分合并为同一类,从而将每个项目的预测简化为"正常"还是"异常"的二分类任务。
四、现有的AI大模型,真的看不懂孩子走路
研究团队首先做了一件很有意思的事:把目前最先进的几款多模态大语言模型(Multimodal Large Language Model,简称MLLM)拉来直接测试,看它们在不做任何专项训练的情况下,能不能直接读懂孩子的步态视频。
参与测试的模型阵容相当豪华,包括谷歌的Gemini 3 Pro、OpenAI的GPT-5.2、阿里巴巴的Qwen3-VL-235B、智谱AI的GLM4.6V、以及Qwen3.5-9B和InternVL3-8B。测试方法是给每个模型提供16帧均匀采样的视频画面,同时附上包含EVGS评分标准的详细提示词,要求模型对每个评分项输出判断。
结果相当令人沮丧——或者说,相当清醒:这些模型在每一侧肢体的平均准确率只有50%至60%左右,而对于这道二分类题来说,纯靠随机猜测也能有50%的正确率。换句话说,这些被认为拥有强大视觉理解能力的大模型,在这项任务上的表现几乎和抛硬币差不多。
仔细分析具体项目,可以发现一个规律:这些模型在判断"摆动期峰值髋关节屈曲"(HFX)这样视觉特征比较明显的项目时,平均准确率能达到约61%;但在判断"支撑期最大踝关节背屈"(SAD)这类需要精确感知细微角度变化的项目时,平均准确率只有约54%。
研究团队对此的解释是:大语言模型的训练核心是语义级别的理解,它们擅长理解事物的概念和关系,却不擅长进行定量的生物力学判断。更重要的是,这些模型的训练数据中几乎没有针对儿童步态的临床评分任务,它们缺乏对应的"领域对齐",因此无法有效区分那些在视觉上极其细微的步态偏差。
五、专项微调大模型:效果依然差强人意
看到零样本测试失败,研究团队进行了下一步尝试:把Qwen3-VL-4B模型在CGV数据集上进行专项微调训练(fine-tuning),希望通过"让模型见过足够多的儿童步态案例"来提升其判断能力。微调后的版本被命名为Qwen3-VL-ChildGait。
训练时,每段视频被下采样至30帧每秒,然后随机裁取4个时间窗口,每个窗口均匀采样16帧,形成训练样本;测试时,从视频中央时间窗口均匀提取16帧进行评估。训练目标是让模型预测特定步态项目的类别标签,使用负对数似然损失进行优化。
然而,微调之后的结果依然让人有些困惑:Qwen3-VL-ChildGait相比零样本的Qwen3-VL-4B,左侧肢体平均准确率只提升了约2%,右侧提升了约1%。某些项目确实有所改善,比如"支撑期初始接触"(IC)提升了约11.5%;但其他项目反而出现了下降,比如"支撑期后足内翻/外翻"(HVV)下降了约1.5%。整体来看,提升可以说是微不足道的。
这个反直觉的结果,让研究团队得出一个重要结论:视频大语言模型在细粒度动作识别和动态时空交互理解上存在根本性局限。大语言模型的本质是在海量文本上学习语义和逻辑关系,这种知识无法直接迁移到对运动模式的定量感知上——更不用说步态识别这样更加精细的任务了。
六、换个思路:专用视频分析模型表现如何
既然大语言模型的路行不通,研究团队把目光转向另一类工具:专为视频时序分析设计的视频基础模型(Video Foundation Model)和专门做步态识别的步态分析模型。
在步态分析模型这一侧,研究团队评估了一批业内有代表性的方法,包括GaitSet、GaitPart、GaitGL、GaitBase、SwinGait、DeepGaitV2,以及当前的步态识别最佳模型BiggerGait。这些模型都先在大规模步态数据集上预训练,然后在CGV数据集上微调,再进行评估。
测试结果再次令人清醒:所有步态分析模型的左右肢体平均准确率都只有45%至56%。即便是当前步态识别领域的最佳模型BiggerGait,对左侧肢体的平均准确率也只有54%,右侧为53%。分析原因,研究团队认为这些模型的设计目标是"识别是谁在走路"而非"判断怎么走的"——它们提取的是全局时空特征用于身份区分,而非细粒度的局部运动细节。此外,这些模型全部在健康成年人的数据上预训练,儿童步态中特有的病理模式对它们来说是陌生的领域,泛化能力自然受限。
在视频基础模型这一侧,研究团队引入了VideoMAE v2——一个通过"掩码自编码"方式在超大规模无标签视频上预训练、再在Kinetics-710动作识别数据集上微调的视频理解模型。将VideoMAE v2在CGV上进行完整微调后,效果出现了显著跃升:左侧肢体平均准确率达到69%,右侧达到72%,较BiggerGait分别提升了15%和19%个百分点,几乎超越了之前所有的步态分析模型。
这说明,通用视频理解能力确实比专门为成人步态设计的特征提取方式更适合这个任务。不过,69%至72%的准确率仍然有较大提升空间,距离临床实用还有差距。
七、ChildGait-Video:专为儿童步态打造的端到端框架
面对上述种种局限,研究团队提出了自己的方法:ChildGait-Video。这个框架的设计哲学是"端到端"——直接从视频像素到EVGS评分,中间不经过那种把关节角度一个一个算出来再用规则判断的老套路。
传统步态分析的多级流程有两个明显弊端:把高维视频压缩成稀疏骨架坐标的过程中,大量外观和纹理信息会被丢失;而且分阶段评估单个关节角度,忽视了人体运动的整体协同性——各关节之间的联动关系本身就是诊断的重要依据。
ChildGait-Video的核心架构与VideoMAE v2相同——使用视觉Transformer(ViT)作为时空特征编码器——但在训练策略上引入了两项关键创新,使其能够更好地服务于儿童步态的临床评估。
第一项创新叫做"基于Token的运动学提示"(Token-Level Kinematic Prompting,TKP)。具体做法是:用Sapiens-2B骨架估计模型从视频帧中提取人体关键点坐标(总共检测全身关节),然后把这些关节点和它们之间的连接线直接画在原始RGB视频帧上,生成一个叠加了骨骼图的合成帧。这样一来,当ViT编码器把图像切成小块(patch)进行处理时,那些包含骨骼线的小块就天然地携带了解剖位置和局部拓扑信息。这些小块在被投影到特征空间后,就成为了"运动学提示token",与普通的视觉token混合在一起,帮助模型在不需要单独处理骨架序列的情况下,直接理解身体各部位的相对位置关系。
第二项创新叫做"掩码引导的补丁剪枝"(Mask-Guided Patch Pruning,MPP)。儿童步态视频的一个常见挑战是背景复杂:家长跟在旁边扶着,地板有花纹,背景有医疗设备……这些信息对判断步态质量完全没有帮助,却会分散模型的注意力,甚至引入偏差。研究团队用SAM 3实例分割模型提取孩子身体的精确二值掩码,然后在ViT编码器处理视频时,丢弃那些背景区域对应的patch——只保留属于孩子身体前景区域的patch。这种确定性空间剪枝策略不仅强迫模型的注意力集中在孩子的步态动作上,还显著降低了计算量,因为处理的patch数量大幅减少了。
在训练策略上,ChildGait-Video采用两阶段迁移学习:首先在Kinetics-710上预训练,获得通用人体运动识别能力;然后在CGV数据集上微调,同时加入TKP和MPP,让模型学习识别儿童步态的细微临床异常。最终输出层是一个简单的MLP分类头,对每个评分项输出二分类预测。优化器使用AdamW,学习率设为0.0001,权重衰减0.05,采用线性预热调度。整个训练在10块NVIDIA L40S GPU上完成,批量大小为每GPU 8个样本。
八、ChildGait-Video的实验成绩:全面超越所有基准
在CGV测试集上,ChildGait-Video的表现如何?研究团队按患者ID进行严格的数据划分,训练集与测试集患者比例为6:1,确保同一个孩子的所有视频片段只出现在一侧,防止身份信息泄漏导致的虚假高分。测试集中正负样本保持近似平衡。
最终结果是:ChildGait-Video在全部34个评分项(左右各17项)上全面超越所有基准,各项准确率落在70%至93%的范围内,左侧肢体平均准确率84%,右侧肢体平均准确率84%,平均F1得分达到0.83(F1分数是兼顾精确率和召回率的综合指标,满分1,得0.83说明模型在正常和异常两类上都有较好的识别能力)。相较于直接微调的VideoMAE v2,ChildGait-Video在左右肢体上分别提升了约15%和12%的平均准确率。
研究团队还用麦克尼马检验(McNemar's test)对ChildGait-Video和微调VideoMAE v2进行了统计显著性检验。在所有测试样本中,有28例是ChildGait-Video答对而VideoMAE v2答错的,只有6例是反过来的情况,对应p值为2.3×10??,远小于0.001的显著性阈值。这说明ChildGait-Video的优势不是运气,是统计上高度显著的真实提升。
从混淆矩阵的可视化结果来看,无论是矢状面还是冠状面的评分项,ChildGait-Video对"正常"和"异常"两类都保持了较高的敏感性,非对角线错误率较低,说明模型确实有效地把自注意力机制引导到了步态运动学的关键区域。
九、细节决定成败:帧数和模块的消融实验
研究团队还专门对影响性能的关键参数进行了消融实验,以确认设计选择的合理性。
在输入帧数的影响方面,研究团队固定采样帧率为30帧每秒,分别测试了8帧(覆盖约0.26秒)、16帧(约0.53秒)和32帧(约1.06秒)三种配置,以"支撑期初始接触"(L/R-IC)这一项的准确率和F1分数作为评估指标。结果显示,从8帧到16帧,准确率从74.1%提升至87.0%,F1从0.73提升至0.89,进步相当显著。这是因为8帧覆盖的时间太短,不足以捕捉儿童步态中一个有意义的运动转变。而从16帧增加到32帧,准确率继续提升至90.7%,F1达到0.92,但提升幅度明显收窄,仅约3.7%,而计算量却因为序列长度翻倍而大幅增加。因此16帧是效果与效率的较好平衡点。
在模块贡献的消融方面,研究团队逐步叠加各个组件,测量每一步的边际收益。以VideoMAE v2作为基线(L-AVG/R-AVG为69%/72%,F1约0.70/0.71),加入TKP后平均准确率提升至72%/74%,F1改善至0.72/0.73;加入MPP(但不加TKP)后,准确率进一步提升至78%/79%,F1达到0.77/0.78;两者同时使用的完整ChildGait-Video达到84%/84%,F1为0.83/0.83。
对比掩码策略时,用随机掩码替换MPP会导致准确率下降至68%/70%,甚至低于基线——这正是因为随机遮挡可能掩盖关键关节,破坏了诊断所需的细节。而使用简单的矩形边界框掩码虽然有所帮助(75%/77%),但效果不如基于实例分割的精确身体掩码,后者能更准确地区分孩子和背景,不会把边界框内的背景区域也当成有效信息保留。
此外,研究团队还评估了骨骼序列基线方法,包括SkeletonGait++(在多个大规模数据集上预训练)和ScoNet(在脊柱侧弯数据集上预训练)。骨骼方法相比步态识别模型有所改善,ScoNet的左右肢体平均准确率最高达到68%/70%,但仍然显著低于ChildGait-Video,说明仅凭关节坐标序列、舍弃视频中的外观和纹理信息,对这类细粒度临床评分任务仍然是不够的。
十、年龄的影响与未来的方向
研究团队还专门分析了年龄对模型性能的影响。将测试集按年龄划分为8岁及以下和8岁以上两组,较小年龄组的平均准确率为82.4%,较大年龄组为85.2%。这个差异符合直觉:越小的孩子步态越不成熟、变化越大、个体差异越显著,判断难度更高。
在更宏观的意义上,研究团队认为这项工作回应了一个更深的问题:当人工智能与儿科医疗相遇,能否真正实现"民主化"——让步态分析不再是大城市大医院的专利,而是每一个有普通摄像机的诊室都能做到的事情?与传统三维动作捕捉系统相比,这套方法只需要普通智能手机或运动相机,无需专门的实验室空间,不需要给孩子身上贴任何标记物,也不需要专业操作人员。
当然,研究团队也坦承这项工作目前的局限:数据集来自亚洲地区一家儿童医院,样本量(110名患者)仍然有限;视频在相对受控的临床环境下采集,尚未在家庭、社区、康复中心等更复杂的"野外"场景下测试。未来的工作方向包括扩展数据来源、增加样本多样性、以及探索在不受控环境下的实时步态追踪能力。
说到底,这项研究做的事情,是把一套原本需要专家眼睛才能完成的视觉判断任务,转化为机器可以学习和执行的结构化问题。研究团队在这条路上迈出了扎实的一步:建立了数据集、确立了评估基准、证明了现有大模型的不足,并提出了一个在精度上明显更优的专用框架。这个框架在全部34个评分项上达到了70%至93%的准确率,平均F1分数0.83,已经相当接近人类专家之间的互评水平。
对那些正在等待漫长预约、辗转跋涉到大型医疗中心只为让孩子走几步、让专家看一看的家长来说,这项研究代表的未来,或许意味着一部手机就能完成那次诊断。
有兴趣深入了解这项研究细节的读者,可以通过arXiv编号2608.00371查阅完整论文,数据集已公开发布于HuggingFace平台(PediaMedAI/ChildrenGait),相关代码和信息也可通过pediamedai.com/ChildrenGait获取。
Q&A
Q1:CGV数据集和普通的步态数据集有什么不同?
A:CGV数据集专门针对3到17岁儿童患者,包含110名孩子、超过1100段视频,每段视频都有专业儿科医生依据爱丁堡视觉步态评分系统(EVGS)的34个项目进行临床标注,还附带骨骼关键点和实例分割掩码。现有步态数据集几乎全部基于健康成年人,没有这种儿科临床评分标注,无法支撑儿童步态异常识别的研究。
Q2:为什么GPT和Gemini这样的顶级大模型分析不了儿童步态视频?
A:这些多模态大模型的训练核心是语义级别的理解,它们擅长识别概念和语言逻辑,但对于"膝盖弯了几度""踝关节在摆动期角度是否偏大"这类定量生物力学判断能力极弱。而且它们几乎没有见过儿童临床步态评分的训练数据,任务对齐不足,导致在这道二分类题上准确率接近随机猜测的50%。
Q3:ChildGait-Video方法在临床上能直接使用吗?
A:目前还处于研究阶段,不能直接用于临床诊断。该方法在受控医院环境下的测试准确率达到70%至93%,表现有临床参考价值,但数据集来源单一、样本量有限,尚未在家庭或社区等复杂真实场景下验证,仍需更大规模的多中心研究和临床验证才能推向实际应用。