如果只让我对这两年的姿态识别下一个判断,那就是:二维关键点已经不稀缺了,稀缺的是可信的第三个维度。OpenPose、HRNet、MediaPipe与BlazePose、RTMPose、ViTPose这些名字,几乎覆盖了从服务器到手机的各种部署条件,给一段视频标出十几到几十个关节点,已经是一件成熟的、可以直接调用的事情。真正的分水岭出现在下一步:能不能从这些点里,得到关节角度、旋转轴、身体在空间中的位置,并且让运动科学的人愿意相信它。
这篇文章是一篇观察,不是产品公告。我想把这条路上正在发生的几件事、圈内的分歧,以及od体育目前的取舍,摊开讲清楚。所有对研究的引用,都停留在“公开综述与基准显示了什么方向”的层面,不涉及具体数字。
2D关键点的天花板:图像里的“点”不是关节
二维姿态估计的输出,是图像平面上的一组坐标,加上每个点的置信度。它给人一种错觉,好像这些点就是身体的关节。其实它们只是关节在某个视角下的投影,而且一个点在图像上的位置,很大程度上取决于相机站在哪里。
拿深蹲来说:从正侧面拍,膝角看起来很准;从斜前方拍,同样的膝盖弯曲,投影出来的角度会明显变小。二维角度因此不是身体的属性,而是“身体加相机”的共同产物。做纵向对比时,只要机位稍微变化,曲线就会出现看似真实的漂移。这也是为什么二维方案在动作类别识别、重复计数、粗略的节奏判断上很好用,一旦要谈到“膝关节内扣多少度”“髋部旋转多少度”这类需要空间量的问题,就开始力不从心。
另一个更隐蔽的问题是深度歧义:同一组二维点,可以对应无数种三维姿态。手臂是朝相机伸出还是朝远离相机的方向伸出,在单张图上几乎无法区分。模型靠的是从大量数据里学来的“人一般是怎么动的”来消歧,这在常见姿势下效果不错,在罕见的、幅度大的、发力方式特殊的动作上,就容易把动作“拉回”到最常见的那种。
从点到身体:SMPL 和网格恢复带来了什么
为了摆脱“只有点”的局限,研究界的一条主线是恢复完整的三维人体。SMPL这类参数化人体模型,用一组形状参数和一组姿态参数描述整个身体,输出的是一张带有拓扑结构的网格。HMR系列、4DHumans一类的方法,则尝试直接从图像或视频里回归这些参数。这条路线的好处很直观:身体不再是散落的点,而是一个有骨长比例、有关节旋转、有体表形状的对象。
它带来几个实际的改变。第一,骨骼长度可以被约束,同一个人的大腿在不同帧里不会一会儿长一会儿短,这一点在纯二维点方案里很难保证。第二,关节旋转有了明确的表示,可以直接谈“旋转了多少”,而不只是“两个点连线的夹角”。第三,体表网格能帮助处理遮挡:手臂被躯干挡住一部分时,网格提供了“身体应当在那里”的形状先验。
但网格恢复不是万灵药。参数化模型是在有限的人体扫描数据上建立的,对肌肉极其发达、肢体比例特别的运动员,未必贴合;网格的“好看”很容易让人误以为精度高,实际上一个视觉上合理的网格,其关节位置可能与真实位置有明显偏差;它主要服务于计算机视觉里“看起来对”的评价标准,而运动科学关心的是“数值可复现”,这两个目标并不总是一致。
综述在吵什么:让摄像头走出实验室,代价是什么
2025到2026年,运动科学与生物力学期刊上出现了多篇关于无标记动作捕捉的综述,讨论的核心问题是:如何从二维图像得到三维关节角度。这些文章的共识可以概括成两句话:一方面,它让“离开实验室、用普通摄像头甚至手机采集”变得可行,门槛降低是实实在在的;另一方面,单目模型通常在动作复杂度有限的数据集上训练和评估,面对快速、大幅度的竞技动作,精度会下降。
综述里反复出现的另一个观点,是学科之间的错位:很多系统源自计算机科学的问题设定,优化的是标准数据集上的关键点误差,而生物力学与运动科学真正关心的是关节角度是否可靠、左右是否可比、不同次重复之间是否可复现,两者并不完全吻合。举个例子,一个平均位置误差很小的模型,可能在某个关节角度上有稳定的偏差,而稳定的偏差对科研和训练监控的伤害,比随机噪声大得多,因为它会被误读成真实的变化。
这场讨论我更愿意称作“良性的争论”。它没有否定无标记方案的价值,而是在追问:好到什么程度算可用?可用于什么用途?在哪里必须回到标记点系统?MoCap标记点系统至今仍是实验室里的金标准之一,无标记方案更适合作为补充与扩展,而不是简单替代。
竞技动作是最难啃的一段:AthletePose3D 们想解决什么
为什么强调“竞技”?因为大多数通用三维姿态数据集里,是行走、坐下、挥手这类日常动作,动作幅度有限,速度不快,遮挡关系也简单。而运动员的动作,跳跃、空翻、快速转体、器械交互,几乎处处是这些数据集的边缘情形。用它们训练出的模型,去评价一次高速转体的髋膝角度,本身就是一次外推。
AthletePose3D这类新基准的意义就在这里:专门收集竞技运动的动作,用来检验三维姿态估计,并做运动学层面的验证,也就是不只问“点准不准”,还问“由这些点算出来的关节角度和速度,跟参考测量吻合吗”。基准的出现本身是一个信号:领域已经意识到,通用数据集上的进步不能自动换算成运动场景里的可用性,需要一把更贴近运动科学的尺子。
对做产品的人来说,这意味着一个务实的态度:不要拿通用榜单上的名次去背书运动场景中的可靠性。真正有意义的,是在与自己用户相近的动作、机位、光线、衣着下,做自己的验证。
两个“不让模型乱想”的办法:时序一致性与物理约束
单帧恢复三维姿态,本质上是一个欠定问题,因此各种约束成了提升可信度的关键。目前最常被采用的有两类。
一是时序一致性。把视频看作序列,要求相邻帧的三维姿态平滑变化,骨长保持不变,身体质心的运动符合连续性。这能有效压制单帧抖动,也能在个别帧遮挡时借助前后帧补全。它的代价在挥拍、跳跃这类高速动作里尤其明显:过度平滑会削平真实的速度尖峰,补全出来的姿态也可能只是“最常见的那种”。
二是物理约束。加入关节活动范围的限制,让脚在触地时不要“滑动”,让身体重心符合动力学规律,甚至让整个动作满足质量与惯性的基本关系。物理约束能够剔除很多“看起来对但身体做不到”的解,让输出更接近可以被生物力学接受的范围。它的难点是:真实身体的参数(质量分布、肌肉力量、关节柔韧)对每个人都不同,而约束一旦设得太死,又会把真实的个体差异当成误差抹掉。
所以这两类约束的取舍,本质上是在“稳定”和“真实”之间选一个平衡点。没有放之四海而皆准的设置,只能靠针对具体项目、具体用途的验证来定。
多方法融合:不再依赖单一路线
近年的另一个趋势,是承认单一路线各有短板,转向融合:深度学习姿态模型负责“从画面里看出人”,惯性传感器负责高频的角速度与冲击,多视角相机负责补足深度,有时还加上压力垫或测力设备。核心逻辑是各取所长:不同传感器在不同时间尺度、不同噪声下各有强项,融合不能是简单平均,而要按各自的可靠区间加权,冲突时明确规则。
研究界也在往这个方向推进,目标是提升动态运动场景中的可用性。对手机用户来说,这条路径的现实版本是“手机摄像头 + 手表或简单的惯性设备”,而不是一台要价昂贵的多相机系统。
放到手机上,这意味着什么
对手机场景,我的判断是三句话。第一,三维化会继续推进,但短期内不会让手机替代实验室;第二,在动作幅度适中、机位规范、光线足够的条件下,手机三维姿态可以提供有用的趋势信息;第三,面对高速、大幅度、遮挡严重的动作,系统必须学会“报告不确定性”,而不是硬给出一组漂亮的数字。
想了解单个手机摄像头的精度边界,可以读《手机单摄像头能做到专业动作分析吗?od体育姿态识别的精度边界在哪里》,它把深度歧义、透视畸变和运动模糊逐项列了出来。而想看三维化的价值具体落在哪些指标上,可以看《深蹲角度正确为什么还是会练错?od体育姿态识别开始分析速度、重心和左右不对称》:重心路径、左右不对称这类量,正是二维投影最容易失真、三维信息最能补足的部分。
需要现实地说明,三维恢复也带来新的隐私与算力问题。恢复完整的人体网格,意味着比二维关键点更详细的身体形态数据,处理方式要更谨慎;网格与时序模型的计算量更大,在旧手机上未必能实时运行,端侧与云端的分工也要重新设计。这些不是技术细节,而是产品决策。
od体育的取舍,以及三个还没有答案的问题
在od体育的产品逻辑里,三维化是一条值得走的路,但走法偏保守。二维关键点仍是稳定的基础层,三维信息作为增强层,只在置信度足够时启用;三维输出必须附带可靠程度,而不是与二维输出同等呈现;涉及关节角度的结论,在机位不规范或动作过快时降级为“趋势提示”,而不是精确读数。我们更愿意让用户看到“这次数据不够,请调整拍摄”,也不愿意给出一个看似精确的角度。
还有三个我认为目前谁也没有完全解决的问题,留给读者自己判断。
- 三维精度应该怎样在运动场景里被独立验证?通用榜单与运动学验证之间,还缺少被广泛接受的中间标准。
- 个体差异如何进入模型?参数化人体模型的“平均体型”,对不同项目运动员的适配程度有多高,还需要更多公开的数据来回答。
- 什么时候该相信、什么时候该拒绝?把不确定性告诉用户,比提高一点点平均精度,可能更能改变训练决策的质量。
姿态识别走向三维,不是一次突然的飞跃,更像一段缓慢、反复、不断校准的爬坡。看清坡度、诚实地标注哪里还没爬上去,比宣布已经登顶更接近这个领域真正需要的东西。