先看一段拍坏的视频:手机斜靠在水杯上,镜头离地大概膝盖高,人站在一米半开外,头顶和脚尖各被截掉一小块,身后是一扇明亮的窗。这样的画面里,人眼还能大致看出他在做深蹲,姿态估计模型却要面对一个近乎逆光的剪影,脚踝的位置靠猜,髋部被裤子的褶皱遮住。很多“识别不准”的抱怨,问题在按下录制键之前就已经定了。
这篇指南按拍摄的实际顺序写:先定机位,再看光线和背景,然后是衣着、方向、帧率这些容易被忽略的设置,接着分别给深蹲、跑步、投篮各一套机位建议,收尾讲怎样在三十秒内自己检查一段视频值不值得上传分析。文中的距离、高度都是常见的经验做法,用来帮你避开明显的坑,不是硬性标准;App内的取景框与提示如果和这里不同,以App内实际显示为准。
机位三件事:全身入镜、高度对准髋、镜头别歪
最重要的一条是全身完整入镜,并且头顶和脚下各留出一点空隙。姿态估计输出的是关节点,关节点一旦落在画面边缘之外,模型只能靠上下文推断它在哪里,推断出来的位置在后续计算里会被当成真实数据使用,结果是角度和轨迹一起变形。脚是最常被截掉的部位,而踝关节偏偏是下蹲、落地、起跳里的关键点。
镜头高度建议对准身体中段,也就是髋部附近。镜头放得太低,仰拍会让大腿显得更短,膝盖看起来更靠近镜头;放得太高,俯拍会压缩躯干,让前倾角度失真。这是透视造成的,不是模型的错,但模型没法区分“真的前倾”和“镜头俯拍造成的前倾”。手机也要尽量保持水平,不要为了让画面装下更多而把镜头歪着放,倾斜的画面会让“竖直”这个参照被破坏,所有以垂直线为基准的角度都会带上系统性偏差。
距离方面,常见做法是让人在画面中占据大约三分之二的高度,通常需要离镜头三到四米左右,具体取决于手机的视角和场地。离得太近,广角镜头的边缘畸变会把靠近镜头的肢体放大;离得太远,关节点只占几十个像素,微小的抖动就会变成数据上的跳动。折中的判断标准是:能清楚看到手腕和脚踝,同时人没有被缩成一个小点。
光线和背景:模型要的不是漂亮,而是轮廓清楚
光线的原则可以概括成一句话:光从镜头的方向或斜前方照向人,而不是从人的身后照向镜头。逆光时,身体正面陷入阴影,关节点的边界变得模糊,衣服和皮肤的对比也消失了。窗户在人背后,是室内拍摄最常见的坑,解决办法通常只有一个:转身九十度,或者把手机和人换个位置,让窗户在镜头侧。
背景比很多人想的更重要。干净的单色背景,比如一面白墙,能让人体轮廓一目了然;杂乱的背景,比如挂着人形海报、衣架上挂着衣服、后面有别人走动,则可能让模型把不是你的东西当成人体,或者在多人之间来回切换目标。有一种很隐蔽的情况是背景里有镜子:镜中的“另一个人”会和真人同时被检测到,导致数据里出现两套关节点。健身房里的整面镜子在这一点上尤其麻烦,拍摄时尽量让镜头避开镜面。
阴影和地面反光也会干扰脚部的判断。深色鞋踩在深色地板上,落地点几乎和阴影混成一片;反光很强的地板会在脚下形成倒影。换到哑光地面,或者换一双对比明显的鞋,比调整参数有效得多。
衣着、方向和帧率:三个容易被忽略的细节
衣着的原则是贴身但不紧绷。宽松的卫衣、长裙、宽腿裤会盖住髋、膝的轮廓,模型只能根据布料的形状去推测关节位置,而宽松布料随动作摆动,本身就是噪声。短裤加贴身上衣是最省心的选择,做不到时,至少让膝盖和髋部的位置在视觉上能被分辨出来。头发遮住肩膀、背包挡住躯干、手里拿着水瓶,这些细节同样会影响判断。
手机用竖屏还是横屏,取决于你要拍什么。站立的单人动作,比如深蹲、原地投篮,竖屏可以更好地利用画面高度,让人占更多像素;需要横向移动的动作,比如跑步的一段直线,用横屏才能让人在画面里跑得更久而不出框。拍摄过程中不要中途转动手机。
帧率决定了快速动作会被切成多少张图。常见的普通视频是每秒三十帧左右,多数手机还提供更高的选项。深蹲、慢跑这类速度不快的动作,三十帧通常够用;投篮出手、挥拍、冲刺起步这类快动作,画面里的手和脚在相邻两帧之间会移动很长的距离,关键瞬间可能恰好落在两帧之间,更高的帧率会有明显帮助。但是提高帧率也会在光线不足时压缩单帧的曝光时间,画面会更暗、噪点更多,所以帧率和光线要一起考虑,而不是单独追求某一项。
手持拍摄时的晃动,在关节点数据里会表现为全身一起微微抖动,很难与真实的身体晃动区分。用支架、三脚架,或者把手机稳稳地靠在固定物上,都比手持要好得多。
三个项目,三套机位
不同动作要看的东西不一样,机位也应当不一样。下表是一份常见做法的汇总,具体取景以App内提示为准。
| 项目 | 主要机位 | 补充机位 | 想看到什么 |
|---|---|---|---|
| 深蹲 | 侧面,镜头与髋同高 | 正面,用来看膝盖方向与左右对称 | 髋膝踝角度、躯干倾角、下蹲速度、左右差异 |
| 跑步 | 侧面,镜头固定,人从画面中横穿 | 后方,用来看骨盆与足的落点方向 | 步频节奏、落地位置、躯干前倾、膝关节轨迹 |
| 投篮 | 侧面或斜前方约四十五度 | 正面,用来看出手手臂是否偏离身体中线 | 脚步准备、屈膝、肘的路径、出手时机 |
深蹲以侧面为主。侧面最能反映躯干倾角、下蹲深度,以及髋和膝谁先动,这几个问题的答案都藏在“前后方向”上,而正面机位对前后方向几乎没有分辨力。反过来,膝盖是否内扣、左右两侧是否对称,则只有正面才看得清。如果只能拍一个机位,就按你最想解决的问题来选:担心的是前倾和深度就拍侧面,担心的是膝盖方向和左右不均就拍正面。
跑步的关键是镜头固定、人跑过镜头。侧面机位下,通常拍摄一段十几米的直线,让跑者从画面一端跑到另一端,中间的几个步态周期是最有用的部分。跑步机上拍摄则更容易控制,位置固定,但跑步机上的步态和路面跑并不完全相同,结论要留有余地。腿部的自遮挡是跑步侧拍的固有问题:靠近镜头的那条腿会挡住远端腿,摆动到某个瞬间两条腿重叠,模型对被遮住那条腿的位置只能估计。
投篮的麻烦是动作既快又立体。侧面机位能看清屈膝、髋的发力和肘的运动路径,斜前方四十五度则能同时看到肩、肘和出手方向的偏差,但脚步的细节容易被身体自己挡住。对投篮这类动作,宁愿选一个稍远、稍高一点的位置,保证整套动作从脚到出手都留在画面里。
拍多久,拍几次
一次拍摄不是越长越好。对深蹲这类重复动作,一组五到八次通常足够,重复次数太多会因疲劳而使动作变形,反而让“平均水平”失去代表性;对投篮,每次分析建议聚焦一小组连续出手,而不是把整场训练一直录下去。太长的视频文件更大、处理更慢,手机还可能因发热而降频。
多拍几次,比一次拍得完美更有价值。一次视频里的偶然失误、被遮住的一帧、突然的光线变化,会在重复拍摄之后被平均掉。同时,多次数据之间的对比才是真正有意义的部分:稳定的动作应当在几次里表现出相近的轨迹,如果某一项指标在每次拍摄中都大幅波动,那它可能是噪声,而不是你身体的真实变化。拍摄条件越一致,不同日期之间的对比越可靠。
五种最常见的拍坏方式
- 只拍了半身或者截掉脚:下肢的关节点缺失,深蹲和跑步的核心信息丢了一半,应当把手机往后放、往下调。
- 逆光、背对窗户:身体正面陷入阴影,轮廓模糊,换个方向,或者拉上窗帘、打开正面的灯。
- 镜头在动:手持晃动或中途转身,人体的运动和相机的运动混在一起,无法拆开。
- 有第二个人入镜:身后走动的人、旁边同练的人,会让识别在两个目标之间切换,导致轨迹被拼错。
- 宽松衣服加杂乱背景:轮廓与背景混在一起,最好换成贴身一点的衣着和一面干净的墙。
如果你按上面这些做了,识别仍然不理想,就需要从更系统的角度逐层排查:权限、画面、光线、帧率、遮挡、设备性能。这套思路整理在《od体育下载后动作识别不了?从机位、光线到设备性能逐层排查》里,从最便宜、最容易验证的原因开始,适合在拍摄之后遇到问题时对照使用。
拍完先自查三十秒
上传或分析之前,可以用三十秒做一次快速的自我检查。第一,从头到尾回放一遍,看人是不是始终完整在画面里,有没有哪一帧脚或手被截掉。第二,暂停在动作最深或最快的一刻,看这一帧里手、脚、膝盖的边界是否清楚,有没有严重的动态模糊。第三,看背景里有没有另一个人或镜子里的影像。如果三项里有一项不通过,最好重拍,不要把有明显问题的视频交给分析,因为不良输入得出的结论,比没有结论更容易误导你。
这里还有一个反直觉的地方:好的分析流程,应当在输入质量不足时“拒绝打分”,而不是勉强给出一个数字。od体育App的设计思路是在识别置信度偏低、画面质量不足时提示你重拍,或者只给出保守的描述,而不是输出一份看起来完整的报告。
拍得再规范,手机也有做不到的事
还要说清楚边界。就算机位、光线、衣着都符合要求,一部普通手机的单个摄像头仍然只是一个二维的观察窗口:它看不到深度,看不到被身体自己挡住的关节,对快速大幅度的竞技动作也有精度下降的问题。公开的研究和综述反复指出,单目模型在动作复杂度有限的数据集上表现较好,而面对快速、大幅度的竞技动作时,精度通常会降低;这些边界并不会因为拍得规范就消失。对这部分背景感兴趣,可以读《手机单摄像头能做到专业动作分析吗?od体育姿态识别的精度边界在哪里》,那里专门讨论了手机能回答哪些问题、不能回答哪些问题。
所以,拍摄指南的目标不是让你拍出实验室水平的数据,而是保证你交给系统的画面,值得被认真对待。遇到疼痛、动作明显异常或者需要专业判断的情况,应当找教练或医生,而不是反复重拍,期待一个更“准确”的分数。