姿态与关键点估计
定位关节键点,还原人体骨架
视觉理解进阶 #14
输入图像表格
这项能力指什么
输入图像或视频,输出一组关键点坐标(肩、肘、腕、髋、膝、踝等),用它们连成人体骨架。它在检测之上增加了几何结构约束,输出是坐标序列而非类别。既可以做单人估计,也可以做多人估计并区分出哪几个点属于同一个人。
技术上如何做到
两种主流范式:自顶向下先检测出每个人再在框内回归关键点,精度高但耗时随人数增长;自底向上先在整图上同时预测所有关节点,再借助部分亲和场把属于同一个人的点组装起来,速度基本与人数无关。热力图回归一度是标准做法,之后坐标直接回归与 Transformer 结构也逐渐成熟。
代表产品
4相关机构
典型用途
- 健身与运动动作分析
- 人机交互与体感控制
- 动作捕捉与动画驱动
- 手部与面部跟踪
怎么评价它好不好
- PCK
- 关键点落在真值半径内的比例
- OKS / 关键点 mAP
- 按关节可见性加权的检测平均精度
- MPJPE
- 三维姿态里关节位置的平均误差,单位毫米
边界与难点
- 遮挡与出画导致关键点缺失,模型仍会补出一个看似合理但错误的位置
- 极端姿态(倒立、蜷缩)与罕见动作在训练分布之外,误差明显放大
- 多人相互遮挡时会张冠李戴,把甲的肢体接到乙的骨架上