跳到正文
AI 图鉴

姿态与关键点估计

定位关节键点,还原人体骨架

视觉理解进阶 #14
输入图像表格

这项能力指什么

输入图像或视频,输出一组关键点坐标(肩、肘、腕、髋、膝、踝等),用它们连成人体骨架。它在检测之上增加了几何结构约束,输出是坐标序列而非类别。既可以做单人估计,也可以做多人估计并区分出哪几个点属于同一个人。

技术上如何做到

两种主流范式:自顶向下先检测出每个人再在框内回归关键点,精度高但耗时随人数增长;自底向上先在整图上同时预测所有关节点,再借助部分亲和场把属于同一个人的点组装起来,速度基本与人数无关。热力图回归一度是标准做法,之后坐标直接回归与 Transformer 结构也逐渐成熟。

代表产品

4

相关机构

典型用途

  • 健身与运动动作分析
  • 人机交互与体感控制
  • 动作捕捉与动画驱动
  • 手部与面部跟踪

怎么评价它好不好

PCK
关键点落在真值半径内的比例
OKS / 关键点 mAP
按关节可见性加权的检测平均精度
MPJPE
三维姿态里关节位置的平均误差,单位毫米

边界与难点

  • 遮挡与出画导致关键点缺失,模型仍会补出一个看似合理但错误的位置
  • 极端姿态(倒立、蜷缩)与罕见动作在训练分布之外,误差明显放大
  • 多人相互遮挡时会张冠李戴,把甲的肢体接到乙的骨架上

背后的概念