
----追光逐電 光贏未來----
導(dǎo)讀
?作者總結(jié)了人體姿態(tài)估計(jì)入門需要學(xué)習(xí)的一些知識,在學(xué)習(xí)過程中的一些感悟和踩過的坑,列舉主要的工作脈絡(luò)和一些細(xì)節(jié)。
自己的研究方向?qū)儆谌梭w姿態(tài)估計(jì)領(lǐng)域,但是學(xué)了大概兩年了,才感覺剛?cè)腴T(主要是自己太菜...),一開始對各種各樣的名詞和網(wǎng)絡(luò)方法摸不著頭腦,沒有建立屬于自己的研究體系,論文堆積如山,各種方法層出不窮,研究生就這么幾年,哪能看的完呢?沒有一個(gè)指路人,真的太難,而且這個(gè)領(lǐng)域的應(yīng)用和教程屬實(shí)沒有檢測和分割多......這里總結(jié)一下自己在學(xué)習(xí)過程中的一些感悟和踩過的坑,列舉主要的工作脈絡(luò)和一些細(xì)節(jié),還有前期主要看的論文。主要以幫助后來者入門使用,肯定有一些內(nèi)容屬于自己主觀理解,純屬個(gè)人經(jīng)驗(yàn),若有錯(cuò)誤,麻煩一起討論交流,感謝指正!歡迎留言私信哈~~
人體姿態(tài)估計(jì)按照不同的標(biāo)準(zhǔn)有著各種各樣的分類。包括2D/3D/mesh,單人/多人,自頂向下(top-down)/自底向上(bottom-up),圖像(image)/視頻(video),坐標(biāo)/熱圖(heatmap),?檢測(detection-based)/回歸(regression-based) , 單階段(single-stage)/多階段(multi-stage)......等等,各種分類方法之間相互嵌套,每篇文章都有作者按照自己理解劃分的類別,真的很讓人摸不著頭腦。但實(shí)際上,很多分類都有著遞進(jìn)的關(guān)系,例如:

大部分論文在講述的時(shí)候,都是繼承之前的論文方法,因此很多細(xì)節(jié)講的不是很清楚,一篇參考文獻(xiàn)就一筆帶過,如果沒有完整的體系架構(gòu),直接看最新的文獻(xiàn)會很亂,發(fā)現(xiàn)需要補(bǔ)充的知識越來越多,導(dǎo)致知識體系細(xì)碎繁雜,看完了也不知道講的是什么。這里給出姿態(tài)估計(jì)的幾篇綜述文獻(xiàn),里面從各個(gè)角度講述了姿態(tài)估計(jì)的一些經(jīng)典方法和分類,有助于建立整個(gè)框架體系:
[1] Single Person Pose Estimation: A Survey(2021.09)
https://arxiv.org/abs/2109.10056v1
[2] Monocular human pose estimation: A survey of deep learning-based methods(2020.06) ?
https://arxiv.org/abs/2006.01423
[3] Deep Learning-Based Human Pose Estimation: A Survey(2020.11)?https://arxiv.org/abs/2012.13392v1)
[4] Recent Advances in Monocular 2D and 3D Human Pose Estimation: A Deep Learning Perspective (2021.04)
https://arxiv.org/abs/2104.11536
[5] Recovering 3D Human Mesh from Monocular Images: A Survey(2022.03)
https://arxiv.org/abs/2203.01923v1
在寫這篇文章的時(shí)候,發(fā)現(xiàn)了大神剛出的一篇比較好的總結(jié),鏈接放到這里,供大家學(xué)習(xí)參考,可先閱讀,對比和本文的異同,以作參考:
人體姿態(tài)估計(jì)的過去,現(xiàn)在,未來
https://zhuanlan.zhihu.com/p/85506259
還有OpenMMlab有一期盧策吾老師的視頻講解,總結(jié)了pose相關(guān)的方法,鏈接如下,建議觀看,以作參考:
https://www.bilibili.com/video/BV1kk4y1L7Xb
這里使用上面文獻(xiàn)[4]的一張圖展示一下相關(guān)研究和論文,按照時(shí)間順序展示,清晰明了,推薦閱讀這篇綜述:

另外上面文獻(xiàn)[5]是關(guān)于人體Mesh研究的,也是我研究的一個(gè)領(lǐng)域,所以把這篇綜述也放了上來,同樣有一張圖:

建立思路:按照時(shí)間建立自己的知識體系,個(gè)人認(rèn)為是一個(gè)很好的方式,感受這個(gè)領(lǐng)域的方法一步一步的推進(jìn)過程,一點(diǎn)一點(diǎn)構(gòu)建自己的知識領(lǐng)域框架,后面讀論文不再是一行一行讀,而是一塊一塊地讀;而且可以在閱讀的過程中,從后面的研究者在Related Work中對早期的文章的見解和描述,是一種感受不同人對某一方法的不同見解的過程,幸運(yùn)的話甚至可以從中得到啟發(fā)。從一篇文獻(xiàn)中追根溯源,并總結(jié)流派和方法,然后再繼續(xù)關(guān)注當(dāng)前的最新進(jìn)展,逐步完善自己的領(lǐng)域,是我個(gè)人認(rèn)為比較好的一種科研思維。

https://github.com/open-mmlab/mmpose
下圖是2D姿態(tài)估計(jì)領(lǐng)域比較經(jīng)典的論文,也是我認(rèn)為必讀的一些論文,建議按照時(shí)間順序來閱讀,可以從中感受2D姿態(tài)估計(jì)的層層遞進(jìn)。閱讀的時(shí)候建議大家關(guān)注一下作者,因?yàn)楹芏嗾撐陌送蛔髡撸f明兩篇論文之間是有聯(lián)系的,例如,Openpose的前身就是CPM,MSPN是基于CPN的修改,另外Hpurglass、CPN、SimpleBaseline2D在HRNet論文中做了比較......這些論文之間的異同以及包含關(guān)系,也是比較有趣的。所有論文的題目和鏈接也一起放在了下面,感興趣的童鞋可以直接下載閱讀。每一篇文章的詳細(xì)講解,大家可以在各大分享平臺找到,很多大佬也都分享過自己的見解,本文僅對部分文章進(jìn)行簡單的介紹,梳理論文邏輯,詳細(xì)的內(nèi)容大家可以自行閱讀論文或者搜索參考其他作者講解的內(nèi)容。
當(dāng)然,只看論文是不夠的,因?yàn)檎撐膶W(wǎng)絡(luò)結(jié)構(gòu)的講解比較抽象,進(jìn)一步的學(xué)習(xí)一定要親自敲一遍網(wǎng)絡(luò)結(jié)構(gòu)的代碼,這一部分后續(xù)有時(shí)間也可以整理一下(挖坑1...)。

《[DeepPose: Human Pose Estimation via Deep Neural Networks]》(CVPR'2014)
https://arxiv.org/abs/1312.4659

DeepPose是姿態(tài)估估計(jì)領(lǐng)域中使用深度學(xué)習(xí)檢測人體關(guān)節(jié)點(diǎn)的最初的論文,在它之前,很多文章都是基于身體部位(part)檢測的。它?(1)繼承了AleXNet網(wǎng)絡(luò)結(jié)構(gòu),AlexNet 作為 backbone,是第一個(gè)DNN姿態(tài)估計(jì)網(wǎng)絡(luò);(2)采用級聯(lián)(cascade)結(jié)構(gòu)細(xì)化(refine)姿態(tài)。這對后面的網(wǎng)絡(luò)結(jié)構(gòu)思想有了很大啟發(fā),后續(xù)的很多網(wǎng)絡(luò)也都采用了cascade的這種結(jié)構(gòu)。
這篇文章提出了姿態(tài)估計(jì)的兩個(gè)概念:

cascade這個(gè)單詞在后面的很多網(wǎng)絡(luò)中都會用到,例如Hourglass和CPM,但我一開始并不太明白,后來翻看英文釋義,表示“串聯(lián),級聯(lián)”,也就是說,它將一個(gè)網(wǎng)絡(luò)模塊重復(fù)地使用多次,串在一起,形成multi-stage,相當(dāng)于加深了層數(shù),第一個(gè)stage粗檢測,后面逐漸精細(xì),類似于“從粗到細(xì)”的策略,逐漸糾正,不斷細(xì)化。事實(shí)證明這種結(jié)構(gòu)的有效性非常好。后續(xù)我們也會經(jīng)常見到這個(gè)詞,以及這種結(jié)構(gòu)。
與之對應(yīng)的還有一個(gè)詞:stacked,堆疊,Hourglass使用了這個(gè)詞的表述。兩個(gè)詞都表示同樣或相似的Block結(jié)構(gòu)多層連接。
論文使用的數(shù)據(jù)集有兩個(gè):FLIC和LSP,評價(jià)指標(biāo)分別為PDJ(=0.9+)和PCP@0.5(=0.61),評價(jià)指標(biāo)和數(shù)據(jù)集都比較舊了,現(xiàn)在已經(jīng)很少使用。建議大家看看上面提到的綜述論文,里面有數(shù)據(jù)集和評價(jià)指標(biāo)的詳細(xì)總結(jié),后期有空,可以單獨(dú)寫一個(gè)總結(jié)(挖坑2...)。
填坑2:人體姿態(tài)估計(jì)評價(jià)指標(biāo)見下文。
陌塵小小:【人體姿態(tài)估計(jì)評價(jià)指標(biāo)】
https://zhuanlan.zhihu.com/p/646159957
ResNet就不用多說了,源自何愷明論文《Deep Residual Learning for Image Recognition》。它幾乎是現(xiàn)在深度學(xué)習(xí)框架的基石,幾乎所有的backbone都用到它或者它的變體,當(dāng)然,幾乎所有的姿態(tài)估計(jì)的結(jié)構(gòu)代碼中都用到了這種殘差結(jié)構(gòu)。在使用代碼的時(shí)候,主要注意三個(gè)函數(shù),這也是后續(xù)所有網(wǎng)絡(luò)結(jié)構(gòu)代碼經(jīng)常用到的三個(gè)函數(shù):BasicBlock;Bottleneck;_make-layer方法。具體原理大家可看論文或者其他大佬講解。

具體的代碼可以看下面這個(gè)博文:
ResNet _make_layer代碼理解
https://blog.csdn.net/cangafuture/article/details/113485879

具體的代碼和講解可以看這個(gè)博文:
FPN網(wǎng)絡(luò)結(jié)構(gòu)及Pytorch實(shí)現(xiàn)
https://blog.csdn.net/qq_41251963/article/details/109398699
下面還有一些方法網(wǎng)絡(luò)很經(jīng)典,每一篇都逐漸遞進(jìn),每一篇都值得去看并且復(fù)現(xiàn)其網(wǎng)絡(luò)結(jié)構(gòu),例如Hourglass的網(wǎng)絡(luò),甚至用了遞歸的方法構(gòu)建網(wǎng)絡(luò),其中的細(xì)節(jié)就涉及到算法層面的知識了,但是了解每一種算法的輸入輸出和整體框架搭建思路,先構(gòu)建體系,再深入了解細(xì)節(jié),注意實(shí)際上手和操練,還是很不錯(cuò)的學(xué)習(xí)過程。這些論文的講解網(wǎng)上有一大堆,大家可以自行查閱,后續(xù)有時(shí)間可以對其中的細(xì)節(jié)進(jìn)行單獨(dú)的寫作,但是本篇僅作為入門使用。
HRNet網(wǎng)絡(luò)詳解
https://www.bilibili.com/video/BV1bB4y1y7qP
以上都是經(jīng)典的人體姿態(tài)估計(jì)網(wǎng)絡(luò),或許稱之為經(jīng)典的單人姿態(tài)估計(jì)網(wǎng)絡(luò),對于多人姿態(tài)估計(jì),分為自頂向下和自底向上,代表作分別是AlphaPose和OpenPose。
openpose教程人體姿態(tài)估計(jì)網(wǎng)絡(luò)
https://www.bilibili.com/video/BV1JD4y1W7jZ
看完這些經(jīng)典的論文之后自然要有所比較,在數(shù)據(jù)集那個(gè)哪個(gè)最優(yōu),這一部分可以看上文提到的綜述[2],里面有每個(gè)方法的亮點(diǎn)和每個(gè)數(shù)據(jù)集相應(yīng)的精度。進(jìn)一步的精度對比可以看這個(gè)網(wǎng)站paperswithcode,里面有所有最新算法在數(shù)據(jù)集上的精度比較,記錄了論文和代碼,非常方便來個(gè)示例圖,:

鏈接如下:大家可以看最新的精度和效果在MSCOCO、MPII數(shù)據(jù)集上的榜單,從而對比自己正在閱讀的論文和所做的工作有多大差距。
paperswithcode.com
https://paperswithcode.com/area/computer-vision/pose-estimation
截至寫本文的時(shí)候,最好的是基于Transformer的ViTPose。《ViTPose: Simple Vision Transformer Baselines for Human Pose Estimation》,講解可參考下文:
論文閱讀:ViTPose27
https://zhuanlan.zhihu.com/p/527877998
3D人體姿態(tài)估計(jì)是從圖片或視頻中估計(jì)出關(guān)節(jié)點(diǎn)的三維坐標(biāo) (x, y,z),它本質(zhì)上是一個(gè)回歸問題。
(1)單視角下2D到3D映射中固有的深度模糊性與不適定性:因?yàn)橐粋€(gè)2D骨架可以對應(yīng)多個(gè)3D骨架,它具有在單視角下2D到3D映射中固有的深度模糊性與不適定性,這也導(dǎo)致了它本身就具有挑戰(zhàn)性。
(2)缺少大型的室外數(shù)據(jù)集和特殊姿態(tài)數(shù)據(jù)集:這主要由于3D姿態(tài)數(shù)據(jù)集是依靠適合室內(nèi)環(huán)境的動作捕捉(MOCAP)系統(tǒng)構(gòu)建的,而MOCAP系統(tǒng)需要帶有多個(gè)傳感器和緊身衣褲的復(fù)雜裝置,在室外環(huán)境使用是不切實(shí)際的。因此數(shù)據(jù)集大多是在實(shí)驗(yàn)室環(huán)境下建立的,模型的泛化能力也比較差。
感興趣的同學(xué)可以看一下這篇CSDN的博客,有個(gè)大致了解,下面的部分內(nèi)容摘自其中。當(dāng)然這篇里面的分類只是一種,大家參考綜述[4]里面的配圖9,也可以作為一種分類,不過大家注意每種分類方法,一些重要的文獻(xiàn)總是歸在同一類別的。
3D人體姿態(tài)估計(jì)論文匯總(CVPR/ECCV/ACCV/AAAI)
https://yongqi.blog.csdn.net/article/details/107625327
《3D Human Pose Estimation from Monocular Images with Deep Convolutional Neural Network》,第一篇用卷及網(wǎng)絡(luò)直接回歸3D姿態(tài)的文章。

[1]《3D Human Pose Estimation from Monocular Images with Deep Convolutional Neural Network》?(2014)
[2]《VNect: Real-time 3D Human Pose Estimation with a Single RGB Camera》?(ACM-2017)
[3]《Coarse-to-Fine Volumetric Prediction for Single-Image 3D Human Pose》(CVPR-2017)
[4]《Integral Human Pose Regression》(CVPR-2018)
[5]《Camera Distance-aware Top-down Approach for 3D Multi-person Pose Estimation from a Single RGB Image》?(ICCV2019)
上述論文?[3](CVPR 2017)從2D圖片中直接得到體素(Volumetric representation),而不是直接回歸關(guān)節(jié)點(diǎn)的坐標(biāo),并取最大值的位置作為每個(gè)關(guān)節(jié)點(diǎn)的輸出。體素是從2D姿態(tài)估計(jì)的heatmap學(xué)習(xí)而來,其實(shí)就是3D heatmap。
第一步:ConvNet直接回歸生成關(guān)節(jié)體素(傳統(tǒng)是直接回歸3D坐標(biāo)),用到了Hourglass;
第二步:采用從粗到細(xì)的Coarse-to-Fine預(yù)測策略。



ChatGPT助你理解積分人體姿態(tài)估計(jì)
https://www.bilibili.com/video/BV1oM411A79c
總結(jié):首先是做2D的人體姿態(tài)估計(jì),然后基于Nearest neighbor最近鄰的match來從training data中找最像的姿態(tài)。2D的姿態(tài)估計(jì)算法是基于CPM來做的。3D的match方法是KNN(https://blog.csdn.net/u010608296/article/details/120640343)方法,先把training data中的人體3d骨架投射到2D空間,然后把test sample的2d骨架跟這些training data進(jìn)行對比,最后使用最相近的2d骨架對應(yīng)的3D骨架當(dāng)成最后test sample點(diǎn)3D骨架。當(dāng)training數(shù)據(jù)量非常多的時(shí)候,這種方法可能可以保證比較好的精度,但是在大部分時(shí)候,這種匹配方法的精度較粗,而且誤差很大。

論文動機(jī):論文作者開頭就提到,目前最先進(jìn)的 3d 人體姿態(tài)估計(jì)方法主要集中在端到端(直接回歸)的方法,即在給定原始圖像像素的情況下預(yù)測 3d 關(guān)節(jié)位置。盡管性能優(yōu)異,但通常很難理解它們的誤差來源于 2d姿態(tài)估計(jì)部分過程(visual),還是將 2d 姿勢映射到 3d關(guān)節(jié)的過程。因此,作者將 3d 姿態(tài)估計(jì)解耦為2d 姿態(tài)估計(jì)和從2d 到 3d 姿態(tài)估計(jì)(即,3D姿態(tài)估計(jì) = 2D姿態(tài)估計(jì) + (2D->3D)),重點(diǎn)關(guān)注?(2D->3D)。所以作者提出了一個(gè)從2D關(guān)節(jié)到3D關(guān)節(jié)的系統(tǒng),系統(tǒng)的輸入是 2d 個(gè)關(guān)節(jié)位置數(shù)組,輸出是 3d 中的一系列關(guān)節(jié)位置,并將其誤差降到很低,從而證明3D姿態(tài)估計(jì)的誤差主要來源于圖像到2D姿態(tài)的過程,即視覺理解(visual)的過程。

同樣,從這個(gè)工作的名字可以看出,這個(gè)工作提出了一個(gè)比較simple的baseline,但是效果還是非常明顯。方法上面來講,就是先做一個(gè)2d skeleton的姿態(tài)估計(jì),方法是基于Hourglass的,文章中的解釋是較好的效果以及不錯(cuò)的速度。基于獲得的2d骨架位置后,后續(xù)接入兩個(gè)fully connected的操作,直接回歸3D坐標(biāo)點(diǎn)。這個(gè)做法非常粗暴直接,但是效果還是非常明顯的。在回歸之前,需要對坐標(biāo)系統(tǒng)做一些操作。
VideoPose3D:《3D human pose estimation in video with temporal convolutions and semi-supervised training》
利用這篇是利用視頻做姿態(tài)估計(jì)的比較經(jīng)典的論文,使用了多幀的圖像來估計(jì)姿態(tài),直覺上應(yīng)該比單幀姿態(tài)估計(jì)要更加準(zhǔn)確。兩個(gè)貢獻(xiàn):
1. 提出了一種基于2D關(guān)節(jié)點(diǎn)軌跡的空洞時(shí)域卷積方法,簡單、有效的預(yù)測出視頻中的3D人體姿態(tài);
2. 引入了一種半監(jiān)督的方法,它利用了未標(biāo)記的視頻,并且在標(biāo)記數(shù)據(jù)稀缺的情況下是有效的。


關(guān)于最新進(jìn)展,大家同樣可以在paperswithcode網(wǎng)站去關(guān)注數(shù)據(jù)集Human3.6的榜單。
下面這個(gè)榜單是沒使用2DGT數(shù)據(jù)集的:
monocular-3d-human-pose-estimation
https://paperswithcode.com/task/monocular-3d-human-pose-estimation
下面這個(gè)榜單是使用2DGT數(shù)據(jù)集:
Human3.6M Benchmark (3D Human Pose Estimation)
https://paperswithcode.com/sota/3d-human-pose-estimation-on-human36m
3D形態(tài)估計(jì)是一個(gè)更新的任務(wù),旨在恢復(fù)人體的三維網(wǎng)格,我的研究課題正好與此相關(guān)。研究這個(gè)方向的同學(xué)應(yīng)該并不陌生,但是這里我們只介紹有關(guān)于SMPL的內(nèi)容,再次推薦之前提到的綜述論文[5] Recovering 3D Human Mesh from Monocular Images: A Survey(2022.03),里面的總結(jié)也是非常全的,截止2022年論文如下圖所示:

其論文可以歸類為兩類型:
這篇是Michael J. Black實(shí)驗(yàn)室的SMPL開山之作,后續(xù)的大部分SMPL方法等也是該實(shí)驗(yàn)出品,大部分SMPL相關(guān)論文均是這個(gè)研究所出來的。

SMPL模型學(xué)習(xí)
https://www.cnblogs.com/sariel-sakura/p/14321818.html
以下必讀論文來自商湯OpenMMLAB實(shí)驗(yàn)室的mmhuman3d項(xiàng)目,與之前提到的mmpose3d類似:上面有很多總結(jié)、經(jīng)典以及最新方法的實(shí)現(xiàn)和講解,有框架,有代碼,有教程,可快速復(fù)現(xiàn),而且維護(hù)和更新也很塊。
https://github.com/wmj142326/mmhuman3dgithub.com/wmj142326/mmhuman3d
[1] SMPLify(ECCV'2016):《Keep it SMPL: Automatic Estimation of 3D Human Pose and Shape from a Single Image》。?
https://smplify.is.tue.mpg.de/
[2]SMPLify-X (CVPR'2019):《Expressive Body Capture: 3D Hands, Face, and Body from a Single Image》
https://smpl-x.is.tue.mpg.de/
[3]HMR(CVPR'2018) :《End-to-end Recovery of Human Shape and Pose》
https://link.zhihu.com/?target=https%3A//akanazawa.github.io/hmr/
[4] SPIN(ICCV'2019):《 Learning to Reconstruct 3D Human Pose and Shapevia Model-fitting in the Loop 》
https://www.seas.upenn.edu/~nkolot/projects/spin/
[5] VIBE(CVPR'2020):《 Video lnference for Human Body Pose and Shape Estimation》
https://github.com/mkocabas/VIBE
[6] HybrIK (CVPR'2021):《HybrIK: A Hybrid Analytical-Neural Inverse Kinematics Solution for 3D Human Pose and Shape Estimation》 ?
https://jeffli.site/HybrIK/
[7] PARE (ICCV'2021):《PARE: Part Attention Regressor for 3D Human Body Estimation》 ?
https://pare.is.tue.mpg.de/
[8]?HuMoR?(2021) :《3D Human Motion Model for Robust Pose Estimation》
[9] DeciWatch(ECCV'2022):《DeciWatch: A Simple Baseline for 10× Efficient 2D and 3D Pose Estimation》 ?
https://ailingzeng.site/deciwatch
[10] SmoothNet (ECCV'2022):《SmoothNet:A Plug-and-Play Network for Refining Human Poses in Videos》 ?
https://ailingzeng.site/smoothnet
[11] ExPose (ECCV'2020):《Monocular Expressive Body Regression through Body-Driven Attention》 ?
https://expose.is.tue.mpg.de/
[12]BalancedMSE (CVPR'2022):《Balanced MSE for Imbalanced Visual Regression 》
https://sites.google.com/view/balanced-mse/home
對其中的部分論文作簡要介紹:






作者有過一期視頻講解,鏈接放在這里,大家可以進(jìn)一步聽聽,愛玲姐姐還講了一些姿態(tài)的總結(jié)知識(人美聲甜的大佬~):
【社區(qū)開放麥】第 14 期 從時(shí)間序列角度破解姿態(tài)估計(jì)中的兩大問題
https://www.zhihu.com/zvideo/1534485957927075840
CLIFF(2022):《CLIFF: Carrying Location Information in Full Frames into Human Pose and Shape Estimation》
[參考鏈接:https://zhuanlan.zhihu.com/p/556885801]這篇是華為諾亞方舟出品。3D Human mesh中采用Top-Down策略的多人姿態(tài)估計(jì)。以極其優(yōu)雅的方式,將原圖的信息融合到人體姿態(tài)估計(jì)的神經(jīng)網(wǎng)絡(luò)的輸入中,巨大提升了估計(jì)的準(zhǔn)確度,刷到了3dpw的rank 1,并贏得了ECCV 2022的oral。正如參考的博文所說,他的處理方式極其優(yōu)雅:

OSX(CVPR2023-IDEA)《One-Stage 3D Whole-Body Mesh Recovery with Component Aware Transformer》, 2023年CVPR的最新文章,提供了一個(gè)Ubody上身數(shù)據(jù)集。個(gè)人感覺,這是個(gè)“大團(tuán)隊(duì)+工作量+SOTA”的結(jié)果。


其他的最新進(jìn)展,大家可以關(guān)注3DPW這個(gè)數(shù)據(jù)集的paperswithcode榜單。
https://paperswithcode.com/sota/3d-human-pose-estimation-on-3dpw?metric=MPJPE
那么,問題來了,關(guān)于HPE的方法,論文已經(jīng)這么多了,最終它的應(yīng)用場景是什么?學(xué)習(xí)這個(gè)領(lǐng)域,最終的目的也是工作,再好的方向跟不上工業(yè)界的需要也是瞎扯,閉門造車!這里寫一些本人在學(xué)習(xí)和實(shí)習(xí)中的一些發(fā)現(xiàn)。
前情提要:本人碩士[現(xiàn)在是"菜博"了~:(],沒有工作。但是有過相關(guān)實(shí)習(xí),另外實(shí)驗(yàn)室也有相關(guān)的師兄弟從事這個(gè)方向,簡單寫一些所見所聞和個(gè)人感受,就當(dāng)交流了,簡單滴發(fā)表一些個(gè)人看法,后期發(fā)現(xiàn)說的不對了,再改hhhh~~。
單純的看姿態(tài)估計(jì),它是一個(gè)基礎(chǔ)任務(wù),目的是從圖像中獲得信息,更重要的是如何利用這一部分信息,或者說用這一信息可以用在什么地方,所以這一任務(wù)在學(xué)術(shù)界是為其他任務(wù)提供數(shù)據(jù)支撐的,追求的是更高的精度,更快的速度,俗稱“打榜”,更注重于方法研究。
現(xiàn)在的方法,層出不窮,但是個(gè)人認(rèn)為,工業(yè)界的落地還是不多。學(xué)術(shù)界與工業(yè)界就像是一個(gè)狹窄的漏斗的兩邊,大量的方法研究堵在上頭,卻因?yàn)榉N種原因難以落地~

自動駕駛的感知領(lǐng)域,行人行為識別、手勢識別等是可以看得見的應(yīng)用。但是,目前的自動駕駛好像并沒有做到這一塊,因?yàn)槟壳暗淖詣玉{駛還在“躲避障礙物”的階段,檢測任務(wù)還是應(yīng)用的主流,行人的行為識別還存在比較遠(yuǎn)的路,精度、速度都是限制。
數(shù)字人、數(shù)字驅(qū)動、游戲建模,AR,VR,游戲和動畫是目前的應(yīng)用主流,這種限制場景下的姿態(tài)有實(shí)現(xiàn)的硬件基礎(chǔ);但是,單目的姿態(tài)估計(jì)感覺還是沒有多視角的應(yīng)用多,因?yàn)槎嘁粋€(gè)攝像頭不會花很多錢,還能提高精度;但是少一個(gè)攝像頭的精度下降可能會帶來體驗(yàn)感的下降。
其實(shí),人體姿態(tài)估計(jì)只是深度學(xué)習(xí)的一個(gè)任務(wù)罷了,它的基礎(chǔ)知識,學(xué)習(xí)流程和其他的任務(wù)沒有本質(zhì)的區(qū)別,一通百通,手勢的關(guān)節(jié)點(diǎn)不也是關(guān)鍵點(diǎn)嗎?動物的關(guān)鍵點(diǎn)不也是關(guān)鍵點(diǎn)嗎?只會一種任務(wù)適應(yīng)不了時(shí)代的發(fā)展,我們學(xué)習(xí)的主要是一個(gè)領(lǐng)域,不要只把目光限制在“人體”和“姿態(tài)”,感知任務(wù),皆可!
這些大概就是關(guān)于人體姿態(tài)估計(jì)入門需要學(xué)習(xí)的一些知識了,相信看完這些,HPE的體系架構(gòu)可以建立個(gè)七七八八了,其他具體的一些算法層面的知識,大家可以基于這個(gè)框架體系流程逐步完善,網(wǎng)上的大佬教程也是相當(dāng)之多,寫此篇的目的:
一算整理,避免資源過多,學(xué)習(xí)凌亂;
二來幫助后人少走坑,盡量節(jié)省時(shí)間快速掌握;
三來也算自己的筆記整理,方便日后查詢;
來源:新機(jī)器視覺

申明:感謝原創(chuàng)作者的辛勤付出。本號轉(zhuǎn)載的文章均會在文中注明,若遇到版權(quán)問題請聯(lián)系我們處理。
?
----與智者為伍?為創(chuàng)新賦能----

聯(lián)系郵箱:uestcwxd@126.com
QQ:493826566