點(diǎn)擊藍(lán)字 關(guān)注我們
SUBSCRIBE to US

Source image: Alamy
This article is part of our exclusive IEEE Journal Watch series in partnership with IEEE Xplore (https://spectrum.ieee.org/collections/journal-watch/).
隨著機(jī)器人的靈活操作能力及其他肢體性能不斷提升,人類與機(jī)器人并肩工作的場景也愈發(fā)普遍。若這一趨勢成為現(xiàn)實(shí),機(jī)器人需要在情緒感知能力上實(shí)現(xiàn)怎樣的升級,才能順利與人協(xié)作?
在近期一項(xiàng)研究中,研究人員訓(xùn)練協(xié)作型機(jī)器人識別人類情緒。這套識別體系不僅依托面部表情,還會(huì)結(jié)合互動(dòng)場景中的各類環(huán)境信息。研究人員邀請40名志愿者開展實(shí)驗(yàn),測試機(jī)器人識別情緒、調(diào)整行為的能力,以及在人機(jī)協(xié)同完成任務(wù)時(shí),這類能力會(huì)如何影響人類對機(jī)器人及其性能的觀感。該研究成果已于5月18日發(fā)表在《IEEE機(jī)器人與自動(dòng)化快報(bào)》上。實(shí)驗(yàn)結(jié)果表明,機(jī)器人的情緒感知能力在人機(jī)互動(dòng)中仍存在明顯局限 (https://ieeexplore.ieee.org/document/11523497)。
該研究由Seung Chan Hong主導(dǎo),是他在澳大利亞墨爾本大學(xué)就讀本科期間的畢業(yè)論文課題。他表示,當(dāng)下人們大多追捧機(jī)器人運(yùn)動(dòng)能力的進(jìn)步,但這只是整體問題的一環(huán)。“除了提升機(jī)器人的肢體性能,我們還需在人機(jī)交互領(lǐng)域做出創(chuàng)新。”
這也促使他進(jìn)一步探究人機(jī)互動(dòng)中的情緒感知問題。起初,Seung Chan Hong與研究團(tuán)隊(duì)借助視覺語言模型(VLM)訓(xùn)練機(jī)器人識別人類情緒。該模型與ChatGPT等大語言模型原理相近,同時(shí)還可接收視覺信息輸入。
面向人類情緒識別的視覺語言模型訓(xùn)練
為訓(xùn)練視覺語言模型,研究人員讓志愿者觀看機(jī)器人向人類遞送物品的視頻(視頻中遞送效果有好有壞),并描述視頻里人物流露的情緒。值得一提的是,標(biāo)注視頻的志愿者不只是單純依據(jù)面部表情判斷,還會(huì)結(jié)合互動(dòng)中的各類場景信息。舉例來說,有人眉頭緊鎖、駐足思索,可能只是在專注手頭工作,并非心生怒氣。而敲手指、抿嘴等行為表現(xiàn),這類場景細(xì)節(jié)才能真正解讀出對方皺眉背后的真實(shí)情緒。
研究人員隨后將這款視覺語言模型,與目前人機(jī)交互領(lǐng)域常用、依托傳統(tǒng)面部分析和目標(biāo)追蹤技術(shù)的人工智能系統(tǒng)進(jìn)行對比。結(jié)果顯示,視覺語言模型的表現(xiàn)更優(yōu)。本次評分區(qū)間為0至1分:0分代表識別結(jié)果與志愿者判斷的情緒完全不符,1分代表二者完全一致。傳統(tǒng)人工智能系統(tǒng)得分0.77,而視覺語言模型得分達(dá)到0.86。
Hong表示:“這款視覺語言模型能更好地匹配人類觀察者的判斷。它并非只短暫捕捉人臉表情,而是會(huì)審視完整場景,包括人物所處位置、正在進(jìn)行的動(dòng)作,以及人與機(jī)器人的互動(dòng)狀態(tài)。”
研究團(tuán)隊(duì)開展了第二項(xiàng)實(shí)驗(yàn),安排40名志愿者與搭載該視覺語言模型的機(jī)器人互動(dòng),并特意設(shè)置讓機(jī)器人出現(xiàn)操作失誤。隨后機(jī)器人會(huì)做出兩種回應(yīng):一種是結(jié)合人類當(dāng)場反應(yīng)、做出情緒適配的道歉,另一種則是預(yù)先設(shè)定好的制式道歉。
絕大多數(shù)志愿者更偏愛前者,40人中共有31人選擇接受這種貼合情緒的道歉,而非千篇一律的客套說辭。
不過問卷結(jié)果也表明,相比情緒適配能力,機(jī)器人的實(shí)際功能表現(xiàn)要重要得多。即便機(jī)器人為失誤做出不同方式的道歉,只要任務(wù)執(zhí)行失敗,多數(shù)志愿者對它的信任度都會(huì)下降。Hong說道:“貼合情緒的個(gè)性化道歉能起到緩和氛圍的作用,卻無法彌補(bǔ)因操作失誤而流失的信任。”
有趣的是,該視覺語言模型對人類情緒的判斷,和旁觀互動(dòng)過程的第三方志愿者基本一致。但在第二項(xiàng)實(shí)驗(yàn)中,將模型判斷結(jié)果與當(dāng)事人自述的真實(shí)情緒比對后發(fā)現(xiàn),其情緒識別準(zhǔn)確率大幅下降。
Hong表示:“這款模型善于捕捉外在的情緒表現(xiàn),卻無法洞悉人心。它的判斷和第三方觀察者相差無幾,但往往難以貼合使用者內(nèi)心真實(shí)的感受。”
綜合實(shí)驗(yàn)結(jié)果可知,機(jī)器人尚無法精準(zhǔn)識別人類情緒。所以即便人們會(huì)認(rèn)可機(jī)器人的努力,但最終還是更希望共事的伙伴具備出色的工作能力。

微信號|IEEE電氣電子工程師學(xué)會(huì)
新浪微博|IEEE中國
Bilibili | IEEE中國
· IEEE電氣電子工程師學(xué)會(huì) ·
往
期
推
薦
機(jī)器人行業(yè)邁向真實(shí)應(yīng)用,專家關(guān)注2026年關(guān)鍵轉(zhuǎn)變
電池廠商優(yōu)化替代鉛酸電池的便捷方案
一段從“重新搭建一切”開始的職業(yè)道路
人工智能可在元宇宙中構(gòu)建新世界,但也引發(fā)重大的倫理問題