點擊藍字 關注我們
SUBSCRIBE to US

University of Waikato
新西蘭以壯闊自然風光聞名,其語言文化同樣獨具特色。該國共有三門官方語言,其中僅有毛利語屬于本土原生語言。雖然能流利使用毛利語的人口僅占總人口4.3%,但國家統計數據顯示,約三成新西蘭人都會基礎毛利詞句(https://en.tetaurawhiri.govt.nz/state_of_te_reo_maori)。
向聊天機器人程序下達毛利語寫作指令,它便能以學校教學、國家電視臺通用的標準毛利語流暢作答,Claude、Perplexity等人工智能產品也具備同款能力。這類出色的語言能力,依托毛利族群與學者創作的文本、語音數據訓練而成。這些數據未經許可被爬取收錄,在新西蘭境外加工處理,最終通過大型科技企業旗下平臺面向用戶提供服務。這一現狀,令毛利族群深感困擾。
懷卡托大學教授、人工智能研究所聯合負責人Te Taka Keegan表示:“海外科技企業擁有充足資源打造性能優異的人工智能模型,但它們擅自爬取相關數據,全程未征求毛利族群意見,產出成果也不歸我們所有。語言是傳承本土知識最重要的載體,可新西蘭本土知識的傳播話語權,正不斷被境外技術掌控。”
出于構建基根口中主權數字系統(sovereign digital systems)的訴求,他與當時的碩士生Kingsley Eng聯手,著手研發高保真語音合成系統,適配毛利語特定方言。二人研發全程恪守一條人工智能行業普遍忽視的核心原則:合成語音及所有研發素材,所有權必須歸屬該方言使用者。團隊希望這項成果,能為全球其他少數民族語言社群提供可借鑒的研發范本。
毛利語人工智能語音模型面臨的難題
人工智能語音模型大多基于英語研發,直接套用至其他語言極易出現差錯。毛利語具備獨特語言特性,元音長短區分嚴格,給語音合成系統帶來不小挑戰。
舉例來說,毛利語里蛋糕 (keke)、腋窩(kēkē)、嘎吱作響(kekē)三個單詞,拼寫相近,僅依靠元音發音長短區分詞義。雙字母組合發音現象也十分常見,讀音和英語截然不同,例如字母組合wh通常讀作f音。在毛利語中,發音偏差就會改變單詞本意。
此外,毛利語屬于低資源語言。相較于英語、漢語,其數字化文本、數據集、語音錄音等可用訓練素材儲量稀少。為解決該問題,Keegan邀請翻譯師、教育工作者兼語言導師Ngaringi Katipa擔任發聲原型,授權提供語音素材用于模型搭建(https://hai.stanford.edu/policy/mind-the-language-gap-mapping-the-challenges-of-llm-development-in-low-resource-language-contexts)。
“Our language is the most important conveyor we have for our knowledge.…yet we see technology developed outside of Aotearoa get more and more control over the transfer of that knowledge.”
—Te Taka Keegan, University of Waikato
Keegan表示:“我們專注Waikato-Maniapoto本土方言,方言最能彰顯語言獨特魅力,也承載著地域文化與族群身份認同?!?/span>
現任精密器械制造商Extec工程師的Eng稱:“起初我們只是錄制Ngaringi朗讀文本,累計獲得4.5小時語音數據。后續依托毛利語言學專家、基根教授的弟弟彼得整理的詞句清單,囊括生僻詞匯,進一步擴充數據集。”語音素材經清洗處理后,最終有效錄音時長達到7小時45分鐘。
毛利語文本轉語音人工智能模型
搭建語音合成系統主要有兩種數據輸入方式。第一種基于字符,直接將原始文字輸入模型;第二種基于音素,訓練前先把文本轉化為音標發音形式。
Eng表示:“兩種方式我們都嘗試過,音素法效果顯著更優。直接賦予模型音素規則,相當于搶占研發先機?!币羲啬苊鞔_字母組合對應的發音,可簡化部分學習過程。研究人員借助開源工具eSpeak NG錄入音素規則,該工具自帶毛利語試用版發音規則,團隊在此基礎上完成二次優化適配(https://github.com/espeak-ng/espeak-ng)。
Eng測試了Matcha-TTS、Tacotron2、Piper三款開源神經網絡框架,用以訓練語音素材、合成人聲。可本地離線運行的Piper效果最佳,最終被選定用于模型搭建。
該模型僅采用不到八小時的優質錄音數據,遠低于行業普遍要求的數百小時訓練時長,最終合成語音效果依舊出色。語音合成領域主要以詞錯誤率作為評判標準,數值越低代表準確度越高(https://northflank.com/blog/best-open-source-speech-to-text-stt-model-in-2026-benchmarks)。這款模型詞錯誤率為6.78%,達到行業優良水準。
研發全程均由專業毛利語評審人員,從自然度、發音準確度與情感表現力三方面持續評測語音質量。
研究人員還邀請68名毛利語流利使用者,分辨真人語音與合成語音。受試者辨別正確率為65%?;硎荆摻Y果令人滿意,部分聽者熟知發聲者本人聲線,仍出現判斷失誤。
毛利人工智能自主權屬
谷歌為懷卡托大學團隊提供資金支持,Keegan稱這筆資助無附加條款,企業也不享有相關所有權。谷歌表示聽聞團隊致力于語言保護工作,愿意提供助力,經費可自由支配。這筆資金最終用于合理支付Katipa的勞務報酬。
目前這套語音工具已投入使用,但所有權歸屬仍是基根重點考量的問題。依照常規知識產權法規,該語音模型歸卡蒂帕個人所有。
而從毛利族群的傳統觀念來看,Keegan認為其屬于集體共有:“這是祖輩傳承下來的文化瑰寶,她肩負著為后代守護這份財富的責任。”
因此團隊并未對外公開該語音模型,Keegan正與Katipa所屬的懷卡托、馬尼亞波托、勞卡瓦三大部族商議相關事宜。他表示,模型的管護權應交由部族掌管,而非校方。為此,Keegan聯系到惠靈頓的Catalyst IT公司,該企業無償提供為期一年的網站托管服務與模型運行算力支持。
數據主權日漸成為原住民人工智能領域的核心關注點。新西蘭北部毛利傳媒機構Te Hiku Media,研發出毛利語自動語音識別系統,純毛利語識別準確率達92%,雙語識別準確率為82%。該機構以守護治理許可協議發布模型,這份法律協議規定相關數據僅可用于造福毛利族群。
全球多地也涌現同類項目。巴塞羅那超級計算中心的Aina項目,依托開源框架打造出支持多方言的加泰羅尼亞語語音合成系統Matxa。加拿大魁北克地區,Michael Running Wolf牽頭First Languages AI Reality (FLAIR)計劃,致力于為北美各類原住民語言搭建語音識別模型。
語音驅動技術如今隨處可見,虛擬助手、屏幕閱讀器、導航系統與智能設備均屬此類。Keegan認為,這類工具既可能“篡改、同化本土語言”,也能夠“讓子孫后代傳承傳統知識”。他表示,技術的發展歸屬權決定了最終走向?!拔蚁M訉O后輩能依托本土自研體系汲取民族智慧,這套語音技術便是實現目標的開端?!?/span>
長遠來看,他計劃沿用社區共有、開源共建的模式,搭建完整語言模型?!斑@不會是通用毛利語大模型,”他說道,“而是馬尼阿波托部族、圖霍埃部族等專屬語言大模型?!泵靠钅P途鶜w對應族群所有,且依托本族語音數據完成訓練。
相較于語音合成系統,搭建這類模型的工程難度更高,但懷卡托項目證實,相關配套基礎條件已然具備:小數據高效訓練、音素輸入模式、開源工具,以及保障族群所有權的法律與管理體系。Keegan表示:“我們已經摸索出可行范式,新西蘭各地毛利部落均可參照復刻,我也樂意為此提供協助?!?/span>

微信號|IEEE電氣電子工程師學會
新浪微博|IEEE中國
Bilibili | IEEE中國
· IEEE電氣電子工程師學會 ·
往
期
推
薦
綠色工作崗位在哪里:電力工程
她的父親告訴她,教育可以改變人生
一段從“重新搭建一切”開始的職業道路
人工智能可在元宇宙中構建新世界,但也引發重大的倫理問題