Google DeepMind週三(8/12) 推出手語轉文字AI模型SL2T ,可透過手機鏡頭理解使用者的手語,再即時翻譯成文字。目前率先整合於Pixel 11的Gboard及即時轉錄(Live Transcribe)App,初期僅支援將美國手語(ASL)翻譯成英文,之後將擴大至更多裝置與手語。
SL2T讓聾人及聽障使用者可直接對著手機打手語,而不必逐字打字。由於它整合至Gboard手機虛擬鍵盤,使用者可在原本能輸入文字的地方以手語操作,包括搜尋網路、撰寫訊息與文件,以及要求Gemini回答問題或執行任務。在即時轉錄App中,也能以手語回應面對面談話。
過去坊間雖然已有手語轉文字模型及商用系統,但多數用於研究、教育、企業櫃台等特定環境,有些還需要動作感測器、深度攝影機或其他專用設備。過去也有研究嘗試利用手機鏡頭辨識手語,但多停留在研究原型或獨立應用程式;SL2T則直接整合至Pixel的虛擬鍵盤,讓手語成為可跨不同App使用的手機輸入方式。
Google解釋,手語並非只是用雙手依序比出英文單字,而是具有獨立詞彙及文法的自然語言,也會同時利用手掌、手臂、軀幹、頭部及臉部動作傳達意義。因此,模型除了辨識細微且快速的全身動作,還必須重新組織語句,才能翻譯成自然英文。
SL2T使用超過10萬小時、涵蓋50多種手語的資料共同訓練,其中約四分之一為美國手語。Google表示,多語訓練能讓模型學習不同手語共通的底層結構,實驗表現優於只學習單一手語的模型。在評估美國手語翻譯成英文能力的FLEURS-ASL基準測試中,SL2T取得70分BLEURT;Google宣稱,這項零樣本成績高於過去公開紀錄,但未列出具體比較模型。
SL2T採手機與雲端協作。Pixel 11先擷取使用者臉部、手部及身體的關鍵點,再將座標傳至雲端翻譯,原始影片不會上傳。模型也支援左撇子及單手手語,但遇到罕見手勢或快速手指拼字時仍可能翻錯。
Google已成立AI手語諮詢委員會,邀請全球聾人組織及手語專家參與部署與影響評估。除了擴大支援更多手語及裝置,未來也計畫研究手語生成技術,朝手語與文字雙向溝通發展。