【谷歌推出手语转文本模型】手语AI首次进入消费级8月13日消息,谷歌旗下人工智能实验室当地时间12日宣布推出一款大规模多语言手语转文本 (SL2T) 翻译模型。
得益于这一模型,手语人工智能首次进入消费级产品:谷歌Pixel 11系列智能手机上的Gboard和Live Transcribe应用程序支持手语转文本输入功能(初期仅限美国手语,后续将扩展至更多种手语和更多设备)。
DeepMind表示,手语是一种独立的自然语言,拥有自身独特的语法和词汇。因此手语翻译需要真正的机器翻译,而非按顺序将手语转换为文字。而能满足SL2T任务的模型必须能“看懂”手语使用者的身体多部位同步运动,这需要强大的计算机视觉处理能力。
Google DeepMind的SL2T模型在超过50种手语的10万小时数据上进行训练。其将手语转化为一系列姿势特征点的位置信息以保护用户隐私安全,无需将原始视频流发送到服务器端。同时其放弃了以往广泛使用的“中间注释”,直接解读空间信息。(IT之家)
