研究 / 官方
苹果提出首个篇章级手语词素翻译框架
手语翻译系统长期以来只在句子层面运作,忽略了手语理解中至关重要的篇章现象。苹果机器学习研究团队联合东北大学、高立德大学等机构,提出 DiscoSign——一个基于模块化大语言模型的篇章感知文本到手语词素翻译框架。该框架重点解决三类核心语言现象:空间共指消解(确保实体在整个篇章中保持一致的空间位置)、问答从句结构(处理美国手语中具有特定篇章功能的伪分裂结构),以及概念与词素的一致性映射。研究团队同时指出,传统翻译评估指标无法衡量篇章层面的质量,因此配套提出了一套全新评估体系。实验结果表明,与仅处理单句的方法相比,DiscoSign 在空间一致性和实体追踪方面取得显著提升,同时保持了有竞争力的单句翻译质量。该工作是首个系统性的篇章级手语词素翻译框架。
手语翻译领域长期面临一个根本性局限:现有系统几乎都以单句为处理单元,而真实的手语交流是在连贯篇章中展开的。篇章层面存在大量句子级方法无法捕捉的语言现象,例如实体在空间中的持续定位、跨句的指代关系,以及特定的语法结构。这一缺口直接影响了手语翻译系统对聋人及听障群体的实际可用性。
DiscoSign 的核心是一个模块化的大语言模型翻译框架,针对三类关键篇章现象分别设计处理模块。第一类是空间共指消解:在美国手语中,说话者会将实体指定到特定空间位置,并在整个对话中持续引用这些位置,系统需要跨句追踪并保持这种空间一致性。第二类是问答从句,即手语中用于强调或对比的伪分裂结构,具有独特的篇章功能,需要专门识别与生成。
第三类现象是概念与词素的一致性映射,即同一英语概念在整篇翻译中应始终对应同一个美国手语词素,避免因翻译不一致而造成理解混乱。DiscoSign 通过模块化设计,让每个子系统专注于各自的语言现象,再将结果整合为连贯的篇章级翻译输出,从而在保持单句翻译质量的同时,大幅提升篇章层面的连贯性。
评估方法的创新同样是本研究的重要贡献。传统的 BLEU 等翻译指标以句子为单位计算,无法反映篇章层面的空间一致性或实体追踪质量。研究团队为此设计了一套专门针对上述三类篇章现象的新型评估指标,并在句子级和篇章级两类数据集上进行了系统实验,验证了 DiscoSign 在篇章处理上的显著优势。
DiscoSign 是苹果在无障碍技术与手语处理领域持续投入的最新成果。此前,苹果团队已发布基于伪标注流水线的手语数据集自动标注方法,以及关注非手动标记(如面部表情和肢体语言)的手语生成研究。DiscoSign 将于 2026 年 EMNLP 会议正式发表,标志着计算手语研究从句子级向篇章级的重要跨越,为未来更自然、更准确的手语翻译系统奠定了方法论基础。
要点
- DiscoSign 是首个系统性处理篇章层面语言现象的文本到手语词素翻译框架,填补了该领域的重要空白
- 框架通过模块化大语言模型分别解决空间共指消解、问答从句结构和概念词素一致性三大核心问题
- 研究团队同步提出配套的篇章级评估指标体系,弥补了传统翻译指标无法衡量篇章连贯性的不足
- 实验证明,篇章感知处理在空间一致性和实体追踪方面显著优于仅处理单句的基线方法
原始标题:DiscoSign: Discourse-Aware Text to Sign Language Gloss Translation
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。