arxivcs.CVcs.CL2026-07-10
VTaMo: Video-Text Alignment Model for Sign Language Translation
Junyi Hu, Zhewen He, Haomian Huang, Aoxiang Yang, Yi Fang
Sign language translation (SLT) converts continuous sign videos into spoken language text. Gloss-free approaches leverage pre-trained visual encoders and language models but rely on implicit cross-modal alignment from translation supervision alone. We present VTaMo, a framework t…