Denoising-Diffusion Alignment for Continuous Sign Language Recognition

Guo, Leming; Xue, Wanli; Kang, Ze; Zhou, Yuxi; Yuan, Tiantian; Gao, Zan; Chen, Shengyong

Computer Science > Computer Vision and Pattern Recognition

arXiv:2305.03614v3 (cs)

[Submitted on 5 May 2023 (v1), revised 5 Feb 2024 (this version, v3), latest version 3 May 2024 (v4)]

Title:Denoising-Diffusion Alignment for Continuous Sign Language Recognition

Authors:Leming Guo, Wanli Xue, Ze Kang, Yuxi Zhou, Tiantian Yuan, Zan Gao, Shengyong Chen

View PDF

Abstract:As a key to social good, continuous sign language recognition (CSLR) aims to promote active and accessible communication for the hearing impaired. Current CSLR research adopts a cross-modality alignment scheme to learn the map** relationship between "video clip-textual gloss". However, this local alignment method, especially with weak data annotation, ignores the contextual information of modalities and directly reduces the generalization of visual features. To this end, we propose a novel Denoising-Diffusion global Alignment scheme (DDA), which focuses on modeling the map** of the "entire video-gloss sequence". DDA consists of a partial noising process strategy and a denoising-diffusion autoencoder. The former is used to achieve efficient guidance of the text modality to the visual modality; the latter learns the global alignment information of the two modalities in a denoising manner. Our DDA confirms the feasibility of diffusion models for visual representation learning in CSLR. Experiments on three public benchmarks demonstrate that our method achieves state-of-the-art performances. Furthermore, the proposed method can be a plug-and-play optimization to generalize other CSLR methods.

Subjects:	Computer Vision and Pattern Recognition (cs.CV)
Cite as:	arXiv:2305.03614 [cs.CV]
	(or arXiv:2305.03614v3 [cs.CV] for this version)
	https://doi.org/10.48550/arXiv.2305.03614

Submission history

From: Leming Guo [view email]
[v1] Fri, 5 May 2023 15:20:27 UTC (996 KB)
[v2] Thu, 1 Jun 2023 02:23:02 UTC (6,269 KB)
[v3] Mon, 5 Feb 2024 17:15:26 UTC (1,096 KB)
[v4] Fri, 3 May 2024 04:11:55 UTC (1,522 KB)

Computer Science > Computer Vision and Pattern Recognition

Title:Denoising-Diffusion Alignment for Continuous Sign Language Recognition

Submission history

Access Paper:

References & Citations

Bookmark

Bibliographic and Citation Tools

Code, Data and Media Associated with this Article

Demos

Recommenders and Search Tools

arXivLabs: experimental projects with community collaborators

Computer Science > Computer Vision and Pattern Recognition

Title:Denoising-Diffusion Alignment for Continuous Sign Language Recognition

Submission history

Access Paper:

References & Citations

BibTeX formatted citation

Bookmark

Bibliographic and Citation Tools

Code, Data and Media Associated with this Article

Demos

Recommenders and Search Tools

arXivLabs: experimental projects with community collaborators