SignVTCL: Multi-Modal Continuous Sign Language Recognition Enhanced by Visual-Textual Contrastive Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Hao, Wang, Jiaze, Guo, Ziyu, Li, Jinpeng, Zhou, Donghao, Wu, Bian, Guan, Chenyong, Chen, Guangyong, Heng, Pheng-Ann |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MM-Mixing: Multi-Modal Mixing Alignment for 3D Understanding
by: Wang, Jiaze, et al.
Published: (2024)
by: Wang, Jiaze, et al.
Published: (2024)
Point Cloud Understanding via Attention-Driven Contrastive Learning
by: Wang, Yi, et al.
Published: (2024)
by: Wang, Yi, et al.
Published: (2024)
MagicTailor: Component-Controllable Personalization in Text-to-Image Diffusion Models
by: Zhou, Donghao, et al.
Published: (2024)
by: Zhou, Donghao, et al.
Published: (2024)
SciVerse: Unveiling the Knowledge Comprehension and Visual Reasoning of LMMs on Multi-modal Scientific Problems
by: Guo, Ziyu, et al.
Published: (2025)
by: Guo, Ziyu, et al.
Published: (2025)
Denoising-Contrastive Alignment for Continuous Sign Language Recognition
by: Guo, Leming, et al.
Published: (2023)
by: Guo, Leming, et al.
Published: (2023)
LLM-Assisted Multi-Teacher Continual Learning for Visual Question Answering in Robotic Surgery
by: Du, Yuyang, et al.
Published: (2024)
by: Du, Yuyang, et al.
Published: (2024)
Medical Large Vision Language Models with Multi-Image Visual Ability
by: Yang, Xikai, et al.
Published: (2025)
by: Yang, Xikai, et al.
Published: (2025)
SFANet: Spatial-Frequency Attention Network for Weather Forecasting
by: Wang, Jiaze, et al.
Published: (2024)
by: Wang, Jiaze, et al.
Published: (2024)
ATLAS: Agentic or Latent Visual Reasoning? One Word is Enough for Both
by: Guo, Ziyu, et al.
Published: (2026)
by: Guo, Ziyu, et al.
Published: (2026)
Perceive and Calibrate: Analyzing and Enhancing Robustness of Medical Multi-Modal Large Language Models
by: XU, Dunyuan, et al.
Published: (2025)
by: XU, Dunyuan, et al.
Published: (2025)
Multi‐Task Mixture Density Graph Neural Networks for Predicting Catalyst Performance
by: Chen Liang, et al.
Published: (2024)
by: Chen Liang, et al.
Published: (2024)
Boosting In-Silicon Directed Evolution with Fine-Tuned Protein Language Model and Tree Search
by: Yang, Yaodong, et al.
Published: (2025)
by: Yang, Yaodong, et al.
Published: (2025)
Generative Sign-description Prompts with Multi-positive Contrastive Learning for Sign Language Recognition
by: Liang, Siyu, et al.
Published: (2025)
by: Liang, Siyu, et al.
Published: (2025)
Thinking-while-Generating: Interleaving Textual Reasoning throughout Visual Generation
by: Guo, Ziyu, et al.
Published: (2025)
by: Guo, Ziyu, et al.
Published: (2025)
Distribution-Aware Calibration for Object Detection with Noisy Bounding Boxes
by: Zhou, Donghao, et al.
Published: (2023)
by: Zhou, Donghao, et al.
Published: (2023)
Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis
by: Yu, Yang, et al.
Published: (2026)
by: Yu, Yang, et al.
Published: (2026)
SceneDecorator: Towards Scene-Oriented Story Generation with Scene Planning and Scene Consistency
by: Song, Quanjian, et al.
Published: (2025)
by: Song, Quanjian, et al.
Published: (2025)
EvSign: Sign Language Recognition and Translation with Streaming Events
by: Zhang, Pengyu, et al.
Published: (2024)
by: Zhang, Pengyu, et al.
Published: (2024)
MM-WLAuslan: Multi-View Multi-Modal Word-Level Australian Sign Language Recognition Dataset
by: Shen, Xin, et al.
Published: (2024)
by: Shen, Xin, et al.
Published: (2024)
SignX: Continuous Sign Recognition in Compact Pose-Rich Latent Space
by: Fang, Sen, et al.
Published: (2025)
by: Fang, Sen, et al.
Published: (2025)
AutoSign: Direct Pose-to-Text Translation for Continuous Sign Language Recognition
by: Johnny, Samuel Ebimobowei, et al.
Published: (2025)
by: Johnny, Samuel Ebimobowei, et al.
Published: (2025)
Dual Ensembled Multiagent Q-Learning with Hypernet Regularizer
by: Yang, Yaodong, et al.
Published: (2025)
by: Yang, Yaodong, et al.
Published: (2025)
Cross-Modal Consistency Learning for Sign Language Recognition
by: Wu, Kepeng, et al.
Published: (2025)
by: Wu, Kepeng, et al.
Published: (2025)
SignBind-LLM: Multi-Stage Modality Fusion for Sign Language Translation
by: Thomas, Marshall, et al.
Published: (2025)
by: Thomas, Marshall, et al.
Published: (2025)
EfficientSign: An Attention-Enhanced Lightweight Architecture for Indian Sign Language Recognition
by: Gupta, Rishabh, et al.
Published: (2026)
by: Gupta, Rishabh, et al.
Published: (2026)
Multi-Stream Keypoint Attention Network for Sign Language Recognition and Translation
by: Guan, Mo, et al.
Published: (2024)
by: Guan, Mo, et al.
Published: (2024)
Contrastive Learning-Driven Traffic Sign Perception: Multi-Modal Fusion of Text and Vision
by: Lu, Qiang, et al.
Published: (2025)
by: Lu, Qiang, et al.
Published: (2025)
“Target Sign” of Schwannoma on Contrast‐Enhanced Ultrasound
by: Lu Yang, et al.
Published: (2025)
by: Lu Yang, et al.
Published: (2025)
Signed Angle Rigid Graphs for Network Localization and Formation Control
by: Huang, Jinpeng, et al.
Published: (2025)
by: Huang, Jinpeng, et al.
Published: (2025)
Unlocking Potential Binders: Multimodal Pretraining DEL-Fusion for Denoising DNA-Encoded Libraries
by: Gu, Chunbin, et al.
Published: (2024)
by: Gu, Chunbin, et al.
Published: (2024)
Exploring Attention Mechanisms in Integration of Multi-Modal Information for Sign Language Recognition and Translation
by: Hakim, Zaber Ibn Abdul, et al.
Published: (2023)
by: Hakim, Zaber Ibn Abdul, et al.
Published: (2023)
SignCLIP: Connecting Text and Sign Language by Contrastive Learning
by: Jiang, Zifan, et al.
Published: (2024)
by: Jiang, Zifan, et al.
Published: (2024)
Towards Online Continuous Sign Language Recognition and Translation
by: Zuo, Ronglai, et al.
Published: (2024)
by: Zuo, Ronglai, et al.
Published: (2024)
MEJO: MLLM-Engaged Surgical Triplet Recognition via Inter- and Intra-Task Joint Optimization
by: Zhang, Yiyi, et al.
Published: (2025)
by: Zhang, Yiyi, et al.
Published: (2025)
Adaptive Negative Evidential Deep Learning for Open-set Semi-supervised Learning
by: Yu, Yang, et al.
Published: (2023)
by: Yu, Yang, et al.
Published: (2023)
LA-Sign: Looped Transformers with Geometry-aware Alignment for Skeleton-based Sign Language Recognition
by: Pu, Muxin, et al.
Published: (2026)
by: Pu, Muxin, et al.
Published: (2026)
SignScene: Visual Sign Grounding for Mapless Navigation
by: Zimmerman, Nicky, et al.
Published: (2026)
by: Zimmerman, Nicky, et al.
Published: (2026)
From Learning to Unlearning: Biomedical Security Protection in Multimodal Large Language Models
by: Xu, Dunyuan, et al.
Published: (2025)
by: Xu, Dunyuan, et al.
Published: (2025)
SeaDAG: Semi-autoregressive Diffusion for Conditional Directed Acyclic Graph Generation
by: Zhou, Xinyi, et al.
Published: (2024)
by: Zhou, Xinyi, et al.
Published: (2024)
Hierarchical Sub-action Tree for Continuous Sign Language Recognition
by: Yang, Dejie, et al.
Published: (2025)
by: Yang, Dejie, et al.
Published: (2025)
Similar Items
-
MM-Mixing: Multi-Modal Mixing Alignment for 3D Understanding
by: Wang, Jiaze, et al.
Published: (2024) -
Point Cloud Understanding via Attention-Driven Contrastive Learning
by: Wang, Yi, et al.
Published: (2024) -
MagicTailor: Component-Controllable Personalization in Text-to-Image Diffusion Models
by: Zhou, Donghao, et al.
Published: (2024) -
SciVerse: Unveiling the Knowledge Comprehension and Visual Reasoning of LMMs on Multi-modal Scientific Problems
by: Guo, Ziyu, et al.
Published: (2025) -
Denoising-Contrastive Alignment for Continuous Sign Language Recognition
by: Guo, Leming, et al.
Published: (2023)