SyncVSR: Data-Efficient Visual Speech Recognition with End-to-End Crossmodal Audio Token Synchronization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ahn, Young Jin, Park, Jungwoo, Park, Sangha, Choi, Jonghyun, Kim, Kee-Eung |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Monet: Mixture of Monosemantic Experts for Transformers
par: Park, Jungwoo, et autres
Publié: (2024)
par: Park, Jungwoo, et autres
Publié: (2024)
ScrewSplat: An End-to-End Method for Articulated Object Recognition
par: Kim, Seungyeon, et autres
Publié: (2025)
par: Kim, Seungyeon, et autres
Publié: (2025)
MMS-LLaMA: Efficient LLM-based Audio-Visual Speech Recognition with Minimal Multimodal Speech Tokens
par: Yeo, Jeong Hun, et autres
Publié: (2025)
par: Yeo, Jeong Hun, et autres
Publié: (2025)
AV2AV: Direct Audio-Visual Speech to Audio-Visual Speech Translation with Unified Audio-Visual Speech Representation
par: Choi, Jeongsoo, et autres
Publié: (2023)
par: Choi, Jeongsoo, et autres
Publié: (2023)
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
par: Liu, Zehua, et autres
Publié: (2024)
par: Liu, Zehua, et autres
Publié: (2024)
InfoSyncNet: Information Synchronization Temporal Convolutional Network for Visual Speech Recognition
par: Xue, Junxiao, et autres
Publié: (2025)
par: Xue, Junxiao, et autres
Publié: (2025)
OLKAVS: An Open Large-Scale Korean Audio-Visual Speech Dataset
par: Park, Jeongkyun, et autres
Publié: (2023)
par: Park, Jeongkyun, et autres
Publié: (2023)
Attention Misses Visual Risk: Risk-Adaptive Steering for Multimodal Safety Alignment
par: Park, Jonghyun, et autres
Publié: (2025)
par: Park, Jonghyun, et autres
Publié: (2025)
Can Natural Image Autoencoders Compactly Tokenize fMRI Volumes for Long-Range Dynamics Modeling?
par: Kim, Peter Yongho, et autres
Publié: (2026)
par: Kim, Peter Yongho, et autres
Publié: (2026)
KVoiceBench, KOpenAudioBench, and KMMAU: Agent-Driven Korean Speech Benchmarks for Evaluating SpeechLMs
par: Kim, Haechan, et autres
Publié: (2026)
par: Kim, Haechan, et autres
Publié: (2026)
Survey of End-to-End Multi-Speaker Automatic Speech Recognition for Monaural Audio
par: He, Xinlu, et autres
Publié: (2025)
par: He, Xinlu, et autres
Publié: (2025)
UniSync: A Unified Framework for Audio-Visual Synchronization
par: Feng, Tao, et autres
Publié: (2025)
par: Feng, Tao, et autres
Publié: (2025)
See and Fix the Flaws: Enabling VLMs and Diffusion Models to Comprehend Visual Artifacts via Agentic Data Synthesis
par: Park, Jaehyun, et autres
Publié: (2026)
par: Park, Jaehyun, et autres
Publié: (2026)
Leveraging Synthetic Audio Data for End-to-End Low-Resource Speech Translation
par: Moslem, Yasmin
Publié: (2024)
par: Moslem, Yasmin
Publié: (2024)
SyncAnimation: A Real-Time End-to-End Framework for Audio-Driven Human Pose and Talking Head Animation
par: Liu, Yujian, et autres
Publié: (2025)
par: Liu, Yujian, et autres
Publié: (2025)
A Comprehensive Analysis of Tokenization and Self-Supervised Learning in End-to-End Automatic Speech Recognition applied on French Language
par: Bañeras-Roux, Thibault, et autres
Publié: (2026)
par: Bañeras-Roux, Thibault, et autres
Publié: (2026)
VisionSelector: End-to-End Learnable Visual Token Compression for Efficient Multimodal LLMs
par: Zhu, Jiaying, et autres
Publié: (2025)
par: Zhu, Jiaying, et autres
Publié: (2025)
Efficient Training for Multilingual Visual Speech Recognition: Pre-training with Discretized Visual Speech Representation
par: Kim, Minsu, et autres
Publié: (2024)
par: Kim, Minsu, et autres
Publié: (2024)
Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction
par: Li, Tianpeng, et autres
Publié: (2025)
par: Li, Tianpeng, et autres
Publié: (2025)
Continual Learning for Monolingual End-to-End Automatic Speech Recognition
par: Eeckt, Steven Vander, et autres
Publié: (2021)
par: Eeckt, Steven Vander, et autres
Publié: (2021)
Efficient End-to-End Visual Document Understanding with Rationale Distillation
par: Zhu, Wang, et autres
Publié: (2023)
par: Zhu, Wang, et autres
Publié: (2023)
P‐Hologen: An End‐to‐End Generative Framework for Phase‐Only Holograms
par: JooHyun Park, et autres
Publié: (2024)
par: JooHyun Park, et autres
Publié: (2024)
EXAONE Path 2.0: Pathology Foundation Model with End-to-End Supervision
par: Pyeon, Myeongjang, et autres
Publié: (2025)
par: Pyeon, Myeongjang, et autres
Publié: (2025)
Data Augmentation for End-to-end Code-switching Speech Recognition
par: Du, Chenpeng, et autres
Publié: (2020)
par: Du, Chenpeng, et autres
Publié: (2020)
HEAT: Heterogeneous End-to-End Autonomous Driving via Trajectory-Guided World Models
par: Cho, Hoonhee, et autres
Publié: (2026)
par: Cho, Hoonhee, et autres
Publié: (2026)
Integrating Pre-Trained Speech and Language Models for End-to-End Speech Recognition
par: Hono, Yukiya, et autres
Publié: (2023)
par: Hono, Yukiya, et autres
Publié: (2023)
SUPER-AD: Semantic Uncertainty-aware Planning for End-to-End Robust Autonomous Driving
par: Ryu, Wonjeong, et autres
Publié: (2025)
par: Ryu, Wonjeong, et autres
Publié: (2025)
MI-Pruner: Crossmodal Mutual Information-guided Token Pruner for Efficient MLLMs
par: Li, Jiameng, et autres
Publié: (2026)
par: Li, Jiameng, et autres
Publié: (2026)
SwinLip: An Efficient Visual Speech Encoder for Lip Reading Using Swin Transformer
par: Park, Young-Hu, et autres
Publié: (2025)
par: Park, Young-Hu, et autres
Publié: (2025)
End-to-End Vision Tokenizer Tuning
par: Wang, Wenxuan, et autres
Publié: (2025)
par: Wang, Wenxuan, et autres
Publié: (2025)
Bayesian Multi-Task Transfer Learning for Soft Prompt Tuning
par: Lee, Haeju, et autres
Publié: (2024)
par: Lee, Haeju, et autres
Publié: (2024)
Efficient Multi-Camera Tokenization with Triplanes for End-to-End Driving
par: Ivanovic, Boris, et autres
Publié: (2025)
par: Ivanovic, Boris, et autres
Publié: (2025)
Modeling Stereo-Confidence Out of the End-to-End Stereo-Matching Network via Disparity Plane Sweep
par: Lee, Jae Young, et autres
Publié: (2024)
par: Lee, Jae Young, et autres
Publié: (2024)
Enhancing End-to-End Autonomous Driving Systems Through Synchronized Human Behavior Data
par: Duan, Yiqun, et autres
Publié: (2024)
par: Duan, Yiqun, et autres
Publié: (2024)
Adapting Diarization-Conditioned Whisper for End-to-End Multi-Talker Speech Recognition
par: Kocour, Martin, et autres
Publié: (2025)
par: Kocour, Martin, et autres
Publié: (2025)
End-to-End Chess Recognition
par: Masouris, Athanasios, et autres
Publié: (2023)
par: Masouris, Athanasios, et autres
Publié: (2023)
TextlessRAG: End-to-End Visual Document RAG by Speech Without Text
par: Xie, Peijin, et autres
Publié: (2025)
par: Xie, Peijin, et autres
Publié: (2025)
VR-Drive: Viewpoint-Robust End-to-End Driving with Feed-Forward 3D Gaussian Splatting
par: Cho, Hoonhee, et autres
Publié: (2025)
par: Cho, Hoonhee, et autres
Publié: (2025)
End-to-End Chart Summarization via Visual Chain-of-Thought in Vision-Language Models
par: Choi, Raymond, et autres
Publié: (2025)
par: Choi, Raymond, et autres
Publié: (2025)
CREPE: Coordinate-Aware End-to-End Document Parser
par: Okamoto, Yamato, et autres
Publié: (2024)
par: Okamoto, Yamato, et autres
Publié: (2024)
Documents similaires
-
Monet: Mixture of Monosemantic Experts for Transformers
par: Park, Jungwoo, et autres
Publié: (2024) -
ScrewSplat: An End-to-End Method for Articulated Object Recognition
par: Kim, Seungyeon, et autres
Publié: (2025) -
MMS-LLaMA: Efficient LLM-based Audio-Visual Speech Recognition with Minimal Multimodal Speech Tokens
par: Yeo, Jeong Hun, et autres
Publié: (2025) -
AV2AV: Direct Audio-Visual Speech to Audio-Visual Speech Translation with Unified Audio-Visual Speech Representation
par: Choi, Jeongsoo, et autres
Publié: (2023) -
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
par: Liu, Zehua, et autres
Publié: (2024)