VALLR: Visual ASR Language Model for Lip Reading
Fuente:
arXiv
Guardado en:
| Autores principales: | Thomas, Marshall, Fish, Edward, Bowden, Richard |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SignBind-LLM: Multi-Stage Modality Fusion for Sign Language Translation
por: Thomas, Marshall, et al.
Publicado: (2025)
por: Thomas, Marshall, et al.
Publicado: (2025)
Geo-Sign: Hyperbolic Contrastive Regularisation for Geometrically Aware Sign Language Translation
por: Fish, Edward, et al.
Publicado: (2025)
por: Fish, Edward, et al.
Publicado: (2025)
VisualSpeaker: Visually-Guided 3D Avatar Lip Synthesis
por: Symeonidis-Herzig, Alexandre, et al.
Publicado: (2025)
por: Symeonidis-Herzig, Alexandre, et al.
Publicado: (2025)
VALLR-Pin: Uncertainty-Factorized Visual Speech Recognition for Mandarin with Pinyin Guidance
por: Sun, Chang, et al.
Publicado: (2025)
por: Sun, Chang, et al.
Publicado: (2025)
Contrastive Pretraining with Dual Visual Encoders for Gloss-Free Sign Language Translation
por: Sincan, Ozge Mercanoglu, et al.
Publicado: (2025)
por: Sincan, Ozge Mercanoglu, et al.
Publicado: (2025)
Diverse Signer Avatars with Manual and Non-Manual Feature Modelling for Sign Language Production
por: Lakhal, Mohamed Ilyes, et al.
Publicado: (2025)
por: Lakhal, Mohamed Ilyes, et al.
Publicado: (2025)
SwinLip: An Efficient Visual Speech Encoder for Lip Reading Using Swin Transformer
por: Park, Young-Hu, et al.
Publicado: (2025)
por: Park, Young-Hu, et al.
Publicado: (2025)
Sign2GPT: Leveraging Large Language Models for Gloss-Free Sign Language Translation
por: Wong, Ryan, et al.
Publicado: (2024)
por: Wong, Ryan, et al.
Publicado: (2024)
Diversity-Aware Sign Language Production through a Pose Encoding Variational Autoencoder
por: Lakhal, Mohamed Ilyes, et al.
Publicado: (2024)
por: Lakhal, Mohamed Ilyes, et al.
Publicado: (2024)
Enhancing Lip Reading with Multi-Scale Video and Multi-Encoder
por: Wang, He, et al.
Publicado: (2024)
por: Wang, He, et al.
Publicado: (2024)
SignSplat: Rendering Sign Language via Gaussian Splatting
por: Ivashechkin, Maksym, et al.
Publicado: (2025)
por: Ivashechkin, Maksym, et al.
Publicado: (2025)
BioLip: Language-Generalizable Lip-Sync Deepfake Detection via Biomechanical Constraint Violation Modeling
por: Chen, Hao, et al.
Publicado: (2026)
por: Chen, Hao, et al.
Publicado: (2026)
Lips Are Lying: Spotting the Temporal Inconsistency between Audio and Visual in Lip-Syncing DeepFakes
por: Liu, Weifeng, et al.
Publicado: (2024)
por: Liu, Weifeng, et al.
Publicado: (2024)
Using Sign Language Production as Data Augmentation to enhance Sign Language Translation
por: Walsh, Harry, et al.
Publicado: (2025)
por: Walsh, Harry, et al.
Publicado: (2025)
PLOT-TAL: Prompt Learning with Optimal Transport for Few-Shot Temporal Action Localization
por: Fish, Edward, et al.
Publicado: (2024)
por: Fish, Edward, et al.
Publicado: (2024)
LipGen: Viseme-Guided Lip Video Generation for Enhancing Visual Speech Recognition
por: Hao, Bowen, et al.
Publicado: (2025)
por: Hao, Bowen, et al.
Publicado: (2025)
Hierarchical Feature Alignment for Gloss-Free Sign Language Translation
por: Asasi, Sobhan, et al.
Publicado: (2025)
por: Asasi, Sobhan, et al.
Publicado: (2025)
Personalized Lip Reading: Adapting to Your Unique Lip Movements with Vision and Language
por: Yeo, Jeong Hun, et al.
Publicado: (2024)
por: Yeo, Jeong Hun, et al.
Publicado: (2024)
Enhancing Speech-Driven 3D Facial Animation with Audio-Visual Guidance from Lip Reading Expert
por: EunGi, Han, et al.
Publicado: (2024)
por: EunGi, Han, et al.
Publicado: (2024)
Sign Stitching: A Novel Approach to Sign Language Production
por: Walsh, Harry, et al.
Publicado: (2024)
por: Walsh, Harry, et al.
Publicado: (2024)
SignAgent: Agentic LLMs for Linguistically-Grounded Sign Language Annotation and Dataset Curation
por: Cory, Oliver, et al.
Publicado: (2026)
por: Cory, Oliver, et al.
Publicado: (2026)
MTGA: Multi-View Temporal Granularity Aligned Aggregation for Event-Based Lip-Reading
por: Zhang, Wenhao, et al.
Publicado: (2024)
por: Zhang, Wenhao, et al.
Publicado: (2024)
Sign Spotting Disambiguation using Large Language Models
por: Low, JianHe, et al.
Publicado: (2025)
por: Low, JianHe, et al.
Publicado: (2025)
SAGE: Segment-Aware Gloss-Free Encoding for Token-Efficient Sign Language Translation
por: Low, JianHe, et al.
Publicado: (2025)
por: Low, JianHe, et al.
Publicado: (2025)
GaussianGAN: Real-Time Photorealistic controllable Human Avatars
por: Lakhal, Mohamed Ilyes, et al.
Publicado: (2025)
por: Lakhal, Mohamed Ilyes, et al.
Publicado: (2025)
Spotter+GPT: Turning Sign Spottings into Sentences with LLMs
por: Sincan, Ozge Mercanoglu, et al.
Publicado: (2024)
por: Sincan, Ozge Mercanoglu, et al.
Publicado: (2024)
Integrating Persian Lip Reading in Surena-V Humanoid Robot for Human-Robot Interaction
por: Abbasi, Ali Farshian, et al.
Publicado: (2025)
por: Abbasi, Ali Farshian, et al.
Publicado: (2025)
HuGeDiff: 3D Human Generation via Diffusion with Gaussian Splatting
por: Ivashechkin, Maksym, et al.
Publicado: (2025)
por: Ivashechkin, Maksym, et al.
Publicado: (2025)
HandOcc: NeRF-based Hand Rendering with Occupancy Networks
por: Ivashechkin, Maksym, et al.
Publicado: (2025)
por: Ivashechkin, Maksym, et al.
Publicado: (2025)
Two Hands Are Better Than One: Resolving Hand to Hand Intersections via Occupancy Networks
por: Ivashechkin, Maksym, et al.
Publicado: (2024)
por: Ivashechkin, Maksym, et al.
Publicado: (2024)
LRW-Persian: Lip-reading in the Wild Dataset for Persian Language
por: Taghizadeh, Zahra, et al.
Publicado: (2025)
por: Taghizadeh, Zahra, et al.
Publicado: (2025)
M3T: Discrete Multi-Modal Motion Tokens for Sign Language Production
por: Symeonidis-Herzig, Alexandre, et al.
Publicado: (2026)
por: Symeonidis-Herzig, Alexandre, et al.
Publicado: (2026)
Beyond Gloss: A Hand-Centric Framework for Gloss-Free Sign Language Translation
por: Asasi, Sobhan, et al.
Publicado: (2025)
por: Asasi, Sobhan, et al.
Publicado: (2025)
OmniEdit: A Training-free framework for Lip Synchronization and Audio-Visual Editing
por: Lin, Lixiang, et al.
Publicado: (2026)
por: Lin, Lixiang, et al.
Publicado: (2026)
SignRep: Enhancing Self-Supervised Sign Representations
por: Wong, Ryan, et al.
Publicado: (2025)
por: Wong, Ryan, et al.
Publicado: (2025)
Landmark-Guided Cross-Speaker Lip Reading with Mutual Information Regularization
por: Wu, Linzhi, et al.
Publicado: (2024)
por: Wu, Linzhi, et al.
Publicado: (2024)
Gloss-Free Sign Language Translation: An Unbiased Evaluation of Progress in the Field
por: Sincan, Ozge Mercanoglu, et al.
Publicado: (2026)
por: Sincan, Ozge Mercanoglu, et al.
Publicado: (2026)
FlashLips: 100-FPS Mask-Free Latent Lip-Sync using Reconstruction Instead of Diffusion or GANs
por: Zinonos, Andreas, et al.
Publicado: (2025)
por: Zinonos, Andreas, et al.
Publicado: (2025)
SignSparK: Efficient Multilingual Sign Language Production via Sparse Keyframe Learning
por: Low, Jianhe, et al.
Publicado: (2026)
por: Low, Jianhe, et al.
Publicado: (2026)
Giving a Hand to Diffusion Models: a Two-Stage Approach to Improving Conditional Human Image Generation
por: Pelykh, Anton, et al.
Publicado: (2024)
por: Pelykh, Anton, et al.
Publicado: (2024)
Ejemplares similares
-
SignBind-LLM: Multi-Stage Modality Fusion for Sign Language Translation
por: Thomas, Marshall, et al.
Publicado: (2025) -
Geo-Sign: Hyperbolic Contrastive Regularisation for Geometrically Aware Sign Language Translation
por: Fish, Edward, et al.
Publicado: (2025) -
VisualSpeaker: Visually-Guided 3D Avatar Lip Synthesis
por: Symeonidis-Herzig, Alexandre, et al.
Publicado: (2025) -
VALLR-Pin: Uncertainty-Factorized Visual Speech Recognition for Mandarin with Pinyin Guidance
por: Sun, Chang, et al.
Publicado: (2025) -
Contrastive Pretraining with Dual Visual Encoders for Gloss-Free Sign Language Translation
por: Sincan, Ozge Mercanoglu, et al.
Publicado: (2025)