Enregistré dans:
| Auteurs principaux: | Fernandez-Lopez, Adriana, Chen, Honglie, Ma, Pingchuan, Yin, Lu, Xiao, Qiao, Petridis, Stavros, Liu, Shiwei, Pantic, Maja |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2406.17614 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Large Language Models are Strong Audio-Visual Speech Recognition Learners
par: Cappellazzo, Umberto, et autres
Publié: (2024)
par: Cappellazzo, Umberto, et autres
Publié: (2024)
RT-LA-VocE: Real-Time Low-SNR Audio-Visual Speech Enhancement
par: Chen, Honglie, et autres
Publié: (2024)
par: Chen, Honglie, et autres
Publié: (2024)
Full-Rank No More: Low-Rank Weight Training for Modern Speech Recognition Models
par: Fernandez-Lopez, Adriana, et autres
Publié: (2024)
par: Fernandez-Lopez, Adriana, et autres
Publié: (2024)
Revival with Voice: Multi-modal Controllable Text-to-Speech Synthesis
par: Kim, Minsu, et autres
Publié: (2025)
par: Kim, Minsu, et autres
Publié: (2025)
MoME: Mixture of Matryoshka Experts for Audio-Visual Speech Recognition
par: Cappellazzo, Umberto, et autres
Publié: (2025)
par: Cappellazzo, Umberto, et autres
Publié: (2025)
Dynamic Data Pruning for Automatic Speech Recognition
par: Xiao, Qiao, et autres
Publié: (2024)
par: Xiao, Qiao, et autres
Publié: (2024)
Omni-AVSR: Towards Unified Multimodal Speech Recognition with Large Language Models
par: Cappellazzo, Umberto, et autres
Publié: (2025)
par: Cappellazzo, Umberto, et autres
Publié: (2025)
Adaptive Audio-Visual Speech Recognition via Matryoshka-Based Multimodal LLMs
par: Cappellazzo, Umberto, et autres
Publié: (2025)
par: Cappellazzo, Umberto, et autres
Publié: (2025)
Contextual Speech Extraction: Leveraging Textual History as an Implicit Cue for Target Speech Extraction
par: Kim, Minsu, et autres
Publié: (2025)
par: Kim, Minsu, et autres
Publié: (2025)
Unified Speech Recognition: A Single Model for Auditory, Visual, and Audiovisual Inputs
par: Haliassos, Alexandros, et autres
Publié: (2024)
par: Haliassos, Alexandros, et autres
Publié: (2024)
Dr. SHAP-AV: Decoding Relative Modality Contributions via Shapley Attribution in Audio-Visual Speech Recognition
par: Cappellazzo, Umberto, et autres
Publié: (2026)
par: Cappellazzo, Umberto, et autres
Publié: (2026)
Mitigating Attention Sinks and Massive Activations in Audio-Visual Speech Recognition with LLMs
par: Anand, et autres
Publié: (2025)
par: Anand, et autres
Publié: (2025)
Zero-AVSR: Zero-Shot Audio-Visual Speech Recognition with LLMs by Learning Language-Agnostic Speech Representations
par: Yeo, Jeong Hun, et autres
Publié: (2025)
par: Yeo, Jeong Hun, et autres
Publié: (2025)
Efficient Audiovisual Speech Processing via MUTUD: Multimodal Training and Unimodal Deployment
par: Hong, Joanna, et autres
Publié: (2025)
par: Hong, Joanna, et autres
Publié: (2025)
Scaling and Enhancing LLM-based AVSR: A Sparse Mixture of Projectors Approach
par: Cappellazzo, Umberto, et autres
Publié: (2025)
par: Cappellazzo, Umberto, et autres
Publié: (2025)
BRAVEn: Improving Self-Supervised Pre-training for Visual and Auditory Speech Recognition
par: Haliassos, Alexandros, et autres
Publié: (2024)
par: Haliassos, Alexandros, et autres
Publié: (2024)
Angle-Optimized Partial Disentanglement for Multimodal Emotion Recognition in Conversation
par: Che, Xinyi, et autres
Publié: (2025)
par: Che, Xinyi, et autres
Publié: (2025)
MSAC: Multiple Speech Attribute Control Method for Reliable Speech Emotion Recognition
par: Pan, Yu, et autres
Publié: (2023)
par: Pan, Yu, et autres
Publié: (2023)
Purification Before Fusion: Toward Mask-Free Speech Enhancement for Robust Audio-Visual Speech Recognition
par: Wu, Linzhi, et autres
Publié: (2026)
par: Wu, Linzhi, et autres
Publié: (2026)
FreeMask: Rethinking the Importance of Attention Masks for Zero-Shot Video Editing
par: Cai, Lingling, et autres
Publié: (2024)
par: Cai, Lingling, et autres
Publié: (2024)
Controllable Text-to-Speech Synthesis with Masked-Autoencoded Style-Rich Representation
par: Wang, Yongqi, et autres
Publié: (2025)
par: Wang, Yongqi, et autres
Publié: (2025)
State-Anchored Complete-View Distillation for Robust Conversational Multimodal Emotion Recognition
par: Pan, Zhaoyan, et autres
Publié: (2026)
par: Pan, Zhaoyan, et autres
Publié: (2026)
SVLA: A Unified Speech-Vision-Language Assistant with Multimodal Reasoning and Speech Generation
par: Huynh, Ngoc Dung, et autres
Publié: (2025)
par: Huynh, Ngoc Dung, et autres
Publié: (2025)
Multimodal Emotion Recognition with Large Language Models
par: Zhang, Hongrui, et autres
Publié: (2026)
par: Zhang, Hongrui, et autres
Publié: (2026)
SpikEmo: Enhancing Emotion Recognition With Spiking Temporal Dynamics in Conversations
par: Yu, Xiaomin, et autres
Publié: (2024)
par: Yu, Xiaomin, et autres
Publié: (2024)
MLLM-based Speech Recognition: When and How is Multimodality Beneficial?
par: Guan, Yiwen, et autres
Publié: (2025)
par: Guan, Yiwen, et autres
Publié: (2025)
TARQ: Tail-Aware Reconstruction Quantization for Rare-Word Robust Automatic Speech Recognition
par: Wang, Xinyu, et autres
Publié: (2026)
par: Wang, Xinyu, et autres
Publié: (2026)
Robust LLM-based Audio-Visual Speech Recognition with Sparse Modality Alignment and Visual Unit-Guided Refinement
par: Su, Fei, et autres
Publié: (2026)
par: Su, Fei, et autres
Publié: (2026)
Multimodal Learned Sparse Retrieval for Image Suggestion
par: Nguyen, Thong, et autres
Publié: (2024)
par: Nguyen, Thong, et autres
Publié: (2024)
Evolutionary Multimodal Reasoning via Hierarchical Semantic Representation for Intent Recognition
par: Zhou, Qianrui, et autres
Publié: (2026)
par: Zhou, Qianrui, et autres
Publié: (2026)
Orthogonal Disentanglement with Projected Feature Alignment for Multimodal Emotion Recognition in Conversation
par: Che, Xinyi, et autres
Publié: (2025)
par: Che, Xinyi, et autres
Publié: (2025)
Multimodal Fusion via Hypergraph Autoencoder and Contrastive Learning for Emotion Recognition in Conversation
par: Yi, Zijian, et autres
Publié: (2024)
par: Yi, Zijian, et autres
Publié: (2024)
Mitigating Multimodal Inconsistency via Cognitive Dual-Pathway Reasoning for Intent Recognition
par: Wang, Yifan, et autres
Publié: (2026)
par: Wang, Yifan, et autres
Publié: (2026)
Ada2I: Enhancing Modality Balance for Multimodal Conversational Emotion Recognition
par: Nguyen, Cam-Van Thi, et autres
Publié: (2024)
par: Nguyen, Cam-Van Thi, et autres
Publié: (2024)
Explainable Multimodal Emotion Recognition
par: Lian, Zheng, et autres
Publié: (2023)
par: Lian, Zheng, et autres
Publié: (2023)
Target Speech Diarization with Multimodal Prompts
par: Jiang, Yidi, et autres
Publié: (2024)
par: Jiang, Yidi, et autres
Publié: (2024)
LipGen: Viseme-Guided Lip Video Generation for Enhancing Visual Speech Recognition
par: Hao, Bowen, et autres
Publié: (2025)
par: Hao, Bowen, et autres
Publié: (2025)
Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark
par: Zhang, Han, et autres
Publié: (2025)
par: Zhang, Han, et autres
Publié: (2025)
Private Speech Classification without Collapse: Stabilized DP Training and Offline Distillation
par: Wen, Yadi, et autres
Publié: (2026)
par: Wen, Yadi, et autres
Publié: (2026)
Multimodal Methods for Analyzing Learning and Training Environments: A Systematic Literature Review
par: Cohn, Clayton, et autres
Publié: (2024)
par: Cohn, Clayton, et autres
Publié: (2024)
Documents similaires
-
Large Language Models are Strong Audio-Visual Speech Recognition Learners
par: Cappellazzo, Umberto, et autres
Publié: (2024) -
RT-LA-VocE: Real-Time Low-SNR Audio-Visual Speech Enhancement
par: Chen, Honglie, et autres
Publié: (2024) -
Full-Rank No More: Low-Rank Weight Training for Modern Speech Recognition Models
par: Fernandez-Lopez, Adriana, et autres
Publié: (2024) -
Revival with Voice: Multi-modal Controllable Text-to-Speech Synthesis
par: Kim, Minsu, et autres
Publié: (2025) -
MoME: Mixture of Matryoshka Experts for Audio-Visual Speech Recognition
par: Cappellazzo, Umberto, et autres
Publié: (2025)