VAPO: End-to-end Slide-Enhanced Speech Recognition with Omni-modal Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hu, Rui, Qiu, Delai, Wang, Yining, Liu, Shengping, Sang, Jitao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Omni-AVSR: Towards Unified Multimodal Speech Recognition with Large Language Models
par: Cappellazzo, Umberto, et autres
Publié: (2025)
par: Cappellazzo, Umberto, et autres
Publié: (2025)
Continual Test-time Adaptation for End-to-end Speech Recognition on Noisy Speech
par: Lin, Guan-Ting, et autres
Publié: (2024)
par: Lin, Guan-Ting, et autres
Publié: (2024)
Enhancing CTC-Based Visual Speech Recognition
par: Laux, Hendrik, et autres
Publié: (2024)
par: Laux, Hendrik, et autres
Publié: (2024)
SlideAVSR: A Dataset of Paper Explanation Videos for Audio-Visual Speech Recognition
par: Wang, Hao, et autres
Publié: (2024)
par: Wang, Hao, et autres
Publié: (2024)
Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing
par: Liu, Zehua, et autres
Publié: (2025)
par: Liu, Zehua, et autres
Publié: (2025)
Large Language Models are Strong Audio-Visual Speech Recognition Learners
par: Cappellazzo, Umberto, et autres
Publié: (2024)
par: Cappellazzo, Umberto, et autres
Publié: (2024)
End-to-end Acoustic-linguistic Emotion and Intent Recognition Enhanced by Semi-supervised Learning
par: Ren, Zhao, et autres
Publié: (2025)
par: Ren, Zhao, et autres
Publié: (2025)
Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper
par: Chen, Gehui, et autres
Publié: (2025)
par: Chen, Gehui, et autres
Publié: (2025)
Sheet Music Transformer: End-To-End Optical Music Recognition Beyond Monophonic Transcription
par: Ríos-Vila, Antonio, et autres
Publié: (2024)
par: Ríos-Vila, Antonio, et autres
Publié: (2024)
Semantically consistent Video-to-Audio Generation using Multimodal Language Large Model
par: Chen, Gehui, et autres
Publié: (2024)
par: Chen, Gehui, et autres
Publié: (2024)
NaturalL2S: End-to-End High-quality Multispeaker Lip-to-Speech Synthesis with Differential Digital Signal Processing
par: Liang, Yifan, et autres
Publié: (2025)
par: Liang, Yifan, et autres
Publié: (2025)
DeepAudio-V1:Towards Multi-Modal Multi-Stage End-to-End Video to Speech and Audio Generation
par: Zhang, Haomin, et autres
Publié: (2025)
par: Zhang, Haomin, et autres
Publié: (2025)
Contextualized End-to-end Automatic Speech Recognition with Intermediate Biasing Loss
par: Shakeel, Muhammad, et autres
Publié: (2024)
par: Shakeel, Muhammad, et autres
Publié: (2024)
UniCUE: Unified Recognition and Generation Framework for Chinese Cued Speech Video-to-Speech Generation
par: Wang, Jinting, et autres
Publié: (2025)
par: Wang, Jinting, et autres
Publié: (2025)
Efficient Training for Multilingual Visual Speech Recognition: Pre-training with Discretized Visual Speech Representation
par: Kim, Minsu, et autres
Publié: (2024)
par: Kim, Minsu, et autres
Publié: (2024)
S2ST-Omni: Hierarchical Language-Aware SpeechLLM Adaptation for Multilingual Speech-to-Speech Translation
par: Pan, Yu, et autres
Publié: (2025)
par: Pan, Yu, et autres
Publié: (2025)
End-to-end Audio Deepfake Detection from RAW Waveforms: a RawNet-Based Approach with Cross-Dataset Evaluation
par: Di Pierno, Andrea, et autres
Publié: (2025)
par: Di Pierno, Andrea, et autres
Publié: (2025)
MoME: Mixture of Matryoshka Experts for Audio-Visual Speech Recognition
par: Cappellazzo, Umberto, et autres
Publié: (2025)
par: Cappellazzo, Umberto, et autres
Publié: (2025)
CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge
par: Liu, Zehua, et autres
Publié: (2025)
par: Liu, Zehua, et autres
Publié: (2025)
Zero-Shot Recognition of Dysarthric Speech Using Commercial Automatic Speech Recognition and Multimodal Large Language Models
par: Alsayegh, Ali, et autres
Publié: (2025)
par: Alsayegh, Ali, et autres
Publié: (2025)
Zero-AVSR: Zero-Shot Audio-Visual Speech Recognition with LLMs by Learning Language-Agnostic Speech Representations
par: Yeo, Jeong Hun, et autres
Publié: (2025)
par: Yeo, Jeong Hun, et autres
Publié: (2025)
mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition
par: Rouditchenko, Andrew, et autres
Publié: (2025)
par: Rouditchenko, Andrew, et autres
Publié: (2025)
Mitigating Attention Sinks and Massive Activations in Audio-Visual Speech Recognition with LLMs
par: Anand, et autres
Publié: (2025)
par: Anand, et autres
Publié: (2025)
Computation and Parameter Efficient Multi-Modal Fusion Transformer for Cued Speech Recognition
par: Liu, Lei, et autres
Publié: (2024)
par: Liu, Lei, et autres
Publié: (2024)
Oceanship: A Large-Scale Dataset for Underwater Audio Target Recognition
par: Li, Zeyu, et autres
Publié: (2024)
par: Li, Zeyu, et autres
Publié: (2024)
A Low-rank Matching Attention based Cross-modal Feature Fusion Method for Conversational Emotion Recognition
par: Shou, Yuntao, et autres
Publié: (2023)
par: Shou, Yuntao, et autres
Publié: (2023)
Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model
par: Zhang, Shaolei, et autres
Publié: (2025)
par: Zhang, Shaolei, et autres
Publié: (2025)
Whisper-Flamingo: Integrating Visual Features into Whisper for Audio-Visual Speech Recognition and Translation
par: Rouditchenko, Andrew, et autres
Publié: (2024)
par: Rouditchenko, Andrew, et autres
Publié: (2024)
Nexus: An Omni-Perceptive And -Interactive Model for Language, Audio, And Vision
par: Liu, Che, et autres
Publié: (2025)
par: Liu, Che, et autres
Publié: (2025)
IKFST: IOO and KOO Algorithms for Accelerated and Precise WFST-based End-to-End Automatic Speech Recognition
par: Zhuang, Zhuoran, et autres
Publié: (2026)
par: Zhuang, Zhuoran, et autres
Publié: (2026)
OmniSep: Unified Omni-Modality Sound Separation with Query-Mixup
par: Cheng, Xize, et autres
Publié: (2024)
par: Cheng, Xize, et autres
Publié: (2024)
AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation
par: Wang, Le, et autres
Publié: (2025)
par: Wang, Le, et autres
Publié: (2025)
TCDiff++: An End-to-end Trajectory-Controllable Diffusion Model for Harmonious Music-Driven Group Choreography
par: Dai, Yuqin, et autres
Publié: (2025)
par: Dai, Yuqin, et autres
Publié: (2025)
Harnessing the Zero-Shot Power of Instruction-Tuned Large Language Model in End-to-End Speech Recognition
par: Higuchi, Yosuke, et autres
Publié: (2023)
par: Higuchi, Yosuke, et autres
Publié: (2023)
End-to-End Target Speaker Speech Recognition Using Context-Aware Attention Mechanisms for Challenging Enrollment Scenario
par: Ghane, Mohsen, et autres
Publié: (2025)
par: Ghane, Mohsen, et autres
Publié: (2025)
End-to-End Integration of Speech Emotion Recognition with Voice Activity Detection using Self-Supervised Learning Features
par: Yamashita, Natsuo, et autres
Publié: (2024)
par: Yamashita, Natsuo, et autres
Publié: (2024)
EmoQ: Speech Emotion Recognition via Speech-Aware Q-Former and Large Language Model
par: Yang, Yiqing, et autres
Publié: (2025)
par: Yang, Yiqing, et autres
Publié: (2025)
OmniAudio: Generating Spatial Audio from 360-Degree Video
par: Liu, Huadai, et autres
Publié: (2025)
par: Liu, Huadai, et autres
Publié: (2025)
Streaming Speech Recognition with Decoder-Only Large Language Models and Latency Optimization
par: Wan, Genshun, et autres
Publié: (2026)
par: Wan, Genshun, et autres
Publié: (2026)
Dr. SHAP-AV: Decoding Relative Modality Contributions via Shapley Attribution in Audio-Visual Speech Recognition
par: Cappellazzo, Umberto, et autres
Publié: (2026)
par: Cappellazzo, Umberto, et autres
Publié: (2026)
Documents similaires
-
Omni-AVSR: Towards Unified Multimodal Speech Recognition with Large Language Models
par: Cappellazzo, Umberto, et autres
Publié: (2025) -
Continual Test-time Adaptation for End-to-end Speech Recognition on Noisy Speech
par: Lin, Guan-Ting, et autres
Publié: (2024) -
Enhancing CTC-Based Visual Speech Recognition
par: Laux, Hendrik, et autres
Publié: (2024) -
SlideAVSR: A Dataset of Paper Explanation Videos for Audio-Visual Speech Recognition
par: Wang, Hao, et autres
Publié: (2024) -
Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing
par: Liu, Zehua, et autres
Publié: (2025)