SlideAVSR: A Dataset of Paper Explanation Videos for Audio-Visual Speech Recognition
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Hao, Kurita, Shuhei, Shimizu, Shuichiro, Kawahara, Daisuke |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AD-AVSR: Asymmetric Dual-stream Enhancement for Robust Audio-Visual Speech Recognition
di: Xue, Junxiao, et al.
Pubblicazione: (2025)
di: Xue, Junxiao, et al.
Pubblicazione: (2025)
Zero-AVSR: Zero-Shot Audio-Visual Speech Recognition with LLMs by Learning Language-Agnostic Speech Representations
di: Yeo, Jeong Hun, et al.
Pubblicazione: (2025)
di: Yeo, Jeong Hun, et al.
Pubblicazione: (2025)
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
di: Liu, Zehua, et al.
Pubblicazione: (2024)
di: Liu, Zehua, et al.
Pubblicazione: (2024)
Large Language Models are Strong Audio-Visual Speech Recognition Learners
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2024)
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2024)
Adaptive Audio-Visual Speech Recognition via Matryoshka-Based Multimodal LLMs
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2025)
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2025)
AISHELL6-whisper: A Chinese Mandarin Audio-visual Whisper Speech Dataset with Speech Recognition Baselines
di: Li, Cancan, et al.
Pubblicazione: (2025)
di: Li, Cancan, et al.
Pubblicazione: (2025)
MMS-LLaMA: Efficient LLM-based Audio-Visual Speech Recognition with Minimal Multimodal Speech Tokens
di: Yeo, Jeong Hun, et al.
Pubblicazione: (2025)
di: Yeo, Jeong Hun, et al.
Pubblicazione: (2025)
Scaling and Enhancing LLM-based AVSR: A Sparse Mixture of Projectors Approach
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2025)
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2025)
LCB-net: Long-Context Biasing for Audio-Visual Speech Recognition
di: Yu, Fan, et al.
Pubblicazione: (2024)
di: Yu, Fan, et al.
Pubblicazione: (2024)
Human-Inspired Computing for Robust and Efficient Audio-Visual Speech Recognition
di: Liu, Qianhui, et al.
Pubblicazione: (2024)
di: Liu, Qianhui, et al.
Pubblicazione: (2024)
AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation
di: Wang, Le, et al.
Pubblicazione: (2025)
di: Wang, Le, et al.
Pubblicazione: (2025)
Robust LLM-based Audio-Visual Speech Recognition with Sparse Modality Alignment and Visual Unit-Guided Refinement
di: Su, Fei, et al.
Pubblicazione: (2026)
di: Su, Fei, et al.
Pubblicazione: (2026)
IIANet: An Intra- and Inter-Modality Attention Network for Audio-Visual Speech Separation
di: Li, Kai, et al.
Pubblicazione: (2023)
di: Li, Kai, et al.
Pubblicazione: (2023)
Audio-Visual Speech Enhancement In Complex Scenarios With Separation And Dereverberation Joint Modeling
di: Du, Jiarong, et al.
Pubblicazione: (2025)
di: Du, Jiarong, et al.
Pubblicazione: (2025)
AVFF: Audio-Visual Feature Fusion for Video Deepfake Detection
di: Oorloff, Trevine, et al.
Pubblicazione: (2024)
di: Oorloff, Trevine, et al.
Pubblicazione: (2024)
Real Acoustic Fields: An Audio-Visual Room Acoustics Dataset and Benchmark
di: Chen, Ziyang, et al.
Pubblicazione: (2024)
di: Chen, Ziyang, et al.
Pubblicazione: (2024)
A Study of Dropout-Induced Modality Bias on Robustness to Missing Video Frames for Audio-Visual Speech Recognition
di: Dai, Yusheng, et al.
Pubblicazione: (2024)
di: Dai, Yusheng, et al.
Pubblicazione: (2024)
RT-LA-VocE: Real-Time Low-SNR Audio-Visual Speech Enhancement
di: Chen, Honglie, et al.
Pubblicazione: (2024)
di: Chen, Honglie, et al.
Pubblicazione: (2024)
Beyond Video-to-SFX: Video to Audio Synthesis with Environmentally Aware Speech
di: Niu, Xinlei, et al.
Pubblicazione: (2025)
di: Niu, Xinlei, et al.
Pubblicazione: (2025)
Multilingual Audio-Visual Speech Recognition with Hybrid CTC/RNN-T Fast Conformer
di: Burchi, Maxime, et al.
Pubblicazione: (2024)
di: Burchi, Maxime, et al.
Pubblicazione: (2024)
UniAV: Unified Audio-Visual Perception for Multi-Task Video Event Localization
di: Geng, Tiantian, et al.
Pubblicazione: (2024)
di: Geng, Tiantian, et al.
Pubblicazione: (2024)
Draw an Audio: Leveraging Multi-Instruction for Video-to-Audio Synthesis
di: Yang, Qi, et al.
Pubblicazione: (2024)
di: Yang, Qi, et al.
Pubblicazione: (2024)
Audio-Visual Speech Separation via Bottleneck Iterative Network
di: Zhang, Sidong, et al.
Pubblicazione: (2025)
di: Zhang, Sidong, et al.
Pubblicazione: (2025)
Video-to-Audio Generation with Hidden Alignment
di: Xu, Manjie, et al.
Pubblicazione: (2024)
di: Xu, Manjie, et al.
Pubblicazione: (2024)
Temporally Aligned Audio for Video with Autoregression
di: Viertola, Ilpo, et al.
Pubblicazione: (2024)
di: Viertola, Ilpo, et al.
Pubblicazione: (2024)
3D Audio-Visual Segmentation
di: Sokolov, Artem, et al.
Pubblicazione: (2024)
di: Sokolov, Artem, et al.
Pubblicazione: (2024)
Audio-Vision Contrastive Learning for Phonological Class Recognition
di: Liu, Daiqi, et al.
Pubblicazione: (2025)
di: Liu, Daiqi, et al.
Pubblicazione: (2025)
Efficient Video to Audio Mapper with Visual Scene Detection
di: Yi, Mingjing, et al.
Pubblicazione: (2024)
di: Yi, Mingjing, et al.
Pubblicazione: (2024)
Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis
di: Huang, Zhiqi, et al.
Pubblicazione: (2024)
di: Huang, Zhiqi, et al.
Pubblicazione: (2024)
RAVSS: Robust Audio-Visual Speech Separation in Multi-Speaker Scenarios with Missing Visual Cues
di: Pan, Tianrui, et al.
Pubblicazione: (2024)
di: Pan, Tianrui, et al.
Pubblicazione: (2024)
Diffusion Models as Masked Audio-Video Learners
di: Nunez, Elvis, et al.
Pubblicazione: (2023)
di: Nunez, Elvis, et al.
Pubblicazione: (2023)
Zero-Shot Fake Video Detection by Audio-Visual Consistency
di: Li, Xiaolou, et al.
Pubblicazione: (2024)
di: Li, Xiaolou, et al.
Pubblicazione: (2024)
Benchmarking Cross-Domain Audio-Visual Deception Detection
di: Guo, Xiaobao, et al.
Pubblicazione: (2024)
di: Guo, Xiaobao, et al.
Pubblicazione: (2024)
Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning
di: Xu, Le, et al.
Pubblicazione: (2025)
di: Xu, Le, et al.
Pubblicazione: (2025)
Detecting Audio-Visual Deepfakes with Fine-Grained Inconsistencies
di: Astrid, Marcella, et al.
Pubblicazione: (2024)
di: Astrid, Marcella, et al.
Pubblicazione: (2024)
Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation
di: Goncalves, Lucas, et al.
Pubblicazione: (2024)
di: Goncalves, Lucas, et al.
Pubblicazione: (2024)
DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis
di: Tian, Wenjie, et al.
Pubblicazione: (2025)
di: Tian, Wenjie, et al.
Pubblicazione: (2025)
MAVERIX: Multimodal Audio-Visual Evaluation and Recognition IndeX
di: Xie, Liuyue, et al.
Pubblicazione: (2025)
di: Xie, Liuyue, et al.
Pubblicazione: (2025)
EgoSonics: Generating Synchronized Audio for Silent Egocentric Videos
di: Rai, Aashish, et al.
Pubblicazione: (2024)
di: Rai, Aashish, et al.
Pubblicazione: (2024)
Learning Self-Supervised Audio-Visual Representations for Sound Recommendations
di: Krishnamurthy, Sudha
Pubblicazione: (2024)
di: Krishnamurthy, Sudha
Pubblicazione: (2024)
Documenti analoghi
-
AD-AVSR: Asymmetric Dual-stream Enhancement for Robust Audio-Visual Speech Recognition
di: Xue, Junxiao, et al.
Pubblicazione: (2025) -
Zero-AVSR: Zero-Shot Audio-Visual Speech Recognition with LLMs by Learning Language-Agnostic Speech Representations
di: Yeo, Jeong Hun, et al.
Pubblicazione: (2025) -
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
di: Liu, Zehua, et al.
Pubblicazione: (2024) -
Large Language Models are Strong Audio-Visual Speech Recognition Learners
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2024) -
Adaptive Audio-Visual Speech Recognition via Matryoshka-Based Multimodal LLMs
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2025)