VGGSounder: Audio-Visual Evaluations for Foundation Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zverev, Daniil, Wiedemer, Thaddäus, Prabhu, Ameya, Bethge, Matthias, Brendel, Wieland, Koepke, A. Sophia |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AV-SUPERB: A Multi-Task Evaluation Benchmark for Audio-Visual Representation Models
par: Tseng, Yuan, et autres
Publié: (2023)
par: Tseng, Yuan, et autres
Publié: (2023)
Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper
par: Chen, Gehui, et autres
Publié: (2025)
par: Chen, Gehui, et autres
Publié: (2025)
Multifaceted Evaluation of Audio-Visual Capability for MLLMs: Effectiveness, Efficiency, Generalizability and Robustness
par: Zhao, Yusheng, et autres
Publié: (2025)
par: Zhao, Yusheng, et autres
Publié: (2025)
3D Audio-Visual Segmentation
par: Sokolov, Artem, et autres
Publié: (2024)
par: Sokolov, Artem, et autres
Publié: (2024)
Aligned Better, Listen Better for Audio-Visual Large Language Models
par: Guo, Yuxin, et autres
Publié: (2025)
par: Guo, Yuxin, et autres
Publié: (2025)
Large Language Models are Strong Audio-Visual Speech Recognition Learners
par: Cappellazzo, Umberto, et autres
Publié: (2024)
par: Cappellazzo, Umberto, et autres
Publié: (2024)
Audio-Visual Speech Enhancement In Complex Scenarios With Separation And Dereverberation Joint Modeling
par: Du, Jiarong, et autres
Publié: (2025)
par: Du, Jiarong, et autres
Publié: (2025)
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
par: Liu, Zehua, et autres
Publié: (2024)
par: Liu, Zehua, et autres
Publié: (2024)
Benchmarking Cross-Domain Audio-Visual Deception Detection
par: Guo, Xiaobao, et autres
Publié: (2024)
par: Guo, Xiaobao, et autres
Publié: (2024)
Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning
par: Xu, Le, et autres
Publié: (2025)
par: Xu, Le, et autres
Publié: (2025)
Detecting Audio-Visual Deepfakes with Fine-Grained Inconsistencies
par: Astrid, Marcella, et autres
Publié: (2024)
par: Astrid, Marcella, et autres
Publié: (2024)
AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment
par: Cao, Yuqin, et autres
Publié: (2025)
par: Cao, Yuqin, et autres
Publié: (2025)
Learning Self-Supervised Audio-Visual Representations for Sound Recommendations
par: Krishnamurthy, Sudha
Publié: (2024)
par: Krishnamurthy, Sudha
Publié: (2024)
DETECLAP: Enhancing Audio-Visual Representation Learning with Object Information
par: Nakada, Shota, et autres
Publié: (2024)
par: Nakada, Shota, et autres
Publié: (2024)
AVFF: Audio-Visual Feature Fusion for Video Deepfake Detection
par: Oorloff, Trevine, et autres
Publié: (2024)
par: Oorloff, Trevine, et autres
Publié: (2024)
Spiking Tucker Fusion Transformer for Audio-Visual Zero-Shot Learning
par: Li, Wenrui, et autres
Publié: (2024)
par: Li, Wenrui, et autres
Publié: (2024)
Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization
par: Yu, Fei, et autres
Publié: (2024)
par: Yu, Fei, et autres
Publié: (2024)
MA-AVT: Modality Alignment for Parameter-Efficient Audio-Visual Transformers
par: Mahmud, Tanvir, et autres
Publié: (2024)
par: Mahmud, Tanvir, et autres
Publié: (2024)
Music Audio-Visual Question Answering Requires Specialized Multimodal Designs
par: You, Wenhao, et autres
Publié: (2025)
par: You, Wenhao, et autres
Publié: (2025)
Classifying Shelf Life Quality of Pineapples by Combining Audio and Visual Features
par: Jiang, Yi-Lu, et autres
Publié: (2025)
par: Jiang, Yi-Lu, et autres
Publié: (2025)
Real Acoustic Fields: An Audio-Visual Room Acoustics Dataset and Benchmark
par: Chen, Ziyang, et autres
Publié: (2024)
par: Chen, Ziyang, et autres
Publié: (2024)
Cross Pseudo-Labeling for Semi-Supervised Audio-Visual Source Localization
par: Guo, Yuxin, et autres
Publié: (2024)
par: Guo, Yuxin, et autres
Publié: (2024)
IIANet: An Intra- and Inter-Modality Attention Network for Audio-Visual Speech Separation
par: Li, Kai, et autres
Publié: (2023)
par: Li, Kai, et autres
Publié: (2023)
Comparative Analysis of Modality Fusion Approaches for Audio-Visual Person Identification and Verification
par: Farhadipour, Aref, et autres
Publié: (2024)
par: Farhadipour, Aref, et autres
Publié: (2024)
Seeing and Hearing: Open-domain Visual-Audio Generation with Diffusion Latent Aligners
par: Xing, Yazhou, et autres
Publié: (2024)
par: Xing, Yazhou, et autres
Publié: (2024)
Adaptive Audio-Visual Speech Recognition via Matryoshka-Based Multimodal LLMs
par: Cappellazzo, Umberto, et autres
Publié: (2025)
par: Cappellazzo, Umberto, et autres
Publié: (2025)
Discrepancy-Aware Attention Network for Enhanced Audio-Visual Zero-Shot Learning
par: Yu, RunLin, et autres
Publié: (2024)
par: Yu, RunLin, et autres
Publié: (2024)
UniAV: Unified Audio-Visual Perception for Multi-Task Video Event Localization
par: Geng, Tiantian, et autres
Publié: (2024)
par: Geng, Tiantian, et autres
Publié: (2024)
AD-AVSR: Asymmetric Dual-stream Enhancement for Robust Audio-Visual Speech Recognition
par: Xue, Junxiao, et autres
Publié: (2025)
par: Xue, Junxiao, et autres
Publié: (2025)
Aligning Sight and Sound: Advanced Sound Source Localization Through Audio-Visual Alignment
par: Senocak, Arda, et autres
Publié: (2024)
par: Senocak, Arda, et autres
Publié: (2024)
SlideAVSR: A Dataset of Paper Explanation Videos for Audio-Visual Speech Recognition
par: Wang, Hao, et autres
Publié: (2024)
par: Wang, Hao, et autres
Publié: (2024)
AV-DTEC: Self-Supervised Audio-Visual Fusion for Drone Trajectory Estimation and Classification
par: Xiao, Zhenyuan, et autres
Publié: (2024)
par: Xiao, Zhenyuan, et autres
Publié: (2024)
RT-LA-VocE: Real-Time Low-SNR Audio-Visual Speech Enhancement
par: Chen, Honglie, et autres
Publié: (2024)
par: Chen, Honglie, et autres
Publié: (2024)
Diffusion Models as Masked Audio-Video Learners
par: Nunez, Elvis, et autres
Publié: (2023)
par: Nunez, Elvis, et autres
Publié: (2023)
Sound2Vision: Generating Diverse Visuals from Audio through Cross-Modal Latent Alignment
par: Sung-Bin, Kim, et autres
Publié: (2024)
par: Sung-Bin, Kim, et autres
Publié: (2024)
CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment
par: Araujo, Edson, et autres
Publié: (2025)
par: Araujo, Edson, et autres
Publié: (2025)
Zero-AVSR: Zero-Shot Audio-Visual Speech Recognition with LLMs by Learning Language-Agnostic Speech Representations
par: Yeo, Jeong Hun, et autres
Publié: (2025)
par: Yeo, Jeong Hun, et autres
Publié: (2025)
Straight Through Gumbel Softmax Estimator based Bimodal Neural Architecture Search for Audio-Visual Deepfake Detection
par: PN, Aravinda Reddy, et autres
Publié: (2024)
par: PN, Aravinda Reddy, et autres
Publié: (2024)
MMS-LLaMA: Efficient LLM-based Audio-Visual Speech Recognition with Minimal Multimodal Speech Tokens
par: Yeo, Jeong Hun, et autres
Publié: (2025)
par: Yeo, Jeong Hun, et autres
Publié: (2025)
Draw an Audio: Leveraging Multi-Instruction for Video-to-Audio Synthesis
par: Yang, Qi, et autres
Publié: (2024)
par: Yang, Qi, et autres
Publié: (2024)
Documents similaires
-
AV-SUPERB: A Multi-Task Evaluation Benchmark for Audio-Visual Representation Models
par: Tseng, Yuan, et autres
Publié: (2023) -
Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper
par: Chen, Gehui, et autres
Publié: (2025) -
Multifaceted Evaluation of Audio-Visual Capability for MLLMs: Effectiveness, Efficiency, Generalizability and Robustness
par: Zhao, Yusheng, et autres
Publié: (2025) -
3D Audio-Visual Segmentation
par: Sokolov, Artem, et autres
Publié: (2024) -
Aligned Better, Listen Better for Audio-Visual Large Language Models
par: Guo, Yuxin, et autres
Publié: (2025)