MAVERIX: Multimodal Audio-Visual Evaluation and Recognition IndeX
Fuente:
arXiv
Salvato in:
| Autori principali: | Xie, Liuyue, Kuthiala, Avik, Wei, George Z., Zheng, Ce, Bal, Ananya, Dabhi, Mosam, Wen, Liting, Rustagi, Taru, Lai, Ethan, Khyalia, Sushil, Choudhury, Rohan, Ziyadi, Morteza, Zhang, Xu, Yang, Hao, Jeni, László A. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Unified Spherical Frontend: Learning Rotation-Equivariant Representations of Spherical Images from Any Camera
di: Yu, Mukai, et al.
Pubblicazione: (2025)
di: Yu, Mukai, et al.
Pubblicazione: (2025)
3D-LFM: Lifting Foundation Model
di: Dabhi, Mosam, et al.
Pubblicazione: (2023)
di: Dabhi, Mosam, et al.
Pubblicazione: (2023)
MusiCRS: Benchmarking Audio-Centric Conversational Recommendation
di: Surana, Rohan, et al.
Pubblicazione: (2025)
di: Surana, Rohan, et al.
Pubblicazione: (2025)
Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video Parsing
di: Chen, Yaru, et al.
Pubblicazione: (2025)
di: Chen, Yaru, et al.
Pubblicazione: (2025)
Audio Matters Too! Enhancing Markerless Motion Capture with Audio Signals for String Performance Capture
di: Jin, Yitong, et al.
Pubblicazione: (2024)
di: Jin, Yitong, et al.
Pubblicazione: (2024)
Exploring the Role of Audio in Multimodal Misinformation Detection
di: Liu, Moyang, et al.
Pubblicazione: (2024)
di: Liu, Moyang, et al.
Pubblicazione: (2024)
MaskAnyone Toolkit: Offering Strategies for Minimizing Privacy Risks and Maximizing Utility in Audio-Visual Data Archiving
di: Owoyele, Babajide Alamu, et al.
Pubblicazione: (2024)
di: Owoyele, Babajide Alamu, et al.
Pubblicazione: (2024)
EMID: An Emotional Aligned Dataset in Audio-Visual Modality
di: Zou, Jialing, et al.
Pubblicazione: (2023)
di: Zou, Jialing, et al.
Pubblicazione: (2023)
Multimodal Semantic Communication for Generative Audio-Driven Video Conferencing
di: Tong, Haonan, et al.
Pubblicazione: (2024)
di: Tong, Haonan, et al.
Pubblicazione: (2024)
Generative Audio Extension and Morphing
di: Seetharaman, Prem, et al.
Pubblicazione: (2026)
di: Seetharaman, Prem, et al.
Pubblicazione: (2026)
MixFake: Benchmarking and Enhancing Audio Deepfake Detection in Diverse Real-world Mixed Audio
di: Li, Qingcao, et al.
Pubblicazione: (2026)
di: Li, Qingcao, et al.
Pubblicazione: (2026)
Enhancing Video Music Recommendation with Transformer-Driven Audio-Visual Embeddings
di: Liu, Shimiao, et al.
Pubblicazione: (2025)
di: Liu, Shimiao, et al.
Pubblicazione: (2025)
Look, Listen and Segment: Towards Weakly Supervised Audio-visual Semantic Segmentation
di: Li, Chengzhi, et al.
Pubblicazione: (2026)
di: Li, Chengzhi, et al.
Pubblicazione: (2026)
Cross-Modality and Within-Modality Regularization for Audio-Visual DeepFake Detection
di: Zou, Heqing, et al.
Pubblicazione: (2024)
di: Zou, Heqing, et al.
Pubblicazione: (2024)
Generalizing Video DeepFake Detection by Self-generated Audio-Visual Pseudo-Fakes
di: Wei, Zihe, et al.
Pubblicazione: (2026)
di: Wei, Zihe, et al.
Pubblicazione: (2026)
MAR3: Multi-Agent Recognition, Reasoning, and Reflection for Reference Audio-Visual Segmentation
di: Zhao, Yuan, et al.
Pubblicazione: (2026)
di: Zhao, Yuan, et al.
Pubblicazione: (2026)
EyEar: Learning Audio Synchronized Human Gaze Trajectory Based on Physics-Informed Dynamics
di: Liu, Xiaochuan, et al.
Pubblicazione: (2025)
di: Liu, Xiaochuan, et al.
Pubblicazione: (2025)
Ges-QA: A Multidimensional Quality Assessment Dataset for Audio-to-3D Gesture Generation
di: Gao, Zhilin, et al.
Pubblicazione: (2025)
di: Gao, Zhilin, et al.
Pubblicazione: (2025)
Audio-Visual Separation with Hierarchical Fusion and Representation Alignment
di: Hu, Han, et al.
Pubblicazione: (2025)
di: Hu, Han, et al.
Pubblicazione: (2025)
TeMTG: Text-Enhanced Multi-Hop Temporal Graph Modeling for Audio-Visual Video Parsing
di: Chen, Yaru, et al.
Pubblicazione: (2025)
di: Chen, Yaru, et al.
Pubblicazione: (2025)
AVID: A Benchmark for Omni-Modal Audio-Visual Inconsistency Understanding via Agent-Driven Construction
di: Chen, Zixuan, et al.
Pubblicazione: (2026)
di: Chen, Zixuan, et al.
Pubblicazione: (2026)
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction
di: Wang, Jiadong, et al.
Pubblicazione: (2026)
di: Wang, Jiadong, et al.
Pubblicazione: (2026)
Manipulated Regions Localization For Partially Deepfake Audio: A Survey
di: He, Jiayi, et al.
Pubblicazione: (2025)
di: He, Jiayi, et al.
Pubblicazione: (2025)
StyleSpeaker: Audio-Enhanced Fine-Grained Style Modeling for Speech-Driven 3D Facial Animation
di: Yang, An, et al.
Pubblicazione: (2025)
di: Yang, An, et al.
Pubblicazione: (2025)
Interpreting Multimodal Communication at Scale in Short-Form Video: Visual, Audio, and Textual Mental Health Discourse on TikTok
di: Zha, Mingyue, et al.
Pubblicazione: (2026)
di: Zha, Mingyue, et al.
Pubblicazione: (2026)
Delayed Commitment for Representation Readiness in Stage-wise Audio-Visual Learning
di: Xu, Xinmeng, et al.
Pubblicazione: (2026)
di: Xu, Xinmeng, et al.
Pubblicazione: (2026)
DreamFoley: Scalable VLMs for High-Fidelity Video-to-Audio Generation
di: Li, Fu, et al.
Pubblicazione: (2025)
di: Li, Fu, et al.
Pubblicazione: (2025)
AFL-Net: Integrating Audio, Facial, and Lip Modalities with a Two-step Cross-attention for Robust Speaker Diarization in the Wild
di: Yin, Yongkang, et al.
Pubblicazione: (2023)
di: Yin, Yongkang, et al.
Pubblicazione: (2023)
MMED: A Multimodal Micro-Expression Dataset based on Audio-Visual Fusion
di: Wang, Junbo, et al.
Pubblicazione: (2025)
di: Wang, Junbo, et al.
Pubblicazione: (2025)
Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding
di: Wang, Jieyi, et al.
Pubblicazione: (2026)
di: Wang, Jieyi, et al.
Pubblicazione: (2026)
Open-Vocabulary Audio-Visual Semantic Segmentation
di: Guo, Ruohao, et al.
Pubblicazione: (2024)
di: Guo, Ruohao, et al.
Pubblicazione: (2024)
MusicSem: A Semantically Rich Language--Audio Dataset of Natural Music Descriptions
di: Salganik, Rebecca, et al.
Pubblicazione: (2026)
di: Salganik, Rebecca, et al.
Pubblicazione: (2026)
SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding
di: Sun, Luoyi, et al.
Pubblicazione: (2026)
di: Sun, Luoyi, et al.
Pubblicazione: (2026)
Coherent Audio-Visual Editing via Conditional Audio Generation Following Video Edits
di: Ishii, Masato, et al.
Pubblicazione: (2025)
di: Ishii, Masato, et al.
Pubblicazione: (2025)
Fast Audio Codec Identification Using Overlapping LCS
di: Jafari, Farzane
Pubblicazione: (2025)
di: Jafari, Farzane
Pubblicazione: (2025)
MTAVG-Bench: A Diagnostic Benchmark for Multi-Talker Dialogue-Centric Audio-Video Generation
di: Zhou, Yang-Hao, et al.
Pubblicazione: (2026)
di: Zhou, Yang-Hao, et al.
Pubblicazione: (2026)
Enkidu: Universal Frequential Perturbation for Real-Time Audio Privacy Protection against Voice Deepfakes
di: Feng, Zhou, et al.
Pubblicazione: (2025)
di: Feng, Zhou, et al.
Pubblicazione: (2025)
XGC-AVis: Towards Audio-Visual Content Understanding with a Multi-Agent Collaborative System
di: Cao, Yuqin, et al.
Pubblicazione: (2025)
di: Cao, Yuqin, et al.
Pubblicazione: (2025)
Variable-Length Audio Fingerprinting
di: Chen, Hongjie, et al.
Pubblicazione: (2026)
di: Chen, Hongjie, et al.
Pubblicazione: (2026)
MoLEx: Mixture of LoRA Experts in Speech Self-Supervised Models for Audio Deepfake Detection
di: Pan, Zihan, et al.
Pubblicazione: (2025)
di: Pan, Zihan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Unified Spherical Frontend: Learning Rotation-Equivariant Representations of Spherical Images from Any Camera
di: Yu, Mukai, et al.
Pubblicazione: (2025) -
3D-LFM: Lifting Foundation Model
di: Dabhi, Mosam, et al.
Pubblicazione: (2023) -
MusiCRS: Benchmarking Audio-Centric Conversational Recommendation
di: Surana, Rohan, et al.
Pubblicazione: (2025) -
Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video Parsing
di: Chen, Yaru, et al.
Pubblicazione: (2025) -
Audio Matters Too! Enhancing Markerless Motion Capture with Audio Signals for String Performance Capture
di: Jin, Yitong, et al.
Pubblicazione: (2024)