AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Jialiang, Xia, Bin, Chu, Ruihang, Wang, Dingdong, Xia, Wanke, Mou, Zhun, Zhong, Tianyang, Zhao, Yiting, Yang, Wenming |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SAVGBench: Benchmarking Spatially Aligned Audio-Video Generation
di: Shimada, Kazuki, et al.
Pubblicazione: (2024)
di: Shimada, Kazuki, et al.
Pubblicazione: (2024)
V2A-DPO: Omni-Preference Optimization for Video-to-Audio Generation
di: Chan, Nolan, et al.
Pubblicazione: (2026)
di: Chan, Nolan, et al.
Pubblicazione: (2026)
MTAVG-Bench: A Diagnostic Benchmark for Multi-Talker Dialogue-Centric Audio-Video Generation
di: Zhou, Yang-Hao, et al.
Pubblicazione: (2026)
di: Zhou, Yang-Hao, et al.
Pubblicazione: (2026)
DreamFoley: Scalable VLMs for High-Fidelity Video-to-Audio Generation
di: Li, Fu, et al.
Pubblicazione: (2025)
di: Li, Fu, et al.
Pubblicazione: (2025)
SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text
di: Liu, Haohe, et al.
Pubblicazione: (2024)
di: Liu, Haohe, et al.
Pubblicazione: (2024)
MixFake: Benchmarking and Enhancing Audio Deepfake Detection in Diverse Real-world Mixed Audio
di: Li, Qingcao, et al.
Pubblicazione: (2026)
di: Li, Qingcao, et al.
Pubblicazione: (2026)
MusiCRS: Benchmarking Audio-Centric Conversational Recommendation
di: Surana, Rohan, et al.
Pubblicazione: (2025)
di: Surana, Rohan, et al.
Pubblicazione: (2025)
3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation
di: Li, Yaoru, et al.
Pubblicazione: (2025)
di: Li, Yaoru, et al.
Pubblicazione: (2025)
Generative Audio Extension and Morphing
di: Seetharaman, Prem, et al.
Pubblicazione: (2026)
di: Seetharaman, Prem, et al.
Pubblicazione: (2026)
Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation
di: Li, Chunyu, et al.
Pubblicazione: (2026)
di: Li, Chunyu, et al.
Pubblicazione: (2026)
Coherent Audio-Visual Editing via Conditional Audio Generation Following Video Edits
di: Ishii, Masato, et al.
Pubblicazione: (2025)
di: Ishii, Masato, et al.
Pubblicazione: (2025)
ProAV-DiT: A Projected Latent Diffusion Transformer for Efficient Synchronized Audio-Video Generation
di: Sun, Jiahui, et al.
Pubblicazione: (2025)
di: Sun, Jiahui, et al.
Pubblicazione: (2025)
AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues
di: Zhou, Dingkun, et al.
Pubblicazione: (2025)
di: Zhou, Dingkun, et al.
Pubblicazione: (2025)
Human-Inspired Computing for Robust and Efficient Audio-Visual Speech Recognition
di: Liu, Qianhui, et al.
Pubblicazione: (2024)
di: Liu, Qianhui, et al.
Pubblicazione: (2024)
JointAVBench: A Benchmark for Joint Audio-Visual Reasoning Evaluation
di: Chao, Jianghan, et al.
Pubblicazione: (2025)
di: Chao, Jianghan, et al.
Pubblicazione: (2025)
LoVA: Long-form Video-to-Audio Generation
di: Cheng, Xin, et al.
Pubblicazione: (2024)
di: Cheng, Xin, et al.
Pubblicazione: (2024)
Temporally Aligned Audio for Video with Autoregression
di: Viertola, Ilpo, et al.
Pubblicazione: (2024)
di: Viertola, Ilpo, et al.
Pubblicazione: (2024)
MultiSoundGen: Video-to-Audio Generation for Multi-Event Scenarios via SlowFast Contrastive Audio-Visual Pretraining and Direct Preference Optimization
di: Yang, Jianxuan, et al.
Pubblicazione: (2025)
di: Yang, Jianxuan, et al.
Pubblicazione: (2025)
The Interspeech 2026 Audio Reasoning Challenge: Evaluating Reasoning Process Quality for Audio Reasoning Models and Agents
di: Ma, Ziyang, et al.
Pubblicazione: (2026)
di: Ma, Ziyang, et al.
Pubblicazione: (2026)
Video Echoed in Music: Semantic, Temporal, and Rhythmic Alignment for Video-to-Music Generation
di: Tong, Xinyi, et al.
Pubblicazione: (2025)
di: Tong, Xinyi, et al.
Pubblicazione: (2025)
UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation
di: Li, Hebeizi, et al.
Pubblicazione: (2026)
di: Li, Hebeizi, et al.
Pubblicazione: (2026)
PAVAS: Physics-Aware Video-to-Audio Synthesis
di: Hyun-Bin, Oh, et al.
Pubblicazione: (2025)
di: Hyun-Bin, Oh, et al.
Pubblicazione: (2025)
StereoFoley: Object-Aware Stereo Audio Generation from Video
di: Karchkhadze, Tornike, et al.
Pubblicazione: (2025)
di: Karchkhadze, Tornike, et al.
Pubblicazione: (2025)
Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation
di: Cheng, Shihao, et al.
Pubblicazione: (2026)
di: Cheng, Shihao, et al.
Pubblicazione: (2026)
RVCBench: Benchmarking the Robustness of Voice Cloning Across Modern Audio Generation Models
di: Jin, Ruinan, et al.
Pubblicazione: (2026)
di: Jin, Ruinan, et al.
Pubblicazione: (2026)
Audio-Visual Separation with Hierarchical Fusion and Representation Alignment
di: Hu, Han, et al.
Pubblicazione: (2025)
di: Hu, Han, et al.
Pubblicazione: (2025)
MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation
di: Li, Haitian, et al.
Pubblicazione: (2026)
di: Li, Haitian, et al.
Pubblicazione: (2026)
STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment
di: Ren, Yong, et al.
Pubblicazione: (2024)
di: Ren, Yong, et al.
Pubblicazione: (2024)
SONIQUE: Video Background Music Generation Using Unpaired Audio-Visual Data
di: Zhang, Liqian, et al.
Pubblicazione: (2024)
di: Zhang, Liqian, et al.
Pubblicazione: (2024)
Semantically consistent Video-to-Audio Generation using Multimodal Language Large Model
di: Chen, Gehui, et al.
Pubblicazione: (2024)
di: Chen, Gehui, et al.
Pubblicazione: (2024)
Manipulated Regions Localization For Partially Deepfake Audio: A Survey
di: He, Jiayi, et al.
Pubblicazione: (2025)
di: He, Jiayi, et al.
Pubblicazione: (2025)
MG-Former: A Transformer-Based Framework for Music-Driven 3D Conducting Gesture Generation
di: Qiu, Ke, et al.
Pubblicazione: (2026)
di: Qiu, Ke, et al.
Pubblicazione: (2026)
Delayed Commitment for Representation Readiness in Stage-wise Audio-Visual Learning
di: Xu, Xinmeng, et al.
Pubblicazione: (2026)
di: Xu, Xinmeng, et al.
Pubblicazione: (2026)
ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling
di: Yang, Jianxuan, et al.
Pubblicazione: (2026)
di: Yang, Jianxuan, et al.
Pubblicazione: (2026)
DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis
di: Tian, Wenjie, et al.
Pubblicazione: (2025)
di: Tian, Wenjie, et al.
Pubblicazione: (2025)
Audio ControlNet for Fine-Grained Audio Generation and Editing
di: Zhu, Haina, et al.
Pubblicazione: (2026)
di: Zhu, Haina, et al.
Pubblicazione: (2026)
MMED: A Multimodal Micro-Expression Dataset based on Audio-Visual Fusion
di: Wang, Junbo, et al.
Pubblicazione: (2025)
di: Wang, Junbo, et al.
Pubblicazione: (2025)
Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding
di: Wang, Jieyi, et al.
Pubblicazione: (2026)
di: Wang, Jieyi, et al.
Pubblicazione: (2026)
OmniCustom: Sync Audio-Video Customization Via Joint Audio-Video Generation Model
di: Li, Maomao, et al.
Pubblicazione: (2026)
di: Li, Maomao, et al.
Pubblicazione: (2026)
Beyond Video-to-SFX: Video to Audio Synthesis with Environmentally Aware Speech
di: Niu, Xinlei, et al.
Pubblicazione: (2025)
di: Niu, Xinlei, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SAVGBench: Benchmarking Spatially Aligned Audio-Video Generation
di: Shimada, Kazuki, et al.
Pubblicazione: (2024) -
V2A-DPO: Omni-Preference Optimization for Video-to-Audio Generation
di: Chan, Nolan, et al.
Pubblicazione: (2026) -
MTAVG-Bench: A Diagnostic Benchmark for Multi-Talker Dialogue-Centric Audio-Video Generation
di: Zhou, Yang-Hao, et al.
Pubblicazione: (2026) -
DreamFoley: Scalable VLMs for High-Fidelity Video-to-Audio Generation
di: Li, Fu, et al.
Pubblicazione: (2025) -
SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text
di: Liu, Haohe, et al.
Pubblicazione: (2024)