MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation
Fuente:
arXiv
Saved in:
| Main Authors: | Wei, Yujie, Han, Yujin, Chen, Zhekai, Li, Yongming, Jiang, Kaixun, Liu, Zhihang, Li, Quanhao, Qing, Zhiwu, Wang, Xiang, Xing, Zhen, Chu, Ruihang, Hong, Lingyi, He, Yefei, Zhou, Junjie, Yu, Junqiu, Shi, Yang, Zou, Difan, Zhu, Kai, Zhang, Shiwei, Zhang, Yingya, Liu, Yu, Liu, Xihui, Shan, Hongming |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Routing Matters in MoE: Scaling Diffusion Transformers with Explicit Routing Guidance
by: Wei, Yujie, et al.
Published: (2025)
by: Wei, Yujie, et al.
Published: (2025)
TTS-VAR: A Test-Time Scaling Framework for Visual Auto-Regressive Generation
by: Chen, Zhekai, et al.
Published: (2025)
by: Chen, Zhekai, et al.
Published: (2025)
DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models
by: Li, Quanhao, et al.
Published: (2026)
by: Li, Quanhao, et al.
Published: (2026)
AIBench: Evaluating Visual-Logical Consistency in Academic Illustration Generation
by: Liao, Zhaohe, et al.
Published: (2026)
by: Liao, Zhaohe, et al.
Published: (2026)
Wan-Move: Motion-controllable Video Generation via Latent Trajectory Guidance
by: Chu, Ruihang, et al.
Published: (2025)
by: Chu, Ruihang, et al.
Published: (2025)
DreamVideo-Omni: Omni-Motion Controlled Multi-Subject Video Customization with Latent Identity Reinforcement Learning
by: Wei, Yujie, et al.
Published: (2026)
by: Wei, Yujie, et al.
Published: (2026)
AesRM: Improving Video Aesthetics with Expert-Level Feedback
by: Han, Yujin, et al.
Published: (2026)
by: Han, Yujin, et al.
Published: (2026)
Turning Internal Gap into Self-Improvement: Promoting the Generation-Understanding Unification in MLLMs
by: Han, Yujin, et al.
Published: (2025)
by: Han, Yujin, et al.
Published: (2025)
FreeScale: Unleashing the Resolution of Diffusion Models via Tuning-Free Scale Fusion
by: Qiu, Haonan, et al.
Published: (2024)
by: Qiu, Haonan, et al.
Published: (2024)
Exploiting Discriminative Codebook Prior for Autoregressive Image Generation
by: Tang, Longxiang, et al.
Published: (2025)
by: Tang, Longxiang, et al.
Published: (2025)
MACRO: Advancing Multi-Reference Image Generation with Structured Long-Context Data
by: Chen, Zhekai, et al.
Published: (2026)
by: Chen, Zhekai, et al.
Published: (2026)
Speculative Jacobi-Denoising Decoding for Accelerating Autoregressive Text-to-image Generation
by: Teng, Yao, et al.
Published: (2025)
by: Teng, Yao, et al.
Published: (2025)
ShowTable: Unlocking Creative Table Visualization with Collaborative Reflection and Refinement
by: Liu, Zhihang, et al.
Published: (2025)
by: Liu, Zhihang, et al.
Published: (2025)
Additive Manufacturing Provides Infinite Possibilities for Self‐Sensing Technology
by: Daobing Chen, et al.
Published: (2024)
by: Daobing Chen, et al.
Published: (2024)
DreamRelation: Relation-Centric Video Customization
by: Wei, Yujie, et al.
Published: (2025)
by: Wei, Yujie, et al.
Published: (2025)
DreamVideo-2: Zero-Shot Subject-Driven Video Customization with Precise Motion Control
by: Wei, Yujie, et al.
Published: (2024)
by: Wei, Yujie, et al.
Published: (2024)
Replace Anyone in Videos
by: Wang, Xiang, et al.
Published: (2024)
by: Wang, Xiang, et al.
Published: (2024)
Improving Group Robustness on Spurious Correlation Requires Preciser Group Inference
by: Han, Yujin, et al.
Published: (2024)
by: Han, Yujin, et al.
Published: (2024)
Timestep Embedding Tells: It's Time to Cache for Video Diffusion Model
by: Liu, Feng, et al.
Published: (2024)
by: Liu, Feng, et al.
Published: (2024)
PersonalVideo: High ID-Fidelity Video Customization without Dynamic and Semantic Degradation
by: Li, Hengjia, et al.
Published: (2024)
by: Li, Hengjia, et al.
Published: (2024)
Reliability-Aware Geometric Fusion for Robust Audio-Visual Navigation
by: Liu, Teng, et al.
Published: (2026)
by: Liu, Teng, et al.
Published: (2026)
GenAgent: Scaling Text-to-Image Generation via Agentic Multimodal Reasoning
by: Jiang, Kaixun, et al.
Published: (2026)
by: Jiang, Kaixun, et al.
Published: (2026)
RSAgent: Learning to Reason and Act for Text-Guided Segmentation via Multi-Turn Tool Invocations
by: He, Xingqi, et al.
Published: (2025)
by: He, Xingqi, et al.
Published: (2025)
VideoPure: Diffusion-based Adversarial Purification for Video Recognition
by: Jiang, Kaixun, et al.
Published: (2025)
by: Jiang, Kaixun, et al.
Published: (2025)
Taming Consistency Distillation for Accelerated Human Image Animation
by: Wang, Xiang, et al.
Published: (2025)
by: Wang, Xiang, et al.
Published: (2025)
Parallelized Autoregressive Visual Generation
by: Wang, Yuqing, et al.
Published: (2024)
by: Wang, Yuqing, et al.
Published: (2024)
Tracking vs. Deciding: The Dual-Capability Bottleneck in Searchless Chess Transformers
by: Li, Quanhao, et al.
Published: (2026)
by: Li, Quanhao, et al.
Published: (2026)
DreamTalk: When Emotional Talking Head Generation Meets Diffusion Probabilistic Models
by: Ma, Yifeng, et al.
Published: (2023)
by: Ma, Yifeng, et al.
Published: (2023)
FreeMask: Rethinking the Importance of Attention Masks for Zero-Shot Video Editing
by: Cai, Lingling, et al.
Published: (2024)
by: Cai, Lingling, et al.
Published: (2024)
DOD ‐ SSR : An Adaptive Seamless Phase II / III Design With Dose Optimization Decision and Sample Size Re‐estimation
by: Meizi Liu, et al.
Published: (2025)
by: Meizi Liu, et al.
Published: (2025)
DeTrack: In-model Latent Denoising Learning for Visual Object Tracking
by: Zhou, Xinyu, et al.
Published: (2025)
by: Zhou, Xinyu, et al.
Published: (2025)
Transmembrane Ion Channels: From Natural to Artificial Systems
by: Tengfei Yan, et al.
Published: (2024)
by: Tengfei Yan, et al.
Published: (2024)
Curvature Augmented Manifold Embedding and Learning
by: Liu, Yongming
Published: (2024)
by: Liu, Yongming
Published: (2024)
Jovian Zonal Winds Revealed from Cassini/VIMS Observations
by: Ma, Shenghan, et al.
Published: (2026)
by: Ma, Shenghan, et al.
Published: (2026)
Perspective of high-speed Mach-Zehnder modulators based on nonlinear optics and complex band structures
by: Li, Shuyi, et al.
Published: (2025)
by: Li, Shuyi, et al.
Published: (2025)
CLIP-guided Prototype Modulating for Few-shot Action Recognition
by: Wang, Xiang, et al.
Published: (2023)
by: Wang, Xiang, et al.
Published: (2023)
UniAnimate-DiT: Human Image Animation with Large-Scale Video Diffusion Transformer
by: Wang, Xiang, et al.
Published: (2025)
by: Wang, Xiang, et al.
Published: (2025)
Capturing Conditional Dependence via Auto-regressive Diffusion Models
by: Huang, Xunpeng, et al.
Published: (2025)
by: Huang, Xunpeng, et al.
Published: (2025)
LingoLoop Attack: Trapping MLLMs via Linguistic Context and State Entrapment into Endless Loops
by: Fu, Jiyuan, et al.
Published: (2025)
by: Fu, Jiyuan, et al.
Published: (2025)
TagOOD: A Novel Approach to Out-of-Distribution Detection via Vision-Language Representations and Class Center Learning
by: Li, Jinglun, et al.
Published: (2024)
by: Li, Jinglun, et al.
Published: (2024)
Similar Items
-
Routing Matters in MoE: Scaling Diffusion Transformers with Explicit Routing Guidance
by: Wei, Yujie, et al.
Published: (2025) -
TTS-VAR: A Test-Time Scaling Framework for Visual Auto-Regressive Generation
by: Chen, Zhekai, et al.
Published: (2025) -
DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models
by: Li, Quanhao, et al.
Published: (2026) -
AIBench: Evaluating Visual-Logical Consistency in Academic Illustration Generation
by: Liao, Zhaohe, et al.
Published: (2026) -
Wan-Move: Motion-controllable Video Generation via Latent Trajectory Guidance
by: Chu, Ruihang, et al.
Published: (2025)