T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cao, Zhe, Wang, Tao, Wang, Jiaming, Wang, Yanghai, Zhang, Yuanxing, Chen, Jialu, Deng, Miao, Wang, Jiahao, Guo, Yubin, Liao, Chenxi, Zhang, Yize, Zhang, Zhaoxiang, Liu, Jiaheng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV
par: Liu, Tengfei, et autres
Publié: (2026)
par: Liu, Tengfei, et autres
Publié: (2026)
MVU-Eval: Towards Multi-Video Understanding Evaluation for Multimodal LLMs
par: Peng, Tianhao, et autres
Publié: (2025)
par: Peng, Tianhao, et autres
Publié: (2025)
SWE-Compass: Towards Unified Evaluation of Agentic Coding Abilities for Large Language Models
par: Xu, Jingxuan, et autres
Publié: (2025)
par: Xu, Jingxuan, et autres
Publié: (2025)
Edit-Compass & EditReward-Compass: A Unified Benchmark for Image Editing and Reward Modeling
par: Bai, Xuehai, et autres
Publié: (2026)
par: Bai, Xuehai, et autres
Publié: (2026)
OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs
par: Li, Caorui, et autres
Publié: (2025)
par: Li, Caorui, et autres
Publié: (2025)
UniAV: Unified Audio-Visual Perception for Multi-Task Video Event Localization
par: Geng, Tiantian, et autres
Publié: (2024)
par: Geng, Tiantian, et autres
Publié: (2024)
IF-VidCap: Can Video Caption Models Follow Instructions?
par: Li, Shihao, et autres
Publié: (2025)
par: Li, Shihao, et autres
Publié: (2025)
AV-DiT: Efficient Audio-Visual Diffusion Transformer for Joint Audio and Video Generation
par: Wang, Kai, et autres
Publié: (2024)
par: Wang, Kai, et autres
Publié: (2024)
AV-Unified: A Unified Framework for Audio-visual Scene Understanding
par: Li, Guangyao, et autres
Publié: (2026)
par: Li, Guangyao, et autres
Publié: (2026)
ViDiC: Video Difference Captioning
par: Wu, Jiangtao, et autres
Publié: (2025)
par: Wu, Jiangtao, et autres
Publié: (2025)
AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation
par: Wang, Le, et autres
Publié: (2025)
par: Wang, Le, et autres
Publié: (2025)
Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text
par: Mei, Jiahao, et autres
Publié: (2026)
par: Mei, Jiahao, et autres
Publié: (2026)
MT-Video-Bench: A Holistic Video Understanding Benchmark for Evaluating Multimodal LLMs in Multi-Turn Dialogues
par: Pan, Yaning, et autres
Publié: (2025)
par: Pan, Yaning, et autres
Publié: (2025)
VidCapBench: A Comprehensive Benchmark of Video Captioning for Controllable Text-to-Video Generation
par: Chen, Xinlong, et autres
Publié: (2025)
par: Chen, Xinlong, et autres
Publié: (2025)
M$^3$AV: A Multimodal, Multigenre, and Multipurpose Audio-Visual Academic Lecture Dataset
par: Chen, Zhe, et autres
Publié: (2024)
par: Chen, Zhe, et autres
Publié: (2024)
DrivingGPT: Unifying Driving World Modeling and Planning with Multi-modal Autoregressive Transformers
par: Chen, Yuntao, et autres
Publié: (2024)
par: Chen, Yuntao, et autres
Publié: (2024)
Towards High-Order Mean Flow Generative Models: Feasibility, Expressivity, and Provably Efficient Criteria
par: Cao, Yang, et autres
Publié: (2025)
par: Cao, Yang, et autres
Publié: (2025)
Apollo: Unified Multi-Task Audio-Video Joint Generation
par: Wang, Jun, et autres
Publié: (2026)
par: Wang, Jun, et autres
Publié: (2026)
When Audio and Text Disagree: Revealing Text Bias in Large Audio-Language Models
par: Wang, Cheng, et autres
Publié: (2025)
par: Wang, Cheng, et autres
Publié: (2025)
Complex Image-Generative Diffusion Transformer for Audio Denoising
par: Li, Junhui, et autres
Publié: (2024)
par: Li, Junhui, et autres
Publié: (2024)
T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation
par: Chen, Yubin, et autres
Publié: (2025)
par: Chen, Yubin, et autres
Publié: (2025)
WebCompass: Towards Multimodal Web Coding Evaluation for Code Language Models
par: Lei, Xinping, et autres
Publié: (2026)
par: Lei, Xinping, et autres
Publié: (2026)
OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text
par: Pian, Weiguo, et autres
Publié: (2026)
par: Pian, Weiguo, et autres
Publié: (2026)
Diffusion Gaussian Mixture Audio Denoise
par: Wang, Pu, et autres
Publié: (2024)
par: Wang, Pu, et autres
Publié: (2024)
AV2AV: Direct Audio-Visual Speech to Audio-Visual Speech Translation with Unified Audio-Visual Speech Representation
par: Choi, Jeongsoo, et autres
Publié: (2023)
par: Choi, Jeongsoo, et autres
Publié: (2023)
Vibe AIGC: A New Paradigm for Content Generation via Agentic Orchestration
par: Liu, Jiaheng, et autres
Publié: (2026)
par: Liu, Jiaheng, et autres
Publié: (2026)
Omni2Sound: Towards Unified Video-Text-to-Audio Generation
par: Dai, Yusheng, et autres
Publié: (2026)
par: Dai, Yusheng, et autres
Publié: (2026)
Unified Vision-Language-Action Model
par: Wang, Yuqi, et autres
Publié: (2025)
par: Wang, Yuqi, et autres
Publié: (2025)
VideoTetris: Towards Compositional Text-to-Video Generation
par: Tian, Ye, et autres
Publié: (2024)
par: Tian, Ye, et autres
Publié: (2024)
InstructAV2AV: Instruction-Guided Audio-Video Joint Editing
par: Zheng, Haojie, et autres
Publié: (2026)
par: Zheng, Haojie, et autres
Publié: (2026)
VR-Thinker: Boosting Video Reward Models through Thinking-with-Image Reasoning
par: Wang, Qunzhong, et autres
Publié: (2025)
par: Wang, Qunzhong, et autres
Publié: (2025)
AV-Odyssey Bench: Can Your Multimodal LLMs Really Understand Audio-Visual Information?
par: Gong, Kaixiong, et autres
Publié: (2024)
par: Gong, Kaixiong, et autres
Publié: (2024)
Hijacking Large Audio-Language Models via Context-Agnostic and Imperceptible Auditory Prompt Injection
par: Chen, Meng, et autres
Publié: (2026)
par: Chen, Meng, et autres
Publié: (2026)
Towards Real-time Video Compressive Sensing on Mobile Devices
par: Cao, Miao, et autres
Publié: (2024)
par: Cao, Miao, et autres
Publié: (2024)
Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling
par: Ye, Zhen, et autres
Publié: (2026)
par: Ye, Zhen, et autres
Publié: (2026)
AVFakeBench: A Comprehensive Audio-Video Forgery Detection Benchmark for AV-LMMs
par: Xia, Shuhan, et autres
Publié: (2025)
par: Xia, Shuhan, et autres
Publié: (2025)
MMEDIT: A Unified Framework for Multi-Type Audio Editing via Audio Language Model
par: Tao, Ye, et autres
Publié: (2025)
par: Tao, Ye, et autres
Publié: (2025)
CodeCriticBench: A Holistic Code Critique Benchmark for Large Language Models
par: Zhang, Alexander, et autres
Publié: (2025)
par: Zhang, Alexander, et autres
Publié: (2025)
UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions
par: Zhang, Guozhen, et autres
Publié: (2025)
par: Zhang, Guozhen, et autres
Publié: (2025)
TransPixeler: Advancing Text-to-Video Generation with Transparency
par: Wang, Luozhou, et autres
Publié: (2025)
par: Wang, Luozhou, et autres
Publié: (2025)
Documents similaires
-
LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV
par: Liu, Tengfei, et autres
Publié: (2026) -
MVU-Eval: Towards Multi-Video Understanding Evaluation for Multimodal LLMs
par: Peng, Tianhao, et autres
Publié: (2025) -
SWE-Compass: Towards Unified Evaluation of Agentic Coding Abilities for Large Language Models
par: Xu, Jingxuan, et autres
Publié: (2025) -
Edit-Compass & EditReward-Compass: A Unified Benchmark for Image Editing and Reward Modeling
par: Bai, Xuehai, et autres
Publié: (2026) -
OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs
par: Li, Caorui, et autres
Publié: (2025)