MTAVG-Bench: A Diagnostic Benchmark for Multi-Talker Dialogue-Centric Audio-Video Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhou, Yang-Hao, Li, Haitian, Lin, Rexar, Huang, Heyan, Zhou, Jinxing, Yuan, Changsen, Lan, Tian, Zhou, Ziqin, Li, Yudong, Xu, Jiajun, Liao, Jingyun, Cheng, Yi-Ming, Chen, Xuefeng, Mao, Xian-Ling, Feng, Yousheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation
por: Li, Haitian, et al.
Publicado: (2026)
por: Li, Haitian, et al.
Publicado: (2026)
Look, Listen and Segment: Towards Weakly Supervised Audio-visual Semantic Segmentation
por: Li, Chengzhi, et al.
Publicado: (2026)
por: Li, Chengzhi, et al.
Publicado: (2026)
CLASP: Cross-modal Salient Anchor-based Semantic Propagation for Weakly-supervised Dense Audio-Visual Event Localization
por: Zhou, Jinxing, et al.
Publicado: (2025)
por: Zhou, Jinxing, et al.
Publicado: (2025)
Patch-level Sounding Object Tracking for Audio-Visual Question Answering
por: Li, Zhangbin, et al.
Publicado: (2024)
por: Li, Zhangbin, et al.
Publicado: (2024)
Advancing Weakly-Supervised Audio-Visual Video Parsing via Segment-wise Pseudo Labeling
por: Zhou, Jinxing, et al.
Publicado: (2024)
por: Zhou, Jinxing, et al.
Publicado: (2024)
Label-anticipated Event Disentanglement for Audio-Visual Video Parsing
por: Zhou, Jinxing, et al.
Publicado: (2024)
por: Zhou, Jinxing, et al.
Publicado: (2024)
Towards Open-Vocabulary Audio-Visual Event Localization
por: Zhou, Jinxing, et al.
Publicado: (2024)
por: Zhou, Jinxing, et al.
Publicado: (2024)
Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing
por: Zhao, Pengcheng, et al.
Publicado: (2024)
por: Zhao, Pengcheng, et al.
Publicado: (2024)
DreamFoley: Scalable VLMs for High-Fidelity Video-to-Audio Generation
por: Li, Fu, et al.
Publicado: (2025)
por: Li, Fu, et al.
Publicado: (2025)
Enkidu: Universal Frequential Perturbation for Real-Time Audio Privacy Protection against Voice Deepfakes
por: Feng, Zhou, et al.
Publicado: (2025)
por: Feng, Zhou, et al.
Publicado: (2025)
MusiCRS: Benchmarking Audio-Centric Conversational Recommendation
por: Surana, Rohan, et al.
Publicado: (2025)
por: Surana, Rohan, et al.
Publicado: (2025)
From Natural Alignment to Conditional Controllability in Multimodal Dialogue
por: Jin, Zeyu, et al.
Publicado: (2026)
por: Jin, Zeyu, et al.
Publicado: (2026)
SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding
por: Sun, Luoyi, et al.
Publicado: (2026)
por: Sun, Luoyi, et al.
Publicado: (2026)
LongInsightBench: A Comprehensive Benchmark for Evaluating Omni-Modal Models on Human-Centric Long-Video Understanding
por: Han, ZhaoYang, et al.
Publicado: (2025)
por: Han, ZhaoYang, et al.
Publicado: (2025)
GaussianTalker: Real-Time High-Fidelity Talking Head Synthesis with Audio-Driven 3D Gaussian Splatting
por: Cho, Kyusun, et al.
Publicado: (2024)
por: Cho, Kyusun, et al.
Publicado: (2024)
Think Before You Segment: An Object-aware Reasoning Agent for Referring Audio-Visual Segmentation
por: Zhou, Jinxing, et al.
Publicado: (2025)
por: Zhou, Jinxing, et al.
Publicado: (2025)
Audio-Language Models for Audio-Centric Tasks: A Systematic Survey
por: Su, Yi, et al.
Publicado: (2025)
por: Su, Yi, et al.
Publicado: (2025)
SegTalker: Segmentation-based Talking Face Generation with Mask-guided Local Editing
por: Xiong, Lingyu, et al.
Publicado: (2024)
por: Xiong, Lingyu, et al.
Publicado: (2024)
TAVGBench: Benchmarking Text to Audible-Video Generation
por: Mao, Yuxin, et al.
Publicado: (2024)
por: Mao, Yuxin, et al.
Publicado: (2024)
Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling
por: Ye, Zhen, et al.
Publicado: (2026)
por: Ye, Zhen, et al.
Publicado: (2026)
TCC-Bench: Benchmarking the Traditional Chinese Culture Understanding Capabilities of MLLMs
por: Xu, Pengju, et al.
Publicado: (2025)
por: Xu, Pengju, et al.
Publicado: (2025)
OpFlowTalker: Realistic and Natural Talking Face Generation via Optical Flow Guidance
por: Ge, Shuheng, et al.
Publicado: (2024)
por: Ge, Shuheng, et al.
Publicado: (2024)
EEmo-Bench: A Benchmark for Multi-modal Large Language Models on Image Evoked Emotion Assessment
por: Gao, Lancheng, et al.
Publicado: (2025)
por: Gao, Lancheng, et al.
Publicado: (2025)
Listen, Look, Drive: Coupling Audio Instructions for User-aware VLA-based Autonomous Driving
por: Guo, Ziang, et al.
Publicado: (2026)
por: Guo, Ziang, et al.
Publicado: (2026)
Audio-Visual Instance Segmentation
por: Guo, Ruohao, et al.
Publicado: (2023)
por: Guo, Ruohao, et al.
Publicado: (2023)
Two-stage dynamic creative optimization under sparse ambiguous samples for e-commerce advertising
por: Li, Guandong, et al.
Publicado: (2023)
por: Li, Guandong, et al.
Publicado: (2023)
Towards Multimodal Emotional Support Conversation Systems
por: Chu, Yuqi, et al.
Publicado: (2024)
por: Chu, Yuqi, et al.
Publicado: (2024)
CLIPRerank: An Extremely Simple Method for Improving Ad-hoc Video Search
por: Chen, Aozhu, et al.
Publicado: (2024)
por: Chen, Aozhu, et al.
Publicado: (2024)
FastTalker: Jointly Generating Speech and Conversational Gestures from Text
por: Guo, Zixin, et al.
Publicado: (2024)
por: Guo, Zixin, et al.
Publicado: (2024)
Generalizing Video DeepFake Detection by Self-generated Audio-Visual Pseudo-Fakes
por: Wei, Zihe, et al.
Publicado: (2026)
por: Wei, Zihe, et al.
Publicado: (2026)
MOS-FAD: Improving Fake Audio Detection Via Automatic Mean Opinion Score Prediction
por: Zhou, Wangjin, et al.
Publicado: (2024)
por: Zhou, Wangjin, et al.
Publicado: (2024)
Audio Matters Too! Enhancing Markerless Motion Capture with Audio Signals for String Performance Capture
por: Jin, Yitong, et al.
Publicado: (2024)
por: Jin, Yitong, et al.
Publicado: (2024)
Exploring the Role of Audio in Multimodal Misinformation Detection
por: Liu, Moyang, et al.
Publicado: (2024)
por: Liu, Moyang, et al.
Publicado: (2024)
Beyond Isolated Utterances: Cue-Guided Interaction for Context-Dependent Conversational Multimodal Understanding
por: Pan, Zhaoyan, et al.
Publicado: (2026)
por: Pan, Zhaoyan, et al.
Publicado: (2026)
Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis
por: Huang, Zhiqi, et al.
Publicado: (2024)
por: Huang, Zhiqi, et al.
Publicado: (2024)
Audit After Segmentation: Reference-Free Mask Quality Assessment for Language-Referred Audio-Visual Segmentation
por: Zhou, Jinxing, et al.
Publicado: (2026)
por: Zhou, Jinxing, et al.
Publicado: (2026)
Trusted Fake Audio Detection Based on Dirichlet Distribution
por: Ding, Chi, et al.
Publicado: (2025)
por: Ding, Chi, et al.
Publicado: (2025)
Multimodal Semantic Communication for Generative Audio-Driven Video Conferencing
por: Tong, Haonan, et al.
Publicado: (2024)
por: Tong, Haonan, et al.
Publicado: (2024)
MixFake: Benchmarking and Enhancing Audio Deepfake Detection in Diverse Real-world Mixed Audio
por: Li, Qingcao, et al.
Publicado: (2026)
por: Li, Qingcao, et al.
Publicado: (2026)
Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer
por: Lei, Ke, et al.
Publicado: (2026)
por: Lei, Ke, et al.
Publicado: (2026)
Ejemplares similares
-
MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation
por: Li, Haitian, et al.
Publicado: (2026) -
Look, Listen and Segment: Towards Weakly Supervised Audio-visual Semantic Segmentation
por: Li, Chengzhi, et al.
Publicado: (2026) -
CLASP: Cross-modal Salient Anchor-based Semantic Propagation for Weakly-supervised Dense Audio-Visual Event Localization
por: Zhou, Jinxing, et al.
Publicado: (2025) -
Patch-level Sounding Object Tracking for Audio-Visual Question Answering
por: Li, Zhangbin, et al.
Publicado: (2024) -
Advancing Weakly-Supervised Audio-Visual Video Parsing via Segment-wise Pseudo Labeling
por: Zhou, Jinxing, et al.
Publicado: (2024)