Do Modern Video-LLMs Need to Listen? A Benchmark Audit and Scalable Remedy
Fuente:
arXiv
Salvato in:
| Autori principali: | Kim, Geewook, Seo, Minjoon |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AccKV: Towards Efficient Audio-Video LLMs Inference via Adaptive-Focusing and Cross-Calibration KV Cache Optimization
di: Jiang, Zhonghua, et al.
Pubblicazione: (2025)
di: Jiang, Zhonghua, et al.
Pubblicazione: (2025)
UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation
di: Li, Hebeizi, et al.
Pubblicazione: (2026)
di: Li, Hebeizi, et al.
Pubblicazione: (2026)
PAVAS: Physics-Aware Video-to-Audio Synthesis
di: Hyun-Bin, Oh, et al.
Pubblicazione: (2025)
di: Hyun-Bin, Oh, et al.
Pubblicazione: (2025)
Do Joint Audio-Video Generation Models Understand Physics?
di: Cui, Zijun, et al.
Pubblicazione: (2026)
di: Cui, Zijun, et al.
Pubblicazione: (2026)
State-Space Hierarchical Compression with Gated Attention and Learnable Sampling for Hour-Long Video Understanding in Large Multimodal Models
di: Kim, Geewook, et al.
Pubblicazione: (2025)
di: Kim, Geewook, et al.
Pubblicazione: (2025)
Tora3: Trajectory-Guided Audio-Video Generation with Physical Coherence
di: Liao, Junchao, et al.
Pubblicazione: (2026)
di: Liao, Junchao, et al.
Pubblicazione: (2026)
JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation
di: Liu, Kai, et al.
Pubblicazione: (2026)
di: Liu, Kai, et al.
Pubblicazione: (2026)
Omni2Sound: Towards Unified Video-Text-to-Audio Generation
di: Dai, Yusheng, et al.
Pubblicazione: (2026)
di: Dai, Yusheng, et al.
Pubblicazione: (2026)
OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text
di: Pian, Weiguo, et al.
Pubblicazione: (2026)
di: Pian, Weiguo, et al.
Pubblicazione: (2026)
Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation
di: Chen, Yuheng, et al.
Pubblicazione: (2026)
di: Chen, Yuheng, et al.
Pubblicazione: (2026)
ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling
di: Yang, Jianxuan, et al.
Pubblicazione: (2026)
di: Yang, Jianxuan, et al.
Pubblicazione: (2026)
IsoSignVid2Aud: Sign Language Video to Audio Conversion without Text Intermediaries
di: Kavediya, Harsh, et al.
Pubblicazione: (2025)
di: Kavediya, Harsh, et al.
Pubblicazione: (2025)
Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation
di: Li, Chunyu, et al.
Pubblicazione: (2026)
di: Li, Chunyu, et al.
Pubblicazione: (2026)
AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models
di: Yang, Jialiang, et al.
Pubblicazione: (2026)
di: Yang, Jialiang, et al.
Pubblicazione: (2026)
MultiSoundGen: Video-to-Audio Generation for Multi-Event Scenarios via SlowFast Contrastive Audio-Visual Pretraining and Direct Preference Optimization
di: Yang, Jianxuan, et al.
Pubblicazione: (2025)
di: Yang, Jianxuan, et al.
Pubblicazione: (2025)
Aligned Better, Listen Better for Audio-Visual Large Language Models
di: Guo, Yuxin, et al.
Pubblicazione: (2025)
di: Guo, Yuxin, et al.
Pubblicazione: (2025)
Sound Sparks Motion: Audio and Text Tuning for Video Editing
di: Razlighi, AmirHossein Naghi, et al.
Pubblicazione: (2026)
di: Razlighi, AmirHossein Naghi, et al.
Pubblicazione: (2026)
Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation
di: Cheng, Shihao, et al.
Pubblicazione: (2026)
di: Cheng, Shihao, et al.
Pubblicazione: (2026)
AV-Surf: Surface-Enhanced Geometry-Aware Novel-View Acoustic Synthesis
di: Baek, Hadam, et al.
Pubblicazione: (2025)
di: Baek, Hadam, et al.
Pubblicazione: (2025)
VAInpaint: Zero-Shot Video-Audio inpainting framework with LLMs-driven Module
di: Wu, Kam Man, et al.
Pubblicazione: (2025)
di: Wu, Kam Man, et al.
Pubblicazione: (2025)
Omni-Captioner: Data Pipeline, Models, and Benchmark for Omni Detailed Perception
di: Ma, Ziyang, et al.
Pubblicazione: (2025)
di: Ma, Ziyang, et al.
Pubblicazione: (2025)
On Efficient Language and Vision Assistants for Visually-Situated Natural Language Understanding: What Matters in Reading and Reasoning
di: Kim, Geewook, et al.
Pubblicazione: (2024)
di: Kim, Geewook, et al.
Pubblicazione: (2024)
Anomaly Detection and Localization for Speech Deepfakes via Feature Pyramid Matching
di: Coletta, Emma, et al.
Pubblicazione: (2025)
di: Coletta, Emma, et al.
Pubblicazione: (2025)
AV-Edit: Multimodal Generative Sound Effect Editing via Audio-Visual Semantic Joint Control
di: Guo, Xinyue, et al.
Pubblicazione: (2025)
di: Guo, Xinyue, et al.
Pubblicazione: (2025)
MoLT: Mixture of Layer-Wise Tokens for Efficient Audio-Visual Learning
di: Rho, Kyeongha, et al.
Pubblicazione: (2025)
di: Rho, Kyeongha, et al.
Pubblicazione: (2025)
Tempo as the Stable Cue: Hierarchical Mixture of Tempo and Beat Experts for Music to 3D Dance Generation
di: Lyu, Guangtao, et al.
Pubblicazione: (2025)
di: Lyu, Guangtao, et al.
Pubblicazione: (2025)
Schrodinger Audio-Visual Editor: Object-Level Audiovisual Removal
di: Xu, Weihan, et al.
Pubblicazione: (2025)
di: Xu, Weihan, et al.
Pubblicazione: (2025)
Audio-Visual World Models: Towards Multisensory Imagination in Sight and Sound
di: Wang, Jiahua, et al.
Pubblicazione: (2025)
di: Wang, Jiahua, et al.
Pubblicazione: (2025)
AudioStory: Generating Long-Form Narrative Audio with Large Language Models
di: Guo, Yuxin, et al.
Pubblicazione: (2025)
di: Guo, Yuxin, et al.
Pubblicazione: (2025)
TurboTalk: Progressive Distillation for One-Step Audio-Driven Talking Avatar Generation
di: Liu, Xiangyu, et al.
Pubblicazione: (2026)
di: Liu, Xiangyu, et al.
Pubblicazione: (2026)
SonoWorld: From One Image to a 3D Audio-Visual Scene
di: Jin, Derong, et al.
Pubblicazione: (2026)
di: Jin, Derong, et al.
Pubblicazione: (2026)
Art2Mus: Artwork-to-Music Generation via Visual Conditioning and Large-Scale Cross-Modal Alignment
di: Rinaldi, Ivan, et al.
Pubblicazione: (2026)
di: Rinaldi, Ivan, et al.
Pubblicazione: (2026)
READ-Net: Clarifying Emotional Ambiguity via Adaptive Feature Recalibration for Audio-Visual Depression Detection
di: Chen, Chenglizhao, et al.
Pubblicazione: (2026)
di: Chen, Chenglizhao, et al.
Pubblicazione: (2026)
LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV
di: Liu, Tengfei, et al.
Pubblicazione: (2026)
di: Liu, Tengfei, et al.
Pubblicazione: (2026)
EgoAdapt: Enhancing Robustness in Egocentric Interactive Speaker Detection Under Missing Modalities
di: Qian, Xinyuan, et al.
Pubblicazione: (2026)
di: Qian, Xinyuan, et al.
Pubblicazione: (2026)
AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers
di: Araujo, Edson, et al.
Pubblicazione: (2026)
di: Araujo, Edson, et al.
Pubblicazione: (2026)
CoSyncDiT: Cognitive Synchronous Diffusion Transformer for Movie Dubbing
di: Cong, Gaoxiang, et al.
Pubblicazione: (2026)
di: Cong, Gaoxiang, et al.
Pubblicazione: (2026)
OmniForcing: Unleashing Real-time Joint Audio-Visual Generation
di: Su, Yaofeng, et al.
Pubblicazione: (2026)
di: Su, Yaofeng, et al.
Pubblicazione: (2026)
Adaptive Audio-Visual Speech Recognition via Matryoshka-Based Multimodal LLMs
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2025)
di: Cappellazzo, Umberto, et al.
Pubblicazione: (2025)
Diffusion Models for Joint Audio-Video Generation
di: La Torre, Alejandro Paredes
Pubblicazione: (2026)
di: La Torre, Alejandro Paredes
Pubblicazione: (2026)
Documenti analoghi
-
AccKV: Towards Efficient Audio-Video LLMs Inference via Adaptive-Focusing and Cross-Calibration KV Cache Optimization
di: Jiang, Zhonghua, et al.
Pubblicazione: (2025) -
UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation
di: Li, Hebeizi, et al.
Pubblicazione: (2026) -
PAVAS: Physics-Aware Video-to-Audio Synthesis
di: Hyun-Bin, Oh, et al.
Pubblicazione: (2025) -
Do Joint Audio-Video Generation Models Understand Physics?
di: Cui, Zijun, et al.
Pubblicazione: (2026) -
State-Space Hierarchical Compression with Gated Attention and Learnable Sampling for Hour-Long Video Understanding in Large Multimodal Models
di: Kim, Geewook, et al.
Pubblicazione: (2025)