WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM
Fuente:
arXiv
Guardado en:
| Autores principales: | Tang, Changli, Xiao, Qinfan, Mei, Ke, Wang, Tianyi, Rao, Fengyun, Zhang, Chao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
D-ORCA: Dialogue-Centric Optimization for Robust Audio-Visual Captioning
por: Tang, Changli, et al.
Publicado: (2026)
por: Tang, Changli, et al.
Publicado: (2026)
JAEGER: Joint 3D Audio-Visual Grounding and Reasoning in Simulated Physical Environments
por: Liu, Zhan, et al.
Publicado: (2026)
por: Liu, Zhan, et al.
Publicado: (2026)
video-SALMONN 2: Caption-Enhanced Audio-Visual Large Language Models
por: Tang, Changli, et al.
Publicado: (2025)
por: Tang, Changli, et al.
Publicado: (2025)
Robust Audio-Visual Segmentation via Audio-Guided Visual Convergent Alignment
por: Liu, Chen, et al.
Publicado: (2025)
por: Liu, Chen, et al.
Publicado: (2025)
CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization
por: Bai, Detao, et al.
Publicado: (2025)
por: Bai, Detao, et al.
Publicado: (2025)
VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection
por: Cheng, Hao, et al.
Publicado: (2025)
por: Cheng, Hao, et al.
Publicado: (2025)
LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV
por: Liu, Tengfei, et al.
Publicado: (2026)
por: Liu, Tengfei, et al.
Publicado: (2026)
AV-Edit: Multimodal Generative Sound Effect Editing via Audio-Visual Semantic Joint Control
por: Guo, Xinyue, et al.
Publicado: (2025)
por: Guo, Xinyue, et al.
Publicado: (2025)
Semantic Noise Reduction via Teacher-Guided Dual-Path Audio-Visual Representation Learning
por: Wang, Linge, et al.
Publicado: (2026)
por: Wang, Linge, et al.
Publicado: (2026)
Omni2Sound: Towards Unified Video-Text-to-Audio Generation
por: Dai, Yusheng, et al.
Publicado: (2026)
por: Dai, Yusheng, et al.
Publicado: (2026)
Semantic Audio-Visual Navigation in Continuous Environments
por: Zeng, Yichen, et al.
Publicado: (2026)
por: Zeng, Yichen, et al.
Publicado: (2026)
UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation
por: Li, Hebeizi, et al.
Publicado: (2026)
por: Li, Hebeizi, et al.
Publicado: (2026)
Semantics-Aware Human Motion Generation from Audio Instructions
por: Wang, Zi-An, et al.
Publicado: (2025)
por: Wang, Zi-An, et al.
Publicado: (2025)
AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation
por: Wang, Le, et al.
Publicado: (2025)
por: Wang, Le, et al.
Publicado: (2025)
ReelWave: Multi-Agentic Movie Sound Generation through Multimodal LLM Conversation
por: Wang, Zixuan, et al.
Publicado: (2025)
por: Wang, Zixuan, et al.
Publicado: (2025)
Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing
por: Tian, Zeyue, et al.
Publicado: (2026)
por: Tian, Zeyue, et al.
Publicado: (2026)
Rethinking Audio-Visual Adversarial Vulnerability from Temporal and Modality Perspectives
por: Zhang, Zeliang, et al.
Publicado: (2025)
por: Zhang, Zeliang, et al.
Publicado: (2025)
Audio-Guided Visual Perception for Audio-Visual Navigation
por: Wang, Yi, et al.
Publicado: (2025)
por: Wang, Yi, et al.
Publicado: (2025)
XM-ALIGN: Unified Cross-Modal Embedding Alignment for Face-Voice Association
por: Fang, Zhihua, et al.
Publicado: (2025)
por: Fang, Zhihua, et al.
Publicado: (2025)
UniSync: A Unified Framework for Audio-Visual Synchronization
por: Feng, Tao, et al.
Publicado: (2025)
por: Feng, Tao, et al.
Publicado: (2025)
JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation
por: Liu, Kai, et al.
Publicado: (2026)
por: Liu, Kai, et al.
Publicado: (2026)
UniLS: End-to-End Audio-Driven Avatars for Unified Listening and Speaking
por: Chu, Xuangeng, et al.
Publicado: (2025)
por: Chu, Xuangeng, et al.
Publicado: (2025)
DDAVS: Disentangled Audio Semantics and Delayed Bidirectional Alignment for Audio-Visual Segmentation
por: Tian, Jingqi, et al.
Publicado: (2025)
por: Tian, Jingqi, et al.
Publicado: (2025)
AV-RIR: Audio-Visual Room Impulse Response Estimation
por: Ratnarajah, Anton, et al.
Publicado: (2023)
por: Ratnarajah, Anton, et al.
Publicado: (2023)
MoLT: Mixture of Layer-Wise Tokens for Efficient Audio-Visual Learning
por: Rho, Kyeongha, et al.
Publicado: (2025)
por: Rho, Kyeongha, et al.
Publicado: (2025)
Multimodal Transformer Distillation for Audio-Visual Synchronization
por: Chen, Xuanjun, et al.
Publicado: (2022)
por: Chen, Xuanjun, et al.
Publicado: (2022)
ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling
por: Yang, Jianxuan, et al.
Publicado: (2026)
por: Yang, Jianxuan, et al.
Publicado: (2026)
UniAV: Unified Audio-Visual Perception for Multi-Task Video Event Localization
por: Geng, Tiantian, et al.
Publicado: (2024)
por: Geng, Tiantian, et al.
Publicado: (2024)
SSAVSV: Towards Unified Model for Self-Supervised Audio-Visual Speaker Verification
por: Rajasekhar, Gnana Praveen, et al.
Publicado: (2025)
por: Rajasekhar, Gnana Praveen, et al.
Publicado: (2025)
MultiSoundGen: Video-to-Audio Generation for Multi-Event Scenarios via SlowFast Contrastive Audio-Visual Pretraining and Direct Preference Optimization
por: Yang, Jianxuan, et al.
Publicado: (2025)
por: Yang, Jianxuan, et al.
Publicado: (2025)
A Systematic Study of Cross-Modal Typographic Attacks on Audio-Visual Reasoning
por: Chen, Tianle, et al.
Publicado: (2026)
por: Chen, Tianle, et al.
Publicado: (2026)
An Audio-Visual Speech Separation Model Inspired by Cortico-Thalamo-Cortical Circuits
por: Li, Kai, et al.
Publicado: (2022)
por: Li, Kai, et al.
Publicado: (2022)
Audio-Visual World Models: Towards Multisensory Imagination in Sight and Sound
por: Wang, Jiahua, et al.
Publicado: (2025)
por: Wang, Jiahua, et al.
Publicado: (2025)
MOVA: Towards Scalable and Synchronized Video-Audio Generation
por: OpenMOSS Team, et al.
Publicado: (2026)
por: OpenMOSS Team, et al.
Publicado: (2026)
CCStereo: Audio-Visual Contextual and Contrastive Learning for Binaural Audio Generation
por: Chen, Yuanhong, et al.
Publicado: (2025)
por: Chen, Yuanhong, et al.
Publicado: (2025)
Schrodinger Audio-Visual Editor: Object-Level Audiovisual Removal
por: Xu, Weihan, et al.
Publicado: (2025)
por: Xu, Weihan, et al.
Publicado: (2025)
Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization
por: Yu, Fei, et al.
Publicado: (2024)
por: Yu, Fei, et al.
Publicado: (2024)
MMS-LLaMA: Efficient LLM-based Audio-Visual Speech Recognition with Minimal Multimodal Speech Tokens
por: Yeo, Jeong Hun, et al.
Publicado: (2025)
por: Yeo, Jeong Hun, et al.
Publicado: (2025)
HarmonySet: A Comprehensive Dataset for Understanding Video-Music Semantic Alignment and Temporal Synchronization
por: Zhou, Zitang, et al.
Publicado: (2025)
por: Zhou, Zitang, et al.
Publicado: (2025)
Music Audio-Visual Question Answering Requires Specialized Multimodal Designs
por: You, Wenhao, et al.
Publicado: (2025)
por: You, Wenhao, et al.
Publicado: (2025)
Ejemplares similares
-
D-ORCA: Dialogue-Centric Optimization for Robust Audio-Visual Captioning
por: Tang, Changli, et al.
Publicado: (2026) -
JAEGER: Joint 3D Audio-Visual Grounding and Reasoning in Simulated Physical Environments
por: Liu, Zhan, et al.
Publicado: (2026) -
video-SALMONN 2: Caption-Enhanced Audio-Visual Large Language Models
por: Tang, Changli, et al.
Publicado: (2025) -
Robust Audio-Visual Segmentation via Audio-Guided Visual Convergent Alignment
por: Liu, Chen, et al.
Publicado: (2025) -
CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization
por: Bai, Detao, et al.
Publicado: (2025)