LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport
Fuente:
arXiv
Guardado en:
| Autores principales: | Rho, Kyeongha, Lee, Hyeongkeun, Iverson, Valentio, Chung, Joon Son |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Plug-and-Steer: Decoupling Separation and Selection in Audio-Visual Target Speaker Extraction
por: Kwak, Doyeop, et al.
Publicado: (2026)
por: Kwak, Doyeop, et al.
Publicado: (2026)
Cinematic Audio Source Separation Using Visual Cues
por: Zhang, Kang, et al.
Publicado: (2026)
por: Zhang, Kang, et al.
Publicado: (2026)
Model-Guided Dual-Role Alignment for High-Fidelity Open-Domain Video-to-Audio Generation
por: Zhang, Kang, et al.
Publicado: (2025)
por: Zhang, Kang, et al.
Publicado: (2025)
SpeakerLLM: A Speaker-Specialized Audio-LLM for Speaker Understanding and Verification Reasoning
por: Nam, KiHyun, et al.
Publicado: (2026)
por: Nam, KiHyun, et al.
Publicado: (2026)
Towards Generating Diverse Audio Captions via Adversarial Training
por: Mei, Xinhao, et al.
Publicado: (2022)
por: Mei, Xinhao, et al.
Publicado: (2022)
Unveiling Visual Biases in Audio-Visual Localization Benchmarks
por: Chen, Liangyu, et al.
Publicado: (2024)
por: Chen, Liangyu, et al.
Publicado: (2024)
A Multi-Stream Fusion Approach with One-Class Learning for Audio-Visual Deepfake Detection
por: Lee, Kyungbok, et al.
Publicado: (2024)
por: Lee, Kyungbok, et al.
Publicado: (2024)
Sound-VECaps: Improving Audio Generation with Visual Enhanced Captions
por: Yuan, Yi, et al.
Publicado: (2024)
por: Yuan, Yi, et al.
Publicado: (2024)
LRS-VoxMM: A benchmark for in-the-wild audio-visual speech recognition
por: Kwak, Doyeop, et al.
Publicado: (2026)
por: Kwak, Doyeop, et al.
Publicado: (2026)
Listening and Seeing Again: Generative Error Correction for Audio-Visual Speech Recognition
por: Liu, Rui, et al.
Publicado: (2025)
por: Liu, Rui, et al.
Publicado: (2025)
SHMamba: Structured Hyperbolic State Space Model for Audio-Visual Question Answering
por: Yang, Zhe, et al.
Publicado: (2024)
por: Yang, Zhe, et al.
Publicado: (2024)
PIAST: A Multimodal Piano Dataset with Audio, Symbolic and Text
por: Bang, Hayeon, et al.
Publicado: (2024)
por: Bang, Hayeon, et al.
Publicado: (2024)
AudioRole: An Audio Dataset for Character Role-Playing in Large Language Models
por: Li, Wenyu, et al.
Publicado: (2025)
por: Li, Wenyu, et al.
Publicado: (2025)
MMVA: Multimodal Matching Based on Valence and Arousal across Images, Music, and Musical Captions
por: Choi, Suhwan, et al.
Publicado: (2025)
por: Choi, Suhwan, et al.
Publicado: (2025)
OmniCustom: Sync Audio-Video Customization Via Joint Audio-Video Generation Model
por: Li, Maomao, et al.
Publicado: (2026)
por: Li, Maomao, et al.
Publicado: (2026)
FreeAudio: Training-Free Timing Planning for Controllable Long-Form Text-to-Audio Generation
por: Jiang, Yuxuan, et al.
Publicado: (2025)
por: Jiang, Yuxuan, et al.
Publicado: (2025)
Retrieval-Augmented Text-to-Audio Generation
por: Yuan, Yi, et al.
Publicado: (2023)
por: Yuan, Yi, et al.
Publicado: (2023)
Neural Style Transfer for Audio Spectograms
por: Verma, Prateek, et al.
Publicado: (2018)
por: Verma, Prateek, et al.
Publicado: (2018)
Embedding Alignment in Code Generation for Audio
por: Kouteili, Sam, et al.
Publicado: (2025)
por: Kouteili, Sam, et al.
Publicado: (2025)
Resource-Efficient Reference-Free Evaluation of Audio Captions
por: Mahfuz, Rehana, et al.
Publicado: (2024)
por: Mahfuz, Rehana, et al.
Publicado: (2024)
Integrating IP Broadcasting with Audio Tags: Workflow and Challenges
por: Burchett-Vass, Rhys, et al.
Publicado: (2024)
por: Burchett-Vass, Rhys, et al.
Publicado: (2024)
Robust LLM-based Audio-Visual Speech Recognition with Sparse Modality Alignment and Visual Unit-Guided Refinement
por: Su, Fei, et al.
Publicado: (2026)
por: Su, Fei, et al.
Publicado: (2026)
Leveraging Pre-Trained Autoencoders for Interpretable Prototype Learning of Music Audio
por: Alonso-Jiménez, Pablo, et al.
Publicado: (2024)
por: Alonso-Jiménez, Pablo, et al.
Publicado: (2024)
DeepFake Doctor: Diagnosing and Treating Audio-Video Fake Detection
por: Klemt, Marcel, et al.
Publicado: (2025)
por: Klemt, Marcel, et al.
Publicado: (2025)
Leveraging Pre-trained AudioLDM for Sound Generation: A Benchmark Study
por: Yuan, Yi, et al.
Publicado: (2023)
por: Yuan, Yi, et al.
Publicado: (2023)
Robust Audio Anti-Spoofing with Fusion-Reconstruction Learning on Multi-Order Spectrograms
por: Wen, Penghui, et al.
Publicado: (2023)
por: Wen, Penghui, et al.
Publicado: (2023)
LAV: Audio-Driven Dynamic Visual Generation with Neural Compression and StyleGAN2
por: Jung, Jongmin, et al.
Publicado: (2025)
por: Jung, Jongmin, et al.
Publicado: (2025)
Towards Assessing Data Replication in Music Generation with Music Similarity Metrics on Raw Audio
por: Batlle-Roca, Roser, et al.
Publicado: (2024)
por: Batlle-Roca, Roser, et al.
Publicado: (2024)
LPIPS-AttnWav2Lip: Generic Audio-Driven lip synchronization for Talking Head Generation in the Wild
por: Chen, Zhipeng, et al.
Publicado: (2026)
por: Chen, Zhipeng, et al.
Publicado: (2026)
DreamHead: Learning Spatial-Temporal Correspondence via Hierarchical Diffusion for Audio-driven Talking Head Synthesis
por: Hong, Fa-Ting, et al.
Publicado: (2024)
por: Hong, Fa-Ting, et al.
Publicado: (2024)
CoComposer: LLM Multi-agent Collaborative Music Composition
por: Xing, Peiwen, et al.
Publicado: (2025)
por: Xing, Peiwen, et al.
Publicado: (2025)
Audio is all in one: speech-driven gesture synthetics using WavLM pre-trained model
por: Zhang, Fan, et al.
Publicado: (2023)
por: Zhang, Fan, et al.
Publicado: (2023)
AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining
por: Liu, Haohe, et al.
Publicado: (2023)
por: Liu, Haohe, et al.
Publicado: (2023)
MidiTok Visualizer: a tool for visualization and analysis of tokenized MIDI symbolic music
por: Wiszenko, Michał, et al.
Publicado: (2024)
por: Wiszenko, Michał, et al.
Publicado: (2024)
Quality-Aware End-to-End Audio-Visual Neural Speaker Diarization
por: He, Mao-Kui, et al.
Publicado: (2024)
por: He, Mao-Kui, et al.
Publicado: (2024)
PointTalk: Audio-Driven Dynamic Lip Point Cloud for 3D Gaussian-based Talking Head Synthesis
por: Xie, Yifan, et al.
Publicado: (2024)
por: Xie, Yifan, et al.
Publicado: (2024)
Do Audio-Visual Segmentation Models Truly Segment Sounding Objects?
por: Li, Jia, et al.
Publicado: (2025)
por: Li, Jia, et al.
Publicado: (2025)
On the Design of Diffusion-based Neural Speech Codecs
por: Foti, Pietro, et al.
Publicado: (2025)
por: Foti, Pietro, et al.
Publicado: (2025)
Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis
por: Huang, Zhiqi, et al.
Publicado: (2024)
por: Huang, Zhiqi, et al.
Publicado: (2024)
Building Audio-Visual Digital Twins with Smartphones
por: Lan, Zitong, et al.
Publicado: (2025)
por: Lan, Zitong, et al.
Publicado: (2025)
Ejemplares similares
-
Plug-and-Steer: Decoupling Separation and Selection in Audio-Visual Target Speaker Extraction
por: Kwak, Doyeop, et al.
Publicado: (2026) -
Cinematic Audio Source Separation Using Visual Cues
por: Zhang, Kang, et al.
Publicado: (2026) -
Model-Guided Dual-Role Alignment for High-Fidelity Open-Domain Video-to-Audio Generation
por: Zhang, Kang, et al.
Publicado: (2025) -
SpeakerLLM: A Speaker-Specialized Audio-LLM for Speaker Understanding and Verification Reasoning
por: Nam, KiHyun, et al.
Publicado: (2026) -
Towards Generating Diverse Audio Captions via Adversarial Training
por: Mei, Xinhao, et al.
Publicado: (2022)