Guardado en:
| Autores principales: | Kim, Jongsuk, Lee, Hyeongkeun, Rho, Kyeongha, Kim, Junmo, Chung, Joon Son |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2403.09502 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport
por: Rho, Kyeongha, et al.
Publicado: (2025)
por: Rho, Kyeongha, et al.
Publicado: (2025)
MoLT: Mixture of Layer-Wise Tokens for Efficient Audio-Visual Learning
por: Rho, Kyeongha, et al.
Publicado: (2025)
por: Rho, Kyeongha, et al.
Publicado: (2025)
SpeakerLLM: A Speaker-Specialized Audio-LLM for Speaker Understanding and Verification Reasoning
por: Nam, KiHyun, et al.
Publicado: (2026)
por: Nam, KiHyun, et al.
Publicado: (2026)
Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs
por: Jung, Chaeyoung, et al.
Publicado: (2026)
por: Jung, Chaeyoung, et al.
Publicado: (2026)
AVCap: Leveraging Audio-Visual Features as Text Tokens for Captioning
por: Kim, Jongsuk, et al.
Publicado: (2024)
por: Kim, Jongsuk, et al.
Publicado: (2024)
AV2AV: Direct Audio-Visual Speech to Audio-Visual Speech Translation with Unified Audio-Visual Speech Representation
por: Choi, Jeongsoo, et al.
Publicado: (2023)
por: Choi, Jeongsoo, et al.
Publicado: (2023)
Learning Audio-Visual Embeddings with Inferred Latent Interaction Graphs
por: Zeng, Donghuo, et al.
Publicado: (2026)
por: Zeng, Donghuo, et al.
Publicado: (2026)
Let Multimodal Embedders Learn When to Augment Query via Adaptive Query Augmentation
por: Kim, Wongyu, et al.
Publicado: (2025)
por: Kim, Wongyu, et al.
Publicado: (2025)
Comparing Contrastive and Triplet Loss: Variance Analysis and Optimization Behavior
por: Zeng, Donghuo
Publicado: (2025)
por: Zeng, Donghuo
Publicado: (2025)
Diffusion-Link: Diffusion Probabilistic Model for Bridging the Audio-Text Modality Gap
por: Nam, KiHyun, et al.
Publicado: (2025)
por: Nam, KiHyun, et al.
Publicado: (2025)
Make VLM Recognize Visual Hallucination on Cartoon Character Image with Pose Information
por: Kim, Bumsoo, et al.
Publicado: (2024)
por: Kim, Bumsoo, et al.
Publicado: (2024)
DOA-Aware Audio-Visual Self-Supervised Learning for Sound Event Localization and Detection
por: Fujita, Yoto, et al.
Publicado: (2024)
por: Fujita, Yoto, et al.
Publicado: (2024)
AV-Lip-Sync+: Leveraging AV-HuBERT to Exploit Multimodal Inconsistency for Deepfake Detection of Frontal Face Videos
por: Shahzad, Sahibzada Adil, et al.
Publicado: (2023)
por: Shahzad, Sahibzada Adil, et al.
Publicado: (2023)
Progressive Confident Masking Attention Network for Audio-Visual Segmentation
por: Wang, Yuxuan, et al.
Publicado: (2024)
por: Wang, Yuxuan, et al.
Publicado: (2024)
Model-Guided Dual-Role Alignment for High-Fidelity Open-Domain Video-to-Audio Generation
por: Zhang, Kang, et al.
Publicado: (2025)
por: Zhang, Kang, et al.
Publicado: (2025)
Do Audio-Visual Segmentation Models Truly Segment Sounding Objects?
por: Li, Jia, et al.
Publicado: (2025)
por: Li, Jia, et al.
Publicado: (2025)
Harmful Visual Content Manipulation Matters in Misinformation Detection Under Multimedia Scenarios
por: Wang, Bing, et al.
Publicado: (2026)
por: Wang, Bing, et al.
Publicado: (2026)
Video Face Re-Aging: Toward Temporally Consistent Face Re-Aging
por: Muqeet, Abdul, et al.
Publicado: (2023)
por: Muqeet, Abdul, et al.
Publicado: (2023)
SAVe: Self-Supervised Audio-visual Deepfake Detection Exploiting Visual Artifacts and Audio-visual Misalignment
por: Shahzad, Sahibzada Adil, et al.
Publicado: (2026)
por: Shahzad, Sahibzada Adil, et al.
Publicado: (2026)
GRAFT: GRaPH and Table Reasoning for Textual Alignment -- A Benchmark for Structured Instruction Following and Visual Reasoning
por: Verma, Abhigya, et al.
Publicado: (2025)
por: Verma, Abhigya, et al.
Publicado: (2025)
Contrastive Visual Data Augmentation
por: Zhou, Yu, et al.
Publicado: (2025)
por: Zhou, Yu, et al.
Publicado: (2025)
AlignDiT: Multimodal Aligned Diffusion Transformer for Synchronized Speech Generation
por: Choi, Jeongsoo, et al.
Publicado: (2025)
por: Choi, Jeongsoo, et al.
Publicado: (2025)
Live Music Diffusion Models: Efficient Fine-Tuning and Post-Training of Interactive Diffusion Music Generators
por: Novack, Zachary, et al.
Publicado: (2026)
por: Novack, Zachary, et al.
Publicado: (2026)
Purification Before Fusion: Toward Mask-Free Speech Enhancement for Robust Audio-Visual Speech Recognition
por: Wu, Linzhi, et al.
Publicado: (2026)
por: Wu, Linzhi, et al.
Publicado: (2026)
Audio Transformers
por: Verma, Prateek, et al.
Publicado: (2021)
por: Verma, Prateek, et al.
Publicado: (2021)
Harmony: A Unified Framework for Modality Incremental Learning
por: Song, Yaguang, et al.
Publicado: (2025)
por: Song, Yaguang, et al.
Publicado: (2025)
Learning Trimodal Relation for Audio-Visual Question Answering with Missing Modality
por: Park, Kyu Ri, et al.
Publicado: (2024)
por: Park, Kyu Ri, et al.
Publicado: (2024)
SIDA: Synthetic Image Driven Zero-shot Domain Adaptation
por: Kim, Ye-Chan, et al.
Publicado: (2025)
por: Kim, Ye-Chan, et al.
Publicado: (2025)
Enhancing Modality Representation and Alignment for Multimodal Cold-start Active Learning
por: Shen, Meng, et al.
Publicado: (2024)
por: Shen, Meng, et al.
Publicado: (2024)
Challenge on Sound Scene Synthesis: Evaluating Text-to-Audio Generation
por: Lee, Junwon, et al.
Publicado: (2024)
por: Lee, Junwon, et al.
Publicado: (2024)
A review on Machine Learning based User-Centric Multimedia Streaming Techniques
por: Ghosh, Monalisa, et al.
Publicado: (2024)
por: Ghosh, Monalisa, et al.
Publicado: (2024)
HeLo: Heterogeneous Multi-Modal Fusion with Label Correlation for Emotion Distribution Learning
por: Zheng, Chuhang, et al.
Publicado: (2025)
por: Zheng, Chuhang, et al.
Publicado: (2025)
MultiScript30k: Leveraging Multilingual Embeddings to Extend Cross Script Parallel Data
por: Driggers-Ellis, Christopher, et al.
Publicado: (2025)
por: Driggers-Ellis, Christopher, et al.
Publicado: (2025)
OLKAVS: An Open Large-Scale Korean Audio-Visual Speech Dataset
por: Park, Jeongkyun, et al.
Publicado: (2023)
por: Park, Jeongkyun, et al.
Publicado: (2023)
SyncLipMAE: Contrastive Masked Pretraining for Audio-Visual Talking-Face Representation
por: Ling, Zeyu, et al.
Publicado: (2025)
por: Ling, Zeyu, et al.
Publicado: (2025)
Generative AI for Music and Audio
por: Dong, Hao-Wen
Publicado: (2024)
por: Dong, Hao-Wen
Publicado: (2024)
Jailbreak-AudioBench: In-Depth Evaluation and Analysis of Jailbreak Threats for Large Audio Language Models
por: Cheng, Hao, et al.
Publicado: (2025)
por: Cheng, Hao, et al.
Publicado: (2025)
Contrastive Regularization over LoRA for Multimodal Biomedical Image Incremental Learning
por: Zhang, Haojie, et al.
Publicado: (2025)
por: Zhang, Haojie, et al.
Publicado: (2025)
Content Adaptive Front End For Audio Classification
por: Verma, Prateek, et al.
Publicado: (2023)
por: Verma, Prateek, et al.
Publicado: (2023)
ToonAging: Face Re-Aging upon Artistic Portrait Style Transfer
por: Kim, Bumsoo, et al.
Publicado: (2024)
por: Kim, Bumsoo, et al.
Publicado: (2024)
Ejemplares similares
-
LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport
por: Rho, Kyeongha, et al.
Publicado: (2025) -
MoLT: Mixture of Layer-Wise Tokens for Efficient Audio-Visual Learning
por: Rho, Kyeongha, et al.
Publicado: (2025) -
SpeakerLLM: A Speaker-Specialized Audio-LLM for Speaker Understanding and Verification Reasoning
por: Nam, KiHyun, et al.
Publicado: (2026) -
Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs
por: Jung, Chaeyoung, et al.
Publicado: (2026) -
AVCap: Leveraging Audio-Visual Features as Text Tokens for Captioning
por: Kim, Jongsuk, et al.
Publicado: (2024)