Salvato in:
| Autori principali: | Kim, Jongsuk, Lee, Hyeongkeun, Rho, Kyeongha, Kim, Junmo, Chung, Joon Son |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2403.09502 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport
di: Rho, Kyeongha, et al.
Pubblicazione: (2025)
di: Rho, Kyeongha, et al.
Pubblicazione: (2025)
MoLT: Mixture of Layer-Wise Tokens for Efficient Audio-Visual Learning
di: Rho, Kyeongha, et al.
Pubblicazione: (2025)
di: Rho, Kyeongha, et al.
Pubblicazione: (2025)
SpeakerLLM: A Speaker-Specialized Audio-LLM for Speaker Understanding and Verification Reasoning
di: Nam, KiHyun, et al.
Pubblicazione: (2026)
di: Nam, KiHyun, et al.
Pubblicazione: (2026)
Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs
di: Jung, Chaeyoung, et al.
Pubblicazione: (2026)
di: Jung, Chaeyoung, et al.
Pubblicazione: (2026)
AVCap: Leveraging Audio-Visual Features as Text Tokens for Captioning
di: Kim, Jongsuk, et al.
Pubblicazione: (2024)
di: Kim, Jongsuk, et al.
Pubblicazione: (2024)
AV2AV: Direct Audio-Visual Speech to Audio-Visual Speech Translation with Unified Audio-Visual Speech Representation
di: Choi, Jeongsoo, et al.
Pubblicazione: (2023)
di: Choi, Jeongsoo, et al.
Pubblicazione: (2023)
Learning Audio-Visual Embeddings with Inferred Latent Interaction Graphs
di: Zeng, Donghuo, et al.
Pubblicazione: (2026)
di: Zeng, Donghuo, et al.
Pubblicazione: (2026)
Let Multimodal Embedders Learn When to Augment Query via Adaptive Query Augmentation
di: Kim, Wongyu, et al.
Pubblicazione: (2025)
di: Kim, Wongyu, et al.
Pubblicazione: (2025)
Comparing Contrastive and Triplet Loss: Variance Analysis and Optimization Behavior
di: Zeng, Donghuo
Pubblicazione: (2025)
di: Zeng, Donghuo
Pubblicazione: (2025)
Diffusion-Link: Diffusion Probabilistic Model for Bridging the Audio-Text Modality Gap
di: Nam, KiHyun, et al.
Pubblicazione: (2025)
di: Nam, KiHyun, et al.
Pubblicazione: (2025)
Make VLM Recognize Visual Hallucination on Cartoon Character Image with Pose Information
di: Kim, Bumsoo, et al.
Pubblicazione: (2024)
di: Kim, Bumsoo, et al.
Pubblicazione: (2024)
DOA-Aware Audio-Visual Self-Supervised Learning for Sound Event Localization and Detection
di: Fujita, Yoto, et al.
Pubblicazione: (2024)
di: Fujita, Yoto, et al.
Pubblicazione: (2024)
AV-Lip-Sync+: Leveraging AV-HuBERT to Exploit Multimodal Inconsistency for Deepfake Detection of Frontal Face Videos
di: Shahzad, Sahibzada Adil, et al.
Pubblicazione: (2023)
di: Shahzad, Sahibzada Adil, et al.
Pubblicazione: (2023)
Progressive Confident Masking Attention Network for Audio-Visual Segmentation
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
Model-Guided Dual-Role Alignment for High-Fidelity Open-Domain Video-to-Audio Generation
di: Zhang, Kang, et al.
Pubblicazione: (2025)
di: Zhang, Kang, et al.
Pubblicazione: (2025)
Do Audio-Visual Segmentation Models Truly Segment Sounding Objects?
di: Li, Jia, et al.
Pubblicazione: (2025)
di: Li, Jia, et al.
Pubblicazione: (2025)
Harmful Visual Content Manipulation Matters in Misinformation Detection Under Multimedia Scenarios
di: Wang, Bing, et al.
Pubblicazione: (2026)
di: Wang, Bing, et al.
Pubblicazione: (2026)
Video Face Re-Aging: Toward Temporally Consistent Face Re-Aging
di: Muqeet, Abdul, et al.
Pubblicazione: (2023)
di: Muqeet, Abdul, et al.
Pubblicazione: (2023)
SAVe: Self-Supervised Audio-visual Deepfake Detection Exploiting Visual Artifacts and Audio-visual Misalignment
di: Shahzad, Sahibzada Adil, et al.
Pubblicazione: (2026)
di: Shahzad, Sahibzada Adil, et al.
Pubblicazione: (2026)
GRAFT: GRaPH and Table Reasoning for Textual Alignment -- A Benchmark for Structured Instruction Following and Visual Reasoning
di: Verma, Abhigya, et al.
Pubblicazione: (2025)
di: Verma, Abhigya, et al.
Pubblicazione: (2025)
Contrastive Visual Data Augmentation
di: Zhou, Yu, et al.
Pubblicazione: (2025)
di: Zhou, Yu, et al.
Pubblicazione: (2025)
AlignDiT: Multimodal Aligned Diffusion Transformer for Synchronized Speech Generation
di: Choi, Jeongsoo, et al.
Pubblicazione: (2025)
di: Choi, Jeongsoo, et al.
Pubblicazione: (2025)
Live Music Diffusion Models: Efficient Fine-Tuning and Post-Training of Interactive Diffusion Music Generators
di: Novack, Zachary, et al.
Pubblicazione: (2026)
di: Novack, Zachary, et al.
Pubblicazione: (2026)
Purification Before Fusion: Toward Mask-Free Speech Enhancement for Robust Audio-Visual Speech Recognition
di: Wu, Linzhi, et al.
Pubblicazione: (2026)
di: Wu, Linzhi, et al.
Pubblicazione: (2026)
Audio Transformers
di: Verma, Prateek, et al.
Pubblicazione: (2021)
di: Verma, Prateek, et al.
Pubblicazione: (2021)
Harmony: A Unified Framework for Modality Incremental Learning
di: Song, Yaguang, et al.
Pubblicazione: (2025)
di: Song, Yaguang, et al.
Pubblicazione: (2025)
Learning Trimodal Relation for Audio-Visual Question Answering with Missing Modality
di: Park, Kyu Ri, et al.
Pubblicazione: (2024)
di: Park, Kyu Ri, et al.
Pubblicazione: (2024)
SIDA: Synthetic Image Driven Zero-shot Domain Adaptation
di: Kim, Ye-Chan, et al.
Pubblicazione: (2025)
di: Kim, Ye-Chan, et al.
Pubblicazione: (2025)
Enhancing Modality Representation and Alignment for Multimodal Cold-start Active Learning
di: Shen, Meng, et al.
Pubblicazione: (2024)
di: Shen, Meng, et al.
Pubblicazione: (2024)
Challenge on Sound Scene Synthesis: Evaluating Text-to-Audio Generation
di: Lee, Junwon, et al.
Pubblicazione: (2024)
di: Lee, Junwon, et al.
Pubblicazione: (2024)
A review on Machine Learning based User-Centric Multimedia Streaming Techniques
di: Ghosh, Monalisa, et al.
Pubblicazione: (2024)
di: Ghosh, Monalisa, et al.
Pubblicazione: (2024)
HeLo: Heterogeneous Multi-Modal Fusion with Label Correlation for Emotion Distribution Learning
di: Zheng, Chuhang, et al.
Pubblicazione: (2025)
di: Zheng, Chuhang, et al.
Pubblicazione: (2025)
MultiScript30k: Leveraging Multilingual Embeddings to Extend Cross Script Parallel Data
di: Driggers-Ellis, Christopher, et al.
Pubblicazione: (2025)
di: Driggers-Ellis, Christopher, et al.
Pubblicazione: (2025)
OLKAVS: An Open Large-Scale Korean Audio-Visual Speech Dataset
di: Park, Jeongkyun, et al.
Pubblicazione: (2023)
di: Park, Jeongkyun, et al.
Pubblicazione: (2023)
SyncLipMAE: Contrastive Masked Pretraining for Audio-Visual Talking-Face Representation
di: Ling, Zeyu, et al.
Pubblicazione: (2025)
di: Ling, Zeyu, et al.
Pubblicazione: (2025)
Generative AI for Music and Audio
di: Dong, Hao-Wen
Pubblicazione: (2024)
di: Dong, Hao-Wen
Pubblicazione: (2024)
Jailbreak-AudioBench: In-Depth Evaluation and Analysis of Jailbreak Threats for Large Audio Language Models
di: Cheng, Hao, et al.
Pubblicazione: (2025)
di: Cheng, Hao, et al.
Pubblicazione: (2025)
Contrastive Regularization over LoRA for Multimodal Biomedical Image Incremental Learning
di: Zhang, Haojie, et al.
Pubblicazione: (2025)
di: Zhang, Haojie, et al.
Pubblicazione: (2025)
Content Adaptive Front End For Audio Classification
di: Verma, Prateek, et al.
Pubblicazione: (2023)
di: Verma, Prateek, et al.
Pubblicazione: (2023)
ToonAging: Face Re-Aging upon Artistic Portrait Style Transfer
di: Kim, Bumsoo, et al.
Pubblicazione: (2024)
di: Kim, Bumsoo, et al.
Pubblicazione: (2024)
Documenti analoghi
-
LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport
di: Rho, Kyeongha, et al.
Pubblicazione: (2025) -
MoLT: Mixture of Layer-Wise Tokens for Efficient Audio-Visual Learning
di: Rho, Kyeongha, et al.
Pubblicazione: (2025) -
SpeakerLLM: A Speaker-Specialized Audio-LLM for Speaker Understanding and Verification Reasoning
di: Nam, KiHyun, et al.
Pubblicazione: (2026) -
Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs
di: Jung, Chaeyoung, et al.
Pubblicazione: (2026) -
AVCap: Leveraging Audio-Visual Features as Text Tokens for Captioning
di: Kim, Jongsuk, et al.
Pubblicazione: (2024)