MCAD: Multimodal Context-Aware Audio Description Generation For Soccer
Fuente:
arXiv
Guardado en:
| Autores principales: | Chaudhary, Lipisha, Mittal, Trisha, Gopalakrishnan, Subhadra, Nwogu, Ifeoma, Pytlarz, Jaclyn |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Analysis of Human Perception in Distinguishing Real and AI-Generated Faces: An Eye-Tracking Based Study
por: Huang, Jin, et al.
Publicado: (2024)
por: Huang, Jin, et al.
Publicado: (2024)
Cross-Attention Based Influence Model for Manual and Nonmanual Sign Language Analysis
por: Chaudhary, Lipisha, et al.
Publicado: (2024)
por: Chaudhary, Lipisha, et al.
Publicado: (2024)
Coreset Selection via LLM-based Concept Bottlenecks
por: Mehra, Akshay, et al.
Publicado: (2025)
por: Mehra, Akshay, et al.
Publicado: (2025)
Coherent Audio-Visual Editing via Conditional Audio Generation Following Video Edits
por: Ishii, Masato, et al.
Publicado: (2025)
por: Ishii, Masato, et al.
Publicado: (2025)
MemeCLIP: Leveraging CLIP Representations for Multimodal Meme Classification
por: Shah, Siddhant Bikram, et al.
Publicado: (2024)
por: Shah, Siddhant Bikram, et al.
Publicado: (2024)
Token-Level Contrastive Learning with Modality-Aware Prompting for Multimodal Intent Recognition
por: Zhou, Qianrui, et al.
Publicado: (2023)
por: Zhou, Qianrui, et al.
Publicado: (2023)
Stable Multimodal Graph Unlearning via Feature-Dimension Aware Quantile Selection
por: Zhou, Jingjing, et al.
Publicado: (2026)
por: Zhou, Jingjing, et al.
Publicado: (2026)
E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection
por: Wu, Junjie, et al.
Publicado: (2025)
por: Wu, Junjie, et al.
Publicado: (2025)
SoccerNet-Echoes: A Soccer Game Audio Commentary Dataset
por: Gautam, Sushant, et al.
Publicado: (2024)
por: Gautam, Sushant, et al.
Publicado: (2024)
OpenAVS: Training-Free Open-Vocabulary Audio Visual Segmentation with Foundational Models
por: Chen, Shengkai, et al.
Publicado: (2025)
por: Chen, Shengkai, et al.
Publicado: (2025)
KMMMU: Evaluation of Massive Multi-discipline Multimodal Understanding in Korean Language and Context
por: Lee, Nahyun, et al.
Publicado: (2026)
por: Lee, Nahyun, et al.
Publicado: (2026)
Multimodal Representation Learning and Fusion
por: Jin, Qihang, et al.
Publicado: (2025)
por: Jin, Qihang, et al.
Publicado: (2025)
Balanced Multimodal Learning: An Unidirectional Dynamic Interaction Perspective
por: Wang, Shijie, et al.
Publicado: (2025)
por: Wang, Shijie, et al.
Publicado: (2025)
Exploring Modality Disruption in Multimodal Fake News Detection
por: Liu, Moyang, et al.
Publicado: (2025)
por: Liu, Moyang, et al.
Publicado: (2025)
Zero-Shot Relational Learning for Multimodal Knowledge Graphs
por: Cai, Rui, et al.
Publicado: (2024)
por: Cai, Rui, et al.
Publicado: (2024)
MCIGLE: Multimodal Exemplar-Free Class-Incremental Graph Learning
por: You, Haochen, et al.
Publicado: (2025)
por: You, Haochen, et al.
Publicado: (2025)
To Align or Not to Align: Strategic Multimodal Representation Alignment for Optimal Performance
por: Fang, Wanlong, et al.
Publicado: (2025)
por: Fang, Wanlong, et al.
Publicado: (2025)
Deconfounded Reasoning for Multimodal Fake News Detection via Causal Intervention
por: Liu, Moyang, et al.
Publicado: (2025)
por: Liu, Moyang, et al.
Publicado: (2025)
HyperFusion: Hierarchical Multimodal Ensemble Learning for Social Media Popularity Prediction
por: Ye, Liliang, et al.
Publicado: (2025)
por: Ye, Liliang, et al.
Publicado: (2025)
Cross-Space Synergy: A Unified Framework for Multimodal Emotion Recognition in Conversation
por: Lyu, Xiaosen, et al.
Publicado: (2025)
por: Lyu, Xiaosen, et al.
Publicado: (2025)
Concept Drift Guided LayerNorm Tuning for Efficient Multimodal Metaphor Identification
por: Qian, Wenhao, et al.
Publicado: (2025)
por: Qian, Wenhao, et al.
Publicado: (2025)
Multimodal Methods for Analyzing Learning and Training Environments: A Systematic Literature Review
por: Cohn, Clayton, et al.
Publicado: (2024)
por: Cohn, Clayton, et al.
Publicado: (2024)
GAME-ON: Graph Attention Network based Multimodal Fusion for Fake News Detection
por: Dhawan, Mudit, et al.
Publicado: (2022)
por: Dhawan, Mudit, et al.
Publicado: (2022)
Towards the Synthesis of Non-speech Vocalizations
por: Hoq, Enjamamul, et al.
Publicado: (2024)
por: Hoq, Enjamamul, et al.
Publicado: (2024)
Hyper-modal Imputation Diffusion Embedding with Dual-Distillation for Federated Multimodal Knowledge Graph Completion
por: Zhang, Ying, et al.
Publicado: (2025)
por: Zhang, Ying, et al.
Publicado: (2025)
$C^2$AV-TSE: Context and Confidence-aware Audio Visual Target Speaker Extraction
por: Wu, Wenxuan, et al.
Publicado: (2025)
por: Wu, Wenxuan, et al.
Publicado: (2025)
PrismSSL: One Interface, Many Modalities; A Single-Interface Library for Multimodal Self-Supervised Learning
por: Shirian, Melika, et al.
Publicado: (2025)
por: Shirian, Melika, et al.
Publicado: (2025)
BI-MDRG: Bridging Image History in Multimodal Dialogue Response Generation
por: Yoon, Hee Suk, et al.
Publicado: (2024)
por: Yoon, Hee Suk, et al.
Publicado: (2024)
Network Bending of Diffusion Models for Audio-Visual Generation
por: Dzwonczyk, Luke, et al.
Publicado: (2024)
por: Dzwonczyk, Luke, et al.
Publicado: (2024)
EquiAV: Leveraging Equivariance for Audio-Visual Contrastive Learning
por: Kim, Jongsuk, et al.
Publicado: (2024)
por: Kim, Jongsuk, et al.
Publicado: (2024)
Beyond Memorization: Selective Learning for Copyright-Safe Diffusion Model Training
por: Kothandaraman, Divya, et al.
Publicado: (2025)
por: Kothandaraman, Divya, et al.
Publicado: (2025)
Proactive Conversational Assistant for a Procedural Manual Task based on Audio and IMU
por: Mahfuz, Rehana, et al.
Publicado: (2026)
por: Mahfuz, Rehana, et al.
Publicado: (2026)
Sounding that Object: Interactive Object-Aware Image to Audio Generation
por: Li, Tingle, et al.
Publicado: (2025)
por: Li, Tingle, et al.
Publicado: (2025)
The Hidden Cost of an Image: Quantifying the Energy Consumption of AI Image Generation
por: Bertazzini, Giulia, et al.
Publicado: (2025)
por: Bertazzini, Giulia, et al.
Publicado: (2025)
FoleyGRAM: Video-to-Audio Generation with GRAM-Aligned Multimodal Encoders
por: Gramaccioni, Riccardo Fosco, et al.
Publicado: (2025)
por: Gramaccioni, Riccardo Fosco, et al.
Publicado: (2025)
ConsistencyTTA: Accelerating Diffusion-Based Text-to-Audio Generation with Consistency Distillation
por: Bai, Yatong, et al.
Publicado: (2023)
por: Bai, Yatong, et al.
Publicado: (2023)
Generative AI for Music and Audio
por: Dong, Hao-Wen
Publicado: (2024)
por: Dong, Hao-Wen
Publicado: (2024)
Speech2AffectiveGestures: Synthesizing Co-Speech Gestures with Generative Adversarial Affective Expression Learning
por: Bhattacharya, Uttaran, et al.
Publicado: (2021)
por: Bhattacharya, Uttaran, et al.
Publicado: (2021)
OOD-GraphLLM: Graph Large Language Model for Out-of-Distribution Generalized Drug Synergy Prediction
por: Wang, Xin, et al.
Publicado: (2026)
por: Wang, Xin, et al.
Publicado: (2026)
StereoSync: Spatially-Aware Stereo Audio Generation from Video
por: Marinoni, Christian, et al.
Publicado: (2025)
por: Marinoni, Christian, et al.
Publicado: (2025)
Ejemplares similares
-
Analysis of Human Perception in Distinguishing Real and AI-Generated Faces: An Eye-Tracking Based Study
por: Huang, Jin, et al.
Publicado: (2024) -
Cross-Attention Based Influence Model for Manual and Nonmanual Sign Language Analysis
por: Chaudhary, Lipisha, et al.
Publicado: (2024) -
Coreset Selection via LLM-based Concept Bottlenecks
por: Mehra, Akshay, et al.
Publicado: (2025) -
Coherent Audio-Visual Editing via Conditional Audio Generation Following Video Edits
por: Ishii, Masato, et al.
Publicado: (2025) -
MemeCLIP: Leveraging CLIP Representations for Multimodal Meme Classification
por: Shah, Siddhant Bikram, et al.
Publicado: (2024)