Looking Similar, Sounding Different: Leveraging Counterfactual Cross-Modal Pairs for Audiovisual Representation Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Singh, Nikhil, Wu, Chih-Wei, Orife, Iroro, Kalayeh, Mahdi |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Zero-Shot Crate Digging: DJ Tool Retrieval Using Speech Activity, Music Structure And CLAP Embeddings
par: Orife, Iroro
Publié: (2024)
par: Orife, Iroro
Publié: (2024)
Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries
par: Kim, Minyoung, et autres
Publié: (2025)
par: Kim, Minyoung, et autres
Publié: (2025)
Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities
par: Sudarsanam, Parthasaarathy, et autres
Publié: (2025)
par: Sudarsanam, Parthasaarathy, et autres
Publié: (2025)
Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings
par: Clarke, Jason, et autres
Publié: (2025)
par: Clarke, Jason, et autres
Publié: (2025)
Remastering Divide and Remaster: A Cinematic Audio Source Separation Dataset with Multilingual Support
par: Watcharasupat, Karn N., et autres
Publié: (2024)
par: Watcharasupat, Karn N., et autres
Publié: (2024)
Facing the Music: Tackling Singing Voice Separation in Cinematic Audio Source Separation
par: Watcharasupat, Karn N., et autres
Publié: (2024)
par: Watcharasupat, Karn N., et autres
Publié: (2024)
A Survey on Cross-Modal Interaction Between Music and Multimodal Data
par: Li, Sifei, et autres
Publié: (2025)
par: Li, Sifei, et autres
Publié: (2025)
Robust Wake Word Spotting With Frame-Level Cross-Modal Attention Based Audio-Visual Conformer
par: Wang, Haoxu, et autres
Publié: (2024)
par: Wang, Haoxu, et autres
Publié: (2024)
Learning What To Hear: Boosting Sound-Source Association For Robust Audiovisual Instance Segmentation
par: Seo, Jinbae, et autres
Publié: (2025)
par: Seo, Jinbae, et autres
Publié: (2025)
Stimulus Modality Matters: Impact of Perceptual Evaluations from Different Modalities on Speech Emotion Recognition System Performance
par: Chou, Huang-Cheng, et autres
Publié: (2024)
par: Chou, Huang-Cheng, et autres
Publié: (2024)
Robust LLM-based Audio-Visual Speech Recognition with Sparse Modality Alignment and Visual Unit-Guided Refinement
par: Su, Fei, et autres
Publié: (2026)
par: Su, Fei, et autres
Publié: (2026)
ecVoice: Audio Text Extraction and Optimization of Video Based on Idioms Similarity Replacement
par: Lin, Jinwei
Publié: (2024)
par: Lin, Jinwei
Publié: (2024)
SonicVisionLM: Playing Sound with Vision Language Models
par: Xie, Zhifeng, et autres
Publié: (2024)
par: Xie, Zhifeng, et autres
Publié: (2024)
Sound-VECaps: Improving Audio Generation with Visual Enhanced Captions
par: Yuan, Yi, et autres
Publié: (2024)
par: Yuan, Yi, et autres
Publié: (2024)
Intelligent Text-Conditioned Music Generation
par: Xie, Zhouyao, et autres
Publié: (2024)
par: Xie, Zhouyao, et autres
Publié: (2024)
PerformSinger: Multimodal Singing Voice Synthesis Leveraging Synchronized Lip Cues from Singing Performance Videos
par: Gu, Ke, et autres
Publié: (2025)
par: Gu, Ke, et autres
Publié: (2025)
A Unified Framework for Modality-Agnostic Deepfakes Detection
par: Yu, Cai, et autres
Publié: (2023)
par: Yu, Cai, et autres
Publié: (2023)
Sync-TVA: A Graph-Attention Framework for Multimodal Emotion Recognition with Cross-Modal Fusion
par: Deng, Zeyu, et autres
Publié: (2025)
par: Deng, Zeyu, et autres
Publié: (2025)
Voice Evaluation of Reasoning Ability: Diagnosing the Modality-Induced Performance Gap
par: Lin, Yueqian, et autres
Publié: (2025)
par: Lin, Yueqian, et autres
Publié: (2025)
Leveraging Pre-trained AudioLDM for Sound Generation: A Benchmark Study
par: Yuan, Yi, et autres
Publié: (2023)
par: Yuan, Yi, et autres
Publié: (2023)
MART: Learning Hierarchical Music Audio Representations with Part-Whole Transformer
par: Yao, Dong, et autres
Publié: (2023)
par: Yao, Dong, et autres
Publié: (2023)
REWIND: Speech Time Reversal for Enhancing Speaker Representations in Diffusion-based Voice Conversion
par: Biyani, Ishan D., et autres
Publié: (2025)
par: Biyani, Ishan D., et autres
Publié: (2025)
MusicAOG: an Energy-Based Model for Learning and Sampling a Hierarchical Representation of Symbolic Music
par: Qian, Yikai, et autres
Publié: (2024)
par: Qian, Yikai, et autres
Publié: (2024)
Learning Audio Concepts from Counterfactual Natural Language
par: Vosoughi, Ali, et autres
Publié: (2024)
par: Vosoughi, Ali, et autres
Publié: (2024)
A Study on Synthesizing Expressive Violin Performances: Approaches and Comparisons
par: Hung, Tzu-Yun, et autres
Publié: (2024)
par: Hung, Tzu-Yun, et autres
Publié: (2024)
X-CrossNet: A complex spectral mapping approach to target speaker extraction with cross attention speaker embedding fusion
par: Sun, Chang, et autres
Publié: (2024)
par: Sun, Chang, et autres
Publié: (2024)
Efficient Feature Extraction and Late Fusion Strategy for Audiovisual Emotional Mimicry Intensity Estimation
par: Yu, Jun, et autres
Publié: (2024)
par: Yu, Jun, et autres
Publié: (2024)
Noise-Conditioned Mixture-of-Experts Framework for Robust Speaker Verification
par: Gu, Bin, et autres
Publié: (2025)
par: Gu, Bin, et autres
Publié: (2025)
Leveraging LLM Embeddings for Cross Dataset Label Alignment and Zero Shot Music Emotion Prediction
par: Liu, Renhang, et autres
Publié: (2024)
par: Liu, Renhang, et autres
Publié: (2024)
LoVA: Long-form Video-to-Audio Generation
par: Cheng, Xin, et autres
Publié: (2024)
par: Cheng, Xin, et autres
Publié: (2024)
RAVSS: Robust Audio-Visual Speech Separation in Multi-Speaker Scenarios with Missing Visual Cues
par: Pan, Tianrui, et autres
Publié: (2024)
par: Pan, Tianrui, et autres
Publié: (2024)
Speech-to-See: End-to-End Speech-Driven Open-Set Object Detection
par: Lu, Wenhuan, et autres
Publié: (2025)
par: Lu, Wenhuan, et autres
Publié: (2025)
M$^{2}$UGen: Multi-modal Music Understanding and Generation with the Power of Large Language Models
par: Liu, Shansong, et autres
Publié: (2023)
par: Liu, Shansong, et autres
Publié: (2023)
MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models
par: Liu, Shansong, et autres
Publié: (2024)
par: Liu, Shansong, et autres
Publié: (2024)
Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis
par: Huang, Zhiqi, et autres
Publié: (2024)
par: Huang, Zhiqi, et autres
Publié: (2024)
STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment
par: Ren, Yong, et autres
Publié: (2024)
par: Ren, Yong, et autres
Publié: (2024)
Attentive-based Multi-level Feature Fusion for Voice Disorder Diagnosis
par: Shen, Lipeng, et autres
Publié: (2024)
par: Shen, Lipeng, et autres
Publié: (2024)
pTSE-T: Presentation Target Speaker Extraction using Unaligned Text Cues
par: Jiang, Ziyang, et autres
Publié: (2024)
par: Jiang, Ziyang, et autres
Publié: (2024)
Can Large Language Models Predict Audio Effects Parameters from Natural Language?
par: Doh, Seungheon, et autres
Publié: (2025)
par: Doh, Seungheon, et autres
Publié: (2025)
Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling
par: Lv, Yishan, et autres
Publié: (2026)
par: Lv, Yishan, et autres
Publié: (2026)
Documents similaires
-
Zero-Shot Crate Digging: DJ Tool Retrieval Using Speech Activity, Music Structure And CLAP Embeddings
par: Orife, Iroro
Publié: (2024) -
Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries
par: Kim, Minyoung, et autres
Publié: (2025) -
Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities
par: Sudarsanam, Parthasaarathy, et autres
Publié: (2025) -
Face-Voice Association for Audiovisual Active Speaker Detection in Egocentric Recordings
par: Clarke, Jason, et autres
Publié: (2025) -
Remastering Divide and Remaster: A Cinematic Audio Source Separation Dataset with Multilingual Support
par: Watcharasupat, Karn N., et autres
Publié: (2024)