M2D-CLAP: Masked Modeling Duo Meets CLAP for Learning General-purpose Audio-Language Representation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Niizumi, Daisuke, Takeuchi, Daiki, Ohishi, Yasunori, Harada, Noboru, Yasuda, Masahiro, Tsubaki, Shunsuke, Imoto, Keisuke |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer
von: Takeuchi, Daiki, et al.
Veröffentlicht: (2025)
von: Takeuchi, Daiki, et al.
Veröffentlicht: (2025)
Refining Knowledge Transfer on Audio-Image Temporal Agreement for Audio-Text Cross Retrieval
von: Tsubaki, Shunsuke, et al.
Veröffentlicht: (2024)
von: Tsubaki, Shunsuke, et al.
Veröffentlicht: (2024)
M2D-CLAP: Exploring General-purpose Audio-Language Representations Beyond CLAP
von: Niizumi, Daisuke, et al.
Veröffentlicht: (2025)
von: Niizumi, Daisuke, et al.
Veröffentlicht: (2025)
Masked Modeling Duo: Towards a Universal Audio Pre-training Framework
von: Niizumi, Daisuke, et al.
Veröffentlicht: (2024)
von: Niizumi, Daisuke, et al.
Veröffentlicht: (2024)
Exploring Pre-trained General-purpose Audio Representations for Heart Murmur Detection
von: Niizumi, Daisuke, et al.
Veröffentlicht: (2024)
von: Niizumi, Daisuke, et al.
Veröffentlicht: (2024)
Rethinking Masking Strategies for Masked Prediction-based Audio Self-supervised Learning
von: Niizumi, Daisuke, et al.
Veröffentlicht: (2026)
von: Niizumi, Daisuke, et al.
Veröffentlicht: (2026)
Baseline Systems and Evaluation Metrics for Spatial Semantic Segmentation of Sound Scenes
von: Nguyen, Binh Thien, et al.
Veröffentlicht: (2025)
von: Nguyen, Binh Thien, et al.
Veröffentlicht: (2025)
Towards Pre-training an Effective Respiratory Audio Foundation Model
von: Niizumi, Daisuke, et al.
Veröffentlicht: (2025)
von: Niizumi, Daisuke, et al.
Veröffentlicht: (2025)
Assessing the Utility of Audio Foundation Models for Heart and Respiratory Sound Analysis
von: Niizumi, Daisuke, et al.
Veröffentlicht: (2025)
von: Niizumi, Daisuke, et al.
Veröffentlicht: (2025)
Diverse Audio Embeddings -- Bringing Features Back Outperforms CLAP!
von: Verma, Prateek
Veröffentlicht: (2023)
von: Verma, Prateek
Veröffentlicht: (2023)
Guided Masked Self-Distillation Modeling for Distributed Multimedia Sensor Event Analysis
von: Yasuda, Masahiro, et al.
Veröffentlicht: (2024)
von: Yasuda, Masahiro, et al.
Veröffentlicht: (2024)
Description and Discussion on DCASE 2026 Challenge Task 2: Noise-aware Unsupervised Anomalous Sound Detection for Machine Condition Monitoring
von: Nishida, Tomoya, et al.
Veröffentlicht: (2026)
von: Nishida, Tomoya, et al.
Veröffentlicht: (2026)
Masked Audio Modeling with CLAP and Multi-Objective Learning
von: Xin, Yifei, et al.
Veröffentlicht: (2024)
von: Xin, Yifei, et al.
Veröffentlicht: (2024)
Description and Discussion on DCASE 2025 Challenge Task 4: Spatial Semantic Segmentation of Sound Scenes
von: Yasuda, Masahiro, et al.
Veröffentlicht: (2025)
von: Yasuda, Masahiro, et al.
Veröffentlicht: (2025)
Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources
von: Nguyen, Binh Thien, et al.
Veröffentlicht: (2026)
von: Nguyen, Binh Thien, et al.
Veröffentlicht: (2026)
What Do Neurons Listen To? A Neuron-level Dissection of a General-purpose Audio Model
von: Kawamura, Takao, et al.
Veröffentlicht: (2026)
von: Kawamura, Takao, et al.
Veröffentlicht: (2026)
EnCLAP++: Analyzing the EnCLAP Framework for Optimizing Automated Audio Captioning Performance
von: Kim, Jaeyeon, et al.
Veröffentlicht: (2024)
von: Kim, Jaeyeon, et al.
Veröffentlicht: (2024)
Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities
von: Sudarsanam, Parthasaarathy, et al.
Veröffentlicht: (2025)
von: Sudarsanam, Parthasaarathy, et al.
Veröffentlicht: (2025)
DOA-Aware Audio-Visual Self-Supervised Learning for Sound Event Localization and Detection
von: Fujita, Yoto, et al.
Veröffentlicht: (2024)
von: Fujita, Yoto, et al.
Veröffentlicht: (2024)
MART: Learning Hierarchical Music Audio Representations with Part-Whole Transformer
von: Yao, Dong, et al.
Veröffentlicht: (2023)
von: Yao, Dong, et al.
Veröffentlicht: (2023)
Text2FX: Harnessing CLAP Embeddings for Text-Guided Audio Effects
von: Chu, Annie, et al.
Veröffentlicht: (2024)
von: Chu, Annie, et al.
Veröffentlicht: (2024)
Audio-Language Models for Audio-Centric Tasks: A Systematic Survey
von: Su, Yi, et al.
Veröffentlicht: (2025)
von: Su, Yi, et al.
Veröffentlicht: (2025)
Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis
von: Huang, Zhiqi, et al.
Veröffentlicht: (2024)
von: Huang, Zhiqi, et al.
Veröffentlicht: (2024)
SmoothCLAP: Soft-Target Enhanced Contrastive Language\--Audio Pretraining for Affective Computing
von: Jing, Xin, et al.
Veröffentlicht: (2026)
von: Jing, Xin, et al.
Veröffentlicht: (2026)
SLAM-AAC: Enhancing Audio Captioning with Paraphrasing Augmentation and CLAP-Refine through LLMs
von: Chen, Wenxi, et al.
Veröffentlicht: (2024)
von: Chen, Wenxi, et al.
Veröffentlicht: (2024)
Building Audio-Visual Digital Twins with Smartphones
von: Lan, Zitong, et al.
Veröffentlicht: (2025)
von: Lan, Zitong, et al.
Veröffentlicht: (2025)
Challenge on Sound Scene Synthesis: Evaluating Text-to-Audio Generation
von: Lee, Junwon, et al.
Veröffentlicht: (2024)
von: Lee, Junwon, et al.
Veröffentlicht: (2024)
Trusted Fake Audio Detection Based on Dirichlet Distribution
von: Ding, Chi, et al.
Veröffentlicht: (2025)
von: Ding, Chi, et al.
Veröffentlicht: (2025)
LoVA: Long-form Video-to-Audio Generation
von: Cheng, Xin, et al.
Veröffentlicht: (2024)
von: Cheng, Xin, et al.
Veröffentlicht: (2024)
SAVGBench: Benchmarking Spatially Aligned Audio-Video Generation
von: Shimada, Kazuki, et al.
Veröffentlicht: (2024)
von: Shimada, Kazuki, et al.
Veröffentlicht: (2024)
Resource-Efficient Reference-Free Evaluation of Audio Captions
von: Mahfuz, Rehana, et al.
Veröffentlicht: (2024)
von: Mahfuz, Rehana, et al.
Veröffentlicht: (2024)
Efficient Video to Audio Mapper with Visual Scene Detection
von: Yi, Mingjing, et al.
Veröffentlicht: (2024)
von: Yi, Mingjing, et al.
Veröffentlicht: (2024)
Cinematic Audio Source Separation Using Visual Cues
von: Zhang, Kang, et al.
Veröffentlicht: (2026)
von: Zhang, Kang, et al.
Veröffentlicht: (2026)
6DoF SELD: Sound Event Localization and Detection Using Microphones and Motion Tracking Sensors on self-motioning human
von: Yasuda, Masahiro, et al.
Veröffentlicht: (2024)
von: Yasuda, Masahiro, et al.
Veröffentlicht: (2024)
Audio-Visual Speaker Tracking: Progress, Challenges, and Future Directions
von: Zhao, Jinzheng, et al.
Veröffentlicht: (2023)
von: Zhao, Jinzheng, et al.
Veröffentlicht: (2023)
Multimodal Emotion Recognition from Raw Audio with Sinc-convolution
von: Zhang, Xiaohui, et al.
Veröffentlicht: (2024)
von: Zhang, Xiaohui, et al.
Veröffentlicht: (2024)
Zero-Shot Fake Video Detection by Audio-Visual Consistency
von: Li, Xiaolou, et al.
Veröffentlicht: (2024)
von: Li, Xiaolou, et al.
Veröffentlicht: (2024)
Audio-Visual Speech Separation via Bottleneck Iterative Network
von: Zhang, Sidong, et al.
Veröffentlicht: (2025)
von: Zhang, Sidong, et al.
Veröffentlicht: (2025)
Sound-VECaps: Improving Audio Generation with Visual Enhanced Captions
von: Yuan, Yi, et al.
Veröffentlicht: (2024)
von: Yuan, Yi, et al.
Veröffentlicht: (2024)
DSCLAP: Domain-Specific Contrastive Language-Audio Pre-Training
von: Liu, Shengqiang, et al.
Veröffentlicht: (2024)
von: Liu, Shengqiang, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer
von: Takeuchi, Daiki, et al.
Veröffentlicht: (2025) -
Refining Knowledge Transfer on Audio-Image Temporal Agreement for Audio-Text Cross Retrieval
von: Tsubaki, Shunsuke, et al.
Veröffentlicht: (2024) -
M2D-CLAP: Exploring General-purpose Audio-Language Representations Beyond CLAP
von: Niizumi, Daisuke, et al.
Veröffentlicht: (2025) -
Masked Modeling Duo: Towards a Universal Audio Pre-training Framework
von: Niizumi, Daisuke, et al.
Veröffentlicht: (2024) -
Exploring Pre-trained General-purpose Audio Representations for Heart Murmur Detection
von: Niizumi, Daisuke, et al.
Veröffentlicht: (2024)