Masked Modeling Duo: Towards a Universal Audio Pre-training Framework
Fuente:
arXiv
Salvato in:
| Autori principali: | Niizumi, Daisuke, Takeuchi, Daiki, Ohishi, Yasunori, Harada, Noboru, Kashino, Kunio |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Exploring Pre-trained General-purpose Audio Representations for Heart Murmur Detection
di: Niizumi, Daisuke, et al.
Pubblicazione: (2024)
di: Niizumi, Daisuke, et al.
Pubblicazione: (2024)
M2D-CLAP: Masked Modeling Duo Meets CLAP for Learning General-purpose Audio-Language Representation
di: Niizumi, Daisuke, et al.
Pubblicazione: (2024)
di: Niizumi, Daisuke, et al.
Pubblicazione: (2024)
Towards Pre-training an Effective Respiratory Audio Foundation Model
di: Niizumi, Daisuke, et al.
Pubblicazione: (2025)
di: Niizumi, Daisuke, et al.
Pubblicazione: (2025)
Assessing the Utility of Audio Foundation Models for Heart and Respiratory Sound Analysis
di: Niizumi, Daisuke, et al.
Pubblicazione: (2025)
di: Niizumi, Daisuke, et al.
Pubblicazione: (2025)
Rethinking Masking Strategies for Masked Prediction-based Audio Self-supervised Learning
di: Niizumi, Daisuke, et al.
Pubblicazione: (2026)
di: Niizumi, Daisuke, et al.
Pubblicazione: (2026)
M2D-CLAP: Exploring General-purpose Audio-Language Representations Beyond CLAP
di: Niizumi, Daisuke, et al.
Pubblicazione: (2025)
di: Niizumi, Daisuke, et al.
Pubblicazione: (2025)
Refining Knowledge Transfer on Audio-Image Temporal Agreement for Audio-Text Cross Retrieval
di: Tsubaki, Shunsuke, et al.
Pubblicazione: (2024)
di: Tsubaki, Shunsuke, et al.
Pubblicazione: (2024)
CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer
di: Takeuchi, Daiki, et al.
Pubblicazione: (2025)
di: Takeuchi, Daiki, et al.
Pubblicazione: (2025)
Baseline Systems and Evaluation Metrics for Spatial Semantic Segmentation of Sound Scenes
di: Nguyen, Binh Thien, et al.
Pubblicazione: (2025)
di: Nguyen, Binh Thien, et al.
Pubblicazione: (2025)
Description and Discussion on DCASE 2025 Challenge Task 4: Spatial Semantic Segmentation of Sound Scenes
di: Yasuda, Masahiro, et al.
Pubblicazione: (2025)
di: Yasuda, Masahiro, et al.
Pubblicazione: (2025)
Description and Discussion on DCASE 2026 Challenge Task 2: Noise-aware Unsupervised Anomalous Sound Detection for Machine Condition Monitoring
di: Nishida, Tomoya, et al.
Pubblicazione: (2026)
di: Nishida, Tomoya, et al.
Pubblicazione: (2026)
What Do Neurons Listen To? A Neuron-level Dissection of a General-purpose Audio Model
di: Kawamura, Takao, et al.
Pubblicazione: (2026)
di: Kawamura, Takao, et al.
Pubblicazione: (2026)
Can Sound Replace Vision in LLaVA With Token Substitution?
di: Vosoughi, Ali, et al.
Pubblicazione: (2025)
di: Vosoughi, Ali, et al.
Pubblicazione: (2025)
Unrestricted Global Phase Bias-Aware Single-channel Speech Enhancement with Conformer-based Metric GAN
di: Zhang, Shiqi, et al.
Pubblicazione: (2024)
di: Zhang, Shiqi, et al.
Pubblicazione: (2024)
Gelina: Unified Speech and Gesture Synthesis via Interleaved Token Prediction
di: Guichoux, Téo, et al.
Pubblicazione: (2025)
di: Guichoux, Téo, et al.
Pubblicazione: (2025)
Fast and High-Quality Auto-Regressive Speech Synthesis via Speculative Decoding
di: Li, Bohan, et al.
Pubblicazione: (2024)
di: Li, Bohan, et al.
Pubblicazione: (2024)
Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources
di: Nguyen, Binh Thien, et al.
Pubblicazione: (2026)
di: Nguyen, Binh Thien, et al.
Pubblicazione: (2026)
SoundBeam meets M2D: Target Sound Extraction with Audio Foundation Model
di: Hernandez-Olivan, Carlos, et al.
Pubblicazione: (2024)
di: Hernandez-Olivan, Carlos, et al.
Pubblicazione: (2024)
Description and Discussion on DCASE 2025 Challenge Task 2: First-shot Unsupervised Anomalous Sound Detection for Machine Condition Monitoring
di: Nishida, Tomoya, et al.
Pubblicazione: (2025)
di: Nishida, Tomoya, et al.
Pubblicazione: (2025)
Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis
di: Salehi, Pegah, et al.
Pubblicazione: (2024)
di: Salehi, Pegah, et al.
Pubblicazione: (2024)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
di: Yang, Dongchao, et al.
Pubblicazione: (2023)
di: Yang, Dongchao, et al.
Pubblicazione: (2023)
SpecMaskGIT: Masked Generative Modeling of Audio Spectrograms for Efficient Audio Synthesis and Beyond
di: Comunità, Marco, et al.
Pubblicazione: (2024)
di: Comunità, Marco, et al.
Pubblicazione: (2024)
6DoF SELD: Sound Event Localization and Detection Using Microphones and Motion Tracking Sensors on self-motioning human
di: Yasuda, Masahiro, et al.
Pubblicazione: (2024)
di: Yasuda, Masahiro, et al.
Pubblicazione: (2024)
BLAT: Bootstrapping Language-Audio Pre-training based on AudioSet Tag-guided Synthetic Data
di: Xu, Xuenan, et al.
Pubblicazione: (2023)
di: Xu, Xuenan, et al.
Pubblicazione: (2023)
MAT-SED: A Masked Audio Transformer with Masked-Reconstruction Based Pre-training for Sound Event Detection
di: Cai, Pengfei, et al.
Pubblicazione: (2024)
di: Cai, Pengfei, et al.
Pubblicazione: (2024)
Coarse-to-Fine Proposal Refinement Framework for Audio Temporal Forgery Detection and Localization
di: Wu, Junyan, et al.
Pubblicazione: (2024)
di: Wu, Junyan, et al.
Pubblicazione: (2024)
SONAR: Self-Distilled Continual Pre-training for Domain Adaptive Audio Representation
di: Zhang, Yizhou, et al.
Pubblicazione: (2025)
di: Zhang, Yizhou, et al.
Pubblicazione: (2025)
Target Speech Extraction with Pre-trained AV-HuBERT and Mask-And-Recover Strategy
di: Wu, Wenxuan, et al.
Pubblicazione: (2024)
di: Wu, Wenxuan, et al.
Pubblicazione: (2024)
Investigating Prosodic Signatures via Speech Pre-Trained Models for Audio Deepfake Source Attribution
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
Masked Audio Modeling with CLAP and Multi-Objective Learning
di: Xin, Yifei, et al.
Pubblicazione: (2024)
di: Xin, Yifei, et al.
Pubblicazione: (2024)
Description and Discussion on DCASE 2024 Challenge Task 2: First-Shot Unsupervised Anomalous Sound Detection for Machine Condition Monitoring
di: Nishida, Tomoya, et al.
Pubblicazione: (2024)
di: Nishida, Tomoya, et al.
Pubblicazione: (2024)
AudioTime: A Temporally-aligned Audio-text Benchmark Dataset
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
PicoAudio2: Temporal Controllable Text-to-Audio Generation with Natural Language Description
di: Zheng, Zihao, et al.
Pubblicazione: (2025)
di: Zheng, Zihao, et al.
Pubblicazione: (2025)
The Rhythm In Anything: Audio-Prompted Drums Generation with Masked Language Modeling
di: O'Reilly, Patrick, et al.
Pubblicazione: (2025)
di: O'Reilly, Patrick, et al.
Pubblicazione: (2025)
PicoAudio: Enabling Precise Timestamp and Frequency Controllability of Audio Events in Text-to-audio Generation
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
Analysing the Masked predictive coding training criterion for pre-training a Speech Representation Model
di: Yadav, Hemant, et al.
Pubblicazione: (2023)
di: Yadav, Hemant, et al.
Pubblicazione: (2023)
Text2midi-InferAlign: Improving Symbolic Music Generation with Inference-Time Alignment
di: Roy, Abhinaba, et al.
Pubblicazione: (2025)
di: Roy, Abhinaba, et al.
Pubblicazione: (2025)
Exploring Prediction Targets in Masked Pre-Training for Speech Foundation Models
di: Chen, Li-Wei, et al.
Pubblicazione: (2024)
di: Chen, Li-Wei, et al.
Pubblicazione: (2024)
FUSE: Universal Speech Enhancement using Multi-Stage Fusion of Sparse Compression and Token Generation Models for the URGENT 2025 Challenge
di: Goswami, Nabarun, et al.
Pubblicazione: (2025)
di: Goswami, Nabarun, et al.
Pubblicazione: (2025)
FakeSound: Deepfake General Audio Detection
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Exploring Pre-trained General-purpose Audio Representations for Heart Murmur Detection
di: Niizumi, Daisuke, et al.
Pubblicazione: (2024) -
M2D-CLAP: Masked Modeling Duo Meets CLAP for Learning General-purpose Audio-Language Representation
di: Niizumi, Daisuke, et al.
Pubblicazione: (2024) -
Towards Pre-training an Effective Respiratory Audio Foundation Model
di: Niizumi, Daisuke, et al.
Pubblicazione: (2025) -
Assessing the Utility of Audio Foundation Models for Heart and Respiratory Sound Analysis
di: Niizumi, Daisuke, et al.
Pubblicazione: (2025) -
Rethinking Masking Strategies for Masked Prediction-based Audio Self-supervised Learning
di: Niizumi, Daisuke, et al.
Pubblicazione: (2026)