AudioMosaic: Contrastive Masked Audio Representation Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Huang, Hanxun, Wang, Qizhou, Ma, Xingjun, Xie, Cihang, Leckie, Christopher, Erfani, Sarah |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AUDETER: A Large-scale Dataset for Deepfake Audio Detection in Open Worlds
di: Wang, Qizhou, et al.
Pubblicazione: (2025)
di: Wang, Qizhou, et al.
Pubblicazione: (2025)
HierCon: Hierarchical Contrastive Attention for Audio Deepfake Detection
di: Liang, Zhili Nicholas, et al.
Pubblicazione: (2026)
di: Liang, Zhili Nicholas, et al.
Pubblicazione: (2026)
Structured-Noise Masked Modeling for Video, Audio and Beyond
di: Bhowmik, Aritra, et al.
Pubblicazione: (2025)
di: Bhowmik, Aritra, et al.
Pubblicazione: (2025)
Myna: Masking-Based Contrastive Learning of Musical Representations
di: Yonay, Ori, et al.
Pubblicazione: (2025)
di: Yonay, Ori, et al.
Pubblicazione: (2025)
Evaluation of Deep Audio Representations for Hearables
di: Gröger, Fabian, et al.
Pubblicazione: (2025)
di: Gröger, Fabian, et al.
Pubblicazione: (2025)
Representation-Based Data Quality Audits for Audio
di: Gonzalez-Jimenez, Alvaro, et al.
Pubblicazione: (2025)
di: Gonzalez-Jimenez, Alvaro, et al.
Pubblicazione: (2025)
A Human-Inspired Decoupled Architecture for Efficient Audio Representation Learning
di: Kawano, Harunori, et al.
Pubblicazione: (2026)
di: Kawano, Harunori, et al.
Pubblicazione: (2026)
Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models
di: Cui, Kaiyuan, et al.
Pubblicazione: (2026)
di: Cui, Kaiyuan, et al.
Pubblicazione: (2026)
AudioCodecBench: A Comprehensive Benchmark for Audio Codec Evaluation
di: Wang, Lu, et al.
Pubblicazione: (2025)
di: Wang, Lu, et al.
Pubblicazione: (2025)
Boosting ASR Robustness via Test-Time Reinforcement Learning with Audio-Text Semantic Rewards
di: Fang, Linghan, et al.
Pubblicazione: (2026)
di: Fang, Linghan, et al.
Pubblicazione: (2026)
Preference-Based Learning in Audio Applications: A Systematic Analysis
di: Broukhim, Aaron, et al.
Pubblicazione: (2025)
di: Broukhim, Aaron, et al.
Pubblicazione: (2025)
Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning
di: Tuncay, Ludovic, et al.
Pubblicazione: (2025)
di: Tuncay, Ludovic, et al.
Pubblicazione: (2025)
HEAR: Holistic Evaluation of Audio Representations
di: Turian, Joseph, et al.
Pubblicazione: (2022)
di: Turian, Joseph, et al.
Pubblicazione: (2022)
Phase-Aware Deep Learning with Complex-Valued CNNs for Audio Signal Applications
di: Agrawal, Naman
Pubblicazione: (2025)
di: Agrawal, Naman
Pubblicazione: (2025)
Masked Audio Generation using a Single Non-Autoregressive Transformer
di: Ziv, Alon, et al.
Pubblicazione: (2024)
di: Ziv, Alon, et al.
Pubblicazione: (2024)
QAMRO: Quality-aware Adaptive Margin Ranking Optimization for Human-aligned Assessment of Audio Generation Systems
di: Wang, Chien-Chun, et al.
Pubblicazione: (2025)
di: Wang, Chien-Chun, et al.
Pubblicazione: (2025)
Low-Resource Guidance for Controllable Latent Audio Diffusion
di: Novack, Zachary, et al.
Pubblicazione: (2026)
di: Novack, Zachary, et al.
Pubblicazione: (2026)
Exploring Token-Space Manipulation in Latent Audio Tokenizers
di: Paissan, Francesco, et al.
Pubblicazione: (2026)
di: Paissan, Francesco, et al.
Pubblicazione: (2026)
X-Transfer Attacks: Towards Super Transferable Adversarial Attacks on CLIP
di: Huang, Hanxun, et al.
Pubblicazione: (2025)
di: Huang, Hanxun, et al.
Pubblicazione: (2025)
A$^2$-LLM: An End-to-end Conversational Audio Avatar Large Language Model
di: Hu, Xiaolin, et al.
Pubblicazione: (2026)
di: Hu, Xiaolin, et al.
Pubblicazione: (2026)
Masked Latent Prediction and Classification for Self-Supervised Audio Representation Learning
di: Quelennec, Aurian, et al.
Pubblicazione: (2025)
di: Quelennec, Aurian, et al.
Pubblicazione: (2025)
Linguistic and Audio Embedding-Based Machine Learning for Alzheimer's Dementia and Mild Cognitive Impairment Detection: Insights from the PROCESS Challenge
di: Devahi, Adharsha Sam Edwin Sam, et al.
Pubblicazione: (2025)
di: Devahi, Adharsha Sam Edwin Sam, et al.
Pubblicazione: (2025)
Guiding Audio Editing with Audio Language Model
di: Lan, Zitong, et al.
Pubblicazione: (2025)
di: Lan, Zitong, et al.
Pubblicazione: (2025)
Explainable Multi-Modal Deep Learning for Automatic Detection of Lung Diseases from Respiratory Audio Signals
di: Saky, S M Asiful Islam, et al.
Pubblicazione: (2025)
di: Saky, S M Asiful Islam, et al.
Pubblicazione: (2025)
Investigating Design Choices in Joint-Embedding Predictive Architectures for General Audio Representation Learning
di: Riou, Alain, et al.
Pubblicazione: (2024)
di: Riou, Alain, et al.
Pubblicazione: (2024)
PoDAR: Power-Disentangled Audio Representation for Generative Modeling
di: Luebs, Alejandro, et al.
Pubblicazione: (2026)
di: Luebs, Alejandro, et al.
Pubblicazione: (2026)
Purification Before Fusion: Toward Mask-Free Speech Enhancement for Robust Audio-Visual Speech Recognition
di: Wu, Linzhi, et al.
Pubblicazione: (2026)
di: Wu, Linzhi, et al.
Pubblicazione: (2026)
MATPAC++: Enhanced Masked Latent Prediction for Self-Supervised Audio Representation Learning
di: Quelennec, Aurian, et al.
Pubblicazione: (2025)
di: Quelennec, Aurian, et al.
Pubblicazione: (2025)
When Denoising Hinders: Revisiting Zero-Shot ASR with SAM-Audio and Whisper
di: Islam, Akif, et al.
Pubblicazione: (2026)
di: Islam, Akif, et al.
Pubblicazione: (2026)
AudioGenX: Explainability on Text-to-Audio Generative Models
di: Kang, Hyunju, et al.
Pubblicazione: (2025)
di: Kang, Hyunju, et al.
Pubblicazione: (2025)
CoDiCodec: Unifying Continuous and Discrete Compressed Representations of Audio
di: Pasini, Marco, et al.
Pubblicazione: (2025)
di: Pasini, Marco, et al.
Pubblicazione: (2025)
MAEB: Massive Audio Embedding Benchmark
di: Assadi, Adnan El, et al.
Pubblicazione: (2026)
di: Assadi, Adnan El, et al.
Pubblicazione: (2026)
Real-Time Voicemail Detection in Telephony Audio Using Temporal Speech Activity Features
di: Saurav, Kumar
Pubblicazione: (2026)
di: Saurav, Kumar
Pubblicazione: (2026)
Learning Source Disentanglement in Neural Audio Codec
di: Bie, Xiaoyu, et al.
Pubblicazione: (2024)
di: Bie, Xiaoyu, et al.
Pubblicazione: (2024)
Learning Audio-Visual Embeddings with Inferred Latent Interaction Graphs
di: Zeng, Donghuo, et al.
Pubblicazione: (2026)
di: Zeng, Donghuo, et al.
Pubblicazione: (2026)
Learning When to Think While Listening in Large Audio-Language Models
di: Song, Zhiyuan, et al.
Pubblicazione: (2026)
di: Song, Zhiyuan, et al.
Pubblicazione: (2026)
Efficient Selective Audio Masked Multimodal Bottleneck Transformer for Audio-Video Classification
di: Zhu, Wentao
Pubblicazione: (2024)
di: Zhu, Wentao
Pubblicazione: (2024)
A Survey of Deep Learning Audio Generation Methods
di: Božić, Matej, et al.
Pubblicazione: (2024)
di: Božić, Matej, et al.
Pubblicazione: (2024)
Synthetic Audio Helps for Cognitive State Tasks
di: Soubki, Adil, et al.
Pubblicazione: (2025)
di: Soubki, Adil, et al.
Pubblicazione: (2025)
Audio Transformers
di: Verma, Prateek, et al.
Pubblicazione: (2021)
di: Verma, Prateek, et al.
Pubblicazione: (2021)
Documenti analoghi
-
AUDETER: A Large-scale Dataset for Deepfake Audio Detection in Open Worlds
di: Wang, Qizhou, et al.
Pubblicazione: (2025) -
HierCon: Hierarchical Contrastive Attention for Audio Deepfake Detection
di: Liang, Zhili Nicholas, et al.
Pubblicazione: (2026) -
Structured-Noise Masked Modeling for Video, Audio and Beyond
di: Bhowmik, Aritra, et al.
Pubblicazione: (2025) -
Myna: Masking-Based Contrastive Learning of Musical Representations
di: Yonay, Ori, et al.
Pubblicazione: (2025) -
Evaluation of Deep Audio Representations for Hearables
di: Gröger, Fabian, et al.
Pubblicazione: (2025)