Learning Linearity in Audio Consistency Autoencoders via Implicit Regularization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Torres, Bernardo, Moussallam, Manuel, Meseguer-Brocal, Gabriel |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
From Real to Cloned Singer Identification
par: Desblancs, Dorian, et autres
Publié: (2024)
par: Desblancs, Dorian, et autres
Publié: (2024)
An Experimental Comparison Of Multi-view Self-supervised Methods For Music Tagging
par: Meseguer-Brocal, Gabriel, et autres
Publié: (2024)
par: Meseguer-Brocal, Gabriel, et autres
Publié: (2024)
Detecting music deepfakes is easy but actually hard
par: Afchar, Darius, et autres
Publié: (2024)
par: Afchar, Darius, et autres
Publié: (2024)
Double Entendre: Robust Audio-Based AI-Generated Lyrics Detection via Multi-View Fusion
par: Frohmann, Markus, et autres
Publié: (2025)
par: Frohmann, Markus, et autres
Publié: (2025)
Sparse Autoencoders Make Audio Foundation Models more Explainable
par: Mariotte, Théo, et autres
Publié: (2025)
par: Mariotte, Théo, et autres
Publié: (2025)
S-KEY: Self-supervised Learning of Major and Minor Keys from Audio
par: Kong, Yuexuan, et autres
Publié: (2025)
par: Kong, Yuexuan, et autres
Publié: (2025)
Translation-Equivariant Self-Supervised Learning for Pitch Estimation with Optimal Transport
par: Torres, Bernardo, et autres
Publié: (2025)
par: Torres, Bernardo, et autres
Publié: (2025)
AI-Generated Music Detection and its Challenges
par: Afchar, Darius, et autres
Publié: (2025)
par: Afchar, Darius, et autres
Publié: (2025)
Music2Latent: Consistency Autoencoders for Latent Audio Compression
par: Pasini, Marco, et autres
Publié: (2024)
par: Pasini, Marco, et autres
Publié: (2024)
Learning Source Disentanglement in Neural Audio Codec
par: Bie, Xiaoyu, et autres
Publié: (2024)
par: Bie, Xiaoyu, et autres
Publié: (2024)
Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework
par: Zhang, Kuiyuan, et autres
Publié: (2025)
par: Zhang, Kuiyuan, et autres
Publié: (2025)
Emergent musical properties of a transformer under contrastive self-supervised learning
par: Kong, Yuexuan, et autres
Publié: (2025)
par: Kong, Yuexuan, et autres
Publié: (2025)
A Survey of Deep Learning Audio Generation Methods
par: Božić, Matej, et autres
Publié: (2024)
par: Božić, Matej, et autres
Publié: (2024)
Guiding Audio Editing with Audio Language Model
par: Lan, Zitong, et autres
Publié: (2025)
par: Lan, Zitong, et autres
Publié: (2025)
Text-Queried Audio Source Separation via Hierarchical Modeling
par: Yin, Xinlei, et autres
Publié: (2025)
par: Yin, Xinlei, et autres
Publié: (2025)
Scaling Speech Tokenizers with Diffusion Autoencoders
par: Wang, Yuancheng, et autres
Publié: (2026)
par: Wang, Yuancheng, et autres
Publié: (2026)
AudioGenX: Explainability on Text-to-Audio Generative Models
par: Kang, Hyunju, et autres
Publié: (2025)
par: Kang, Hyunju, et autres
Publié: (2025)
Masked Audio Generation using a Single Non-Autoregressive Transformer
par: Ziv, Alon, et autres
Publié: (2024)
par: Ziv, Alon, et autres
Publié: (2024)
LiSTEN: Learning Soft Token Embeddings for Neural Audio LLMs
par: Mousavi, Pooneh, et autres
Publié: (2025)
par: Mousavi, Pooneh, et autres
Publié: (2025)
EVA-GAN: Enhanced Various Audio Generation via Scalable Generative Adversarial Networks
par: Liao, Shijia, et autres
Publié: (2024)
par: Liao, Shijia, et autres
Publié: (2024)
Quantifying Multimodal Imbalance: A GMM-Guided Adaptive Loss for Audio-Visual Learning
par: Liu, Zhaocheng, et autres
Publié: (2025)
par: Liu, Zhaocheng, et autres
Publié: (2025)
Investigating Design Choices in Joint-Embedding Predictive Architectures for General Audio Representation Learning
par: Riou, Alain, et autres
Publié: (2024)
par: Riou, Alain, et autres
Publié: (2024)
Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning
par: Tuncay, Ludovic, et autres
Publié: (2025)
par: Tuncay, Ludovic, et autres
Publié: (2025)
HEAR: Holistic Evaluation of Audio Representations
par: Turian, Joseph, et autres
Publié: (2022)
par: Turian, Joseph, et autres
Publié: (2022)
TACNET: Temporal Audio Source Counting Network
par: Ahmadnejad, Amirreza, et autres
Publié: (2023)
par: Ahmadnejad, Amirreza, et autres
Publié: (2023)
Representation-Regularized Convolutional Audio Transformer for Audio Understanding
par: Han, Bing, et autres
Publié: (2026)
par: Han, Bing, et autres
Publié: (2026)
Training-Free Multi-Step Audio Source Separation
par: Zang, Yongyi, et autres
Publié: (2025)
par: Zang, Yongyi, et autres
Publié: (2025)
On Temporal Guidance and Iterative Refinement in Audio Source Separation
par: Morocutti, Tobias, et autres
Publié: (2025)
par: Morocutti, Tobias, et autres
Publié: (2025)
Leveraging Whisper Embeddings for Audio-based Lyrics Matching
par: Mancini, Eleonora, et autres
Publié: (2025)
par: Mancini, Eleonora, et autres
Publié: (2025)
Audio-Based Pedestrian Detection in the Presence of Vehicular Noise
par: Kim, Yonghyun, et autres
Publié: (2025)
par: Kim, Yonghyun, et autres
Publié: (2025)
Exploring and Applying Audio-Based Sentiment Analysis in Music
par: Jhanji, Etash
Publié: (2024)
par: Jhanji, Etash
Publié: (2024)
Prompt-guided Precise Audio Editing with Diffusion Models
par: Xu, Manjie, et autres
Publié: (2024)
par: Xu, Manjie, et autres
Publié: (2024)
PC-MCL: Patient-Consistent Multi-Cycle Learning with multi-label bias correction for respiratory sound classification
par: Jeong, Seung Gyu, et autres
Publié: (2026)
par: Jeong, Seung Gyu, et autres
Publié: (2026)
PESTO: Real-Time Pitch Estimation with Self-supervised Transposition-equivariant Objective
par: Riou, Alain, et autres
Publié: (2025)
par: Riou, Alain, et autres
Publié: (2025)
Evaluating Fake Music Detection Performance Under Audio Augmentations
par: Sroka, Tomasz, et autres
Publié: (2025)
par: Sroka, Tomasz, et autres
Publié: (2025)
Cross-Attention with Confidence Weighting for Multi-Channel Audio Alignment
par: Nihal, Ragib Amin, et autres
Publié: (2025)
par: Nihal, Ragib Amin, et autres
Publié: (2025)
Speech Enhancement Using Continuous Embeddings of Neural Audio Codec
par: Li, Haoyang, et autres
Publié: (2025)
par: Li, Haoyang, et autres
Publié: (2025)
Benchmarking Language Modeling for Lossless Compression of Full-Fidelity Audio
par: Long, Phillip, et autres
Publié: (2026)
par: Long, Phillip, et autres
Publié: (2026)
PoDAR: Power-Disentangled Audio Representation for Generative Modeling
par: Luebs, Alejandro, et autres
Publié: (2026)
par: Luebs, Alejandro, et autres
Publié: (2026)
NatureLM-audio: an Audio-Language Foundation Model for Bioacoustics
par: Robinson, David, et autres
Publié: (2024)
par: Robinson, David, et autres
Publié: (2024)
Documents similaires
-
From Real to Cloned Singer Identification
par: Desblancs, Dorian, et autres
Publié: (2024) -
An Experimental Comparison Of Multi-view Self-supervised Methods For Music Tagging
par: Meseguer-Brocal, Gabriel, et autres
Publié: (2024) -
Detecting music deepfakes is easy but actually hard
par: Afchar, Darius, et autres
Publié: (2024) -
Double Entendre: Robust Audio-Based AI-Generated Lyrics Detection via Multi-View Fusion
par: Frohmann, Markus, et autres
Publié: (2025) -
Sparse Autoencoders Make Audio Foundation Models more Explainable
par: Mariotte, Théo, et autres
Publié: (2025)