A Human-Inspired Decoupled Architecture for Efficient Audio Representation Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kawano, Harunori, Sasaki, Takeshi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AudioMosaic: Contrastive Masked Audio Representation Learning
par: Huang, Hanxun, et autres
Publié: (2026)
par: Huang, Hanxun, et autres
Publié: (2026)
Evaluation of Deep Audio Representations for Hearables
par: Gröger, Fabian, et autres
Publié: (2025)
par: Gröger, Fabian, et autres
Publié: (2025)
Representation-Based Data Quality Audits for Audio
par: Gonzalez-Jimenez, Alvaro, et autres
Publié: (2025)
par: Gonzalez-Jimenez, Alvaro, et autres
Publié: (2025)
Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning
par: Tuncay, Ludovic, et autres
Publié: (2025)
par: Tuncay, Ludovic, et autres
Publié: (2025)
Investigating Design Choices in Joint-Embedding Predictive Architectures for General Audio Representation Learning
par: Riou, Alain, et autres
Publié: (2024)
par: Riou, Alain, et autres
Publié: (2024)
Preference-Based Learning in Audio Applications: A Systematic Analysis
par: Broukhim, Aaron, et autres
Publié: (2025)
par: Broukhim, Aaron, et autres
Publié: (2025)
AudioCodecBench: A Comprehensive Benchmark for Audio Codec Evaluation
par: Wang, Lu, et autres
Publié: (2025)
par: Wang, Lu, et autres
Publié: (2025)
QAMRO: Quality-aware Adaptive Margin Ranking Optimization for Human-aligned Assessment of Audio Generation Systems
par: Wang, Chien-Chun, et autres
Publié: (2025)
par: Wang, Chien-Chun, et autres
Publié: (2025)
Phase-Aware Deep Learning with Complex-Valued CNNs for Audio Signal Applications
par: Agrawal, Naman
Publié: (2025)
par: Agrawal, Naman
Publié: (2025)
Boosting ASR Robustness via Test-Time Reinforcement Learning with Audio-Text Semantic Rewards
par: Fang, Linghan, et autres
Publié: (2026)
par: Fang, Linghan, et autres
Publié: (2026)
HEAR: Holistic Evaluation of Audio Representations
par: Turian, Joseph, et autres
Publié: (2022)
par: Turian, Joseph, et autres
Publié: (2022)
Explainable Multi-Modal Deep Learning for Automatic Detection of Lung Diseases from Respiratory Audio Signals
par: Saky, S M Asiful Islam, et autres
Publié: (2025)
par: Saky, S M Asiful Islam, et autres
Publié: (2025)
Myna: Masking-Based Contrastive Learning of Musical Representations
par: Yonay, Ori, et autres
Publié: (2025)
par: Yonay, Ori, et autres
Publié: (2025)
Cross-Attention with Confidence Weighting for Multi-Channel Audio Alignment
par: Nihal, Ragib Amin, et autres
Publié: (2025)
par: Nihal, Ragib Amin, et autres
Publié: (2025)
AUDETER: A Large-scale Dataset for Deepfake Audio Detection in Open Worlds
par: Wang, Qizhou, et autres
Publié: (2025)
par: Wang, Qizhou, et autres
Publié: (2025)
Low-Resource Guidance for Controllable Latent Audio Diffusion
par: Novack, Zachary, et autres
Publié: (2026)
par: Novack, Zachary, et autres
Publié: (2026)
Exploring Token-Space Manipulation in Latent Audio Tokenizers
par: Paissan, Francesco, et autres
Publié: (2026)
par: Paissan, Francesco, et autres
Publié: (2026)
Structured-Noise Masked Modeling for Video, Audio and Beyond
par: Bhowmik, Aritra, et autres
Publié: (2025)
par: Bhowmik, Aritra, et autres
Publié: (2025)
Linguistic and Audio Embedding-Based Machine Learning for Alzheimer's Dementia and Mild Cognitive Impairment Detection: Insights from the PROCESS Challenge
par: Devahi, Adharsha Sam Edwin Sam, et autres
Publié: (2025)
par: Devahi, Adharsha Sam Edwin Sam, et autres
Publié: (2025)
A$^2$-LLM: An End-to-end Conversational Audio Avatar Large Language Model
par: Hu, Xiaolin, et autres
Publié: (2026)
par: Hu, Xiaolin, et autres
Publié: (2026)
When Denoising Hinders: Revisiting Zero-Shot ASR with SAM-Audio and Whisper
par: Islam, Akif, et autres
Publié: (2026)
par: Islam, Akif, et autres
Publié: (2026)
PoDAR: Power-Disentangled Audio Representation for Generative Modeling
par: Luebs, Alejandro, et autres
Publié: (2026)
par: Luebs, Alejandro, et autres
Publié: (2026)
Real-Time Voicemail Detection in Telephony Audio Using Temporal Speech Activity Features
par: Saurav, Kumar
Publié: (2026)
par: Saurav, Kumar
Publié: (2026)
CoDiCodec: Unifying Continuous and Discrete Compressed Representations of Audio
par: Pasini, Marco, et autres
Publié: (2025)
par: Pasini, Marco, et autres
Publié: (2025)
Competitive Audio-Language Models with Data-Efficient Single-Stage Training on Public Data
par: Kumar, Gokul Karthik, et autres
Publié: (2025)
par: Kumar, Gokul Karthik, et autres
Publié: (2025)
Soft Clustering Anchors for Self-Supervised Speech Representation Learning in Joint Embedding Prediction Architectures
par: Ioannides, Georgios, et autres
Publié: (2026)
par: Ioannides, Georgios, et autres
Publié: (2026)
Fusing Memory and Attention: A study on LSTM, Transformer and Hybrid Architectures for Symbolic Music Generation
par: Ghoshal, Soudeep, et autres
Publié: (2026)
par: Ghoshal, Soudeep, et autres
Publié: (2026)
Efficient Multi-Model Fusion with Adversarial Complementary Representation Learning
par: Kang, Zuheng, et autres
Publié: (2024)
par: Kang, Zuheng, et autres
Publié: (2024)
A Survey of Deep Learning Audio Generation Methods
par: Božić, Matej, et autres
Publié: (2024)
par: Božić, Matej, et autres
Publié: (2024)
Learning When to Think While Listening in Large Audio-Language Models
par: Song, Zhiyuan, et autres
Publié: (2026)
par: Song, Zhiyuan, et autres
Publié: (2026)
Lyrics Matter: Exploiting the Power of Learnt Representations for Music Popularity Prediction
par: Choudhary, Yash, et autres
Publié: (2025)
par: Choudhary, Yash, et autres
Publié: (2025)
KAD: No More FAD! An Effective and Efficient Evaluation Metric for Audio Generation
par: Chung, Yoonjin, et autres
Publié: (2025)
par: Chung, Yoonjin, et autres
Publié: (2025)
Learning Source Disentanglement in Neural Audio Codec
par: Bie, Xiaoyu, et autres
Publié: (2024)
par: Bie, Xiaoyu, et autres
Publié: (2024)
Scaling Ambiguity: Augmenting Human Annotation in Speech Emotion Recognition with Audio-Language Models
par: Zhang, Wenda, et autres
Publié: (2026)
par: Zhang, Wenda, et autres
Publié: (2026)
TRAMBA: A Hybrid Transformer and Mamba Architecture for Practical Audio and Bone Conduction Speech Super Resolution and Enhancement on Mobile and Wearable Platforms
par: Sui, Yueyuan, et autres
Publié: (2024)
par: Sui, Yueyuan, et autres
Publié: (2024)
Guiding Audio Editing with Audio Language Model
par: Lan, Zitong, et autres
Publié: (2025)
par: Lan, Zitong, et autres
Publié: (2025)
MAEB: Massive Audio Embedding Benchmark
par: Assadi, Adnan El, et autres
Publié: (2026)
par: Assadi, Adnan El, et autres
Publié: (2026)
Sample-Efficient Diffusion for Text-To-Speech Synthesis
par: Lovelace, Justin, et autres
Publié: (2024)
par: Lovelace, Justin, et autres
Publié: (2024)
NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations
par: Liao, Huan, et autres
Publié: (2025)
par: Liao, Huan, et autres
Publié: (2025)
Learning Audio-Visual Embeddings with Inferred Latent Interaction Graphs
par: Zeng, Donghuo, et autres
Publié: (2026)
par: Zeng, Donghuo, et autres
Publié: (2026)
Documents similaires
-
AudioMosaic: Contrastive Masked Audio Representation Learning
par: Huang, Hanxun, et autres
Publié: (2026) -
Evaluation of Deep Audio Representations for Hearables
par: Gröger, Fabian, et autres
Publié: (2025) -
Representation-Based Data Quality Audits for Audio
par: Gonzalez-Jimenez, Alvaro, et autres
Publié: (2025) -
Audio-JEPA: Joint-Embedding Predictive Architecture for Audio Representation Learning
par: Tuncay, Ludovic, et autres
Publié: (2025) -
Investigating Design Choices in Joint-Embedding Predictive Architectures for General Audio Representation Learning
par: Riou, Alain, et autres
Publié: (2024)