Evaluating Compositional Structure in Audio Representations
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Chuyang, Steers, Bea, McFee, Brian, Bello, Juan |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Skip That Beat: Augmenting Meter Tracking Models for Underrepresented Time Signatures
by: Morais, Giovana, et al.
Published: (2025)
by: Morais, Giovana, et al.
Published: (2025)
Spatial Scaper: A Library to Simulate and Augment Soundscapes for Sound Event Localization and Detection in Realistic Rooms
by: Roman, Iran R., et al.
Published: (2024)
by: Roman, Iran R., et al.
Published: (2024)
Hybrid Losses for Hierarchical Embedding Learning
by: Tian, Haokun, et al.
Published: (2025)
by: Tian, Haokun, et al.
Published: (2025)
Challenge on Sound Scene Synthesis: Evaluating Text-to-Audio Generation
by: Lee, Junwon, et al.
Published: (2024)
by: Lee, Junwon, et al.
Published: (2024)
Infrastructure-free, Deep Learned Urban Noise Monitoring at $\sim$100mW
by: Yun, Jihoon, et al.
Published: (2022)
by: Yun, Jihoon, et al.
Published: (2022)
Sound Scene Synthesis at the DCASE 2024 Challenge
by: Lagrange, Mathieu, et al.
Published: (2025)
by: Lagrange, Mathieu, et al.
Published: (2025)
Self-Supervised Multi-View Learning for Disentangled Music Audio Representations
by: Wilkins, Julia, et al.
Published: (2024)
by: Wilkins, Julia, et al.
Published: (2024)
Compositional Audio Representation Learning
by: Sridhar, Sripathi, et al.
Published: (2024)
by: Sridhar, Sripathi, et al.
Published: (2024)
Feature Article: The economics of narrow self‐interest – five key trends
by: Innes McFee
Published: (2025)
by: Innes McFee
Published: (2025)
Feature Article: Revisiting the global impact from a slowing China
by: Innes McFee
Published: (2024)
by: Innes McFee
Published: (2024)
Feature Article: How GenAI will change the world economy
by: Innes McFee
Published: (2024)
by: Innes McFee
Published: (2024)
Latent Multi-view Learning for Robust Environmental Sound Representations
by: Ding, Sivan, et al.
Published: (2025)
by: Ding, Sivan, et al.
Published: (2025)
Evaluation of Deep Audio Representations for Hearables
by: Gröger, Fabian, et al.
Published: (2025)
by: Gröger, Fabian, et al.
Published: (2025)
Investigating the Sensitivity of Pre-trained Audio Embeddings to Common Effects
by: Deng, Victor, et al.
Published: (2025)
by: Deng, Victor, et al.
Published: (2025)
Evaluation of Audio Compression Codecs
by: Duong, Thien T., et al.
Published: (2025)
by: Duong, Thien T., et al.
Published: (2025)
Common names applied to the Long-finned Pilot Whale, Globicepheda melas
by: McFee, W. E.
Published: (1991)
by: McFee, W. E.
Published: (1991)
Volunteer Handbook
by: McFee, W. E.
Published: (2003)
by: McFee, W. E.
Published: (2003)
ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models
by: Luo, Kaiwen, et al.
Published: (2026)
by: Luo, Kaiwen, et al.
Published: (2026)
HEAR: Holistic Evaluation of Audio Representations
by: Turian, Joseph, et al.
Published: (2022)
by: Turian, Joseph, et al.
Published: (2022)
MERIT: Learning Disentangled Music Representations for Audio Similarity
by: Roy, Abhinaba, et al.
Published: (2026)
by: Roy, Abhinaba, et al.
Published: (2026)
Discrete Audio Representations for Automated Audio Captioning
by: Tian, Jingguang, et al.
Published: (2025)
by: Tian, Jingguang, et al.
Published: (2025)
DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners
by: Luo, Xiaoxue, et al.
Published: (2025)
by: Luo, Xiaoxue, et al.
Published: (2025)
Audio-Visual Separation with Hierarchical Fusion and Representation Alignment
by: Hu, Han, et al.
Published: (2025)
by: Hu, Han, et al.
Published: (2025)
Balancing Information Preservation and Disentanglement in Self-Supervised Music Representation Learning
by: Wilkins, Julia, et al.
Published: (2025)
by: Wilkins, Julia, et al.
Published: (2025)
AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech
by: Qiu, Jielin, et al.
Published: (2026)
by: Qiu, Jielin, et al.
Published: (2026)
Evaluating CNN with Stacked Feature Representations and Audio Spectrogram Transformer Models for Sound Classification
by: Dehaghania, Parinaz Binandeh, et al.
Published: (2026)
by: Dehaghania, Parinaz Binandeh, et al.
Published: (2026)
AudioMosaic: Contrastive Masked Audio Representation Learning
by: Huang, Hanxun, et al.
Published: (2026)
by: Huang, Hanxun, et al.
Published: (2026)
MoEScore: Mixture-of-Experts-Based Text-Audio Relevance Score Prediction for Text-to-Audio System Evaluation
by: Sun, Bochao, et al.
Published: (2026)
by: Sun, Bochao, et al.
Published: (2026)
AudioRAG+: Feedback-driven Retrieval-augmented Audio Generation with Large Audio Language Models
by: Zhao, Junqi, et al.
Published: (2025)
by: Zhao, Junqi, et al.
Published: (2025)
Audio Fingerprinting with Holographic Reduced Representations
by: Fujita, Yusuke, et al.
Published: (2024)
by: Fujita, Yusuke, et al.
Published: (2024)
Evaluating Objective Speech Quality Metrics for Neural Audio Codecs
by: Lanzendörfer, Luca A., et al.
Published: (2025)
by: Lanzendörfer, Luca A., et al.
Published: (2025)
Delayed Commitment for Representation Readiness in Stage-wise Audio-Visual Learning
by: Xu, Xinmeng, et al.
Published: (2026)
by: Xu, Xinmeng, et al.
Published: (2026)
PolyBench: A Benchmark for Compositional Reasoning in Polyphonic Audio
by: Chen, Yuanjian, et al.
Published: (2026)
by: Chen, Yuanjian, et al.
Published: (2026)
AudioMotionBench: Evaluating Auditory Motion Perception in Audio LLMs
by: Sun, Zhe, et al.
Published: (2025)
by: Sun, Zhe, et al.
Published: (2025)
Audiocards: Structured Metadata Improves Audio Language Models For Sound Design
by: Sridhar, Sripathi, et al.
Published: (2026)
by: Sridhar, Sripathi, et al.
Published: (2026)
UniWhisper: Efficient Continual Multi-task Training for Robust Universal Audio Representation
by: Chen, Yuxuan, et al.
Published: (2026)
by: Chen, Yuxuan, et al.
Published: (2026)
AudioChat: Unified Audio Storytelling, Editing, and Understanding with Transfusion Forcing
by: Chen, William, et al.
Published: (2026)
by: Chen, William, et al.
Published: (2026)
MACE: Leveraging Audio for Evaluating Audio Captioning Systems
by: Dixit, Satvik, et al.
Published: (2024)
by: Dixit, Satvik, et al.
Published: (2024)
Hearing is Believing? Evaluating and Analyzing Audio Language Model Sycophancy with SYAUDIO
by: Yao, Junchi, et al.
Published: (2026)
by: Yao, Junchi, et al.
Published: (2026)
Resonate: Reinforcing Text-to-Audio Generation via Online Feedback from Large Audio Language Models
by: Li, Xiquan, et al.
Published: (2026)
by: Li, Xiquan, et al.
Published: (2026)
Similar Items
-
Skip That Beat: Augmenting Meter Tracking Models for Underrepresented Time Signatures
by: Morais, Giovana, et al.
Published: (2025) -
Spatial Scaper: A Library to Simulate and Augment Soundscapes for Sound Event Localization and Detection in Realistic Rooms
by: Roman, Iran R., et al.
Published: (2024) -
Hybrid Losses for Hierarchical Embedding Learning
by: Tian, Haokun, et al.
Published: (2025) -
Challenge on Sound Scene Synthesis: Evaluating Text-to-Audio Generation
by: Lee, Junwon, et al.
Published: (2024) -
Infrastructure-free, Deep Learned Urban Noise Monitoring at $\sim$100mW
by: Yun, Jihoon, et al.
Published: (2022)