PolyBench: A Benchmark for Compositional Reasoning in Polyphonic Audio
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Yuanjian, Xiao, Yang, Yin, Han, Liu, Xubo, Huang, Jinjie, Dang, Ting |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Temporally Heterogeneous Graph Contrastive Learning for Multimodal Acoustic event Classification
von: Chen, Yuanjian, et al.
Veröffentlicht: (2025)
von: Chen, Yuanjian, et al.
Veröffentlicht: (2025)
Noise-Robust Sound Event Detection and Counting via Language-Queried Sound Separation
von: Chen, Yuanjian, et al.
Veröffentlicht: (2025)
von: Chen, Yuanjian, et al.
Veröffentlicht: (2025)
Ensemble Confidence Calibration for Sound Event Detection in Open-environment
von: Chen, Yuanjian, et al.
Veröffentlicht: (2025)
von: Chen, Yuanjian, et al.
Veröffentlicht: (2025)
DeFT-Mamba: Universal Multichannel Sound Separation and Polyphonic Audio Classification
von: Lee, Dongheon, et al.
Veröffentlicht: (2024)
von: Lee, Dongheon, et al.
Veröffentlicht: (2024)
TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models
von: Wang, Hui, et al.
Veröffentlicht: (2025)
von: Wang, Hui, et al.
Veröffentlicht: (2025)
Rethinking Continual Learning for Speech and Audio: A Representation-Centric Taxonomy and Open Problems
von: Xiao, Yang, et al.
Veröffentlicht: (2026)
von: Xiao, Yang, et al.
Veröffentlicht: (2026)
AudioRAG: A Challenging Benchmark for Audio Reasoning and Information Retrieval
von: Lin, Jingru, et al.
Veröffentlicht: (2026)
von: Lin, Jingru, et al.
Veröffentlicht: (2026)
Polyphonia: Zero-Shot Timbre Transfer in Polyphonic Music with Acoustic-Informed Attention Calibration
von: Li, Haowen, et al.
Veröffentlicht: (2026)
von: Li, Haowen, et al.
Veröffentlicht: (2026)
RMVPE: A Robust Model for Vocal Pitch Estimation in Polyphonic Music
von: Wei, Haojie, et al.
Veröffentlicht: (2023)
von: Wei, Haojie, et al.
Veröffentlicht: (2023)
A Reference-free Metric for Language-Queried Audio Source Separation using Contrastive Language-Audio Pretraining
von: Xiao, Feiyang, et al.
Veröffentlicht: (2024)
von: Xiao, Feiyang, et al.
Veröffentlicht: (2024)
Contrastive Loss Based Frame-wise Feature disentanglement for Polyphonic Sound Event Detection
von: Guan, Yadong, et al.
Veröffentlicht: (2024)
von: Guan, Yadong, et al.
Veröffentlicht: (2024)
A Neural Score Follower for Computer Accompaniment of Polyphonic Musical Instruments
von: Pillay, Ashwin
Veröffentlicht: (2025)
von: Pillay, Ashwin
Veröffentlicht: (2025)
AudioBench: A Universal Benchmark for Audio Large Language Models
von: Wang, Bin, et al.
Veröffentlicht: (2024)
von: Wang, Bin, et al.
Veröffentlicht: (2024)
First-Shot Unsupervised Anomalous Sound Detection With Unknown Anomalies Estimated by Metadata-Assisted Audio Generation
von: Zhang, Hejing, et al.
Veröffentlicht: (2023)
von: Zhang, Hejing, et al.
Veröffentlicht: (2023)
Audio Entailment: Assessing Deductive Reasoning for Audio Understanding
von: Deshmukh, Soham, et al.
Veröffentlicht: (2024)
von: Deshmukh, Soham, et al.
Veröffentlicht: (2024)
End-to-End Real-World Polyphonic Piano Audio-to-Score Transcription with Hierarchical Decoding
von: Zeng, Wei, et al.
Veröffentlicht: (2024)
von: Zeng, Wei, et al.
Veröffentlicht: (2024)
RawTFNet: A Lightweight CNN Architecture for Speech Anti-spoofing
von: Xiao, Yang, et al.
Veröffentlicht: (2025)
von: Xiao, Yang, et al.
Veröffentlicht: (2025)
AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion
von: Zhao, Junqi, et al.
Veröffentlicht: (2025)
von: Zhao, Junqi, et al.
Veröffentlicht: (2025)
Why Can't They Remember? Uncovering Representation and Retrieval Bottlenecks in Multi-Turn Acoustic Memory
von: Xiao, Yang, et al.
Veröffentlicht: (2026)
von: Xiao, Yang, et al.
Veröffentlicht: (2026)
Exploring Text-Queried Sound Event Detection with Audio Source Separation
von: Yin, Han, et al.
Veröffentlicht: (2024)
von: Yin, Han, et al.
Veröffentlicht: (2024)
ISA-Bench: Benchmarking Instruction Sensitivity for Large Audio Language Models
von: Li, Bohan, et al.
Veröffentlicht: (2025)
von: Li, Bohan, et al.
Veröffentlicht: (2025)
AudioGenie-Reasoner: A Training-Free Multi-Agent Framework for Coarse-to-Fine Audio Deep Reasoning
von: Rong, Yan, et al.
Veröffentlicht: (2025)
von: Rong, Yan, et al.
Veröffentlicht: (2025)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
von: Gong, Yitian, et al.
Veröffentlicht: (2026)
von: Gong, Yitian, et al.
Veröffentlicht: (2026)
SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing
von: Zhang, Hanlin, et al.
Veröffentlicht: (2026)
von: Zhang, Hanlin, et al.
Veröffentlicht: (2026)
Compositional Audio Representation Learning
von: Sridhar, Sripathi, et al.
Veröffentlicht: (2024)
von: Sridhar, Sripathi, et al.
Veröffentlicht: (2024)
STAR-Bench: Probing Deep Spatio-Temporal Reasoning as Audio 4D Intelligence
von: Liu, Zihan, et al.
Veröffentlicht: (2025)
von: Liu, Zihan, et al.
Veröffentlicht: (2025)
FoleyBench: A Benchmark For Video-to-Audio Models
von: Dixit, Satvik, et al.
Veröffentlicht: (2025)
von: Dixit, Satvik, et al.
Veröffentlicht: (2025)
Disentangling Reasoning in Large Audio-Language Models for Ambiguous Emotion Prediction
von: Yu, Xiaofeng, et al.
Veröffentlicht: (2026)
von: Yu, Xiaofeng, et al.
Veröffentlicht: (2026)
DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
von: Yuan, Yi, et al.
Veröffentlicht: (2025)
von: Yuan, Yi, et al.
Veröffentlicht: (2025)
AudioLCM: Text-to-Audio Generation with Latent Consistency Models
von: Liu, Huadai, et al.
Veröffentlicht: (2024)
von: Liu, Huadai, et al.
Veröffentlicht: (2024)
MOS-Bench: Benchmarking Generalization Abilities of Subjective Speech Quality Assessment Models
von: Huang, Wen-Chin, et al.
Veröffentlicht: (2024)
von: Huang, Wen-Chin, et al.
Veröffentlicht: (2024)
FlashAudio: Rectified Flows for Fast and High-Fidelity Text-to-Audio Generation
von: Liu, Huadai, et al.
Veröffentlicht: (2024)
von: Liu, Huadai, et al.
Veröffentlicht: (2024)
Leveraging Pre-trained AudioLDM for Sound Generation: A Benchmark Study
von: Yuan, Yi, et al.
Veröffentlicht: (2023)
von: Yuan, Yi, et al.
Veröffentlicht: (2023)
Disentangling Hierarchical Features for Anomalous Sound Detection Under Domain Shift
von: Guan, Jian, et al.
Veröffentlicht: (2025)
von: Guan, Jian, et al.
Veröffentlicht: (2025)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
von: Yang, Dongchao, et al.
Veröffentlicht: (2023)
von: Yang, Dongchao, et al.
Veröffentlicht: (2023)
SSLAM: Enhancing Self-Supervised Models with Audio Mixtures for Polyphonic Soundscapes
von: Alex, Tony, et al.
Veröffentlicht: (2025)
von: Alex, Tony, et al.
Veröffentlicht: (2025)
Transcribing Rhythmic Patterns of the Guitar Track in Polyphonic Music
von: Lukoianov, Aleksandr, et al.
Veröffentlicht: (2025)
von: Lukoianov, Aleksandr, et al.
Veröffentlicht: (2025)
RiTTA: Modeling Event Relations in Text-to-Audio Generation
von: He, Yuhang, et al.
Veröffentlicht: (2024)
von: He, Yuhang, et al.
Veröffentlicht: (2024)
CoPlay: Audio-agnostic Cognitive Scaling for Acoustic Sensing
von: Li, Yin, et al.
Veröffentlicht: (2024)
von: Li, Yin, et al.
Veröffentlicht: (2024)
Interpretable Audio Editing Evaluation via Chain-of-Thought Difference-Commonality Reasoning with Multimodal LLMs
von: Jia, Yuhang, et al.
Veröffentlicht: (2025)
von: Jia, Yuhang, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Temporally Heterogeneous Graph Contrastive Learning for Multimodal Acoustic event Classification
von: Chen, Yuanjian, et al.
Veröffentlicht: (2025) -
Noise-Robust Sound Event Detection and Counting via Language-Queried Sound Separation
von: Chen, Yuanjian, et al.
Veröffentlicht: (2025) -
Ensemble Confidence Calibration for Sound Event Detection in Open-environment
von: Chen, Yuanjian, et al.
Veröffentlicht: (2025) -
DeFT-Mamba: Universal Multichannel Sound Separation and Polyphonic Audio Classification
von: Lee, Dongheon, et al.
Veröffentlicht: (2024) -
TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models
von: Wang, Hui, et al.
Veröffentlicht: (2025)