PitchBench: Measuring Pitch Hearing in Audio-Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Dujardin, Milan Liessens, Yu, Song-Ze, Thomas-Smith, Craver Corbyn, Chan, David M., Nguyen, Karina |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Do Audio-Visual Large Language Models Really See and Hear?
von: Selvakumar, Ramaneswaran, et al.
Veröffentlicht: (2026)
von: Selvakumar, Ramaneswaran, et al.
Veröffentlicht: (2026)
SPA-SVC: Self-supervised Pitch Augmentation for Singing Voice Conversion
von: Bai, Bingsong, et al.
Veröffentlicht: (2024)
von: Bai, Bingsong, et al.
Veröffentlicht: (2024)
Incremental FastPitch: Chunk-based High Quality Text to Speech
von: Du, Muyang, et al.
Veröffentlicht: (2024)
von: Du, Muyang, et al.
Veröffentlicht: (2024)
MAJL: A Model-Agnostic Joint Learning Framework for Music Source Separation and Pitch Estimation
von: Wei, Haojie, et al.
Veröffentlicht: (2025)
von: Wei, Haojie, et al.
Veröffentlicht: (2025)
SwiftF0: Fast and Accurate Monophonic Pitch Detection
von: Nieradzik, Lars
Veröffentlicht: (2025)
von: Nieradzik, Lars
Veröffentlicht: (2025)
Causal Prosody Mediation for Text-to-Speech:Counterfactual Training of Duration, Pitch, and Energy in FastSpeech2
von: Mohanty, Suvendu Sekhar
Veröffentlicht: (2026)
von: Mohanty, Suvendu Sekhar
Veröffentlicht: (2026)
Translation-Equivariant Self-Supervised Learning for Pitch Estimation with Optimal Transport
von: Torres, Bernardo, et al.
Veröffentlicht: (2025)
von: Torres, Bernardo, et al.
Veröffentlicht: (2025)
Real-Time Pitch/F0 Detection Using Spectrogram Images and Convolutional Neural Networks
von: Zhao, Xufang, et al.
Veröffentlicht: (2025)
von: Zhao, Xufang, et al.
Veröffentlicht: (2025)
AttuneBench: A Conversation-Based Benchmark for LLM Emotional Intelligence
von: Lubrano, Kate M., et al.
Veröffentlicht: (2026)
von: Lubrano, Kate M., et al.
Veröffentlicht: (2026)
BERT-APC: A Reference-free Framework for Automatic Pitch Correction via Musical Context Inference
von: Kim, Sungjae, et al.
Veröffentlicht: (2025)
von: Kim, Sungjae, et al.
Veröffentlicht: (2025)
Protecting Bystander Privacy via Selective Hearing in Audio LLMs
von: Zhan, Xiao, et al.
Veröffentlicht: (2025)
von: Zhan, Xiao, et al.
Veröffentlicht: (2025)
PESTO: Real-Time Pitch Estimation with Self-supervised Transposition-equivariant Objective
von: Riou, Alain, et al.
Veröffentlicht: (2025)
von: Riou, Alain, et al.
Veröffentlicht: (2025)
AudioMotionBench: Evaluating Auditory Motion Perception in Audio LLMs
von: Sun, Zhe, et al.
Veröffentlicht: (2025)
von: Sun, Zhe, et al.
Veröffentlicht: (2025)
DisMix: Disentangling Mixtures of Musical Instruments for Source-level Pitch and Timbre Manipulation
von: Luo, Yin-Jyun, et al.
Veröffentlicht: (2024)
von: Luo, Yin-Jyun, et al.
Veröffentlicht: (2024)
Reproducible Machine Learning-based Voice Pathology Detection: Introducing the Pitch Difference Feature
von: Vrba, Jan, et al.
Veröffentlicht: (2024)
von: Vrba, Jan, et al.
Veröffentlicht: (2024)
Eureka-Audio: Triggering Audio Intelligence in Compact Language Models
von: Zhang, Dan, et al.
Veröffentlicht: (2026)
von: Zhang, Dan, et al.
Veröffentlicht: (2026)
ViolinDiff: Enhancing Expressive Violin Synthesis with Pitch Bend Conditioning
von: Kim, Daewoong, et al.
Veröffentlicht: (2024)
von: Kim, Daewoong, et al.
Veröffentlicht: (2024)
AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech
von: Qiu, Jielin, et al.
Veröffentlicht: (2026)
von: Qiu, Jielin, et al.
Veröffentlicht: (2026)
Are Audio-Language Models Listening? Audio-Specialist Heads for Adaptive Audio Steering
von: Glazer, Neta, et al.
Veröffentlicht: (2026)
von: Glazer, Neta, et al.
Veröffentlicht: (2026)
AuditoryBench++: Can Language Models Understand Auditory Knowledge without Hearing?
von: Ok, Hyunjong, et al.
Veröffentlicht: (2025)
von: Ok, Hyunjong, et al.
Veröffentlicht: (2025)
Pitch-Conditioned Instrument Sound Synthesis From an Interactive Timbre Latent Space
von: Limberg, Christian, et al.
Veröffentlicht: (2025)
von: Limberg, Christian, et al.
Veröffentlicht: (2025)
The Sonar Moment: Benchmarking Audio-Language Models in Audio Geo-Localization
von: Zhang, Ruixing, et al.
Veröffentlicht: (2026)
von: Zhang, Ruixing, et al.
Veröffentlicht: (2026)
Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt
von: Shi, Yanfeng, et al.
Veröffentlicht: (2026)
von: Shi, Yanfeng, et al.
Veröffentlicht: (2026)
Do Models Hear Like Us? Probing the Representational Alignment of Audio LLMs and Naturalistic EEG
von: Yang, Haoyun, et al.
Veröffentlicht: (2026)
von: Yang, Haoyun, et al.
Veröffentlicht: (2026)
Audio-Maestro: Enhancing Large Audio-Language Models with Tool-Augmented Reasoning
von: Lee, Kuan-Yi, et al.
Veröffentlicht: (2025)
von: Lee, Kuan-Yi, et al.
Veröffentlicht: (2025)
VidAudio-Bench: Benchmarking V2A and VT2A Generation across Four Audio Categories
von: Zhang, Qian, et al.
Veröffentlicht: (2026)
von: Zhang, Qian, et al.
Veröffentlicht: (2026)
Temporal Contrastive Decoding: A Training-Free Method for Large Audio-Language Models
von: Li, Yanda, et al.
Veröffentlicht: (2026)
von: Li, Yanda, et al.
Veröffentlicht: (2026)
Bridging Biological Hearing and Neuromorphic Computing: End-to-End Time-Domain Audio Signal Processing with Reservoir Computing
von: Sebastian, Rinku, et al.
Veröffentlicht: (2026)
von: Sebastian, Rinku, et al.
Veröffentlicht: (2026)
HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models
von: Zhao, Feiyu, et al.
Veröffentlicht: (2026)
von: Zhao, Feiyu, et al.
Veröffentlicht: (2026)
AudioCodecBench: A Comprehensive Benchmark for Audio Codec Evaluation
von: Wang, Lu, et al.
Veröffentlicht: (2025)
von: Wang, Lu, et al.
Veröffentlicht: (2025)
Evaluation of Audio Language Models for Fairness, Safety, and Security
von: Aloufi, Ranya, et al.
Veröffentlicht: (2026)
von: Aloufi, Ranya, et al.
Veröffentlicht: (2026)
FoleyBench: A Benchmark For Video-to-Audio Models
von: Dixit, Satvik, et al.
Veröffentlicht: (2025)
von: Dixit, Satvik, et al.
Veröffentlicht: (2025)
Measuring the Robustness of Audio Deepfake Detectors
von: Li, Xiang, et al.
Veröffentlicht: (2025)
von: Li, Xiang, et al.
Veröffentlicht: (2025)
A Framework for Synthetic Audio Conversations Generation using Large Language Models
von: Kyaw, Kaung Myat, et al.
Veröffentlicht: (2024)
von: Kyaw, Kaung Myat, et al.
Veröffentlicht: (2024)
The World is Not Mono: Enabling Spatial Understanding in Large Audio-Language Models
von: You, Yuhuan, et al.
Veröffentlicht: (2026)
von: You, Yuhuan, et al.
Veröffentlicht: (2026)
OWL: Geometry-Aware Spatial Reasoning for Audio Large Language Models
von: Biswas, Subrata, et al.
Veröffentlicht: (2025)
von: Biswas, Subrata, et al.
Veröffentlicht: (2025)
CALM: Class-Conditional Sparse Attention Vectors for Large Audio-Language Models
von: Mehta, Videet, et al.
Veröffentlicht: (2026)
von: Mehta, Videet, et al.
Veröffentlicht: (2026)
Language Models as Semantic Teachers: Post-Training Alignment for Medical Audio Understanding
von: Wang, Tsai-Ning, et al.
Veröffentlicht: (2025)
von: Wang, Tsai-Ning, et al.
Veröffentlicht: (2025)
BLAB: Brutally Long Audio Bench
von: Ahia, Orevaoghene, et al.
Veröffentlicht: (2025)
von: Ahia, Orevaoghene, et al.
Veröffentlicht: (2025)
Deep Supervised Contrastive Learning of Pitch Contours for Robust Pitch Accent Classification in Seoul Korean
von: Joo, Hyunjung, et al.
Veröffentlicht: (2026)
von: Joo, Hyunjung, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Do Audio-Visual Large Language Models Really See and Hear?
von: Selvakumar, Ramaneswaran, et al.
Veröffentlicht: (2026) -
SPA-SVC: Self-supervised Pitch Augmentation for Singing Voice Conversion
von: Bai, Bingsong, et al.
Veröffentlicht: (2024) -
Incremental FastPitch: Chunk-based High Quality Text to Speech
von: Du, Muyang, et al.
Veröffentlicht: (2024) -
MAJL: A Model-Agnostic Joint Learning Framework for Music Source Separation and Pitch Estimation
von: Wei, Haojie, et al.
Veröffentlicht: (2025) -
SwiftF0: Fast and Accurate Monophonic Pitch Detection
von: Nieradzik, Lars
Veröffentlicht: (2025)