Enhancing Automatic Chord Recognition through LLM Chain-of-Thought Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Chang, Chih-Cheng, Chen, Bo-Yu, Chen, Lu-Rong, Su, Li |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
BEAST: Online Joint Beat and Downbeat Tracking Based on Streaming Transformer
por: Chang, Chih-Cheng, et al.
Publicado: (2023)
por: Chang, Chih-Cheng, et al.
Publicado: (2023)
Interpretable Audio Editing Evaluation via Chain-of-Thought Difference-Commonality Reasoning with Multimodal LLMs
por: Jia, Yuhang, et al.
Publicado: (2025)
por: Jia, Yuhang, et al.
Publicado: (2025)
The RoyalFlush Automatic Speech Diarization and Recognition System for In-Car Multi-Channel Automatic Speech Recognition Challenge
por: Tian, Jingguang, et al.
Publicado: (2024)
por: Tian, Jingguang, et al.
Publicado: (2024)
Musical Chords: A Novel Java Algorithm and App Utility to Enumerate Chord-Progressions Adhering to Music Theory Guidelines
por: Lakshminarasimhan, Aditya
Publicado: (2024)
por: Lakshminarasimhan, Aditya
Publicado: (2024)
The DKU System for Multi-Speaker Automatic Speech Recognition in MLC-SLM Challenge
por: Lin, Yuke, et al.
Publicado: (2025)
por: Lin, Yuke, et al.
Publicado: (2025)
SpecASR: Accelerating LLM-based Automatic Speech Recognition via Speculative Decoding
por: Wei, Linye, et al.
Publicado: (2025)
por: Wei, Linye, et al.
Publicado: (2025)
Latent-Level Enhancement with Flow Matching for Robust Automatic Speech Recognition
por: Yang, Da-Hee, et al.
Publicado: (2026)
por: Yang, Da-Hee, et al.
Publicado: (2026)
Thinking in cocktail party: Chain-of-Thought and reinforcement learning for target speaker automatic speech recognition
por: Zhang, Yiru, et al.
Publicado: (2025)
por: Zhang, Yiru, et al.
Publicado: (2025)
Findings of the 2024 Mandarin Stuttering Event Detection and Automatic Speech Recognition Challenge
por: Xue, Hongfei, et al.
Publicado: (2024)
por: Xue, Hongfei, et al.
Publicado: (2024)
Nudging Hidden States: Training-Free Model Steering for Chain-of-Thought Reasoning in Large Audio-Language Models
por: Ieong, Lok-Lam, et al.
Publicado: (2026)
por: Ieong, Lok-Lam, et al.
Publicado: (2026)
Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition
por: Bai, Ye, et al.
Publicado: (2024)
por: Bai, Ye, et al.
Publicado: (2024)
AudioGenie-Reasoner: A Training-Free Multi-Agent Framework for Coarse-to-Fine Audio Deep Reasoning
por: Rong, Yan, et al.
Publicado: (2025)
por: Rong, Yan, et al.
Publicado: (2025)
BACHI: Boundary-Aware Symbolic Chord Recognition Through Masked Iterative Decoding on Pop and Classical Music
por: Yao, Mingyang, et al.
Publicado: (2025)
por: Yao, Mingyang, et al.
Publicado: (2025)
Leveraging LLM for Stuttering Speech: A Unified Architecture Bridging Recognition and Event Detection
por: Huang, Shangkun, et al.
Publicado: (2025)
por: Huang, Shangkun, et al.
Publicado: (2025)
Streaming Decoder-Only Automatic Speech Recognition with Discrete Speech Units: A Pilot Study
por: Chen, Peikun, et al.
Publicado: (2024)
por: Chen, Peikun, et al.
Publicado: (2024)
Fine-Tuning Automatic Speech Recognition for People with Parkinson's: An Effective Strategy for Enhancing Speech Technology Accessibility
por: Zheng, Xiuwen, et al.
Publicado: (2024)
por: Zheng, Xiuwen, et al.
Publicado: (2024)
An approach to measuring the performance of Automatic Speech Recognition (ASR) models in the context of Large Language Model (LLM) powered applications
por: Pulikodan, Sujith, et al.
Publicado: (2025)
por: Pulikodan, Sujith, et al.
Publicado: (2025)
UCorrect: An Unsupervised Framework for Automatic Speech Recognition Error Correction
por: Guo, Jiaxin, et al.
Publicado: (2024)
por: Guo, Jiaxin, et al.
Publicado: (2024)
Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Model
por: Ma, Ziyang, et al.
Publicado: (2025)
por: Ma, Ziyang, et al.
Publicado: (2025)
DiveSound: LLM-Assisted Automatic Taxonomy Construction for Diverse Audio Generation
por: Li, Baihan, et al.
Publicado: (2024)
por: Li, Baihan, et al.
Publicado: (2024)
SLAM-AAC: Enhancing Audio Captioning with Paraphrasing Augmentation and CLAP-Refine through LLMs
por: Chen, Wenxi, et al.
Publicado: (2024)
por: Chen, Wenxi, et al.
Publicado: (2024)
The CHiME-8 DASR Challenge for Generalizable and Array Agnostic Distant Automatic Speech Recognition and Diarization
por: Cornell, Samuele, et al.
Publicado: (2024)
por: Cornell, Samuele, et al.
Publicado: (2024)
FireRedASR2S: A State-of-the-Art Industrial-Grade All-in-One Automatic Speech Recognition System
por: Xu, Kaituo, et al.
Publicado: (2026)
por: Xu, Kaituo, et al.
Publicado: (2026)
IKFST: IOO and KOO Algorithms for Accelerated and Precise WFST-based End-to-End Automatic Speech Recognition
por: Zhuang, Zhuoran, et al.
Publicado: (2026)
por: Zhuang, Zhuoran, et al.
Publicado: (2026)
Augmenting Polish Automatic Speech Recognition System With Synthetic Data
por: Bondaruk, Łukasz, et al.
Publicado: (2024)
por: Bondaruk, Łukasz, et al.
Publicado: (2024)
Leveraging Self-Supervised Models for Automatic Whispered Speech Recognition
por: Farhadipour, Aref, et al.
Publicado: (2024)
por: Farhadipour, Aref, et al.
Publicado: (2024)
Rehearsal-Free Online Continual Learning for Automatic Speech Recognition
por: Eeckt, Steven Vander, et al.
Publicado: (2023)
por: Eeckt, Steven Vander, et al.
Publicado: (2023)
ConPCO: Preserving Phoneme Characteristics for Automatic Pronunciation Assessment Leveraging Contrastive Ordinal Regularization
por: Yan, Bi-Cheng, et al.
Publicado: (2024)
por: Yan, Bi-Cheng, et al.
Publicado: (2024)
AISHELL-5: The First Open-Source In-Car Multi-Channel Multi-Speaker Speech Dataset for Automatic Speech Diarization and Recognition
por: Dai, Yuhang, et al.
Publicado: (2025)
por: Dai, Yuhang, et al.
Publicado: (2025)
Leveraging Broadcast Media Subtitle Transcripts for Automatic Speech Recognition and Subtitling
por: Poncelet, Jakob, et al.
Publicado: (2025)
por: Poncelet, Jakob, et al.
Publicado: (2025)
CLAP-Based Automatic Word Naming Recognition in Post-Stroke Aphasia
por: Kaloga, Yacouba, et al.
Publicado: (2026)
por: Kaloga, Yacouba, et al.
Publicado: (2026)
Zero-Shot Recognition of Dysarthric Speech Using Commercial Automatic Speech Recognition and Multimodal Large Language Models
por: Alsayegh, Ali, et al.
Publicado: (2025)
por: Alsayegh, Ali, et al.
Publicado: (2025)
Bridging the Gap: Integrating Pre-trained Speech Enhancement and Recognition Models for Robust Speech Recognition
por: Wang, Kuan-Chen, et al.
Publicado: (2024)
por: Wang, Kuan-Chen, et al.
Publicado: (2024)
Towards Robust Dysarthric Speech Recognition: LLM-Agent Post-ASR Correction Beyond WER
por: Zheng, Xiuwen, et al.
Publicado: (2026)
por: Zheng, Xiuwen, et al.
Publicado: (2026)
Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition
por: Wang, Shih-heng, et al.
Publicado: (2024)
por: Wang, Shih-heng, et al.
Publicado: (2024)
Reducing Geographic Disparities in Automatic Speech Recognition via Elastic Weight Consolidation
por: Trinh, Viet Anh, et al.
Publicado: (2022)
por: Trinh, Viet Anh, et al.
Publicado: (2022)
Guitar-TECHS: An Electric Guitar Dataset Covering Techniques, Musical Excerpts, Chords and Scales Using a Diverse Array of Hardware
por: Pedroza, Hegel, et al.
Publicado: (2025)
por: Pedroza, Hegel, et al.
Publicado: (2025)
Training Data Augmentation for Dysarthric Automatic Speech Recognition by Text-to-Dysarthric-Speech Synthesis
por: Leung, Wing-Zin, et al.
Publicado: (2024)
por: Leung, Wing-Zin, et al.
Publicado: (2024)
DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition
por: Polok, Alexander, et al.
Publicado: (2024)
por: Polok, Alexander, et al.
Publicado: (2024)
Enhancing Open-Set Speaker Identification through Rapid Tuning with Speaker Reciprocal Points and Negative Sample
por: Chen, Zhiyong, et al.
Publicado: (2024)
por: Chen, Zhiyong, et al.
Publicado: (2024)
Ejemplares similares
-
BEAST: Online Joint Beat and Downbeat Tracking Based on Streaming Transformer
por: Chang, Chih-Cheng, et al.
Publicado: (2023) -
Interpretable Audio Editing Evaluation via Chain-of-Thought Difference-Commonality Reasoning with Multimodal LLMs
por: Jia, Yuhang, et al.
Publicado: (2025) -
The RoyalFlush Automatic Speech Diarization and Recognition System for In-Car Multi-Channel Automatic Speech Recognition Challenge
por: Tian, Jingguang, et al.
Publicado: (2024) -
Musical Chords: A Novel Java Algorithm and App Utility to Enumerate Chord-Progressions Adhering to Music Theory Guidelines
por: Lakshminarasimhan, Aditya
Publicado: (2024) -
The DKU System for Multi-Speaker Automatic Speech Recognition in MLC-SLM Challenge
por: Lin, Yuke, et al.
Publicado: (2025)