Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Model
Fuente:
arXiv
Salvato in:
| Autori principali: | Ma, Ziyang, Chen, Zhuo, Wang, Yuping, Chng, Eng Siong, Chen, Xie |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix
di: Ma, Ziyang, et al.
Pubblicazione: (2025)
di: Ma, Ziyang, et al.
Pubblicazione: (2025)
Towards Reliable Large Audio Language Model
di: Ma, Ziyang, et al.
Pubblicazione: (2025)
di: Ma, Ziyang, et al.
Pubblicazione: (2025)
Pay More Attention To Audio: Mitigating Imbalance of Cross-Modal Attention in Large Audio Language Models
di: Wang, Junyu, et al.
Pubblicazione: (2025)
di: Wang, Junyu, et al.
Pubblicazione: (2025)
SoundMind: RL-Incentivized Logic Reasoning for Audio-Language Models
di: Diao, Xingjian, et al.
Pubblicazione: (2025)
di: Diao, Xingjian, et al.
Pubblicazione: (2025)
Resurfacing Paralinguistic Awareness in Large Audio Language Models
di: Yang, Hao, et al.
Pubblicazione: (2026)
di: Yang, Hao, et al.
Pubblicazione: (2026)
Beyond Single-Audio: Advancing Multi-Audio Processing in Audio Large Language Models
di: Chen, Yiming, et al.
Pubblicazione: (2024)
di: Chen, Yiming, et al.
Pubblicazione: (2024)
Audio Is the Achilles' Heel: Red Teaming Audio Large Multimodal Models
di: Yang, Hao, et al.
Pubblicazione: (2024)
di: Yang, Hao, et al.
Pubblicazione: (2024)
Audio-Reasoner: Improving Reasoning Capability in Large Audio Language Models
di: Xie, Zhifei, et al.
Pubblicazione: (2025)
di: Xie, Zhifei, et al.
Pubblicazione: (2025)
Sound-VECaps: Improving Audio Generation with Visual Enhanced Captions
di: Yuan, Yi, et al.
Pubblicazione: (2024)
di: Yuan, Yi, et al.
Pubblicazione: (2024)
Semantically consistent Video-to-Audio Generation using Multimodal Language Large Model
di: Chen, Gehui, et al.
Pubblicazione: (2024)
di: Chen, Gehui, et al.
Pubblicazione: (2024)
Audio-Thinker: Guiding Audio Language Model When and How to Think via Reinforcement Learning
di: Wu, Shu, et al.
Pubblicazione: (2025)
di: Wu, Shu, et al.
Pubblicazione: (2025)
AudioSetMix: Enhancing Audio-Language Datasets with LLM-Assisted Augmentations
di: Xu, David
Pubblicazione: (2024)
di: Xu, David
Pubblicazione: (2024)
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators
di: Chen, Chen, et al.
Pubblicazione: (2025)
di: Chen, Chen, et al.
Pubblicazione: (2025)
Reshaping Representation Space to Balance the Safety and Over-rejection in Large Audio Language Models
di: Yang, Hao, et al.
Pubblicazione: (2025)
di: Yang, Hao, et al.
Pubblicazione: (2025)
Audio-Language Models for Audio-Centric Tasks: A Systematic Survey
di: Su, Yi, et al.
Pubblicazione: (2025)
di: Su, Yi, et al.
Pubblicazione: (2025)
Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model
di: Ren, Yong, et al.
Pubblicazione: (2025)
di: Ren, Yong, et al.
Pubblicazione: (2025)
Quantitative Analysis of Audio-Visual Tasks: An Information-Theoretic Perspective
di: Chen, Chen, et al.
Pubblicazione: (2024)
di: Chen, Chen, et al.
Pubblicazione: (2024)
Can Large Language Models Predict Audio Effects Parameters from Natural Language?
di: Doh, Seungheon, et al.
Pubblicazione: (2025)
di: Doh, Seungheon, et al.
Pubblicazione: (2025)
WavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal Research
di: Mei, Xinhao, et al.
Pubblicazione: (2023)
di: Mei, Xinhao, et al.
Pubblicazione: (2023)
Learning Audio Concepts from Counterfactual Natural Language
di: Vosoughi, Ali, et al.
Pubblicazione: (2024)
di: Vosoughi, Ali, et al.
Pubblicazione: (2024)
Sonic4D: Spatial Audio Generation for Immersive 4D Scene Exploration
di: Xie, Siyi, et al.
Pubblicazione: (2025)
di: Xie, Siyi, et al.
Pubblicazione: (2025)
MusicSem: A Semantically Rich Language--Audio Dataset of Natural Music Descriptions
di: Salganik, Rebecca, et al.
Pubblicazione: (2026)
di: Salganik, Rebecca, et al.
Pubblicazione: (2026)
AudioRole: An Audio Dataset for Character Role-Playing in Large Language Models
di: Li, Wenyu, et al.
Pubblicazione: (2025)
di: Li, Wenyu, et al.
Pubblicazione: (2025)
Zero-Shot Fake Video Detection by Audio-Visual Consistency
di: Li, Xiaolou, et al.
Pubblicazione: (2024)
di: Li, Xiaolou, et al.
Pubblicazione: (2024)
On the Audio Hallucinations in Large Audio-Video Language Models
di: Nishimura, Taichi, et al.
Pubblicazione: (2024)
di: Nishimura, Taichi, et al.
Pubblicazione: (2024)
DSCLAP: Domain-Specific Contrastive Language-Audio Pre-Training
di: Liu, Shengqiang, et al.
Pubblicazione: (2024)
di: Liu, Shengqiang, et al.
Pubblicazione: (2024)
Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities
di: Sudarsanam, Parthasaarathy, et al.
Pubblicazione: (2025)
di: Sudarsanam, Parthasaarathy, et al.
Pubblicazione: (2025)
Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis
di: Huang, Zhiqi, et al.
Pubblicazione: (2024)
di: Huang, Zhiqi, et al.
Pubblicazione: (2024)
DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis
di: Tian, Wenjie, et al.
Pubblicazione: (2025)
di: Tian, Wenjie, et al.
Pubblicazione: (2025)
ELEGANCE: Efficient LLM Guidance for Audio-Visual Target Speech Extraction
di: Wu, Wenxuan, et al.
Pubblicazione: (2025)
di: Wu, Wenxuan, et al.
Pubblicazione: (2025)
Addressing Emotion Bias in Music Emotion Recognition and Generation with Frechet Audio Distance
di: Li, Yuanchao, et al.
Pubblicazione: (2024)
di: Li, Yuanchao, et al.
Pubblicazione: (2024)
StereoFoley: Object-Aware Stereo Audio Generation from Video
di: Karchkhadze, Tornike, et al.
Pubblicazione: (2025)
di: Karchkhadze, Tornike, et al.
Pubblicazione: (2025)
Beyond Video-to-SFX: Video to Audio Synthesis with Environmentally Aware Speech
di: Niu, Xinlei, et al.
Pubblicazione: (2025)
di: Niu, Xinlei, et al.
Pubblicazione: (2025)
Analysis of Speaker Verification Performance Trade-offs with Neural Audio Codec Transmission
di: Thakur, Nirmalya Mallick, et al.
Pubblicazione: (2025)
di: Thakur, Nirmalya Mallick, et al.
Pubblicazione: (2025)
POLIPHONE: A Dataset for Smartphone Model Identification from Audio Recordings
di: Salvi, Davide, et al.
Pubblicazione: (2024)
di: Salvi, Davide, et al.
Pubblicazione: (2024)
STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment
di: Ren, Yong, et al.
Pubblicazione: (2024)
di: Ren, Yong, et al.
Pubblicazione: (2024)
Building Audio-Visual Digital Twins with Smartphones
di: Lan, Zitong, et al.
Pubblicazione: (2025)
di: Lan, Zitong, et al.
Pubblicazione: (2025)
RVCBench: Benchmarking the Robustness of Voice Cloning Across Modern Audio Generation Models
di: Jin, Ruinan, et al.
Pubblicazione: (2026)
di: Jin, Ruinan, et al.
Pubblicazione: (2026)
It's Never Too Late: Fusing Acoustic Information into Large Language Models for Automatic Speech Recognition
di: Chen, Chen, et al.
Pubblicazione: (2024)
di: Chen, Chen, et al.
Pubblicazione: (2024)
Fine-Tuning MIDI-to-Audio Alignment using a Neural Network on Piano Roll and CQT Representations
di: Murgul, Sebastian, et al.
Pubblicazione: (2025)
di: Murgul, Sebastian, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix
di: Ma, Ziyang, et al.
Pubblicazione: (2025) -
Towards Reliable Large Audio Language Model
di: Ma, Ziyang, et al.
Pubblicazione: (2025) -
Pay More Attention To Audio: Mitigating Imbalance of Cross-Modal Attention in Large Audio Language Models
di: Wang, Junyu, et al.
Pubblicazione: (2025) -
SoundMind: RL-Incentivized Logic Reasoning for Audio-Language Models
di: Diao, Xingjian, et al.
Pubblicazione: (2025) -
Resurfacing Paralinguistic Awareness in Large Audio Language Models
di: Yang, Hao, et al.
Pubblicazione: (2026)