AudioBERT: Audio Knowledge Augmented Language Model
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Ok, Hyunjong, Yoo, Suho, Lee, Jaeho |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Imagine to Hear: Auditory Knowledge Generation can be an Effective Assistant for Language Models
von: Yoo, Suho, et al.
Veröffentlicht: (2025)
von: Yoo, Suho, et al.
Veröffentlicht: (2025)
Speculative End-Turn Detector for Efficient Speech Chatbot Assistant
von: Ok, Hyunjong, et al.
Veröffentlicht: (2025)
von: Ok, Hyunjong, et al.
Veröffentlicht: (2025)
S2Cap: A Benchmark and a Baseline for Singing Style Captioning
von: Ok, Hyunjong, et al.
Veröffentlicht: (2024)
von: Ok, Hyunjong, et al.
Veröffentlicht: (2024)
An Investigation Into Explainable Audio Hate Speech Detection
von: An, Jinmyeong, et al.
Veröffentlicht: (2024)
von: An, Jinmyeong, et al.
Veröffentlicht: (2024)
Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models
von: Goel, Arushi, et al.
Veröffentlicht: (2025)
von: Goel, Arushi, et al.
Veröffentlicht: (2025)
AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2025)
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2025)
All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation
von: Foo, Leonardo Haw-Yang, et al.
Veröffentlicht: (2026)
von: Foo, Leonardo Haw-Yang, et al.
Veröffentlicht: (2026)
SAKE: Towards Editing Auditory Attribute Knowledge of Large Audio-Language Models
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2025)
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2025)
AudioTrust: Benchmarking the Multifaceted Trustworthiness of Audio Large Language Models
von: Li, Kai, et al.
Veröffentlicht: (2025)
von: Li, Kai, et al.
Veröffentlicht: (2025)
Benchmarking Open-ended Audio Dialogue Understanding for Large Audio-Language Models
von: Gao, Kuofeng, et al.
Veröffentlicht: (2024)
von: Gao, Kuofeng, et al.
Veröffentlicht: (2024)
Extending Audio Context for Long-Form Understanding in Large Audio-Language Models
von: Chaichana, Yuatyong, et al.
Veröffentlicht: (2025)
von: Chaichana, Yuatyong, et al.
Veröffentlicht: (2025)
RECAP: Retrieval-Augmented Audio Captioning
von: Ghosh, Sreyan, et al.
Veröffentlicht: (2023)
von: Ghosh, Sreyan, et al.
Veröffentlicht: (2023)
Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music
von: Ghosh, Sreyan, et al.
Veröffentlicht: (2026)
von: Ghosh, Sreyan, et al.
Veröffentlicht: (2026)
GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities
von: Ghosh, Sreyan, et al.
Veröffentlicht: (2024)
von: Ghosh, Sreyan, et al.
Veröffentlicht: (2024)
Beyond Single-Audio: Advancing Multi-Audio Processing in Audio Large Language Models
von: Chen, Yiming, et al.
Veröffentlicht: (2024)
von: Chen, Yiming, et al.
Veröffentlicht: (2024)
Towards Holistic Evaluation of Large Audio-Language Models: A Comprehensive Survey
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2025)
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2025)
AudioMarathon: A Comprehensive Benchmark for Long-Context Audio Understanding and Efficiency in Audio LLMs
von: He, Peize, et al.
Veröffentlicht: (2025)
von: He, Peize, et al.
Veröffentlicht: (2025)
MUGEN: Evaluating and Improving Multi-audio Understanding of Large Audio-Language Models
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2026)
von: Yang, Chih-Kai, et al.
Veröffentlicht: (2026)
Enhancing Low-Resource Language and Instruction Following Capabilities of Audio Language Models
von: Manakul, Potsawee, et al.
Veröffentlicht: (2024)
von: Manakul, Potsawee, et al.
Veröffentlicht: (2024)
CompA: Addressing the Gap in Compositional Reasoning in Audio-Language Models
von: Ghosh, Sreyan, et al.
Veröffentlicht: (2023)
von: Ghosh, Sreyan, et al.
Veröffentlicht: (2023)
Investigating Safety Vulnerabilities of Large Audio-Language Models Under Speaker Emotional Variations
von: Feng, Bo-Han, et al.
Veröffentlicht: (2025)
von: Feng, Bo-Han, et al.
Veröffentlicht: (2025)
ALICE: A Multifaceted Evaluation Framework of Large Audio-Language Models' In-Context Learning Ability
von: Piao, Yen-Ting, et al.
Veröffentlicht: (2026)
von: Piao, Yen-Ting, et al.
Veröffentlicht: (2026)
Nudging Hidden States: Training-Free Model Steering for Chain-of-Thought Reasoning in Large Audio-Language Models
von: Ieong, Lok-Lam, et al.
Veröffentlicht: (2026)
von: Ieong, Lok-Lam, et al.
Veröffentlicht: (2026)
MoWE-Audio: Multitask AudioLLMs with Mixture of Weak Encoders
von: Zhang, Wenyu, et al.
Veröffentlicht: (2024)
von: Zhang, Wenyu, et al.
Veröffentlicht: (2024)
Auffusion: Leveraging the Power of Diffusion and Large Language Models for Text-to-Audio Generation
von: Xue, Jinlong, et al.
Veröffentlicht: (2024)
von: Xue, Jinlong, et al.
Veröffentlicht: (2024)
Codec Does Matter: Exploring the Semantic Shortcoming of Codec for Audio Language Model
von: Ye, Zhen, et al.
Veröffentlicht: (2024)
von: Ye, Zhen, et al.
Veröffentlicht: (2024)
ControlAudio: Tackling Text-Guided, Timing-Indicated and Intelligible Audio Generation via Progressive Diffusion Modeling
von: Jiang, Yuxuan, et al.
Veröffentlicht: (2025)
von: Jiang, Yuxuan, et al.
Veröffentlicht: (2025)
PAL: Probing Audio Encoders via LLMs -- Audio Information Transfer into LLMs
von: Alex, Tony, et al.
Veröffentlicht: (2025)
von: Alex, Tony, et al.
Veröffentlicht: (2025)
AuditoryBench++: Can Language Models Understand Auditory Knowledge without Hearing?
von: Ok, Hyunjong, et al.
Veröffentlicht: (2025)
von: Ok, Hyunjong, et al.
Veröffentlicht: (2025)
On Barriers to Archival Audio Processing
von: Sullivan, Peter, et al.
Veröffentlicht: (2025)
von: Sullivan, Peter, et al.
Veröffentlicht: (2025)
KoALa-Bench: Evaluating Large Audio Language Models on Korean Speech Understanding and Faithfulness
von: Kim, Jinyoung, et al.
Veröffentlicht: (2026)
von: Kim, Jinyoung, et al.
Veröffentlicht: (2026)
Fun-Audio-Chat Technical Report
von: Tongyi Fun Team, et al.
Veröffentlicht: (2025)
von: Tongyi Fun Team, et al.
Veröffentlicht: (2025)
BLAB: Brutally Long Audio Bench
von: Ahia, Orevaoghene, et al.
Veröffentlicht: (2025)
von: Ahia, Orevaoghene, et al.
Veröffentlicht: (2025)
SightSound-R1: Cross-Modal Reasoning Distillation from Vision to Audio Language Models
von: Wang, Qiaolin, et al.
Veröffentlicht: (2025)
von: Wang, Qiaolin, et al.
Veröffentlicht: (2025)
Discrete Audio Tokens: More Than a Survey!
von: Mousavi, Pooneh, et al.
Veröffentlicht: (2025)
von: Mousavi, Pooneh, et al.
Veröffentlicht: (2025)
ParaSpeechCLAP: A Dual-Encoder Speech-Text Model for Rich Stylistic Language-Audio Pretraining
von: Diwan, Anuj, et al.
Veröffentlicht: (2026)
von: Diwan, Anuj, et al.
Veröffentlicht: (2026)
Hello-Chat: Towards Realistic Social Audio Interactions
von: Hou, Yueran, et al.
Veröffentlicht: (2026)
von: Hou, Yueran, et al.
Veröffentlicht: (2026)
How Should We Extract Discrete Audio Tokens from Self-Supervised Models?
von: Mousavi, Pooneh, et al.
Veröffentlicht: (2024)
von: Mousavi, Pooneh, et al.
Veröffentlicht: (2024)
FLowHigh: Towards Efficient and High-Quality Audio Super-Resolution with Single-Step Flow Matching
von: Yun, Jun-Hak, et al.
Veröffentlicht: (2025)
von: Yun, Jun-Hak, et al.
Veröffentlicht: (2025)
Audio-Reasoner: Improving Reasoning Capability in Large Audio Language Models
von: Xie, Zhifei, et al.
Veröffentlicht: (2025)
von: Xie, Zhifei, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Imagine to Hear: Auditory Knowledge Generation can be an Effective Assistant for Language Models
von: Yoo, Suho, et al.
Veröffentlicht: (2025) -
Speculative End-Turn Detector for Efficient Speech Chatbot Assistant
von: Ok, Hyunjong, et al.
Veröffentlicht: (2025) -
S2Cap: A Benchmark and a Baseline for Singing Style Captioning
von: Ok, Hyunjong, et al.
Veröffentlicht: (2024) -
An Investigation Into Explainable Audio Hate Speech Detection
von: An, Jinmyeong, et al.
Veröffentlicht: (2024) -
Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models
von: Goel, Arushi, et al.
Veröffentlicht: (2025)