PALM: Few-Shot Prompt Learning for Audio Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Hanif, Asif, Agro, Maha Tufail, Qazi, Mohammad Areeb, Aldarmaki, Hanan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Code-Switching in End-to-End Automatic Speech Recognition: A Systematic Literature Review
di: Agro, Maha Tufail, et al.
Pubblicazione: (2025)
di: Agro, Maha Tufail, et al.
Pubblicazione: (2025)
Generalizable Prompt Tuning for Audio-Language Models via Semantic Expansion
di: Jang, Jaehyuk, et al.
Pubblicazione: (2026)
di: Jang, Jaehyuk, et al.
Pubblicazione: (2026)
STTATTS: Unified Speech-To-Text And Text-To-Speech Model
di: Toyin, Hawau Olamide, et al.
Pubblicazione: (2024)
di: Toyin, Hawau Olamide, et al.
Pubblicazione: (2024)
Self-supervised Learning for Acoustic Few-Shot Classification
di: Liang, Jingyong, et al.
Pubblicazione: (2024)
di: Liang, Jingyong, et al.
Pubblicazione: (2024)
Zero-Shot Parkinson's Disease Detection from Speech: Comparing Large Audio and Language Models
di: Kabir, Muhammad Ashad, et al.
Pubblicazione: (2026)
di: Kabir, Muhammad Ashad, et al.
Pubblicazione: (2026)
BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset
di: Fahad, Istiaq Ahmed, et al.
Pubblicazione: (2025)
di: Fahad, Istiaq Ahmed, et al.
Pubblicazione: (2025)
ArVoice: A Multi-Speaker Dataset for Arabic Speech Synthesis
di: Toyin, Hawau Olamide, et al.
Pubblicazione: (2025)
di: Toyin, Hawau Olamide, et al.
Pubblicazione: (2025)
Vision Language Models Are Few-Shot Audio Spectrogram Classifiers
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
JASTIN: Aligning LLMs for Zero-Shot Audio and Speech Evaluation via Natural Language Instructions
di: Zhang, Leying, et al.
Pubblicazione: (2026)
di: Zhang, Leying, et al.
Pubblicazione: (2026)
Prosody-Adaptable Audio Codecs for Zero-Shot Voice Conversion via In-Context Learning
di: Zhao, Junchuan, et al.
Pubblicazione: (2025)
di: Zhao, Junchuan, et al.
Pubblicazione: (2025)
RelUNet: Relative Channel Fusion U-Net for Multichannel Speech Enhancement
di: Aldarmaki, Ibrahim, et al.
Pubblicazione: (2024)
di: Aldarmaki, Ibrahim, et al.
Pubblicazione: (2024)
Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models
di: Song, Zirui, et al.
Pubblicazione: (2025)
di: Song, Zirui, et al.
Pubblicazione: (2025)
Audio Mamba: Bidirectional State Space Model for Audio Representation Learning
di: Erol, Mehmet Hamza, et al.
Pubblicazione: (2024)
di: Erol, Mehmet Hamza, et al.
Pubblicazione: (2024)
Text Prompt is Not Enough: Sound Event Enhanced Prompt Adapter for Target Style Audio Generation
di: Xiong, Chenxu, et al.
Pubblicazione: (2024)
di: Xiong, Chenxu, et al.
Pubblicazione: (2024)
Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models
di: Yang, Wanqi, et al.
Pubblicazione: (2024)
di: Yang, Wanqi, et al.
Pubblicazione: (2024)
Audio Mamba: Pretrained Audio State Space Model For Audio Tagging
di: Lin, Jiaju, et al.
Pubblicazione: (2024)
di: Lin, Jiaju, et al.
Pubblicazione: (2024)
Decoding Ambiguous Emotions with Test-Time Scaling in Audio-Language Models
di: Jia, Hong, et al.
Pubblicazione: (2026)
di: Jia, Hong, et al.
Pubblicazione: (2026)
Disentangling Reasoning in Large Audio-Language Models for Ambiguous Emotion Prediction
di: Yu, Xiaofeng, et al.
Pubblicazione: (2026)
di: Yu, Xiaofeng, et al.
Pubblicazione: (2026)
Audio Prompt Adapter: Unleashing Music Editing Abilities for Text-to-Music with Lightweight Finetuning
di: Tsai, Fang-Duo, et al.
Pubblicazione: (2024)
di: Tsai, Fang-Duo, et al.
Pubblicazione: (2024)
SLAP: Scalable Language-Audio Pretraining with Variable-Duration Audio and Multi-Objective Training
di: Mei, Xinhao, et al.
Pubblicazione: (2026)
di: Mei, Xinhao, et al.
Pubblicazione: (2026)
DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
di: Yuan, Yi, et al.
Pubblicazione: (2025)
di: Yuan, Yi, et al.
Pubblicazione: (2025)
A Framework for Synthetic Audio Conversations Generation using Large Language Models
di: Kyaw, Kaung Myat, et al.
Pubblicazione: (2024)
di: Kyaw, Kaung Myat, et al.
Pubblicazione: (2024)
DEAF: A Benchmark for Diagnostic Evaluation of Acoustic Faithfulness in Audio Language Models
di: Xiong, Jiaqi, et al.
Pubblicazione: (2026)
di: Xiong, Jiaqi, et al.
Pubblicazione: (2026)
Scaling Auditory Cognition via Test-Time Compute in Audio Language Models
di: Dang, Ting, et al.
Pubblicazione: (2025)
di: Dang, Ting, et al.
Pubblicazione: (2025)
AHAMask: Reliable Task Specification for Large Audio Language Models without Instructions
di: Guo, Yiwei, et al.
Pubblicazione: (2025)
di: Guo, Yiwei, et al.
Pubblicazione: (2025)
DSpAST: Disentangled Representations for Spatial Audio Reasoning with Large Language Models
di: Wilkinghoff, Kevin, et al.
Pubblicazione: (2025)
di: Wilkinghoff, Kevin, et al.
Pubblicazione: (2025)
Mind the Prompt: Prompting Strategies in Audio Generations for Improving Sound Classification
di: Ronchini, Francesca, et al.
Pubblicazione: (2025)
di: Ronchini, Francesca, et al.
Pubblicazione: (2025)
MPE-TTS: Customized Emotion Zero-Shot Text-To-Speech Using Multi-Modal Prompt
di: Wu, Zhichao, et al.
Pubblicazione: (2025)
di: Wu, Zhichao, et al.
Pubblicazione: (2025)
OpenSep: Leveraging Large Language Models with Textual Inversion for Open World Audio Separation
di: Mahmud, Tanvir, et al.
Pubblicazione: (2024)
di: Mahmud, Tanvir, et al.
Pubblicazione: (2024)
MoE Adapter for Large Audio Language Models: Sparsity, Disentanglement, and Gradient-Conflict-Free
di: Lei, Yishu, et al.
Pubblicazione: (2026)
di: Lei, Yishu, et al.
Pubblicazione: (2026)
UltraEval-Audio: A Unified Framework for Comprehensive Evaluation of Audio Foundation Models
di: Shi, Qundong, et al.
Pubblicazione: (2026)
di: Shi, Qundong, et al.
Pubblicazione: (2026)
AudioRole: An Audio Dataset for Character Role-Playing in Large Language Models
di: Li, Wenyu, et al.
Pubblicazione: (2025)
di: Li, Wenyu, et al.
Pubblicazione: (2025)
Deepfake Audio Detection Using Spectrogram-based Feature and Ensemble of Deep Learning Models
di: Pham, Lam, et al.
Pubblicazione: (2024)
di: Pham, Lam, et al.
Pubblicazione: (2024)
Prototype based Masked Audio Model for Self-Supervised Learning of Sound Event Detection
di: Cai, Pengfei, et al.
Pubblicazione: (2024)
di: Cai, Pengfei, et al.
Pubblicazione: (2024)
Sommelier: Scalable Open Multi-turn Audio Pre-processing for Full-duplex Speech Language Models
di: Jung, Kyudan, et al.
Pubblicazione: (2026)
di: Jung, Kyudan, et al.
Pubblicazione: (2026)
Does Current Deepfake Audio Detection Model Effectively Detect ALM-based Deepfake Audio?
di: Xie, Yuankun, et al.
Pubblicazione: (2024)
di: Xie, Yuankun, et al.
Pubblicazione: (2024)
Audio Explanation Synthesis with Generative Foundation Models
di: Akman, Alican, et al.
Pubblicazione: (2024)
di: Akman, Alican, et al.
Pubblicazione: (2024)
MiMo-Audio: Audio Language Models are Few-Shot Learners
di: Core Team, et al.
Pubblicazione: (2025)
di: Core Team, et al.
Pubblicazione: (2025)
Audio Atlas: Visualizing and Exploring Audio Datasets
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2024)
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2024)
Do Joint Language-Audio Embeddings Encode Perceptual Timbre Semantics?
di: Deng, Qixin, et al.
Pubblicazione: (2025)
di: Deng, Qixin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Code-Switching in End-to-End Automatic Speech Recognition: A Systematic Literature Review
di: Agro, Maha Tufail, et al.
Pubblicazione: (2025) -
Generalizable Prompt Tuning for Audio-Language Models via Semantic Expansion
di: Jang, Jaehyuk, et al.
Pubblicazione: (2026) -
STTATTS: Unified Speech-To-Text And Text-To-Speech Model
di: Toyin, Hawau Olamide, et al.
Pubblicazione: (2024) -
Self-supervised Learning for Acoustic Few-Shot Classification
di: Liang, Jingyong, et al.
Pubblicazione: (2024) -
Zero-Shot Parkinson's Disease Detection from Speech: Comparing Large Audio and Language Models
di: Kabir, Muhammad Ashad, et al.
Pubblicazione: (2026)