Language Models as Semantic Teachers: Post-Training Alignment for Medical Audio Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Tsai-Ning, Chen, Lin-Lin, Zeghidour, Neil, Saeed, Aaqib |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Adaptive Test-Time Scaling for Zero-Shot Respiratory Audio Classification
por: Wang, Tsai-Ning, et al.
Publicado: (2026)
por: Wang, Tsai-Ning, et al.
Publicado: (2026)
CaReAQA: A Cardiac and Respiratory Audio Question Answering Model for Open-Ended Diagnostic Reasoning
por: Wang, Tsai-Ning, et al.
Publicado: (2025)
por: Wang, Tsai-Ning, et al.
Publicado: (2025)
Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt
por: Shi, Yanfeng, et al.
Publicado: (2026)
por: Shi, Yanfeng, et al.
Publicado: (2026)
StethoLM: Audio Language Model for Cardiopulmonary Analysis Across Clinical Tasks
por: Wang, Yishan, et al.
Publicado: (2026)
por: Wang, Yishan, et al.
Publicado: (2026)
RespLLM: Unifying Audio and Text with Multimodal LLMs for Generalized Respiratory Health Prediction
por: Zhang, Yuwei, et al.
Publicado: (2024)
por: Zhang, Yuwei, et al.
Publicado: (2024)
Audio-Maestro: Enhancing Large Audio-Language Models with Tool-Augmented Reasoning
por: Lee, Kuan-Yi, et al.
Publicado: (2025)
por: Lee, Kuan-Yi, et al.
Publicado: (2025)
MUGEN: Evaluating and Improving Multi-audio Understanding of Large Audio-Language Models
por: Yang, Chih-Kai, et al.
Publicado: (2026)
por: Yang, Chih-Kai, et al.
Publicado: (2026)
The World is Not Mono: Enabling Spatial Understanding in Large Audio-Language Models
por: You, Yuhuan, et al.
Publicado: (2026)
por: You, Yuhuan, et al.
Publicado: (2026)
AudioSAE: Towards Understanding of Audio-Processing Models with Sparse AutoEncoders
por: Aparin, Georgii, et al.
Publicado: (2026)
por: Aparin, Georgii, et al.
Publicado: (2026)
Eureka-Audio: Triggering Audio Intelligence in Compact Language Models
por: Zhang, Dan, et al.
Publicado: (2026)
por: Zhang, Dan, et al.
Publicado: (2026)
Temporal Contrastive Decoding: A Training-Free Method for Large Audio-Language Models
por: Li, Yanda, et al.
Publicado: (2026)
por: Li, Yanda, et al.
Publicado: (2026)
ERIS: Evolutionary Real-world Interference Scheme for Jailbreaking Audio Large Models
por: Zhang, Yibo, et al.
Publicado: (2025)
por: Zhang, Yibo, et al.
Publicado: (2025)
Continuous Audio Language Models
por: Rouard, Simon, et al.
Publicado: (2025)
por: Rouard, Simon, et al.
Publicado: (2025)
Are Audio-Language Models Listening? Audio-Specialist Heads for Adaptive Audio Steering
por: Glazer, Neta, et al.
Publicado: (2026)
por: Glazer, Neta, et al.
Publicado: (2026)
HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models
por: Zhao, Feiyu, et al.
Publicado: (2026)
por: Zhao, Feiyu, et al.
Publicado: (2026)
EvA: An Evidence-First Audio Understanding Paradigm for LALMs
por: Xie, Xinyuan, et al.
Publicado: (2026)
por: Xie, Xinyuan, et al.
Publicado: (2026)
Audio Mamba: Pretrained Audio State Space Model For Audio Tagging
por: Lin, Jiaju, et al.
Publicado: (2024)
por: Lin, Jiaju, et al.
Publicado: (2024)
The Sonar Moment: Benchmarking Audio-Language Models in Audio Geo-Localization
por: Zhang, Ruixing, et al.
Publicado: (2026)
por: Zhang, Ruixing, et al.
Publicado: (2026)
Rebellion: Noise-Robust Reasoning Training for Audio Reasoning Models
por: Huang, Tiansheng, et al.
Publicado: (2025)
por: Huang, Tiansheng, et al.
Publicado: (2025)
Weakly-supervised Audio Separation via Bi-modal Semantic Similarity
por: Mahmud, Tanvir, et al.
Publicado: (2024)
por: Mahmud, Tanvir, et al.
Publicado: (2024)
SCENEBench: An Audio Understanding Benchmark Grounded in Assistive and Industrial Use Cases
por: Iyer, Laya, et al.
Publicado: (2026)
por: Iyer, Laya, et al.
Publicado: (2026)
VocalParse: Towards Unified and Scalable Singing Voice Transcription with Large Audio Language Models
por: Chen, Yukun, et al.
Publicado: (2026)
por: Chen, Yukun, et al.
Publicado: (2026)
Training-Efficient Text-to-Music Generation with State-Space Modeling
por: Lee, Wei-Jaw, et al.
Publicado: (2026)
por: Lee, Wei-Jaw, et al.
Publicado: (2026)
EchoDistill:Alignment Noisy-to-Clean Self-Distillation for Robust Audio LLMs
por: Lin, Liang, et al.
Publicado: (2026)
por: Lin, Liang, et al.
Publicado: (2026)
MOSS-Audio Technical Report
por: Yang, Chen, et al.
Publicado: (2026)
por: Yang, Chen, et al.
Publicado: (2026)
Codec Does Matter: Exploring the Semantic Shortcoming of Codec for Audio Language Model
por: Ye, Zhen, et al.
Publicado: (2024)
por: Ye, Zhen, et al.
Publicado: (2024)
Evaluation of Audio Language Models for Fairness, Safety, and Security
por: Aloufi, Ranya, et al.
Publicado: (2026)
por: Aloufi, Ranya, et al.
Publicado: (2026)
CALM: Class-Conditional Sparse Attention Vectors for Large Audio-Language Models
por: Mehta, Videet, et al.
Publicado: (2026)
por: Mehta, Videet, et al.
Publicado: (2026)
Generalizable Prompt Tuning for Audio-Language Models via Semantic Expansion
por: Jang, Jaehyuk, et al.
Publicado: (2026)
por: Jang, Jaehyuk, et al.
Publicado: (2026)
AudioGuard: Toward Comprehensive Audio Safety Protection Across Diverse Threat Models
por: Kang, Mintong, et al.
Publicado: (2026)
por: Kang, Mintong, et al.
Publicado: (2026)
PitchBench: Measuring Pitch Hearing in Audio-Language Models
por: Dujardin, Milan Liessens, et al.
Publicado: (2026)
por: Dujardin, Milan Liessens, et al.
Publicado: (2026)
Latent-Mark: An Audio Watermark Robust to Neural Resynthesis
por: Chen, Yen-Shan, et al.
Publicado: (2026)
por: Chen, Yen-Shan, et al.
Publicado: (2026)
UniWhisper: Efficient Continual Multi-task Training for Robust Universal Audio Representation
por: Chen, Yuxuan, et al.
Publicado: (2026)
por: Chen, Yuxuan, et al.
Publicado: (2026)
OWL: Geometry-Aware Spatial Reasoning for Audio Large Language Models
por: Biswas, Subrata, et al.
Publicado: (2025)
por: Biswas, Subrata, et al.
Publicado: (2025)
Do Audio-Visual Large Language Models Really See and Hear?
por: Selvakumar, Ramaneswaran, et al.
Publicado: (2026)
por: Selvakumar, Ramaneswaran, et al.
Publicado: (2026)
Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models
por: Song, Zirui, et al.
Publicado: (2025)
por: Song, Zirui, et al.
Publicado: (2025)
AudioRouter: Data Efficient Audio Understanding via RL based Dual Reasoning
por: Chen, Liyang, et al.
Publicado: (2026)
por: Chen, Liyang, et al.
Publicado: (2026)
AudioMoG: Guiding Audio Generation with Mixture-of-Guidance
por: Wang, Junyou, et al.
Publicado: (2025)
por: Wang, Junyou, et al.
Publicado: (2025)
Representation-Regularized Convolutional Audio Transformer for Audio Understanding
por: Han, Bing, et al.
Publicado: (2026)
por: Han, Bing, et al.
Publicado: (2026)
Extending Audio Context for Long-Form Understanding in Large Audio-Language Models
por: Chaichana, Yuatyong, et al.
Publicado: (2025)
por: Chaichana, Yuatyong, et al.
Publicado: (2025)
Ejemplares similares
-
Adaptive Test-Time Scaling for Zero-Shot Respiratory Audio Classification
por: Wang, Tsai-Ning, et al.
Publicado: (2026) -
CaReAQA: A Cardiac and Respiratory Audio Question Answering Model for Open-Ended Diagnostic Reasoning
por: Wang, Tsai-Ning, et al.
Publicado: (2025) -
Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt
por: Shi, Yanfeng, et al.
Publicado: (2026) -
StethoLM: Audio Language Model for Cardiopulmonary Analysis Across Clinical Tasks
por: Wang, Yishan, et al.
Publicado: (2026) -
RespLLM: Unifying Audio and Text with Multimodal LLMs for Generalized Respiratory Health Prediction
por: Zhang, Yuwei, et al.
Publicado: (2024)