Leveraging Audio and Text Modalities in Mental Health: A Study of LLMs Performance
Fuente:
arXiv
Salvato in:
| Autori principali: | Ali, Abdelrahman A., Fouda, Aya E., Hanafy, Radwa J., Fouda, Mohammed E. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Leveraging Embedding Techniques in Multimodal Machine Learning for Mental Illness Assessment
di: Hassan, Abdelrahaman A., et al.
Pubblicazione: (2025)
di: Hassan, Abdelrahaman A., et al.
Pubblicazione: (2025)
Auffusion: Leveraging the Power of Diffusion and Large Language Models for Text-to-Audio Generation
di: Xue, Jinlong, et al.
Pubblicazione: (2024)
di: Xue, Jinlong, et al.
Pubblicazione: (2024)
PAL: Probing Audio Encoders via LLMs -- Audio Information Transfer into LLMs
di: Alex, Tony, et al.
Pubblicazione: (2025)
di: Alex, Tony, et al.
Pubblicazione: (2025)
All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation
di: Foo, Leonardo Haw-Yang, et al.
Pubblicazione: (2026)
di: Foo, Leonardo Haw-Yang, et al.
Pubblicazione: (2026)
AudioMarathon: A Comprehensive Benchmark for Long-Context Audio Understanding and Efficiency in Audio LLMs
di: He, Peize, et al.
Pubblicazione: (2025)
di: He, Peize, et al.
Pubblicazione: (2025)
MoWE-Audio: Multitask AudioLLMs with Mixture of Weak Encoders
di: Zhang, Wenyu, et al.
Pubblicazione: (2024)
di: Zhang, Wenyu, et al.
Pubblicazione: (2024)
ControlAudio: Tackling Text-Guided, Timing-Indicated and Intelligible Audio Generation via Progressive Diffusion Modeling
di: Jiang, Yuxuan, et al.
Pubblicazione: (2025)
di: Jiang, Yuxuan, et al.
Pubblicazione: (2025)
TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization
di: Hung, Chia-Yu, et al.
Pubblicazione: (2024)
di: Hung, Chia-Yu, et al.
Pubblicazione: (2024)
Domain Adaptation Method and Modality Gap Impact in Audio-Text Models for Prototypical Sound Classification
di: Acevedo, Emiliano, et al.
Pubblicazione: (2025)
di: Acevedo, Emiliano, et al.
Pubblicazione: (2025)
Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music
di: Ghosh, Sreyan, et al.
Pubblicazione: (2026)
di: Ghosh, Sreyan, et al.
Pubblicazione: (2026)
SightSound-R1: Cross-Modal Reasoning Distillation from Vision to Audio Language Models
di: Wang, Qiaolin, et al.
Pubblicazione: (2025)
di: Wang, Qiaolin, et al.
Pubblicazione: (2025)
Diffusion-Link: Diffusion Probabilistic Model for Bridging the Audio-Text Modality Gap
di: Nam, KiHyun, et al.
Pubblicazione: (2025)
di: Nam, KiHyun, et al.
Pubblicazione: (2025)
Leveraging Speech PTM, Text LLM, and Emotional TTS for Speech Emotion Recognition
di: Ma, Ziyang, et al.
Pubblicazione: (2023)
di: Ma, Ziyang, et al.
Pubblicazione: (2023)
Tango 2: Aligning Diffusion-based Text-to-Audio Generations through Direct Preference Optimization
di: Majumder, Navonil, et al.
Pubblicazione: (2024)
di: Majumder, Navonil, et al.
Pubblicazione: (2024)
StreamAtt: Direct Streaming Speech-to-Text Translation with Attention-based Audio History Selection
di: Papi, Sara, et al.
Pubblicazione: (2024)
di: Papi, Sara, et al.
Pubblicazione: (2024)
AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion
di: Zhao, Junqi, et al.
Pubblicazione: (2025)
di: Zhao, Junqi, et al.
Pubblicazione: (2025)
DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
di: Yuan, Yi, et al.
Pubblicazione: (2025)
di: Yuan, Yi, et al.
Pubblicazione: (2025)
COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings
di: Zhu, Yonggang, et al.
Pubblicazione: (2026)
di: Zhu, Yonggang, et al.
Pubblicazione: (2026)
Improving Audio-Visual Speech Recognition by Lip-Subword Correlation Based Visual Pre-training and Cross-Modal Fusion Encoder
di: Dai, Yusheng, et al.
Pubblicazione: (2023)
di: Dai, Yusheng, et al.
Pubblicazione: (2023)
ModalityMirror: Improving Audio Classification in Modality Heterogeneity Federated Learning with Multimodal Distillation
di: Feng, Tiantian, et al.
Pubblicazione: (2024)
di: Feng, Tiantian, et al.
Pubblicazione: (2024)
ParaSpeechCLAP: A Dual-Encoder Speech-Text Model for Rich Stylistic Language-Audio Pretraining
di: Diwan, Anuj, et al.
Pubblicazione: (2026)
di: Diwan, Anuj, et al.
Pubblicazione: (2026)
Expressive Range Characterization of Open Text-to-Audio Models
di: Morse, Jonathan, et al.
Pubblicazione: (2025)
di: Morse, Jonathan, et al.
Pubblicazione: (2025)
EnCLAP: Combining Neural Audio Codec and Audio-Text Joint Embedding for Automated Audio Captioning
di: Kim, Jaeyeon, et al.
Pubblicazione: (2024)
di: Kim, Jaeyeon, et al.
Pubblicazione: (2024)
Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models
di: Goel, Arushi, et al.
Pubblicazione: (2025)
di: Goel, Arushi, et al.
Pubblicazione: (2025)
AudioBERT: Audio Knowledge Augmented Language Model
di: Ok, Hyunjong, et al.
Pubblicazione: (2024)
di: Ok, Hyunjong, et al.
Pubblicazione: (2024)
RespLLM: Unifying Audio and Text with Multimodal LLMs for Generalized Respiratory Health Prediction
di: Zhang, Yuwei, et al.
Pubblicazione: (2024)
di: Zhang, Yuwei, et al.
Pubblicazione: (2024)
A Comprehensive Evaluation of Large Language Models on Mental Illnesses in Arabic Context
di: Zahran, Noureldin, et al.
Pubblicazione: (2025)
di: Zahran, Noureldin, et al.
Pubblicazione: (2025)
Towards Leveraging Contrastively Pretrained Neural Audio Embeddings for Recommender Tasks
di: Grötschla, Florian, et al.
Pubblicazione: (2024)
di: Grötschla, Florian, et al.
Pubblicazione: (2024)
AudioTrust: Benchmarking the Multifaceted Trustworthiness of Audio Large Language Models
di: Li, Kai, et al.
Pubblicazione: (2025)
di: Li, Kai, et al.
Pubblicazione: (2025)
Benchmarking Open-ended Audio Dialogue Understanding for Large Audio-Language Models
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
Extending Audio Context for Long-Form Understanding in Large Audio-Language Models
di: Chaichana, Yuatyong, et al.
Pubblicazione: (2025)
di: Chaichana, Yuatyong, et al.
Pubblicazione: (2025)
In-the-wild Audio Spatialization with Flexible Text-guided Localization
di: Pan, Tianrui, et al.
Pubblicazione: (2025)
di: Pan, Tianrui, et al.
Pubblicazione: (2025)
Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering
di: Li, Gang, et al.
Pubblicazione: (2025)
di: Li, Gang, et al.
Pubblicazione: (2025)
Audio-Conditioned Diffusion LLMs for ASR and Deliberation Processing
di: Wang, Mengqi, et al.
Pubblicazione: (2025)
di: Wang, Mengqi, et al.
Pubblicazione: (2025)
On Barriers to Archival Audio Processing
di: Sullivan, Peter, et al.
Pubblicazione: (2025)
di: Sullivan, Peter, et al.
Pubblicazione: (2025)
When Audio-LLMs Don't Listen: A Cross-Linguistic Study of Modality Arbitration
di: Billa, Jayadev
Pubblicazione: (2026)
di: Billa, Jayadev
Pubblicazione: (2026)
AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities
di: Ghosh, Sreyan, et al.
Pubblicazione: (2024)
di: Ghosh, Sreyan, et al.
Pubblicazione: (2024)
TTMBA: Towards Text To Multiple Sources Binaural Audio Generation
di: He, Yuxuan, et al.
Pubblicazione: (2025)
di: He, Yuxuan, et al.
Pubblicazione: (2025)
Audio Deepfake Detection in the Age of Advanced Text-to-Speech models
di: Singh, Robin, et al.
Pubblicazione: (2026)
di: Singh, Robin, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Leveraging Embedding Techniques in Multimodal Machine Learning for Mental Illness Assessment
di: Hassan, Abdelrahaman A., et al.
Pubblicazione: (2025) -
Auffusion: Leveraging the Power of Diffusion and Large Language Models for Text-to-Audio Generation
di: Xue, Jinlong, et al.
Pubblicazione: (2024) -
PAL: Probing Audio Encoders via LLMs -- Audio Information Transfer into LLMs
di: Alex, Tony, et al.
Pubblicazione: (2025) -
All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation
di: Foo, Leonardo Haw-Yang, et al.
Pubblicazione: (2026) -
AudioMarathon: A Comprehensive Benchmark for Long-Context Audio Understanding and Efficiency in Audio LLMs
di: He, Peize, et al.
Pubblicazione: (2025)