Salvato in:
| Autori principali: | Hong, Javier Si Zhao, Delaya, Timothy Zoe, Kit, Sherwyn Chan Yin, Ng, Pai Chet, Miao, Xiaoxiao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2508.20805 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CLARITY: Contextual Linguistic Adaptation and Accent Retrieval for Dual-Bias Mitigation in Text-to-Speech Generation
di: Poon, Crystal Min Hui, et al.
Pubblicazione: (2025)
di: Poon, Crystal Min Hui, et al.
Pubblicazione: (2025)
Multimodal Magic Elevating Depression Detection with a Fusion of Text and Audio Intelligence
di: Gan, Lindy, et al.
Pubblicazione: (2025)
di: Gan, Lindy, et al.
Pubblicazione: (2025)
A Benchmark for Multi-speaker Anonymization
di: Miao, Xiaoxiao, et al.
Pubblicazione: (2024)
di: Miao, Xiaoxiao, et al.
Pubblicazione: (2024)
SpeechGuard: Exploring the Adversarial Robustness of Multimodal Large Language Models
di: Peri, Raghuveer, et al.
Pubblicazione: (2024)
di: Peri, Raghuveer, et al.
Pubblicazione: (2024)
Hierarchical Self-Supervised Representation Learning for Depression Detection from Speech
di: Li, Yuxin, et al.
Pubblicazione: (2025)
di: Li, Yuxin, et al.
Pubblicazione: (2025)
Exploring the Potential of Large Multimodal Models as Effective Alternatives for Pronunciation Assessment
di: Wang, Ke, et al.
Pubblicazione: (2025)
di: Wang, Ke, et al.
Pubblicazione: (2025)
DAST: A Dual-Stream Voice Anonymization Attacker with Staged Training
di: Arefeen, Ridwan, et al.
Pubblicazione: (2026)
di: Arefeen, Ridwan, et al.
Pubblicazione: (2026)
A Multi-Probe Audit of Clinical-Interview Depression Detection Benchmarks
di: Ishikawa, Takehiro, et al.
Pubblicazione: (2026)
di: Ishikawa, Takehiro, et al.
Pubblicazione: (2026)
Melody or Machine: Detecting Synthetic Music with Dual-Stream Contrastive Learning
di: Batra, Arnesh, et al.
Pubblicazione: (2025)
di: Batra, Arnesh, et al.
Pubblicazione: (2025)
MMFformer: Multimodal Fusion Transformer Network for Depression Detection
di: Haque, Md Rezwanul, et al.
Pubblicazione: (2025)
di: Haque, Md Rezwanul, et al.
Pubblicazione: (2025)
Exploring Speech Pattern Disorders in Autism using Machine Learning
di: Hu, Chuanbo, et al.
Pubblicazione: (2024)
di: Hu, Chuanbo, et al.
Pubblicazione: (2024)
Emotional Dimension Control in Language Model-Based Text-to-Speech: Spanning a Broad Spectrum of Human Emotions
di: Zhou, Kun, et al.
Pubblicazione: (2024)
di: Zhou, Kun, et al.
Pubblicazione: (2024)
Thinking with Sound: Audio Chain-of-Thought Enables Multimodal Reasoning in Large Audio-Language Models
di: Xiong, Zhen, et al.
Pubblicazione: (2025)
di: Xiong, Zhen, et al.
Pubblicazione: (2025)
EMMeTT: Efficient Multimodal Machine Translation Training
di: Żelasko, Piotr, et al.
Pubblicazione: (2024)
di: Żelasko, Piotr, et al.
Pubblicazione: (2024)
Exploring Gender Bias in Alzheimer's Disease Detection: Insights from Mandarin and Greek Speech Perception
di: He, Liu, et al.
Pubblicazione: (2025)
di: He, Liu, et al.
Pubblicazione: (2025)
Leveraging Large Language Models for Spontaneous Speech-Based Suicide Risk Detection
di: Gao, Yifan, et al.
Pubblicazione: (2025)
di: Gao, Yifan, et al.
Pubblicazione: (2025)
Toward Corpus Size Requirements for Training and Evaluating Depression Risk Models Using Spoken Language
di: Rutowski, Tomek, et al.
Pubblicazione: (2024)
di: Rutowski, Tomek, et al.
Pubblicazione: (2024)
DementiaBank-Emotion: A Multi-Rater Emotion Annotation Corpus for Alzheimer's Disease Speech (Version 1.0)
di: Jeong, Cheonkam, et al.
Pubblicazione: (2026)
di: Jeong, Cheonkam, et al.
Pubblicazione: (2026)
Few-Shot Contrastive Adaptation for Audio Abuse Detection in Low-Resource Indic Languages
di: Sankaran, Aditya Narayan, et al.
Pubblicazione: (2026)
di: Sankaran, Aditya Narayan, et al.
Pubblicazione: (2026)
The Third VoicePrivacy Challenge: Preserving Emotional Expressiveness and Linguistic Content in Voice Anonymization
di: Tomashenko, Natalia, et al.
Pubblicazione: (2026)
di: Tomashenko, Natalia, et al.
Pubblicazione: (2026)
SegReConcat: A Data Augmentation Method for Voice Anonymization Attack
di: Arefeen, Ridwan, et al.
Pubblicazione: (2025)
di: Arefeen, Ridwan, et al.
Pubblicazione: (2025)
Training Dynamics-Aware Multi-Factor Curriculum Learning for Target Speaker Extraction
di: Liu, Yun, et al.
Pubblicazione: (2026)
di: Liu, Yun, et al.
Pubblicazione: (2026)
Noise Supervised Contrastive Learning and Feature-Perturbed for Anomalous Sound Detection
di: Huang, Shun, et al.
Pubblicazione: (2025)
di: Huang, Shun, et al.
Pubblicazione: (2025)
SLAM-LLM: A Modular, Open-Source Multimodal Large Language Model Framework and Best Practice for Speech, Language, Audio and Music Processing
di: Ma, Ziyang, et al.
Pubblicazione: (2026)
di: Ma, Ziyang, et al.
Pubblicazione: (2026)
Phonetic Enhanced Language Modeling for Text-to-Speech Synthesis
di: Zhou, Kun, et al.
Pubblicazione: (2024)
di: Zhou, Kun, et al.
Pubblicazione: (2024)
Toward Multimodal Industrial Fault Analysis: A Single-Speed Chain Conveyor Dataset with Audio and Vibration Signals
di: Chen, Zhang, et al.
Pubblicazione: (2026)
di: Chen, Zhang, et al.
Pubblicazione: (2026)
Missingness-resilient Video-enhanced Multimodal Disfluency Detection
di: Mohapatra, Payal, et al.
Pubblicazione: (2024)
di: Mohapatra, Payal, et al.
Pubblicazione: (2024)
Efficient Training for Cross-lingual Speech Language Models
di: Zhou, Yan, et al.
Pubblicazione: (2026)
di: Zhou, Yan, et al.
Pubblicazione: (2026)
CLAIR-A: Leveraging Large Language Models to Judge Audio Captions
di: Wu, Tsung-Han, et al.
Pubblicazione: (2024)
di: Wu, Tsung-Han, et al.
Pubblicazione: (2024)
Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval
di: Yoo, HaeJun, et al.
Pubblicazione: (2026)
di: Yoo, HaeJun, et al.
Pubblicazione: (2026)
Bemba Speech Translation: Exploring a Low-Resource African Language
di: Farouq, Muhammad Hazim Al, et al.
Pubblicazione: (2025)
di: Farouq, Muhammad Hazim Al, et al.
Pubblicazione: (2025)
Exploring the Impact of Data Quantity on ASR in Extremely Low-resource Languages
di: Cheng, Yao-Fei, et al.
Pubblicazione: (2024)
di: Cheng, Yao-Fei, et al.
Pubblicazione: (2024)
DIFFA-2: A Practical Diffusion Large Language Model for General Audio Understanding
di: Zhou, Jiaming, et al.
Pubblicazione: (2026)
di: Zhou, Jiaming, et al.
Pubblicazione: (2026)
Words at Play: Benchmarking Audio Pun Understanding in Large Audio-Language Models
di: Su, Yuchen, et al.
Pubblicazione: (2026)
di: Su, Yuchen, et al.
Pubblicazione: (2026)
HarmoniFuse: A Component-Selective and Prompt-Adaptive Framework for Multi-Task Speech Language Modeling
di: Si, Yuke, et al.
Pubblicazione: (2025)
di: Si, Yuke, et al.
Pubblicazione: (2025)
VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents
di: Hu, Jiliang, et al.
Pubblicazione: (2025)
di: Hu, Jiliang, et al.
Pubblicazione: (2025)
CLaMP 2: Multimodal Music Information Retrieval Across 101 Languages Using Large Language Models
di: Wu, Shangda, et al.
Pubblicazione: (2024)
di: Wu, Shangda, et al.
Pubblicazione: (2024)
LastResort at SemEval-2024 Task 3: Exploring Multimodal Emotion Cause Pair Extraction as Sequence Labelling Task
di: Mathur, Suyash Vardhan, et al.
Pubblicazione: (2024)
di: Mathur, Suyash Vardhan, et al.
Pubblicazione: (2024)
Multimodal Input Aids a Bayesian Model of Phonetic Learning
di: Zhi, Sophia, et al.
Pubblicazione: (2024)
di: Zhi, Sophia, et al.
Pubblicazione: (2024)
Personality-Enhanced Multimodal Depression Detection in the Elderly
di: Wang, Honghong, et al.
Pubblicazione: (2025)
di: Wang, Honghong, et al.
Pubblicazione: (2025)
Documenti analoghi
-
CLARITY: Contextual Linguistic Adaptation and Accent Retrieval for Dual-Bias Mitigation in Text-to-Speech Generation
di: Poon, Crystal Min Hui, et al.
Pubblicazione: (2025) -
Multimodal Magic Elevating Depression Detection with a Fusion of Text and Audio Intelligence
di: Gan, Lindy, et al.
Pubblicazione: (2025) -
A Benchmark for Multi-speaker Anonymization
di: Miao, Xiaoxiao, et al.
Pubblicazione: (2024) -
SpeechGuard: Exploring the Adversarial Robustness of Multimodal Large Language Models
di: Peri, Raghuveer, et al.
Pubblicazione: (2024) -
Hierarchical Self-Supervised Representation Learning for Depression Detection from Speech
di: Li, Yuxin, et al.
Pubblicazione: (2025)