Quantifying Cross-Lingual Transfer in Paralinguistic Speech Tasks
Fuente:
arXiv
Salvato in:
| Autori principali: | Buitrago, Pol, Pareras, Oriol, Costa, Federico, Hernando, Javier |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Bootstrapping Audiovisual Speech Recognition in Zero-AV-Resource Scenarios with Synthetic Visual Data
di: Buitrago, Pol, et al.
Pubblicazione: (2026)
di: Buitrago, Pol, et al.
Pubblicazione: (2026)
Speech-to-Text Translation with Phoneme-Augmented CoT: Enhancing Cross-Lingual Transfer in Low-Resource Scenarios
di: Gállego, Gerard I., et al.
Pubblicazione: (2025)
di: Gállego, Gerard I., et al.
Pubblicazione: (2025)
S2S-Arena: Evaluating Paralinguistic Instruction Following in Speech-to-Speech Models
di: Jiang, Feng, et al.
Pubblicazione: (2025)
di: Jiang, Feng, et al.
Pubblicazione: (2025)
Are Paralinguistic Representations all that is needed for Speech Emotion Recognition?
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
Improved Cross-Lingual Transfer Learning For Automatic Speech Translation
di: Khurana, Sameer, et al.
Pubblicazione: (2023)
di: Khurana, Sameer, et al.
Pubblicazione: (2023)
One Voice, Many Tongues: Cross-Lingual Voice Cloning for Scientific Speech
di: Abebe, Amanuel Gizachew, et al.
Pubblicazione: (2026)
di: Abebe, Amanuel Gizachew, et al.
Pubblicazione: (2026)
Frozen Large Language Models Can Perceive Paralinguistic Aspects of Speech
di: Kang, Wonjune, et al.
Pubblicazione: (2024)
di: Kang, Wonjune, et al.
Pubblicazione: (2024)
Paralinguistics-Aware Speech-Empowered Large Language Models for Natural Conversation
di: Kim, Heeseung, et al.
Pubblicazione: (2024)
di: Kim, Heeseung, et al.
Pubblicazione: (2024)
Towards Quantifying and Reducing Language Mismatch Effects in Cross-Lingual Speech Anti-Spoofing
di: Liu, Tianchi, et al.
Pubblicazione: (2024)
di: Liu, Tianchi, et al.
Pubblicazione: (2024)
On the Use of Audio to Improve Dialogue Policies
di: Roncel, Daniel, et al.
Pubblicazione: (2024)
di: Roncel, Daniel, et al.
Pubblicazione: (2024)
Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models
di: Wang, Qiongqiong, et al.
Pubblicazione: (2025)
di: Wang, Qiongqiong, et al.
Pubblicazione: (2025)
MIKU-PAL: An Automated and Standardized Multi-Modal Method for Speech Paralinguistic and Affect Labeling
di: Cheng, Yifan, et al.
Pubblicazione: (2025)
di: Cheng, Yifan, et al.
Pubblicazione: (2025)
Paralinguistics-Enhanced Large Language Modeling of Spoken Dialogue
di: Lin, Guan-Ting, et al.
Pubblicazione: (2023)
di: Lin, Guan-Ting, et al.
Pubblicazione: (2023)
Leveraging Parameter-Efficient Transfer Learning for Multi-Lingual Text-to-Speech Adaptation
di: Li, Yingting, et al.
Pubblicazione: (2024)
di: Li, Yingting, et al.
Pubblicazione: (2024)
XLAVS-R: Cross-Lingual Audio-Visual Speech Representation Learning for Noise-Robust Speech Perception
di: Han, HyoJung, et al.
Pubblicazione: (2024)
di: Han, HyoJung, et al.
Pubblicazione: (2024)
Cross-Lingual Multi-Granularity Framework for Interpretable Parkinson's Disease Diagnosis from Speech
di: Tougui, Ilias, et al.
Pubblicazione: (2025)
di: Tougui, Ilias, et al.
Pubblicazione: (2025)
SynParaSpeech: Automated Synthesis of Paralinguistic Datasets for Speech Generation and Understanding
di: Bai, Bingsong, et al.
Pubblicazione: (2025)
di: Bai, Bingsong, et al.
Pubblicazione: (2025)
Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information
di: Sanders, Nicholas, et al.
Pubblicazione: (2025)
di: Sanders, Nicholas, et al.
Pubblicazione: (2025)
Efficient ASR for Low-Resource Languages: Leveraging Cross-Lingual Unlabeled Data
di: Bandarupalli, Srihari, et al.
Pubblicazione: (2025)
di: Bandarupalli, Srihari, et al.
Pubblicazione: (2025)
Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation
di: Wang, Qiongqiong, et al.
Pubblicazione: (2025)
di: Wang, Qiongqiong, et al.
Pubblicazione: (2025)
Speech-IFEval: Evaluating Instruction-Following and Quantifying Catastrophic Forgetting in Speech-Aware Language Models
di: Lu, Ke-Han, et al.
Pubblicazione: (2025)
di: Lu, Ke-Han, et al.
Pubblicazione: (2025)
Description-based Controllable Text-to-Speech with Cross-Lingual Voice Control
di: Yamamoto, Ryuichi, et al.
Pubblicazione: (2024)
di: Yamamoto, Ryuichi, et al.
Pubblicazione: (2024)
Resurfacing Paralinguistic Awareness in Large Audio Language Models
di: Yang, Hao, et al.
Pubblicazione: (2026)
di: Yang, Hao, et al.
Pubblicazione: (2026)
Linguistic Knowledge Transfer Learning for Speech Enhancement
di: Hung, Kuo-Hsuan, et al.
Pubblicazione: (2025)
di: Hung, Kuo-Hsuan, et al.
Pubblicazione: (2025)
Optimizing ASR for Catalan-Spanish Code-Switching: A Comparative Analysis of Methodologies
di: Mena, Carlos, et al.
Pubblicazione: (2025)
di: Mena, Carlos, et al.
Pubblicazione: (2025)
ART: The Alternating Reading Task Corpus for Speech Entrainment and Imitation
di: Yuan, Zheng, et al.
Pubblicazione: (2024)
di: Yuan, Zheng, et al.
Pubblicazione: (2024)
Rethinking Cross-Corpus Speech Emotion Recognition Benchmarking: Are Paralinguistic Pre-Trained Representations Sufficient?
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2025)
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2025)
S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models
di: Fang, Yuanbo, et al.
Pubblicazione: (2025)
di: Fang, Yuanbo, et al.
Pubblicazione: (2025)
The Voice Behind the Words: Quantifying Intersectional Bias in SpeechLLMs
di: Satish, Shree Harsha Bokkahalli, et al.
Pubblicazione: (2026)
di: Satish, Shree Harsha Bokkahalli, et al.
Pubblicazione: (2026)
Double Multi-Head Attention Multimodal System for Odyssey 2024 Speech Emotion Recognition Challenge
di: Costa, Federico, et al.
Pubblicazione: (2024)
di: Costa, Federico, et al.
Pubblicazione: (2024)
Attempt Towards Stress Transfer in Speech-to-Speech Machine Translation
di: Akarsh, Sai, et al.
Pubblicazione: (2024)
di: Akarsh, Sai, et al.
Pubblicazione: (2024)
Towards Machine Unlearning for Paralinguistic Speech Processing
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2025)
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2025)
Pseudo2Real: Task Arithmetic for Pseudo-Label Correction in Automatic Speech Recognition
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2025)
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2025)
How Attention Shapes Emotion: A Comparative Study of Attention Mechanisms for Speech Emotion Recognition
di: Casals-Salvador, Marc, et al.
Pubblicazione: (2026)
di: Casals-Salvador, Marc, et al.
Pubblicazione: (2026)
Sentence-wise Speech Summarization: Task, Datasets, and End-to-End Modeling with LM Knowledge Distillation
di: Matsuura, Kohei, et al.
Pubblicazione: (2024)
di: Matsuura, Kohei, et al.
Pubblicazione: (2024)
Lost in Transcription: Identifying and Quantifying the Accuracy Biases of Automatic Speech Recognition Systems Against Disfluent Speech
di: Mujtaba, Dena, et al.
Pubblicazione: (2024)
di: Mujtaba, Dena, et al.
Pubblicazione: (2024)
EmphAssess : a Prosodic Benchmark on Assessing Emphasis Transfer in Speech-to-Speech Models
di: de Seyssel, Maureen, et al.
Pubblicazione: (2023)
di: de Seyssel, Maureen, et al.
Pubblicazione: (2023)
Speech-Based Depression Prediction Using Encoder-Weight-Only Transfer Learning and a Large Corpus
di: Harati, Amir, et al.
Pubblicazione: (2024)
di: Harati, Amir, et al.
Pubblicazione: (2024)
UrduSpeech: A 156-Hour Urdu Speech Corpus with 12-Dimension Paralinguistic Annotations
di: Haq, Attia Nafees ul, et al.
Pubblicazione: (2026)
di: Haq, Attia Nafees ul, et al.
Pubblicazione: (2026)
Task-Agnostic Structured Pruning of Speech Representation Models
di: Wang, Haoyu, et al.
Pubblicazione: (2023)
di: Wang, Haoyu, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Bootstrapping Audiovisual Speech Recognition in Zero-AV-Resource Scenarios with Synthetic Visual Data
di: Buitrago, Pol, et al.
Pubblicazione: (2026) -
Speech-to-Text Translation with Phoneme-Augmented CoT: Enhancing Cross-Lingual Transfer in Low-Resource Scenarios
di: Gállego, Gerard I., et al.
Pubblicazione: (2025) -
S2S-Arena: Evaluating Paralinguistic Instruction Following in Speech-to-Speech Models
di: Jiang, Feng, et al.
Pubblicazione: (2025) -
Are Paralinguistic Representations all that is needed for Speech Emotion Recognition?
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024) -
Improved Cross-Lingual Transfer Learning For Automatic Speech Translation
di: Khurana, Sameer, et al.
Pubblicazione: (2023)