How Far Do SSL Speech Models Listen for Tone? Temporal Focus of Tone Representation under Low-resource Transfer
Fuente:
arXiv
Salvato in:
| Autori principali: | Kim, Minu, Um, Ji Sub, Kim, Hoirin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Scaling Self-Supervised Speech Models Uncovers Deep Linguistic Relationships: Evidence from the Pacific Cluster
di: Kim, Minu, et al.
Pubblicazione: (2026)
di: Kim, Minu, et al.
Pubblicazione: (2026)
STaR: Distilling Speech Temporal Relation for Lightweight Speech Self-Supervised Learning Models
di: Jang, Kangwook, et al.
Pubblicazione: (2023)
di: Jang, Kangwook, et al.
Pubblicazione: (2023)
Do Discrete Self-Supervised Representations of Speech Capture Tone Distinctions?
di: Osakuade, Opeyemi, et al.
Pubblicazione: (2024)
di: Osakuade, Opeyemi, et al.
Pubblicazione: (2024)
Improving Cross-Lingual Phonetic Representation of Low-Resource Languages Through Language Similarity Analysis
di: Kim, Minu, et al.
Pubblicazione: (2025)
di: Kim, Minu, et al.
Pubblicazione: (2025)
Tone recognition in low-resource languages of North-East India: peeling the layers of SSL-based speech models
di: Gogoi, Parismita, et al.
Pubblicazione: (2025)
di: Gogoi, Parismita, et al.
Pubblicazione: (2025)
Learning Video Temporal Dynamics with Cross-Modal Attention for Robust Audio-Visual Speech Recognition
di: Kim, Sungnyun, et al.
Pubblicazione: (2024)
di: Kim, Sungnyun, et al.
Pubblicazione: (2024)
ParaNoise-SV: Integrated Approach for Noise-Robust Speaker Verification with Parallel Joint Learning of Speech Enhancement and Noise Extraction
di: Kim, Minu, et al.
Pubblicazione: (2025)
di: Kim, Minu, et al.
Pubblicazione: (2025)
ToneUnit: A Speech Discretization Approach for Tonal Language Speech Synthesis
di: Tao, Dehua, et al.
Pubblicazione: (2024)
di: Tao, Dehua, et al.
Pubblicazione: (2024)
HuBERT-VIC: Improving Noise-Robust Automatic Speech Recognition of Speech Foundation Model via Variance-Invariance-Covariance Regularization
di: Ahn, Hyebin, et al.
Pubblicazione: (2025)
di: Ahn, Hyebin, et al.
Pubblicazione: (2025)
Two Heads Are Better Than One: Audio-Visual Speech Error Correction with Dual Hypotheses
di: Kim, Sungnyun, et al.
Pubblicazione: (2025)
di: Kim, Sungnyun, et al.
Pubblicazione: (2025)
ToxicTone: A Mandarin Audio Dataset Annotated for Toxicity and Toxic Utterance Tonality
di: Luo, Yu-Xiang, et al.
Pubblicazione: (2025)
di: Luo, Yu-Xiang, et al.
Pubblicazione: (2025)
Towards Prosodically Informed Mizo TTS without Explicit Tone Markings
di: Mohanta, Abhijit, et al.
Pubblicazione: (2026)
di: Mohanta, Abhijit, et al.
Pubblicazione: (2026)
SPEAR: A Unified SSL Framework for Learning Speech and Audio Representations
di: Yang, Xiaoyu, et al.
Pubblicazione: (2025)
di: Yang, Xiaoyu, et al.
Pubblicazione: (2025)
UniEnc-CASSNAT: An Encoder-only Non-autoregressive ASR for Speech SSL Models
di: Fan, Ruchao, et al.
Pubblicazione: (2024)
di: Fan, Ruchao, et al.
Pubblicazione: (2024)
Exploring SSL Discrete Speech Features for Zipformer-based Contextual ASR
di: Cui, Mingyu, et al.
Pubblicazione: (2024)
di: Cui, Mingyu, et al.
Pubblicazione: (2024)
SpeechMLC: Speech Multi-label Classification
di: Kim, Miseul, et al.
Pubblicazione: (2025)
di: Kim, Miseul, et al.
Pubblicazione: (2025)
Non-Causal to Causal SSL-Supported Transfer Learning: Towards a High-Performance Low-Latency Speech Vocoder
di: Shi, Renzheng, et al.
Pubblicazione: (2024)
di: Shi, Renzheng, et al.
Pubblicazione: (2024)
UniCoM: A Universal Code-Switching Speech Generator
di: Lee, Sangmin, et al.
Pubblicazione: (2025)
di: Lee, Sangmin, et al.
Pubblicazione: (2025)
k2SSL: A Faster and Better Framework for Self-Supervised Speech Representation Learning
di: Yang, Yifan, et al.
Pubblicazione: (2024)
di: Yang, Yifan, et al.
Pubblicazione: (2024)
An Initial Investigation of Language Adaptation for TTS Systems under Low-resource Scenarios
di: Gong, Cheng, et al.
Pubblicazione: (2024)
di: Gong, Cheng, et al.
Pubblicazione: (2024)
Leveraging Real Electric Guitar Tones and Effects to Improve Robustness in Guitar Tablature Transcription Modeling
di: Pedroza, Hegel, et al.
Pubblicazione: (2024)
di: Pedroza, Hegel, et al.
Pubblicazione: (2024)
Zero-resource Speech Translation and Recognition with LLMs
di: Mundnich, Karel, et al.
Pubblicazione: (2024)
di: Mundnich, Karel, et al.
Pubblicazione: (2024)
One-Class Learning with Adaptive Centroid Shift for Audio Deepfake Detection
di: Kim, Hyun Myung, et al.
Pubblicazione: (2024)
di: Kim, Hyun Myung, et al.
Pubblicazione: (2024)
Meta-PerSER: Few-Shot Listener Personalized Speech Emotion Recognition via Meta-learning
di: Shen, Liang-Yeh, et al.
Pubblicazione: (2025)
di: Shen, Liang-Yeh, et al.
Pubblicazione: (2025)
MiLorE-SSL: Scaling Multilingual Capabilities in Self-Supervised Models without Forgetting
di: Xu, Jing, et al.
Pubblicazione: (2026)
di: Xu, Jing, et al.
Pubblicazione: (2026)
Beyond IVR Touch-Tones: Customer Intent Routing using LLMs
di: Rojas-Galeano, Sergio
Pubblicazione: (2025)
di: Rojas-Galeano, Sergio
Pubblicazione: (2025)
Entropy-based Coarse and Compressed Semantic Speech Representation Learning
di: Zuo, Jialong, et al.
Pubblicazione: (2025)
di: Zuo, Jialong, et al.
Pubblicazione: (2025)
Can Speech LLMs Think while Listening?
di: Shih, Yi-Jen, et al.
Pubblicazione: (2025)
di: Shih, Yi-Jen, et al.
Pubblicazione: (2025)
Towards Generalizability to Tone and Content Variations in the Transcription of Amplifier Rendered Electric Guitar Audio
di: Chen, Yu-Hua, et al.
Pubblicazione: (2025)
di: Chen, Yu-Hua, et al.
Pubblicazione: (2025)
Enhancing Dialogue Speech Recognition with Robust Contextual Awareness via Noise Representation Learning
di: Lee, Wonjun, et al.
Pubblicazione: (2024)
di: Lee, Wonjun, et al.
Pubblicazione: (2024)
Textless Unit-to-Unit training for Many-to-Many Multilingual Speech-to-Speech Translation
di: Kim, Minsu, et al.
Pubblicazione: (2023)
di: Kim, Minsu, et al.
Pubblicazione: (2023)
Frequency-Modulated and Single-Tone Excitation to Reveal Vibro-Acoustic Nonlinearities in Loosened Bolted Joints
di: Kullukcu, Berkay, et al.
Pubblicazione: (2026)
di: Kullukcu, Berkay, et al.
Pubblicazione: (2026)
What Do Speech Foundation Models Not Learn About Speech?
di: Waheed, Abdul, et al.
Pubblicazione: (2024)
di: Waheed, Abdul, et al.
Pubblicazione: (2024)
Emphasis Sensitivity in Speech Representations
di: Cassini, Shaun, et al.
Pubblicazione: (2025)
di: Cassini, Shaun, et al.
Pubblicazione: (2025)
ELF: Encoding Speaker-Specific Latent Speech Feature for Speech Synthesis
di: Kong, Jungil, et al.
Pubblicazione: (2023)
di: Kong, Jungil, et al.
Pubblicazione: (2023)
Exploring SSL Discrete Tokens for Multilingual ASR
di: Cui, Mingyu, et al.
Pubblicazione: (2024)
di: Cui, Mingyu, et al.
Pubblicazione: (2024)
Linguistic Knowledge Transfer Learning for Speech Enhancement
di: Hung, Kuo-Hsuan, et al.
Pubblicazione: (2025)
di: Hung, Kuo-Hsuan, et al.
Pubblicazione: (2025)
HuBERT-EE: Early Exiting HuBERT for Efficient Speech Recognition
di: Yoon, Ji Won, et al.
Pubblicazione: (2022)
di: Yoon, Ji Won, et al.
Pubblicazione: (2022)
Gated Low-rank Adaptation for personalized Code-Switching Automatic Speech Recognition on the low-spec devices
di: Kim, Gwantae, et al.
Pubblicazione: (2024)
di: Kim, Gwantae, et al.
Pubblicazione: (2024)
Lamer-SSL: Layer-aware Mixture of LoRA Experts for Continual Multilingual Expansion of Self-supervised Models without Forgetting
di: Xu, Jing, et al.
Pubblicazione: (2026)
di: Xu, Jing, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Scaling Self-Supervised Speech Models Uncovers Deep Linguistic Relationships: Evidence from the Pacific Cluster
di: Kim, Minu, et al.
Pubblicazione: (2026) -
STaR: Distilling Speech Temporal Relation for Lightweight Speech Self-Supervised Learning Models
di: Jang, Kangwook, et al.
Pubblicazione: (2023) -
Do Discrete Self-Supervised Representations of Speech Capture Tone Distinctions?
di: Osakuade, Opeyemi, et al.
Pubblicazione: (2024) -
Improving Cross-Lingual Phonetic Representation of Low-Resource Languages Through Language Similarity Analysis
di: Kim, Minu, et al.
Pubblicazione: (2025) -
Tone recognition in low-resource languages of North-East India: peeling the layers of SSL-based speech models
di: Gogoi, Parismita, et al.
Pubblicazione: (2025)