[b]=[d]-[t]+[p]: Self-supervised Speech Models Discover Phonological Vector Arithmetic
Fuente:
arXiv
Salvato in:
| Autori principali: | Choi, Kwanghee, Yeo, Eunjung, Cho, Cheol Jun, Harwath, David, Mortensen, David R. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Self-Supervised Speech Models Encode Phonetic Context via Position-dependent Orthogonal Subspaces
di: Choi, Kwanghee, et al.
Pubblicazione: (2026)
di: Choi, Kwanghee, et al.
Pubblicazione: (2026)
Applications of Artificial Intelligence for Cross-language Intelligibility Assessment of Dysarthric Speech
di: Yeo, Eunjung, et al.
Pubblicazione: (2025)
di: Yeo, Eunjung, et al.
Pubblicazione: (2025)
Multilingual Dysarthric Speech Assessment Using Universal Phone Recognition and Language-Specific Phonemic Contrast Modeling
di: Yeo, Eunjung, et al.
Pubblicazione: (2026)
di: Yeo, Eunjung, et al.
Pubblicazione: (2026)
Voice Biomarker Analysis and Automated Severity Classification of Dysarthric Speech in a Multilingual Context
di: Yeo, Eunjung
Pubblicazione: (2024)
di: Yeo, Eunjung
Pubblicazione: (2024)
Adapting Self-Supervised Speech Representations for Cross-lingual Dysarthria Detection in Parkinson's Disease
di: Hernandez, Abner, et al.
Pubblicazione: (2026)
di: Hernandez, Abner, et al.
Pubblicazione: (2026)
Interface Design for Self-Supervised Speech Models
di: Shih, Yi-Jen, et al.
Pubblicazione: (2024)
di: Shih, Yi-Jen, et al.
Pubblicazione: (2024)
An Empirical Recipe for Universal Phone Recognition
di: Bharadwaj, Shikhar, et al.
Pubblicazione: (2026)
di: Bharadwaj, Shikhar, et al.
Pubblicazione: (2026)
Towards Inclusive ASR: Investigating Voice Conversion for Dysarthric Speech Recognition in Low-Resource Languages
di: Li, Chin-Jou, et al.
Pubblicazione: (2025)
di: Li, Chin-Jou, et al.
Pubblicazione: (2025)
Prosodic ABX: A Language-Agnostic Method for Measuring Prosodic Contrast in Speech Representations
di: Sun, Haitong, et al.
Pubblicazione: (2026)
di: Sun, Haitong, et al.
Pubblicazione: (2026)
Self-supervised Speech Models for Word-Level Stuttered Speech Detection
di: Shih, Yi-Jen, et al.
Pubblicazione: (2024)
di: Shih, Yi-Jen, et al.
Pubblicazione: (2024)
Leveraging Allophony in Self-Supervised Speech Models for Atypical Pronunciation Assessment
di: Choi, Kwanghee, et al.
Pubblicazione: (2025)
di: Choi, Kwanghee, et al.
Pubblicazione: (2025)
ParaSpeechCLAP: A Dual-Encoder Speech-Text Model for Rich Stylistic Language-Audio Pretraining
di: Diwan, Anuj, et al.
Pubblicazione: (2026)
di: Diwan, Anuj, et al.
Pubblicazione: (2026)
Self-supervised Speech Representations Still Struggle with African American Vernacular English
di: Chang, Kalvin, et al.
Pubblicazione: (2024)
di: Chang, Kalvin, et al.
Pubblicazione: (2024)
SpeechCLIP+: Self-supervised multi-task representation learning for speech via CLIP and speech-image data
di: Wang, Hsuan-Fu, et al.
Pubblicazione: (2024)
di: Wang, Hsuan-Fu, et al.
Pubblicazione: (2024)
Probing the Robustness Properties of Neural Speech Codecs
di: Tseng, Wei-Cheng, et al.
Pubblicazione: (2025)
di: Tseng, Wei-Cheng, et al.
Pubblicazione: (2025)
POWSM: A Phonetic Open Whisper-Style Speech Foundation Model
di: Li, Chin-Jou, et al.
Pubblicazione: (2025)
di: Li, Chin-Jou, et al.
Pubblicazione: (2025)
Probing for Phonology in Self-Supervised Speech Representations: A Case Study on Accent Perception
di: Venkateswaran, Nitin, et al.
Pubblicazione: (2025)
di: Venkateswaran, Nitin, et al.
Pubblicazione: (2025)
On the Effects of Heterogeneous Data Sources on Speech-to-Text Foundation Models
di: Tian, Jinchuan, et al.
Pubblicazione: (2024)
di: Tian, Jinchuan, et al.
Pubblicazione: (2024)
VoiceCraft-X: Unifying Multilingual, Voice-Cloning Speech Synthesis and Speech Editing
di: Zheng, Zhisheng, et al.
Pubblicazione: (2025)
di: Zheng, Zhisheng, et al.
Pubblicazione: (2025)
Scaling Rich Style-Prompted Text-to-Speech Datasets
di: Diwan, Anuj, et al.
Pubblicazione: (2025)
di: Diwan, Anuj, et al.
Pubblicazione: (2025)
Position-invariant Fine-tuning of Speech Enhancement Models with Self-supervised Speech Representations
di: Meghanani, Amit, et al.
Pubblicazione: (2026)
di: Meghanani, Amit, et al.
Pubblicazione: (2026)
Sylber: Syllabic Embedding Representation of Speech from Raw Audio
di: Cho, Cheol Jun, et al.
Pubblicazione: (2024)
di: Cho, Cheol Jun, et al.
Pubblicazione: (2024)
CS-FLEURS: A Massively Multilingual and Code-Switched Speech Dataset
di: Yan, Brian, et al.
Pubblicazione: (2025)
di: Yan, Brian, et al.
Pubblicazione: (2025)
Benchmarking Children's ASR with Supervised and Self-supervised Speech Foundation Models
di: Fan, Ruchao, et al.
Pubblicazione: (2024)
di: Fan, Ruchao, et al.
Pubblicazione: (2024)
SSHR: Leveraging Self-supervised Hierarchical Representations for Multilingual Automatic Speech Recognition
di: Xue, Hongfei, et al.
Pubblicazione: (2023)
di: Xue, Hongfei, et al.
Pubblicazione: (2023)
LASER: Learning by Aligning Self-supervised Representations of Speech for Improving Content-related Tasks
di: Meghanani, Amit, et al.
Pubblicazione: (2024)
di: Meghanani, Amit, et al.
Pubblicazione: (2024)
Revisiting Self-supervised Learning of Speech Representation from a Mutual Information Perspective
di: Liu, Alexander H., et al.
Pubblicazione: (2024)
di: Liu, Alexander H., et al.
Pubblicazione: (2024)
Improving Acoustic Word Embeddings through Correspondence Training of Self-supervised Speech Representations
di: Meghanani, Amit, et al.
Pubblicazione: (2024)
di: Meghanani, Amit, et al.
Pubblicazione: (2024)
Enhancing Few-shot Keyword Spotting Performance through Pre-Trained Self-supervised Speech Models
di: Gok, Alican, et al.
Pubblicazione: (2025)
di: Gok, Alican, et al.
Pubblicazione: (2025)
On-device Streaming Discrete Speech Units
di: Choi, Kwanghee, et al.
Pubblicazione: (2025)
di: Choi, Kwanghee, et al.
Pubblicazione: (2025)
Coding Speech through Vocal Tract Kinematics
di: Cho, Cheol Jun, et al.
Pubblicazione: (2024)
di: Cho, Cheol Jun, et al.
Pubblicazione: (2024)
Autoregressive Speech Synthesis without Vector Quantization
di: Meng, Lingwei, et al.
Pubblicazione: (2024)
di: Meng, Lingwei, et al.
Pubblicazione: (2024)
AV2Wav: Diffusion-Based Re-synthesis from Continuous Self-supervised Features for Audio-Visual Speech Enhancement
di: Chou, Ju-Chieh, et al.
Pubblicazione: (2023)
di: Chou, Ju-Chieh, et al.
Pubblicazione: (2023)
ZIPA: A family of efficient models for multilingual phone recognition
di: Zhu, Jian, et al.
Pubblicazione: (2025)
di: Zhu, Jian, et al.
Pubblicazione: (2025)
BAT: Learning to Reason about Spatial Sounds with Large Language Models
di: Zheng, Zhisheng, et al.
Pubblicazione: (2024)
di: Zheng, Zhisheng, et al.
Pubblicazione: (2024)
Codec2Vec: Self-Supervised Speech Representation Learning Using Neural Speech Codecs
di: Tseng, Wei-Cheng, et al.
Pubblicazione: (2025)
di: Tseng, Wei-Cheng, et al.
Pubblicazione: (2025)
How to Learn a New Language? An Efficient Solution for Self-Supervised Learning Models Unseen Languages Adaption in Low-Resource Scenario
di: Wang, Shih-Heng, et al.
Pubblicazione: (2024)
di: Wang, Shih-Heng, et al.
Pubblicazione: (2024)
VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation
di: Peng, Puyuan, et al.
Pubblicazione: (2025)
di: Peng, Puyuan, et al.
Pubblicazione: (2025)
Probing Self-supervised Learning Models with Target Speech Extraction
di: Peng, Junyi, et al.
Pubblicazione: (2024)
di: Peng, Junyi, et al.
Pubblicazione: (2024)
On the Contribution of Lexical Features to Speech Emotion Recognition
di: Combei, David
Pubblicazione: (2025)
di: Combei, David
Pubblicazione: (2025)
Documenti analoghi
-
Self-Supervised Speech Models Encode Phonetic Context via Position-dependent Orthogonal Subspaces
di: Choi, Kwanghee, et al.
Pubblicazione: (2026) -
Applications of Artificial Intelligence for Cross-language Intelligibility Assessment of Dysarthric Speech
di: Yeo, Eunjung, et al.
Pubblicazione: (2025) -
Multilingual Dysarthric Speech Assessment Using Universal Phone Recognition and Language-Specific Phonemic Contrast Modeling
di: Yeo, Eunjung, et al.
Pubblicazione: (2026) -
Voice Biomarker Analysis and Automated Severity Classification of Dysarthric Speech in a Multilingual Context
di: Yeo, Eunjung
Pubblicazione: (2024) -
Adapting Self-Supervised Speech Representations for Cross-lingual Dysarthria Detection in Parkinson's Disease
di: Hernandez, Abner, et al.
Pubblicazione: (2026)