Prosodic ABX: A Language-Agnostic Method for Measuring Prosodic Contrast in Speech Representations
Fuente:
arXiv
Salvato in:
| Autori principali: | Sun, Haitong, McIntosh, Stephen, Choi, Kwanghee, Yeo, Eunjung, Saito, Daisuke, Minematsu, Nobuaki |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Prosodically Enhanced Foreign Accent Simulation by Discrete Token-based Resynthesis Only with Native Speech Corpora
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
Kanade: A Simple Disentangled Tokenizer for Spoken Language Modeling
di: Huang, Zhijie, et al.
Pubblicazione: (2026)
di: Huang, Zhijie, et al.
Pubblicazione: (2026)
Simulating Native Speaker Shadowing for Nonnative Speech Assessment with Latent Speech Representations
di: Geng, Haopeng, et al.
Pubblicazione: (2024)
di: Geng, Haopeng, et al.
Pubblicazione: (2024)
A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion
di: Geng, Haopeng, et al.
Pubblicazione: (2025)
di: Geng, Haopeng, et al.
Pubblicazione: (2025)
Analytic Study of Text-Free Speech Synthesis for Raw Audio using a Self-Supervised Learning Model
di: Park, Joonyong, et al.
Pubblicazione: (2024)
di: Park, Joonyong, et al.
Pubblicazione: (2024)
Beyond Acoustic Sparsity and Linguistic Bias: A Prompt-Free Paradigm for Mispronunciation Detection and Diagnosis
di: Geng, Haopeng, et al.
Pubblicazione: (2026)
di: Geng, Haopeng, et al.
Pubblicazione: (2026)
A Pilot Study of Applying Sequence-to-Sequence Voice Conversion to Evaluate the Intelligibility of L2 Speech Using a Native Speaker's Shadowings
di: Geng, Haopeng, et al.
Pubblicazione: (2024)
di: Geng, Haopeng, et al.
Pubblicazione: (2024)
PSST! Prosodic Speech Segmentation with Transformers
di: Roll, Nathan, et al.
Pubblicazione: (2023)
di: Roll, Nathan, et al.
Pubblicazione: (2023)
Discrete Tokens Exhibit Interlanguage Speech Intelligibility Benefit: an Analytical Study Towards Accent-robust ASR Only with Native Speech Data
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
Benchmarking Prosody Encoding in Discrete Speech Tokens
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
DrawSpeech: Expressive Speech Synthesis Using Prosodic Sketches as Control Conditions
di: Chen, Weidong, et al.
Pubblicazione: (2025)
di: Chen, Weidong, et al.
Pubblicazione: (2025)
Prosodic Parameter Manipulation in TTS generated speech for Controlled Speech Generation
di: Chary, Podakanti Satyajith
Pubblicazione: (2024)
di: Chary, Podakanti Satyajith
Pubblicazione: (2024)
A Pilot Study of GSLM-based Simulation of Foreign Accentuation Only Using Native Speech Corpora
di: Onda, Kentaro, et al.
Pubblicazione: (2024)
di: Onda, Kentaro, et al.
Pubblicazione: (2024)
AutoProsody: A Prosodic Feature Extraction Tool for Indian Languages
di: Thinakaran, Preethi, et al.
Pubblicazione: (2025)
di: Thinakaran, Preethi, et al.
Pubblicazione: (2025)
Modeling Sarcastic Speech: Semantic and Prosodic Cues in a Speech Synthesis Framework
di: Li, Zhu, et al.
Pubblicazione: (2025)
di: Li, Zhu, et al.
Pubblicazione: (2025)
EmphAssess : a Prosodic Benchmark on Assessing Emphasis Transfer in Speech-to-Speech Models
di: de Seyssel, Maureen, et al.
Pubblicazione: (2023)
di: de Seyssel, Maureen, et al.
Pubblicazione: (2023)
Which Prosodic Features Matter Most for Pragmatics?
di: Ward, Nigel G., et al.
Pubblicazione: (2024)
di: Ward, Nigel G., et al.
Pubblicazione: (2024)
Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning
di: Ohnaka, Hien, et al.
Pubblicazione: (2025)
di: Ohnaka, Hien, et al.
Pubblicazione: (2025)
Voice Biomarker Analysis and Automated Severity Classification of Dysarthric Speech in a Multilingual Context
di: Yeo, Eunjung
Pubblicazione: (2024)
di: Yeo, Eunjung
Pubblicazione: (2024)
Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information
di: Sanders, Nicholas, et al.
Pubblicazione: (2025)
di: Sanders, Nicholas, et al.
Pubblicazione: (2025)
Fine-Tuning Whisper for Inclusive Prosodic Stress Analysis
di: Sohn, Samuel S., et al.
Pubblicazione: (2025)
di: Sohn, Samuel S., et al.
Pubblicazione: (2025)
[b]=[d]-[t]+[p]: Self-supervised Speech Models Discover Phonological Vector Arithmetic
di: Choi, Kwanghee, et al.
Pubblicazione: (2026)
di: Choi, Kwanghee, et al.
Pubblicazione: (2026)
Self-Supervised Speech Models Encode Phonetic Context via Position-dependent Orthogonal Subspaces
di: Choi, Kwanghee, et al.
Pubblicazione: (2026)
di: Choi, Kwanghee, et al.
Pubblicazione: (2026)
Pitch Imperfect: Detecting Audio Deepfakes Through Acoustic Prosodic Analysis
di: Warren, Kevin, et al.
Pubblicazione: (2025)
di: Warren, Kevin, et al.
Pubblicazione: (2025)
Multilingual Dysarthric Speech Assessment Using Universal Phone Recognition and Language-Specific Phonemic Contrast Modeling
di: Yeo, Eunjung, et al.
Pubblicazione: (2026)
di: Yeo, Eunjung, et al.
Pubblicazione: (2026)
A Functional Trade-off between Prosodic and Semantic Cues in Conveying Sarcasm
di: Li, Zhu, et al.
Pubblicazione: (2024)
di: Li, Zhu, et al.
Pubblicazione: (2024)
MixedG2P-T5: G2P-free Speech Synthesis for Mixed-script texts using Speech Self-Supervised Learning and Language Model
di: Park, Joonyong, et al.
Pubblicazione: (2025)
di: Park, Joonyong, et al.
Pubblicazione: (2025)
Investigating Prosodic Signatures via Speech Pre-Trained Models for Audio Deepfake Source Attribution
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
Towards Inclusive ASR: Investigating Voice Conversion for Dysarthric Speech Recognition in Low-Resource Languages
di: Li, Chin-Jou, et al.
Pubblicazione: (2025)
di: Li, Chin-Jou, et al.
Pubblicazione: (2025)
Applications of Artificial Intelligence for Cross-language Intelligibility Assessment of Dysarthric Speech
di: Yeo, Eunjung, et al.
Pubblicazione: (2025)
di: Yeo, Eunjung, et al.
Pubblicazione: (2025)
EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge
di: Manku, Ruskin Raj, et al.
Pubblicazione: (2025)
di: Manku, Ruskin Raj, et al.
Pubblicazione: (2025)
On-device Streaming Discrete Speech Units
di: Choi, Kwanghee, et al.
Pubblicazione: (2025)
di: Choi, Kwanghee, et al.
Pubblicazione: (2025)
Adapting Self-Supervised Speech Representations for Cross-lingual Dysarthria Detection in Parkinson's Disease
di: Hernandez, Abner, et al.
Pubblicazione: (2026)
di: Hernandez, Abner, et al.
Pubblicazione: (2026)
fastabx: A library for efficient computation of ABX discriminability
di: Poli, Maxime, et al.
Pubblicazione: (2025)
di: Poli, Maxime, et al.
Pubblicazione: (2025)
An Empirical Recipe for Universal Phone Recognition
di: Bharadwaj, Shikhar, et al.
Pubblicazione: (2026)
di: Bharadwaj, Shikhar, et al.
Pubblicazione: (2026)
AC-Mix: Self-Supervised Adaptation for Low-Resource Automatic Speech Recognition using Agnostic Contrastive Mixup
di: Carvalho, Carlos, et al.
Pubblicazione: (2024)
di: Carvalho, Carlos, et al.
Pubblicazione: (2024)
Learning Disentangled Speech Representations with Contrastive Learning and Time-Invariant Retrieval
di: Deng, Yimin, et al.
Pubblicazione: (2024)
di: Deng, Yimin, et al.
Pubblicazione: (2024)
On the Effects of Heterogeneous Data Sources on Speech-to-Text Foundation Models
di: Tian, Jinchuan, et al.
Pubblicazione: (2024)
di: Tian, Jinchuan, et al.
Pubblicazione: (2024)
ProSDD: Learning Prosodic Representations for Speech Deepfake Detection against Expressive and Emotional Attacks
di: Mahapatra, Aurosweta, et al.
Pubblicazione: (2026)
di: Mahapatra, Aurosweta, et al.
Pubblicazione: (2026)
Task-Agnostic Structured Pruning of Speech Representation Models
di: Wang, Haoyu, et al.
Pubblicazione: (2023)
di: Wang, Haoyu, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Prosodically Enhanced Foreign Accent Simulation by Discrete Token-based Resynthesis Only with Native Speech Corpora
di: Onda, Kentaro, et al.
Pubblicazione: (2025) -
Kanade: A Simple Disentangled Tokenizer for Spoken Language Modeling
di: Huang, Zhijie, et al.
Pubblicazione: (2026) -
Simulating Native Speaker Shadowing for Nonnative Speech Assessment with Latent Speech Representations
di: Geng, Haopeng, et al.
Pubblicazione: (2024) -
A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion
di: Geng, Haopeng, et al.
Pubblicazione: (2025) -
Analytic Study of Text-Free Speech Synthesis for Raw Audio using a Self-Supervised Learning Model
di: Park, Joonyong, et al.
Pubblicazione: (2024)