K-Function: Joint Pronunciation Transcription and Feedback for Evaluating Kids Language Function
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Shuhe, Guo, Chenxu, Lian, Jiachen, Cho, Cheol Jun, Zhao, Wenshuo, Xu, Xiner, Jin, Ruiyu, Shi, Xiaoyu, Zhou, Xuanru, Zhou, Dingkun, Wang, Sam, Wang, Grace, Yang, Jingze, Xu, Jingyi, Bao, Ruohan, Chen, Xingrui, Brenner, Elise, In, Brandon, Pei, Francesca, Gorno-Tempini, Maria Luisa, Anumanchipalli, Gopala |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SSDM 2.0: Time-Accurate Speech Rich Transcription with Non-Fluencies
di: Lian, Jiachen, et al.
Pubblicazione: (2024)
di: Lian, Jiachen, et al.
Pubblicazione: (2024)
Dysfluent WFST: A Framework for Zero-Shot Speech Dysfluency Transcription and Detection
di: Guo, Chenxu, et al.
Pubblicazione: (2025)
di: Guo, Chenxu, et al.
Pubblicazione: (2025)
LCS-CTC: Leveraging Soft Alignments to Enhance Phonetic Transcription Robustness
di: Ye, Zongli, et al.
Pubblicazione: (2025)
di: Ye, Zongli, et al.
Pubblicazione: (2025)
Speech World Model: Causal State-Action Planning with Explicit Reasoning for Speech
di: Zhou, Xuanru, et al.
Pubblicazione: (2025)
di: Zhou, Xuanru, et al.
Pubblicazione: (2025)
SSDM: Scalable Speech Dysfluency Modeling
di: Lian, Jiachen, et al.
Pubblicazione: (2024)
di: Lian, Jiachen, et al.
Pubblicazione: (2024)
Analysis and Evaluation of Synthetic Data Generation in Speech Dysfluency Detection
di: Zhang, Jinming, et al.
Pubblicazione: (2025)
di: Zhang, Jinming, et al.
Pubblicazione: (2025)
Towards Accurate Phonetic Error Detection Through Phoneme Similarity Modeling
di: Zhou, Xuanru, et al.
Pubblicazione: (2025)
di: Zhou, Xuanru, et al.
Pubblicazione: (2025)
Teaching Machines to Speak Using Articulatory Control
di: Anand, Akshay, et al.
Pubblicazione: (2025)
di: Anand, Akshay, et al.
Pubblicazione: (2025)
Stutter-Solver: End-to-end Multi-lingual Dysfluency Detection
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
Towards Hierarchical Spoken Language Dysfluency Modeling
di: Lian, Jiachen, et al.
Pubblicazione: (2024)
di: Lian, Jiachen, et al.
Pubblicazione: (2024)
Seamless Dysfluent Speech Text Alignment for Disordered Speech Analysis
di: Ye, Zongli, et al.
Pubblicazione: (2025)
di: Ye, Zongli, et al.
Pubblicazione: (2025)
Time and Tokens: Benchmarking End-to-End Speech Dysfluency Detection
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
YOLO-Stutter: End-to-end Region-Wise Speech Dysfluency Detection
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
HuPER: A Human-Inspired Framework for Phonetic Perception
di: Guo, Chenxu, et al.
Pubblicazione: (2026)
di: Guo, Chenxu, et al.
Pubblicazione: (2026)
HASS: Hierarchical Simulation of Logopenic Aphasic Speech for Scalable PPA Detection
di: Li, Harrison, et al.
Pubblicazione: (2026)
di: Li, Harrison, et al.
Pubblicazione: (2026)
Unsupervised TTS Acoustic Modeling for TTS with Conditional Disentangled Sequential VAE
di: Lian, Jiachen, et al.
Pubblicazione: (2022)
di: Lian, Jiachen, et al.
Pubblicazione: (2022)
TART: A Comprehensive Tool for Technique-Aware Audio-to-Tab Guitar Transcription
di: Gupta, Akshaj, et al.
Pubblicazione: (2025)
di: Gupta, Akshaj, et al.
Pubblicazione: (2025)
Self-Supervised Models of Speech Infer Universal Articulatory Kinematics
di: Cho, Cheol Jun, et al.
Pubblicazione: (2023)
di: Cho, Cheol Jun, et al.
Pubblicazione: (2023)
Sylber 2.0: A Universal Syllable Embedding
di: Cho, Cheol Jun, et al.
Pubblicazione: (2026)
di: Cho, Cheol Jun, et al.
Pubblicazione: (2026)
Scaling Spoken Language Models with Syllabic Speech Tokenization
di: Lee, Nicholas, et al.
Pubblicazione: (2025)
di: Lee, Nicholas, et al.
Pubblicazione: (2025)
A Unified Framework for Model Editing
di: Gupta, Akshat, et al.
Pubblicazione: (2024)
di: Gupta, Akshat, et al.
Pubblicazione: (2024)
Is Bigger Edit Batch Size Always Better? -- An Empirical Study on Model Editing with Llama-3
di: Yoon, Junsang, et al.
Pubblicazione: (2024)
di: Yoon, Junsang, et al.
Pubblicazione: (2024)
Rebuilding ROME : Resolving Model Collapse during Sequential Model Editing
di: Gupta, Akshat, et al.
Pubblicazione: (2024)
di: Gupta, Akshat, et al.
Pubblicazione: (2024)
Geometric Interpretation of Layer Normalization and a Comparative Analysis with RMSNorm
di: Gupta, Akshat, et al.
Pubblicazione: (2024)
di: Gupta, Akshat, et al.
Pubblicazione: (2024)
Model Editing at Scale leads to Gradual and Catastrophic Forgetting
di: Gupta, Akshat, et al.
Pubblicazione: (2024)
di: Gupta, Akshat, et al.
Pubblicazione: (2024)
StyleStream: Real-Time Zero-Shot Voice Style Conversion
di: Liu, Yisi, et al.
Pubblicazione: (2026)
di: Liu, Yisi, et al.
Pubblicazione: (2026)
Self-Assessment Tests are Unreliable Measures of LLM Personality
di: Gupta, Akshat, et al.
Pubblicazione: (2023)
di: Gupta, Akshat, et al.
Pubblicazione: (2023)
Coding Speech through Vocal Tract Kinematics
di: Cho, Cheol Jun, et al.
Pubblicazione: (2024)
di: Cho, Cheol Jun, et al.
Pubblicazione: (2024)
Asymmetric Hierarchical Anchoring for Audio-Visual Joint Representation: Resolving Information Allocation Ambiguity for Robust Cross-Modal Generalization
di: Wu, Bixing, et al.
Pubblicazione: (2026)
di: Wu, Bixing, et al.
Pubblicazione: (2026)
Audio Texture Manipulation by Exemplar-Based Analogy
di: Cheng, Kan Jen, et al.
Pubblicazione: (2025)
di: Cheng, Kan Jen, et al.
Pubblicazione: (2025)
SD-HuBERT: Sentence-Level Self-Distillation Induces Syllabic Organization in HuBERT
di: Cho, Cheol Jun, et al.
Pubblicazione: (2023)
di: Cho, Cheol Jun, et al.
Pubblicazione: (2023)
Fast, High-Quality and Parameter-Efficient Articulatory Synthesis using Differentiable DSP
di: Liu, Yisi, et al.
Pubblicazione: (2024)
di: Liu, Yisi, et al.
Pubblicazione: (2024)
How Do LLMs Use Their Depth?
di: Gupta, Akshat, et al.
Pubblicazione: (2025)
di: Gupta, Akshat, et al.
Pubblicazione: (2025)
Efficient Knowledge Editing via Minimal Precomputation
di: Gupta, Akshat, et al.
Pubblicazione: (2025)
di: Gupta, Akshat, et al.
Pubblicazione: (2025)
TinyAgent: Function Calling at the Edge
di: Erdogan, Lutfi Eren, et al.
Pubblicazione: (2024)
di: Erdogan, Lutfi Eren, et al.
Pubblicazione: (2024)
The Functional Diversity of Chromatin‐Associated RNA Binding Proteins in Transcriptional and Post‐Transcriptional Regulation
di: Min Zhou, et al.
Pubblicazione: (2025)
di: Min Zhou, et al.
Pubblicazione: (2025)
RT-VC: Real-Time Zero-Shot Voice Conversion with Speech Articulatory Coding
di: Liu, Yisi, et al.
Pubblicazione: (2025)
di: Liu, Yisi, et al.
Pubblicazione: (2025)
Multimodal Segmentation for Vocal Tract Modeling
di: Jain, Rishi, et al.
Pubblicazione: (2024)
di: Jain, Rishi, et al.
Pubblicazione: (2024)
The Oracle Has Spoken: A Multi-Aspect Evaluation of Dialogue in Pythia
di: Chen, Zixun, et al.
Pubblicazione: (2025)
di: Chen, Zixun, et al.
Pubblicazione: (2025)
Sylber: Syllabic Embedding Representation of Speech from Raw Audio
di: Cho, Cheol Jun, et al.
Pubblicazione: (2024)
di: Cho, Cheol Jun, et al.
Pubblicazione: (2024)
Documenti analoghi
-
SSDM 2.0: Time-Accurate Speech Rich Transcription with Non-Fluencies
di: Lian, Jiachen, et al.
Pubblicazione: (2024) -
Dysfluent WFST: A Framework for Zero-Shot Speech Dysfluency Transcription and Detection
di: Guo, Chenxu, et al.
Pubblicazione: (2025) -
LCS-CTC: Leveraging Soft Alignments to Enhance Phonetic Transcription Robustness
di: Ye, Zongli, et al.
Pubblicazione: (2025) -
Speech World Model: Causal State-Action Planning with Explicit Reasoning for Speech
di: Zhou, Xuanru, et al.
Pubblicazione: (2025) -
SSDM: Scalable Speech Dysfluency Modeling
di: Lian, Jiachen, et al.
Pubblicazione: (2024)