Beyond Modality Limitations: A Unified MLLM Approach to Automated Speaking Assessment with Effective Curriculum Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Fang, Yu-Hsuan, Lo, Tien-Hong, Sung, Yao-Ting, Chen, Berlin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
An Effective Strategy for Modeling Score Ordinality and Non-uniform Intervals in Automated Speaking Assessment
por: Lo, Tien-Hong, et al.
Publicado: (2025)
por: Lo, Tien-Hong, et al.
Publicado: (2025)
An Effective Automated Speaking Assessment Approach to Mitigating Data Scarcity and Imbalanced Distribution
por: Lo, Tien-Hong, et al.
Publicado: (2024)
por: Lo, Tien-Hong, et al.
Publicado: (2024)
Advancing Automated Speaking Assessment Leveraging Multifaceted Relevance and Grammar Information
por: Lu, Hao-Chien, et al.
Publicado: (2025)
por: Lu, Hao-Chien, et al.
Publicado: (2025)
A Novel Data Augmentation Approach for Automatic Speaking Assessment on Opinion Expressions
por: Wang, Chung-Chun, et al.
Publicado: (2025)
por: Wang, Chung-Chun, et al.
Publicado: (2025)
The NTNU System at the S&I Challenge 2025 SLA Open Track
por: Lin, Hong-Yun, et al.
Publicado: (2025)
por: Lin, Hong-Yun, et al.
Publicado: (2025)
CLiFT-ASR: A Cross-Lingual Fine-Tuning Framework for Low-Resource Taiwanese Hokkien Speech Recognition
por: Sung, Hung-Yang, et al.
Publicado: (2025)
por: Sung, Hung-Yang, et al.
Publicado: (2025)
Mitigating Data Imbalance in Automated Speaking Assessment
por: Tsai, Fong-Chun, et al.
Publicado: (2025)
por: Tsai, Fong-Chun, et al.
Publicado: (2025)
Automated Speaking Assessment of Conversation Tests with Novel Graph-based Modeling on Spoken Response Coherence
por: Li, Jiun-Ting, et al.
Publicado: (2024)
por: Li, Jiun-Ting, et al.
Publicado: (2024)
Efficient Dialect-Aware Modeling and Conditioning for Low-Resource Taiwanese Hakka Speech Processing
por: Peng, An-Ci, et al.
Publicado: (2026)
por: Peng, An-Ci, et al.
Publicado: (2026)
An Effective Mixture-Of-Experts Approach For Code-Switching Speech Recognition Leveraging Encoder Disentanglement
por: Yang, Tzu-Ting, et al.
Publicado: (2024)
por: Yang, Tzu-Ting, et al.
Publicado: (2024)
An Effective Context-Balanced Adaptation Approach for Long-Tailed Speech Recognition
por: Wang, Yi-Cheng, et al.
Publicado: (2024)
por: Wang, Yi-Cheng, et al.
Publicado: (2024)
Optimizing Automatic Speech Assessment: W-RankSim Regularization and Hybrid Feature Fusion Strategies
por: Wu, Chung-Wen, et al.
Publicado: (2024)
por: Wu, Chung-Wen, et al.
Publicado: (2024)
Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization
por: Wang, Hsuan-Yu, et al.
Publicado: (2025)
por: Wang, Hsuan-Yu, et al.
Publicado: (2025)
Probing the Hidden Talent of ASR Foundation Models for L2 English Oral Assessment
por: Chao, Fu-An, et al.
Publicado: (2025)
por: Chao, Fu-An, et al.
Publicado: (2025)
Building Tailored Speech Recognizers for Japanese Speaking Assessment
por: Kubo, Yotaro, et al.
Publicado: (2025)
por: Kubo, Yotaro, et al.
Publicado: (2025)
Beyond Transcription: Unified Audio Schema for Perception-Aware AudioLLMs
por: Zhang, Linhao, et al.
Publicado: (2026)
por: Zhang, Linhao, et al.
Publicado: (2026)
Style Amnesia: Investigating Speaking Style Degradation and Mitigation in Multi-Turn Spoken Language Models
por: Lin, Yu-Xiang, et al.
Publicado: (2025)
por: Lin, Yu-Xiang, et al.
Publicado: (2025)
An Evaluation of Interleaved Instruction Tuning on Semantic Reasoning Performance in an Audio MLLM
por: Liu, Jiawei, et al.
Publicado: (2025)
por: Liu, Jiawei, et al.
Publicado: (2025)
Hearing to Translate: The Effectiveness of Speech Modality Integration into LLMs
por: Papi, Sara, et al.
Publicado: (2025)
por: Papi, Sara, et al.
Publicado: (2025)
Enhancing Code-Switching ASR Leveraging Non-Peaky CTC Loss and Deep Language Posterior Injection
por: Yang, Tzu-Ting, et al.
Publicado: (2024)
por: Yang, Tzu-Ting, et al.
Publicado: (2024)
Effective Noise-aware Data Simulation for Domain-adaptive Speech Enhancement Leveraging Dynamic Stochastic Perturbation
por: Wang, Chien-Chun, et al.
Publicado: (2024)
por: Wang, Chien-Chun, et al.
Publicado: (2024)
TAU: A Benchmark for Cultural Sound Understanding Beyond Semantics
por: Lin, Yi-Cheng, et al.
Publicado: (2025)
por: Lin, Yi-Cheng, et al.
Publicado: (2025)
Acoustically Precise Hesitation Tagging Is Essential for End-to-End Verbatim Transcription Systems
por: Lin, Jhen-Ke, et al.
Publicado: (2025)
por: Lin, Jhen-Ke, et al.
Publicado: (2025)
Uni-ASR: Unified LLM-Based Architecture for Non-Streaming and Streaming Automatic Speech Recognition
por: Xia, Yinfeng, et al.
Publicado: (2026)
por: Xia, Yinfeng, et al.
Publicado: (2026)
Revealing the Role of Audio Channels in ASR Performance Degradation
por: Huang, Kuan-Tang, et al.
Publicado: (2025)
por: Huang, Kuan-Tang, et al.
Publicado: (2025)
TASTE-Streaming: Towards Streamable Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
por: Tseng, Liang-Hsuan, et al.
Publicado: (2026)
por: Tseng, Liang-Hsuan, et al.
Publicado: (2026)
Beyond Unified Models: A Service-Oriented Approach to Low Latency, Context Aware Phonemization for Real Time TTS
por: Fetrat, Mahta, et al.
Publicado: (2025)
por: Fetrat, Mahta, et al.
Publicado: (2025)
Reflecting Twice before Speaking with Empathy: Self-Reflective Alternating Inference for Empathy-Aware End-to-End Spoken Dialogue
por: Jia, Yuhang, et al.
Publicado: (2026)
por: Jia, Yuhang, et al.
Publicado: (2026)
Audio Jailbreaks in Large Audio-Language Models: Taxonomy, Attack-Defense Analysis, and Cost-Aware Evaluation
por: Feng, Bo-Han, et al.
Publicado: (2026)
por: Feng, Bo-Han, et al.
Publicado: (2026)
Factor-Conditioned Speaking-Style Captioning
por: Ando, Atsushi, et al.
Publicado: (2024)
por: Ando, Atsushi, et al.
Publicado: (2024)
UniMoE-Audio: Unified Speech and Music Generation with Dynamic-Capacity MoE
por: Liu, Zhenyu, et al.
Publicado: (2025)
por: Liu, Zhenyu, et al.
Publicado: (2025)
Mispronunciation Detection and Diagnosis Without Model Training: A Retrieval-Based Approach
por: Tu, Huu Tuong, et al.
Publicado: (2025)
por: Tu, Huu Tuong, et al.
Publicado: (2025)
Learning More with Less: Self-Supervised Approaches for Low-Resource Speech Emotion Recognition
por: Gong, Ziwei, et al.
Publicado: (2025)
por: Gong, Ziwei, et al.
Publicado: (2025)
MIKU-PAL: An Automated and Standardized Multi-Modal Method for Speech Paralinguistic and Affect Labeling
por: Cheng, Yifan, et al.
Publicado: (2025)
por: Cheng, Yifan, et al.
Publicado: (2025)
Beyond the binary: Limitations and possibilities of gender-related speech technology research
por: Sanchez, Ariadna, et al.
Publicado: (2024)
por: Sanchez, Ariadna, et al.
Publicado: (2024)
MLLM-based Speech Recognition: When and How is Multimodality Beneficial?
por: Guan, Yiwen, et al.
Publicado: (2025)
por: Guan, Yiwen, et al.
Publicado: (2025)
Articulatory strategy as a source of variation in acoustic vowel dynamics
por: Strycharczuk, Patrycja, et al.
Publicado: (2026)
por: Strycharczuk, Patrycja, et al.
Publicado: (2026)
Noise Supervised Contrastive Learning and Feature-Perturbed for Anomalous Sound Detection
por: Huang, Shun, et al.
Publicado: (2025)
por: Huang, Shun, et al.
Publicado: (2025)
Exploring the Potential of Large Multimodal Models as Effective Alternatives for Pronunciation Assessment
por: Wang, Ke, et al.
Publicado: (2025)
por: Wang, Ke, et al.
Publicado: (2025)
Zero-Shot Text-to-Speech as Golden Speech Generator: A Systematic Framework and its Applicability in Automatic Pronunciation Assessment
por: Lo, Tien-Hong, et al.
Publicado: (2024)
por: Lo, Tien-Hong, et al.
Publicado: (2024)
Ejemplares similares
-
An Effective Strategy for Modeling Score Ordinality and Non-uniform Intervals in Automated Speaking Assessment
por: Lo, Tien-Hong, et al.
Publicado: (2025) -
An Effective Automated Speaking Assessment Approach to Mitigating Data Scarcity and Imbalanced Distribution
por: Lo, Tien-Hong, et al.
Publicado: (2024) -
Advancing Automated Speaking Assessment Leveraging Multifaceted Relevance and Grammar Information
por: Lu, Hao-Chien, et al.
Publicado: (2025) -
A Novel Data Augmentation Approach for Automatic Speaking Assessment on Opinion Expressions
por: Wang, Chung-Chun, et al.
Publicado: (2025) -
The NTNU System at the S&I Challenge 2025 SLA Open Track
por: Lin, Hong-Yun, et al.
Publicado: (2025)