Investigating Zero-Shot Generalizability on Mandarin-English Code-Switched ASR and Speech-to-text Translation of Recent Foundation Models with Self-Supervision and Weak Supervision
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Chih-Kai, Huang, Kuan-Po, Lu, Ke-Han, Kuan, Chun-Yi, Hsiao, Chi-Yuan, Lee, Hung-yi |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Zero Resource Code-switched Speech Benchmark Using Speech Utterance Pairs For Multiple Spoken Languages
par: Huang, Kuan-Po, et autres
Publié: (2023)
par: Huang, Kuan-Po, et autres
Publié: (2023)
Gender Bias in Instruction-Guided Speech Synthesis Models
par: Kuan, Chun-Yi, et autres
Publié: (2025)
par: Kuan, Chun-Yi, et autres
Publié: (2025)
Speech-IFEval: Evaluating Instruction-Following and Quantifying Catastrophic Forgetting in Speech-Aware Language Models
par: Lu, Ke-Han, et autres
Publié: (2025)
par: Lu, Ke-Han, et autres
Publié: (2025)
Enhancing Multilingual ASR for Unseen Languages via Language Embedding Modeling
par: Huang, Shao-Syuan, et autres
Publié: (2024)
par: Huang, Shao-Syuan, et autres
Publié: (2024)
Do Prompts Really Prompt? Exploring the Prompt Understanding Capability of Whisper
par: Yang, Chih-Kai, et autres
Publié: (2024)
par: Yang, Chih-Kai, et autres
Publié: (2024)
ASPIRin: Action Space Projection for Interactivity-Optimized Reinforcement Learning in Full-Duplex Speech Language Models
par: Hsiao, Chi-Yuan, et autres
Publié: (2026)
par: Hsiao, Chi-Yuan, et autres
Publié: (2026)
Speech-Copilot: Leveraging Large Language Models for Speech Processing via Task Decomposition, Modularization, and Program Generation
par: Kuan, Chun-Yi, et autres
Publié: (2024)
par: Kuan, Chun-Yi, et autres
Publié: (2024)
Can Large Audio-Language Models Truly Hear? Tackling Hallucinations with Multi-Task Assessment and Stepwise Audio Reasoning
par: Kuan, Chun-Yi, et autres
Publié: (2024)
par: Kuan, Chun-Yi, et autres
Publié: (2024)
AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question Answering
par: Kuan, Chun-Yi, et autres
Publié: (2026)
par: Kuan, Chun-Yi, et autres
Publié: (2026)
Teaching Audio-Aware Large Language Models What Does Not Hear: Mitigating Hallucinations through Synthesized Negative Samples
par: Kuan, Chun-Yi, et autres
Publié: (2025)
par: Kuan, Chun-Yi, et autres
Publié: (2025)
From Alignment to Advancement: Bootstrapping Audio-Language Alignment with Synthetic Data
par: Kuan, Chun-Yi, et autres
Publié: (2025)
par: Kuan, Chun-Yi, et autres
Publié: (2025)
Investigating the Effects of Large-Scale Pseudo-Stereo Data and Different Speech Foundation Model on Dialogue Generative Spoken Language Model
par: Fu, Yu-Kuan, et autres
Publié: (2024)
par: Fu, Yu-Kuan, et autres
Publié: (2024)
An Exploration of Mamba for Speech Self-Supervised Models
par: Lin, Tzu-Quan, et autres
Publié: (2025)
par: Lin, Tzu-Quan, et autres
Publié: (2025)
Weakly Supervised 3D Object Detection via Multi-Level Visual Guidance
par: Huang, Kuan-Chih, et autres
Publié: (2023)
par: Huang, Kuan-Chih, et autres
Publié: (2023)
CS3-Bench: Evaluating and Enhancing Speech-to-Speech LLMs for Mandarin-English Code-Switching
par: Liu, Heyang, et autres
Publié: (2025)
par: Liu, Heyang, et autres
Publié: (2025)
Direct Preference Optimization for English-Mandarin Code-Switching Speech Recognition in Audio LLMs
par: Quang, Trung Nguyen, et autres
Publié: (2026)
par: Quang, Trung Nguyen, et autres
Publié: (2026)
Efficient Training of Self-Supervised Speech Foundation Models on a Compute Budget
par: Liu, Andy T., et autres
Publié: (2024)
par: Liu, Andy T., et autres
Publié: (2024)
Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers
par: Lin, Tzu-Quan, et autres
Publié: (2025)
par: Lin, Tzu-Quan, et autres
Publié: (2025)
Listen and Speak Fairly: A Study on Semantic Gender Bias in Speech Integrated Large Language Models
par: Lin, Yi-Cheng, et autres
Publié: (2024)
par: Lin, Yi-Cheng, et autres
Publié: (2024)
Improving Zero-Shot Chinese-English Code-Switching ASR with kNN-CTC and Gated Monolingual Datastores
par: Zhou, Jiaming, et autres
Publié: (2024)
par: Zhou, Jiaming, et autres
Publié: (2024)
ASR for Affective Speech: Investigating Impact of Emotion and Speech Generative Strategy
par: Wu, Ya-Tse, et autres
Publié: (2026)
par: Wu, Ya-Tse, et autres
Publié: (2026)
Property Neurons in Self-Supervised Speech Transformers
par: Lin, Tzu-Quan, et autres
Publié: (2024)
par: Lin, Tzu-Quan, et autres
Publié: (2024)
Benchmarking Children's ASR with Supervised and Self-supervised Speech Foundation Models
par: Fan, Ruchao, et autres
Publié: (2024)
par: Fan, Ruchao, et autres
Publié: (2024)
Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models
par: Kuan, Chun-Yi, et autres
Publié: (2026)
par: Kuan, Chun-Yi, et autres
Publié: (2026)
AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering
par: Kuan, Chun-Yi, et autres
Publié: (2026)
par: Kuan, Chun-Yi, et autres
Publié: (2026)
Understanding Sounds, Missing the Questions: The Challenge of Object Hallucination in Large Audio-Language Models
par: Kuan, Chun-Yi, et autres
Publié: (2024)
par: Kuan, Chun-Yi, et autres
Publié: (2024)
Advancing Speech Translation: A Corpus of Mandarin-English Conversational Telephone Speech
par: Wotherspoon, Shannon, et autres
Publié: (2024)
par: Wotherspoon, Shannon, et autres
Publié: (2024)
DAISY: Data Adaptive Self-Supervised Early Exit for Speech Representation Models
par: Lin, Tzu-Quan, et autres
Publié: (2024)
par: Lin, Tzu-Quan, et autres
Publié: (2024)
Toward Fair Speech Technologies: A Comprehensive Survey of Bias and Fairness in Speech AI
par: Lin, Yi-Cheng, et autres
Publié: (2026)
par: Lin, Yi-Cheng, et autres
Publié: (2026)
CS-Dialogue: A 104-Hour Dataset of Spontaneous Mandarin-English Code-Switching Dialogues for Speech Recognition
par: Zhou, Jiaming, et autres
Publié: (2025)
par: Zhou, Jiaming, et autres
Publié: (2025)
A Self-Refining Framework for Enhancing ASR Using TTS-Synthesized Data
par: Chou, Cheng-Kang, et autres
Publié: (2025)
par: Chou, Cheng-Kang, et autres
Publié: (2025)
Building a Taiwanese Mandarin Spoken Language Model: A First Attempt
par: Yang, Chih-Kai, et autres
Publié: (2024)
par: Yang, Chih-Kai, et autres
Publié: (2024)
Large Language Model as an Assignment Evaluator: Insights, Feedback, and Challenges in a 1000+ Student Course
par: Chiang, Cheng-Han, et autres
Publié: (2024)
par: Chiang, Cheng-Han, et autres
Publié: (2024)
SpeechCaps: Advancing Instruction-Based Universal Speech Models with Multi-Talker Speaking Style Captioning
par: Huang, Chien-yu, et autres
Publié: (2024)
par: Huang, Chien-yu, et autres
Publié: (2024)
AsyncSwitch: Asynchronous Text-Speech Adaptation for Code-Switched ASR
par: Nguyen, Tuan, et autres
Publié: (2025)
par: Nguyen, Tuan, et autres
Publié: (2025)
Is Smaller Always Faster? Tradeoffs in Compressing Self-Supervised Speech Transformers
par: Lin, Tzu-Quan, et autres
Publié: (2022)
par: Lin, Tzu-Quan, et autres
Publié: (2022)
AEGIS : Automated Co-Evolutionary Framework for Guarding Prompt Injections Schema
par: Liu, Ting-Chun, et autres
Publié: (2025)
par: Liu, Ting-Chun, et autres
Publié: (2025)
Mixture to Beamformed Mixture: Leveraging Beamformed Mixture as Weak-Supervision for Speech Enhancement and Noise-Robust ASR
par: Wang, Zhong-Qiu, et autres
Publié: (2025)
par: Wang, Zhong-Qiu, et autres
Publié: (2025)
Learning When to Trust Which Teacher for Weakly Supervised ASR
par: Agrawal, Aakriti, et autres
Publié: (2023)
par: Agrawal, Aakriti, et autres
Publié: (2023)
MoVE: Translating Laughter and Tears via Mixture of Vocalization Experts in Speech-to-Speech Translation
par: Chen, Szu-Chi, et autres
Publié: (2026)
par: Chen, Szu-Chi, et autres
Publié: (2026)
Documents similaires
-
Zero Resource Code-switched Speech Benchmark Using Speech Utterance Pairs For Multiple Spoken Languages
par: Huang, Kuan-Po, et autres
Publié: (2023) -
Gender Bias in Instruction-Guided Speech Synthesis Models
par: Kuan, Chun-Yi, et autres
Publié: (2025) -
Speech-IFEval: Evaluating Instruction-Following and Quantifying Catastrophic Forgetting in Speech-Aware Language Models
par: Lu, Ke-Han, et autres
Publié: (2025) -
Enhancing Multilingual ASR for Unseen Languages via Language Embedding Modeling
par: Huang, Shao-Syuan, et autres
Publié: (2024) -
Do Prompts Really Prompt? Exploring the Prompt Understanding Capability of Whisper
par: Yang, Chih-Kai, et autres
Publié: (2024)