Saved in:
| Main Authors: | Hsu, Chan-Jan, Tseng, Liang-Hsuan, Lin, Yi-Cheng, Kuo, Yen-Chun, Chou, Ju-Chieh, Chang, Kai-Wei, Lee, Hung-yi, Busso, Carlos |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2601.06329 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
TASTE-Streaming: Towards Streamable Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
by: Tseng, Liang-Hsuan, et al.
Published: (2026)
by: Tseng, Liang-Hsuan, et al.
Published: (2026)
TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
by: Tseng, Liang-Hsuan, et al.
Published: (2025)
by: Tseng, Liang-Hsuan, et al.
Published: (2025)
TASLA: Text-Aligned Speech Tokens with Multiple Layer-Aggregation
by: Hsu, Ming-Hao, et al.
Published: (2025)
by: Hsu, Ming-Hao, et al.
Published: (2025)
Mitigating Forgetting in LLM Fine-Tuning via Low-Perplexity Token Learning
by: Wu, Chao-Chung, et al.
Published: (2025)
by: Wu, Chao-Chung, et al.
Published: (2025)
Merging Facts, Crafting Fallacies: Evaluating the Contradictory Nature of Aggregated Factual Claims in Long-Form Generations
by: Chiang, Cheng-Han, et al.
Published: (2024)
by: Chiang, Cheng-Han, et al.
Published: (2024)
Spoken Stereoset: On Evaluating Social Bias Toward Speaker in Speech Large Language Models
by: Lin, Yi-Cheng, et al.
Published: (2024)
by: Lin, Yi-Cheng, et al.
Published: (2024)
A Self-Refining Framework for Enhancing ASR Using TTS-Synthesized Data
by: Chou, Cheng-Kang, et al.
Published: (2025)
by: Chou, Cheng-Kang, et al.
Published: (2025)
EMO-Debias: Benchmarking Gender Debiasing Techniques in Multi-Label Speech Emotion Recognition
by: Lin, Yi-Cheng, et al.
Published: (2025)
by: Lin, Yi-Cheng, et al.
Published: (2025)
AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering
by: Kuan, Chun-Yi, et al.
Published: (2026)
by: Kuan, Chun-Yi, et al.
Published: (2026)
Flow-SLM: Joint Learning of Linguistic and Acoustic Information for Spoken Language Modeling
by: Chou, Ju-Chieh, et al.
Published: (2025)
by: Chou, Ju-Chieh, et al.
Published: (2025)
Building a Taiwanese Mandarin Spoken Language Model: A First Attempt
by: Yang, Chih-Kai, et al.
Published: (2024)
by: Yang, Chih-Kai, et al.
Published: (2024)
Game-Time: Evaluating Temporal Dynamics in Spoken Language Models
by: Chang, Kai-Wei, et al.
Published: (2025)
by: Chang, Kai-Wei, et al.
Published: (2025)
Emo-bias: A Large Scale Evaluation of Social Bias on Speech Emotion Recognition
by: Lin, Yi-Cheng, et al.
Published: (2024)
by: Lin, Yi-Cheng, et al.
Published: (2024)
Investigating the Effects of Large-Scale Pseudo-Stereo Data and Different Speech Foundation Model on Dialogue Generative Spoken Language Model
by: Fu, Yu-Kuan, et al.
Published: (2024)
by: Fu, Yu-Kuan, et al.
Published: (2024)
Stimulus Modality Matters: Impact of Perceptual Evaluations from Different Modalities on Speech Emotion Recognition System Performance
by: Chou, Huang-Cheng, et al.
Published: (2024)
by: Chou, Huang-Cheng, et al.
Published: (2024)
TNF‐α Inhibitors and HBV Reactivation Risk in HBsAg−/Anti‐HBc+ Patients: A Systematic Review and Meta‐Analysis
by: Meng Hsuan Kuo, et al.
Published: (2026)
by: Meng Hsuan Kuo, et al.
Published: (2026)
TiCo: Time-Controllable Spoken Dialogue Model
by: Chang, Kai-Wei, et al.
Published: (2026)
by: Chang, Kai-Wei, et al.
Published: (2026)
A$^2$TG: Adaptive Anisotropic Textured Gaussians for Efficient 3D Scene Representation
by: Hsu, Sheng-Chi, et al.
Published: (2026)
by: Hsu, Sheng-Chi, et al.
Published: (2026)
The False Resonance: A Critical Examination of Emotion Embedding Similarity for Speech Generation Evaluation
by: Tsai, Yun-Shao, et al.
Published: (2026)
by: Tsai, Yun-Shao, et al.
Published: (2026)
Mitigating Subgroup Disparities in Multi-Label Speech Emotion Recognition: A Pseudo-Labeling and Unsupervised Learning Approach
by: Lin, Yi-Cheng, et al.
Published: (2025)
by: Lin, Yi-Cheng, et al.
Published: (2025)
Do You Hear What I Mean? Quantifying the Instruction-Perception Gap in Instruction-Guided Expressive Text-To-Speech Systems
by: Lin, Yi-Cheng, et al.
Published: (2025)
by: Lin, Yi-Cheng, et al.
Published: (2025)
SPAR-K: Scheduled Periodic Alternating Early Exit for Spoken Language Models
by: Huang, Hsiao-Ying, et al.
Published: (2026)
by: Huang, Hsiao-Ying, et al.
Published: (2026)
Editorial: Advancing the Management of Noninfectious Uveitis Through Molecular Targeted Drugs
by: Hou‐Ting Kuo, et al.
Published: (2025)
by: Hou‐Ting Kuo, et al.
Published: (2025)
Style Amnesia: Investigating Speaking Style Degradation and Mitigation in Multi-Turn Spoken Language Models
by: Lin, Yu-Xiang, et al.
Published: (2025)
by: Lin, Yu-Xiang, et al.
Published: (2025)
Advancing Large Language Models to Capture Varied Speaking Styles and Respond Properly in Spoken Conversations
by: Lin, Guan-Ting, et al.
Published: (2024)
by: Lin, Guan-Ting, et al.
Published: (2024)
Leave No Knowledge Behind During Knowledge Distillation: Towards Practical and Effective Knowledge Distillation for Code-Switching ASR Using Realistic Data
by: Tseng, Liang-Hsuan, et al.
Published: (2024)
by: Tseng, Liang-Hsuan, et al.
Published: (2024)
Timely Information Updating for Mobile Devices Without and With ML Advice
by: Hsu, Yu-Pin, et al.
Published: (2025)
by: Hsu, Yu-Pin, et al.
Published: (2025)
Engineering A Workload-balanced Push-Relabel Algorithm for Massive Graphs on GPUs
by: Hsieh, Chou-Ying, et al.
Published: (2024)
by: Hsieh, Chou-Ying, et al.
Published: (2024)
Engineering Majorana Kramers Pairs In Synthetic High Spin Chern Insulators
by: Hung, Yi-Chun, et al.
Published: (2024)
by: Hung, Yi-Chun, et al.
Published: (2024)
Tunable Competing Electronic Orders in Double Quantum Spin Hall Superlattices
by: Hung, Yi-Chun, et al.
Published: (2025)
by: Hung, Yi-Chun, et al.
Published: (2025)
Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models
by: Hsiao, Chi-Yuan, et al.
Published: (2025)
by: Hsiao, Chi-Yuan, et al.
Published: (2025)
Can Large Audio-Language Models Truly Hear? Tackling Hallucinations with Multi-Task Assessment and Stepwise Audio Reasoning
by: Kuan, Chun-Yi, et al.
Published: (2024)
by: Kuan, Chun-Yi, et al.
Published: (2024)
AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question Answering
by: Kuan, Chun-Yi, et al.
Published: (2026)
by: Kuan, Chun-Yi, et al.
Published: (2026)
Gender Bias in Instruction-Guided Speech Synthesis Models
by: Kuan, Chun-Yi, et al.
Published: (2025)
by: Kuan, Chun-Yi, et al.
Published: (2025)
Teaching Audio-Aware Large Language Models What Does Not Hear: Mitigating Hallucinations through Synthesized Negative Samples
by: Kuan, Chun-Yi, et al.
Published: (2025)
by: Kuan, Chun-Yi, et al.
Published: (2025)
From Alignment to Advancement: Bootstrapping Audio-Language Alignment with Synthetic Data
by: Kuan, Chun-Yi, et al.
Published: (2025)
by: Kuan, Chun-Yi, et al.
Published: (2025)
REBORN: Reinforcement-Learned Boundary Segmentation with Iterative Training for Unsupervised ASR
by: Tseng, Liang-Hsuan, et al.
Published: (2024)
by: Tseng, Liang-Hsuan, et al.
Published: (2024)
MedM2T: A MultiModal Framework for Time-Aware Modeling with Electronic Health Record and Electrocardiogram Data
by: Kuo, Yu-Chen, et al.
Published: (2025)
by: Kuo, Yu-Chen, et al.
Published: (2025)
Structural and functional insights into an archaeal dUTPase reveal a subdomain-mediated mechanism for substrate recognition and evolutionary adaptation.
by: Chen, Sheng-Chia, et al.
Published: (2026)
by: Chen, Sheng-Chia, et al.
Published: (2026)
Speech-IFEval: Evaluating Instruction-Following and Quantifying Catastrophic Forgetting in Speech-Aware Language Models
by: Lu, Ke-Han, et al.
Published: (2025)
by: Lu, Ke-Han, et al.
Published: (2025)
Similar Items
-
TASTE-Streaming: Towards Streamable Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
by: Tseng, Liang-Hsuan, et al.
Published: (2026) -
TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
by: Tseng, Liang-Hsuan, et al.
Published: (2025) -
TASLA: Text-Aligned Speech Tokens with Multiple Layer-Aggregation
by: Hsu, Ming-Hao, et al.
Published: (2025) -
Mitigating Forgetting in LLM Fine-Tuning via Low-Perplexity Token Learning
by: Wu, Chao-Chung, et al.
Published: (2025) -
Merging Facts, Crafting Fallacies: Evaluating the Contradictory Nature of Aggregated Factual Claims in Long-Form Generations
by: Chiang, Cheng-Han, et al.
Published: (2024)