StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Song, Yuhan, Zhang, Linhao, Wu, Chuhan, Liu, Aiwei, Jia, Wei, Wang, Houfeng, Zhou, Xiao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Beyond Transcription: Unified Audio Schema for Perception-Aware AudioLLMs
por: Zhang, Linhao, et al.
Publicado: (2026)
por: Zhang, Linhao, et al.
Publicado: (2026)
WildSpeech-Bench: Benchmarking End-to-End SpeechLLMs in the Wild
por: Zhang, Linhao, et al.
Publicado: (2025)
por: Zhang, Linhao, et al.
Publicado: (2025)
Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs
por: Wang, Dingdong, et al.
Publicado: (2025)
por: Wang, Dingdong, et al.
Publicado: (2025)
Speech-Worthy Alignment for Japanese SpeechLLMs via Direct Preference Optimization
por: Zhao, Mengjie, et al.
Publicado: (2026)
por: Zhao, Mengjie, et al.
Publicado: (2026)
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
por: Zhang, Xin, et al.
Publicado: (2023)
por: Zhang, Xin, et al.
Publicado: (2023)
The Voice Behind the Words: Quantifying Intersectional Bias in SpeechLLMs
por: Satish, Shree Harsha Bokkahalli, et al.
Publicado: (2026)
por: Satish, Shree Harsha Bokkahalli, et al.
Publicado: (2026)
Continuous Speech Tokenizer in Text To Speech
por: Li, Yixing, et al.
Publicado: (2024)
por: Li, Yixing, et al.
Publicado: (2024)
Contextualized Token Discrimination for Speech Search Query Correction
por: Lu, Junyu, et al.
Publicado: (2025)
por: Lu, Junyu, et al.
Publicado: (2025)
Next Tokens Denoising for Speech Synthesis
por: Liu, Yanqing, et al.
Publicado: (2025)
por: Liu, Yanqing, et al.
Publicado: (2025)
Frontend Token Enhancement for Token-Based Speech Recognition
por: Ashihara, Takanori, et al.
Publicado: (2026)
por: Ashihara, Takanori, et al.
Publicado: (2026)
DOA: Training-Free Decoder-Only Attention Policy for Long-Form Simultaneous Translation with SpeechLLMs
por: Papi, Sara, et al.
Publicado: (2026)
por: Papi, Sara, et al.
Publicado: (2026)
Rubric-Guided Fine-tuning of SpeechLLMs for Multi-Aspect, Multi-Rater L2 Reading-Speech Assessment
por: Parikh, Aditya Kamlesh, et al.
Publicado: (2026)
por: Parikh, Aditya Kamlesh, et al.
Publicado: (2026)
STAB: Speech Tokenizer Assessment Benchmark
por: Vashishth, Shikhar, et al.
Publicado: (2024)
por: Vashishth, Shikhar, et al.
Publicado: (2024)
TokenChain: A Discrete Speech Chain via Semantic Token Modeling
por: Wang, Mingxuan, et al.
Publicado: (2025)
por: Wang, Mingxuan, et al.
Publicado: (2025)
SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval
por: Lin, Yueqian, et al.
Publicado: (2024)
por: Lin, Yueqian, et al.
Publicado: (2024)
LM-SPT: LM-Aligned Semantic Distillation for Speech Tokenization
por: Jo, Daejin, et al.
Publicado: (2025)
por: Jo, Daejin, et al.
Publicado: (2025)
Factorized RVQ-GAN For Disentangled Speech Tokenization
por: Khurana, Sameer, et al.
Publicado: (2025)
por: Khurana, Sameer, et al.
Publicado: (2025)
Benchmarking Prosody Encoding in Discrete Speech Tokens
por: Onda, Kentaro, et al.
Publicado: (2025)
por: Onda, Kentaro, et al.
Publicado: (2025)
LAST: Language Model Aware Speech Tokenization
por: Turetzky, Arnon, et al.
Publicado: (2024)
por: Turetzky, Arnon, et al.
Publicado: (2024)
Do Bias Benchmarks Generalise? Evidence from Voice-based Evaluation of Gender Bias in SpeechLLMs
por: Satish, Shree Harsha Bokkahalli, et al.
Publicado: (2025)
por: Satish, Shree Harsha Bokkahalli, et al.
Publicado: (2025)
Exploring the Effect of Segmentation and Vocabulary Size on Speech Tokenization for Speech Language Models
por: Kando, Shunsuke, et al.
Publicado: (2025)
por: Kando, Shunsuke, et al.
Publicado: (2025)
SpeechLLM-as-Judges: Towards General and Interpretable Speech Quality Evaluation
por: Wang, Hui, et al.
Publicado: (2025)
por: Wang, Hui, et al.
Publicado: (2025)
PAST: Phonetic-Acoustic Speech Tokenizer
por: Har-Tuv, Nadav, et al.
Publicado: (2025)
por: Har-Tuv, Nadav, et al.
Publicado: (2025)
dMel: Speech Tokenization made Simple
por: Bai, Richard He, et al.
Publicado: (2024)
por: Bai, Richard He, et al.
Publicado: (2024)
NAST: Noise Aware Speech Tokenization for Speech Language Models
por: Messica, Shoval, et al.
Publicado: (2024)
por: Messica, Shoval, et al.
Publicado: (2024)
Rethinking Discrete Speech Representation Tokens for Accent Generation
por: Zhong, Jinzuomu, et al.
Publicado: (2026)
por: Zhong, Jinzuomu, et al.
Publicado: (2026)
Representing Speech Through Autoregressive Prediction of Cochlear Tokens
por: Tuckute, Greta, et al.
Publicado: (2025)
por: Tuckute, Greta, et al.
Publicado: (2025)
Children's Speech Recognition through Discrete Token Enhancement
por: Sukhadia, Vrunda N., et al.
Publicado: (2024)
por: Sukhadia, Vrunda N., et al.
Publicado: (2024)
A Comparative Study of Discrete Speech Tokens for Semantic-Related Tasks with Large Language Models
por: Wang, Dingdong, et al.
Publicado: (2024)
por: Wang, Dingdong, et al.
Publicado: (2024)
Qwen vs. Gemma Integration with Whisper: A Comparative Study in Multilingual SpeechLLM Systems
por: Nguyen, Tuan, et al.
Publicado: (2025)
por: Nguyen, Tuan, et al.
Publicado: (2025)
FELLE: Autoregressive Speech Synthesis with Token-Wise Coarse-to-Fine Flow Matching
por: Wang, Hui, et al.
Publicado: (2025)
por: Wang, Hui, et al.
Publicado: (2025)
Explainable Transformer-CNN Fusion for Noise-Robust Speech Emotion Recognition
por: Chakrabarty, Sudip, et al.
Publicado: (2025)
por: Chakrabarty, Sudip, et al.
Publicado: (2025)
TASTE-Streaming: Towards Streamable Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
por: Tseng, Liang-Hsuan, et al.
Publicado: (2026)
por: Tseng, Liang-Hsuan, et al.
Publicado: (2026)
Utilizing Neural Transducers for Two-Stage Text-to-Speech via Semantic Token Prediction
por: Kim, Minchan, et al.
Publicado: (2024)
por: Kim, Minchan, et al.
Publicado: (2024)
Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners
por: Yuan, Ze, et al.
Publicado: (2024)
por: Yuan, Ze, et al.
Publicado: (2024)
XLAVS-R: Cross-Lingual Audio-Visual Speech Representation Learning for Noise-Robust Speech Perception
por: Han, HyoJung, et al.
Publicado: (2024)
por: Han, HyoJung, et al.
Publicado: (2024)
EchoX: Towards Mitigating Acoustic-Semantic Gap via Echo Training for Speech-to-Speech LLMs
por: Zhang, Yuhao, et al.
Publicado: (2025)
por: Zhang, Yuhao, et al.
Publicado: (2025)
TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
por: Tseng, Liang-Hsuan, et al.
Publicado: (2025)
por: Tseng, Liang-Hsuan, et al.
Publicado: (2025)
DM-Codec: Distilling Multimodal Representations for Speech Tokenization
por: Ahasan, Md Mubtasim, et al.
Publicado: (2024)
por: Ahasan, Md Mubtasim, et al.
Publicado: (2024)
S2ST-Omni: Hierarchical Language-Aware SpeechLLM Adaptation for Multilingual Speech-to-Speech Translation
por: Pan, Yu, et al.
Publicado: (2025)
por: Pan, Yu, et al.
Publicado: (2025)
Ejemplares similares
-
Beyond Transcription: Unified Audio Schema for Perception-Aware AudioLLMs
por: Zhang, Linhao, et al.
Publicado: (2026) -
WildSpeech-Bench: Benchmarking End-to-End SpeechLLMs in the Wild
por: Zhang, Linhao, et al.
Publicado: (2025) -
Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs
por: Wang, Dingdong, et al.
Publicado: (2025) -
Speech-Worthy Alignment for Japanese SpeechLLMs via Direct Preference Optimization
por: Zhao, Mengjie, et al.
Publicado: (2026) -
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
por: Zhang, Xin, et al.
Publicado: (2023)