TASLA: Text-Aligned Speech Tokens with Multiple Layer-Aggregation
Fuente:
arXiv
Guardado en:
| Autores principales: | Hsu, Ming-Hao, Tseng, Liang-Hsuan, Lee, Hung-yi, Wu, Zhizheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
TASTE-Streaming: Towards Streamable Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
por: Tseng, Liang-Hsuan, et al.
Publicado: (2026)
por: Tseng, Liang-Hsuan, et al.
Publicado: (2026)
TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
por: Tseng, Liang-Hsuan, et al.
Publicado: (2025)
por: Tseng, Liang-Hsuan, et al.
Publicado: (2025)
SMILE: Speech Meta In-Context Learning for Low-Resource Language Automatic Speech Recognition
por: Hsu, Ming-Hao, et al.
Publicado: (2024)
por: Hsu, Ming-Hao, et al.
Publicado: (2024)
CodecFake: Enhancing Anti-Spoofing Models Against Deepfake Audios from Codec-Based Speech Synthesis Systems
por: Wu, Haibin, et al.
Publicado: (2024)
por: Wu, Haibin, et al.
Publicado: (2024)
TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
por: Wang, Yuancheng, et al.
Publicado: (2025)
por: Wang, Yuancheng, et al.
Publicado: (2025)
Parallel Synthesis for Autoregressive Speech Generation
por: Hsu, Po-chun, et al.
Publicado: (2022)
por: Hsu, Po-chun, et al.
Publicado: (2022)
Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers
por: Lin, Tzu-Quan, et al.
Publicado: (2025)
por: Lin, Tzu-Quan, et al.
Publicado: (2025)
Academic Text-to-Music Grand Challenge: Datasets, Baselines, and Evaluation Methods
por: Hsieh, Fang-Chih, et al.
Publicado: (2026)
por: Hsieh, Fang-Chih, et al.
Publicado: (2026)
Continual Test-time Adaptation for End-to-end Speech Recognition on Noisy Speech
por: Lin, Guan-Ting, et al.
Publicado: (2024)
por: Lin, Guan-Ting, et al.
Publicado: (2024)
Speech-FT: Merging Pre-trained And Fine-Tuned Speech Representation Models For Cross-Task Generalization
por: Lin, Tzu-Quan, et al.
Publicado: (2025)
por: Lin, Tzu-Quan, et al.
Publicado: (2025)
REBORN: Reinforcement-Learned Boundary Segmentation with Iterative Training for Unsupervised ASR
por: Tseng, Liang-Hsuan, et al.
Publicado: (2024)
por: Tseng, Liang-Hsuan, et al.
Publicado: (2024)
DAISY: Data Adaptive Self-Supervised Early Exit for Speech Representation Models
por: Lin, Tzu-Quan, et al.
Publicado: (2024)
por: Lin, Tzu-Quan, et al.
Publicado: (2024)
Zero Resource Code-switched Speech Benchmark Using Speech Utterance Pairs For Multiple Spoken Languages
por: Huang, Kuan-Po, et al.
Publicado: (2023)
por: Huang, Kuan-Po, et al.
Publicado: (2023)
When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models
por: Li, Chen-An, et al.
Publicado: (2025)
por: Li, Chen-An, et al.
Publicado: (2025)
Causal Tracing of Audio-Text Fusion in Large Audio Language Models
por: Chen, Wei-Chih, et al.
Publicado: (2026)
por: Chen, Wei-Chih, et al.
Publicado: (2026)
Leave No Knowledge Behind During Knowledge Distillation: Towards Practical and Effective Knowledge Distillation for Code-Switching ASR Using Realistic Data
por: Tseng, Liang-Hsuan, et al.
Publicado: (2024)
por: Tseng, Liang-Hsuan, et al.
Publicado: (2024)
Investigating the Effects of Large-Scale Pseudo-Stereo Data and Different Speech Foundation Model on Dialogue Generative Spoken Language Model
por: Fu, Yu-Kuan, et al.
Publicado: (2024)
por: Fu, Yu-Kuan, et al.
Publicado: (2024)
Multi-Scale Accent Modeling and Disentangling for Multi-Speaker Multi-Accent Text-to-Speech Synthesis
por: Zhou, Xuehao, et al.
Publicado: (2024)
por: Zhou, Xuehao, et al.
Publicado: (2024)
Property Neurons in Self-Supervised Speech Transformers
por: Lin, Tzu-Quan, et al.
Publicado: (2024)
por: Lin, Tzu-Quan, et al.
Publicado: (2024)
Improving Speech Emotion Recognition in Under-Resourced Languages via Speech-to-Speech Translation with Bootstrapping Data Selection
por: Lin, Hsi-Che, et al.
Publicado: (2024)
por: Lin, Hsi-Che, et al.
Publicado: (2024)
LLM-Codec: Neural Audio Codec Meets Language Model Objectives
por: Chung, Ho-Lam, et al.
Publicado: (2026)
por: Chung, Ho-Lam, et al.
Publicado: (2026)
CodecFake+: A Large-Scale Neural Audio Codec-Based Deepfake Speech Dataset
por: Chen, Xuanjun, et al.
Publicado: (2025)
por: Chen, Xuanjun, et al.
Publicado: (2025)
Stimulus Modality Matters: Impact of Perceptual Evaluations from Different Modalities on Speech Emotion Recognition System Performance
por: Chou, Huang-Cheng, et al.
Publicado: (2024)
por: Chou, Huang-Cheng, et al.
Publicado: (2024)
Task Arithmetic can Mitigate Synthetic-to-Real Gap in Automatic Speech Recognition
por: Su, Hsuan, et al.
Publicado: (2024)
por: Su, Hsuan, et al.
Publicado: (2024)
NV-Bench: Benchmark of Nonverbal Vocalization Synthesis for Expressive Text-to-Speech Generation
por: Ni, Qinke, et al.
Publicado: (2026)
por: Ni, Qinke, et al.
Publicado: (2026)
Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment
por: Zhang, Xueyao, et al.
Publicado: (2025)
por: Zhang, Xueyao, et al.
Publicado: (2025)
Continuous Speech Tokenizer in Text To Speech
por: Li, Yixing, et al.
Publicado: (2024)
por: Li, Yixing, et al.
Publicado: (2024)
Mitigating Subgroup Disparities in Multi-Label Speech Emotion Recognition: A Pseudo-Labeling and Unsupervised Learning Approach
por: Lin, Yi-Cheng, et al.
Publicado: (2025)
por: Lin, Yi-Cheng, et al.
Publicado: (2025)
UniAudio 2.0: A Unified Audio Language Model with Text-Aligned Factorized Audio Tokenization
por: Yang, Dongchao, et al.
Publicado: (2026)
por: Yang, Dongchao, et al.
Publicado: (2026)
TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling
por: Xie, Hao-Hui, et al.
Publicado: (2026)
por: Xie, Hao-Hui, et al.
Publicado: (2026)
Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition
por: Wang, Shih-heng, et al.
Publicado: (2024)
por: Wang, Shih-heng, et al.
Publicado: (2024)
Towards Generalized Source Tracing for Codec-Based Deepfake Speech
por: Chen, Xuanjun, et al.
Publicado: (2025)
por: Chen, Xuanjun, et al.
Publicado: (2025)
Beyond Fixed Frames: Dynamic Character-Aligned Speech Tokenization
por: Della Libera, Luca, et al.
Publicado: (2026)
por: Della Libera, Luca, et al.
Publicado: (2026)
Efficient Training of Self-Supervised Speech Foundation Models on a Compute Budget
por: Liu, Andy T., et al.
Publicado: (2024)
por: Liu, Andy T., et al.
Publicado: (2024)
SAKURA: On the Multi-hop Reasoning of Large Audio-Language Models Based on Speech and Audio Information
por: Yang, Chih-Kai, et al.
Publicado: (2025)
por: Yang, Chih-Kai, et al.
Publicado: (2025)
Toward Fair Speech Technologies: A Comprehensive Survey of Bias and Fairness in Speech AI
por: Lin, Yi-Cheng, et al.
Publicado: (2026)
por: Lin, Yi-Cheng, et al.
Publicado: (2026)
Teaching Audio-Aware Large Language Models What Does Not Hear: Mitigating Hallucinations through Synthesized Negative Samples
por: Kuan, Chun-Yi, et al.
Publicado: (2025)
por: Kuan, Chun-Yi, et al.
Publicado: (2025)
Can Large Audio-Language Models Truly Hear? Tackling Hallucinations with Multi-Task Assessment and Stepwise Audio Reasoning
por: Kuan, Chun-Yi, et al.
Publicado: (2024)
por: Kuan, Chun-Yi, et al.
Publicado: (2024)
VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech
por: Lin, Yi-Cheng, et al.
Publicado: (2026)
por: Lin, Yi-Cheng, et al.
Publicado: (2026)
NVBench: A Benchmark for Speech Synthesis with Non-Verbal Vocalizations
por: Xue, Liumeng, et al.
Publicado: (2026)
por: Xue, Liumeng, et al.
Publicado: (2026)
Ejemplares similares
-
TASTE-Streaming: Towards Streamable Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
por: Tseng, Liang-Hsuan, et al.
Publicado: (2026) -
TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
por: Tseng, Liang-Hsuan, et al.
Publicado: (2025) -
SMILE: Speech Meta In-Context Learning for Low-Resource Language Automatic Speech Recognition
por: Hsu, Ming-Hao, et al.
Publicado: (2024) -
CodecFake: Enhancing Anti-Spoofing Models Against Deepfake Audios from Codec-Based Speech Synthesis Systems
por: Wu, Haibin, et al.
Publicado: (2024) -
TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
por: Wang, Yuancheng, et al.
Publicado: (2025)