TASU: Text-Only Alignment for Speech Understanding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Peng, Jing, Yang, Yi, Li, Xu, Xi, Yu, Tang, Quanwei, Fang, Yangui, Li, Junjie, Yu, Kai |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs
par: Peng, Jing, et autres
Publié: (2026)
par: Peng, Jing, et autres
Publié: (2026)
Low-Resource Domain Adaptation for Speech LLMs via Text-Only Fine-Tuning
par: Fang, Yangui, et autres
Publié: (2025)
par: Fang, Yangui, et autres
Publié: (2025)
MOSA: Mixtures of Simple Adapters Outperform Monolithic Approaches in LLM-based Multilingual ASR
par: Li, Junjie, et autres
Publié: (2025)
par: Li, Junjie, et autres
Publié: (2025)
Joint decoding method for controllable contextual speech recognition based on Speech LLM
par: Fang, Yangui, et autres
Publié: (2025)
par: Fang, Yangui, et autres
Publié: (2025)
A Survey on Speech Large Language Models for Understanding
par: Peng, Jing, et autres
Publié: (2024)
par: Peng, Jing, et autres
Publié: (2024)
TC-BiMamba: Trans-Chunk bidirectionally within BiMamba for unified streaming and non-streaming ASR
par: She, Qingshun, et autres
Publié: (2026)
par: She, Qingshun, et autres
Publié: (2026)
Text-aware Speech Separation for Multi-talker Keyword Spotting
par: Li, Haoyu, et autres
Publié: (2024)
par: Li, Haoyu, et autres
Publié: (2024)
Fewer Hallucinations, More Verification: A Three-Stage LLM-Based Framework for ASR Error Correction
par: Fang, Yangui, et autres
Publié: (2025)
par: Fang, Yangui, et autres
Publié: (2025)
Attention-Constrained Inference for Robust Decoder-Only Text-to-Speech
par: Wang, Hankun, et autres
Publié: (2024)
par: Wang, Hankun, et autres
Publié: (2024)
VALL-T: Decoder-Only Generative Transducer for Robust and Decoding-Controllable Text-to-Speech
par: Du, Chenpeng, et autres
Publié: (2024)
par: Du, Chenpeng, et autres
Publié: (2024)
Adaptive Duration Model for Text Speech Alignment
par: Cao, Junjie
Publié: (2025)
par: Cao, Junjie
Publié: (2025)
Contrastive Learning With Audio Discrimination For Customizable Keyword Spotting In Continuous Speech
par: Xi, Yu, et autres
Publié: (2024)
par: Xi, Yu, et autres
Publié: (2024)
Semi-supervised Learning for Code-Switching ASR with Large Language Model Filter
par: Xi, Yu, et autres
Publié: (2024)
par: Xi, Yu, et autres
Publié: (2024)
TTA: Transcribe, Translate and Alignment for Cross-lingual Speech Representation
par: Liu, Wei, et autres
Publié: (2025)
par: Liu, Wei, et autres
Publié: (2025)
FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications
par: Guo, Hao-Han, et autres
Publié: (2024)
par: Guo, Hao-Han, et autres
Publié: (2024)
Audio-Mind: An Auditable Agentic Framework for Audio Understanding
par: Wang, Yucheng, et autres
Publié: (2026)
par: Wang, Yucheng, et autres
Publié: (2026)
Interleaved Speech-Text Language Models for Simple Streaming Text-to-Speech Synthesis
par: Yang, Yifan, et autres
Publié: (2024)
par: Yang, Yifan, et autres
Publié: (2024)
Neural Directed Speech Enhancement with Dual Microphone Array in High Noise Scenario
par: Wen, Wen, et autres
Publié: (2024)
par: Wen, Wen, et autres
Publié: (2024)
Time-Layer Adaptive Alignment for Speaker Similarity in Flow-Matching Based Zero-Shot TTS
par: Li, Haoyu, et autres
Publié: (2025)
par: Li, Haoyu, et autres
Publié: (2025)
TDT-KWS: Fast And Accurate Keyword Spotting Using Token-and-duration Transducer
par: Xi, Yu, et autres
Publié: (2024)
par: Xi, Yu, et autres
Publié: (2024)
Speech-Omni-Lite: Portable Speech Interfaces for Vision-Language Models
par: Tao, Dehua, et autres
Publié: (2026)
par: Tao, Dehua, et autres
Publié: (2026)
FireRedTTS-1S: An Upgraded Streamable Foundation Text-to-Speech System
par: Guo, Hao-Han, et autres
Publié: (2025)
par: Guo, Hao-Han, et autres
Publié: (2025)
Total-Duration-Aware Duration Modeling for Text-to-Speech Systems
par: Eskimez, Sefik Emre, et autres
Publié: (2024)
par: Eskimez, Sefik Emre, et autres
Publié: (2024)
Position: Towards Responsible Evaluation for Text-to-Speech
par: Yang, Yifan, et autres
Publié: (2025)
par: Yang, Yifan, et autres
Publié: (2025)
Adversarial Attacks and Robust Defenses in Speaker Embedding based Zero-Shot Text-to-Speech System
par: Li, Ze, et autres
Publié: (2024)
par: Li, Ze, et autres
Publié: (2024)
AS-Speech: Adaptive Style For Speech Synthesis
par: Li, Zhipeng, et autres
Publié: (2024)
par: Li, Zhipeng, et autres
Publié: (2024)
MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder
par: Zhang, Bowen, et autres
Publié: (2025)
par: Zhang, Bowen, et autres
Publié: (2025)
VQTTS: High-Fidelity Text-to-Speech Synthesis with Self-Supervised VQ Acoustic Feature
par: Du, Chenpeng, et autres
Publié: (2022)
par: Du, Chenpeng, et autres
Publié: (2022)
Text2Move: Text-to-moving sound generation via trajectory prediction and temporal alignment
par: Liu, Yunyi, et autres
Publié: (2025)
par: Liu, Yunyi, et autres
Publié: (2025)
HoliTok:A Coutinuous Holistic Tokenization with Robust Dual Capabilities of Speech Generation and Understanding
par: Li, Bohan, et autres
Publié: (2026)
par: Li, Bohan, et autres
Publié: (2026)
DeSTA: Enhancing Speech Language Models through Descriptive Speech-Text Alignment
par: Lu, Ke-Han, et autres
Publié: (2024)
par: Lu, Ke-Han, et autres
Publié: (2024)
FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech
par: Ma, Linhan, et autres
Publié: (2025)
par: Ma, Linhan, et autres
Publié: (2025)
MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts
par: Xue, Heyang, et autres
Publié: (2025)
par: Xue, Heyang, et autres
Publié: (2025)
FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot
par: Xie, Kun, et autres
Publié: (2025)
par: Xie, Kun, et autres
Publié: (2025)
Balancing Speech Understanding and Generation Using Continual Pre-training for Codec-based Speech LLM
par: Shi, Jiatong, et autres
Publié: (2025)
par: Shi, Jiatong, et autres
Publié: (2025)
Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment
par: Zhang, Xueyao, et autres
Publié: (2025)
par: Zhang, Xueyao, et autres
Publié: (2025)
DAIEN-TTS: Disentangled Audio Infilling for Environment-Aware Text-to-Speech Synthesis
par: Lu, Ye-Xin, et autres
Publié: (2025)
par: Lu, Ye-Xin, et autres
Publié: (2025)
FireRedASR2S: A State-of-the-Art Industrial-Grade All-in-One Automatic Speech Recognition System
par: Xu, Kaituo, et autres
Publié: (2026)
par: Xu, Kaituo, et autres
Publié: (2026)
Streaming Speech Recognition with Decoder-Only Large Language Models and Latency Optimization
par: Wan, Genshun, et autres
Publié: (2026)
par: Wan, Genshun, et autres
Publié: (2026)
Incremental Disentanglement for Environment-Aware Zero-Shot Text-to-Speech Synthesis
par: Lu, Ye-Xin, et autres
Publié: (2024)
par: Lu, Ye-Xin, et autres
Publié: (2024)
Documents similaires
-
TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs
par: Peng, Jing, et autres
Publié: (2026) -
Low-Resource Domain Adaptation for Speech LLMs via Text-Only Fine-Tuning
par: Fang, Yangui, et autres
Publié: (2025) -
MOSA: Mixtures of Simple Adapters Outperform Monolithic Approaches in LLM-based Multilingual ASR
par: Li, Junjie, et autres
Publié: (2025) -
Joint decoding method for controllable contextual speech recognition based on Speech LLM
par: Fang, Yangui, et autres
Publié: (2025) -
A Survey on Speech Large Language Models for Understanding
par: Peng, Jing, et autres
Publié: (2024)