PredGen: Accelerated Inference of Large Language Models through Input-Time Speculation for Real-Time Speech Interaction
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Shufan, Grover, Aditya |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CM-TTS: Enhancing Real Time Text-to-Speech Synthesis Efficiency through Weighted Samplers and Consistency Models
par: Li, Xiang, et autres
Publié: (2024)
par: Li, Xiang, et autres
Publié: (2024)
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
par: Zhang, Xin, et autres
Publié: (2023)
par: Zhang, Xin, et autres
Publié: (2023)
Speech Recognition Rescoring with Large Speech-Text Foundation Models
par: Shivakumar, Prashanth Gurunath, et autres
Publié: (2024)
par: Shivakumar, Prashanth Gurunath, et autres
Publié: (2024)
StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling
par: Wang, Hui, et autres
Publié: (2025)
par: Wang, Hui, et autres
Publié: (2025)
Phonikud: Hebrew Grapheme-to-Phoneme Conversion for Real-Time Text-to-Speech
par: Kolani, Yakov, et autres
Publié: (2025)
par: Kolani, Yakov, et autres
Publié: (2025)
SpeechGPT-Gen: Scaling Chain-of-Information Speech Generation
par: Zhang, Dong, et autres
Publié: (2024)
par: Zhang, Dong, et autres
Publié: (2024)
An End-to-End Speech Summarization Using Large Language Model
par: Shang, Hengchao, et autres
Publié: (2024)
par: Shang, Hengchao, et autres
Publié: (2024)
StreamUni: Achieving Streaming Speech Translation with a Unified Large Speech-Language Model
par: Guo, Shoutao, et autres
Publié: (2025)
par: Guo, Shoutao, et autres
Publié: (2025)
Closing the Modality Reasoning Gap for Speech Large Language Models
par: Wang, Chaoren, et autres
Publié: (2026)
par: Wang, Chaoren, et autres
Publié: (2026)
Boosting Large Language Model for Speech Synthesis: An Empirical Study
par: Hao, Hongkun, et autres
Publié: (2023)
par: Hao, Hongkun, et autres
Publié: (2023)
Generating Data with Text-to-Speech and Large-Language Models for Conversational Speech Recognition
par: Cornell, Samuele, et autres
Publié: (2024)
par: Cornell, Samuele, et autres
Publié: (2024)
Leveraging Large Language Models for Sarcastic Speech Annotation in Sarcasm Detection
par: Li, Zhu, et autres
Publié: (2025)
par: Li, Zhu, et autres
Publié: (2025)
Customizing Speech Recognition Model with Large Language Model Feedback
par: Ling, Shaoshi, et autres
Publié: (2025)
par: Ling, Shaoshi, et autres
Publié: (2025)
Large Language Models for Dysfluency Detection in Stuttered Speech
par: Wagner, Dominik, et autres
Publié: (2024)
par: Wagner, Dominik, et autres
Publié: (2024)
Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving
par: Xie, Jingran, et autres
Publié: (2025)
par: Xie, Jingran, et autres
Publié: (2025)
LI-TTA: Language Informed Test-Time Adaptation for Automatic Speech Recognition
par: Yoon, Eunseop, et autres
Publié: (2024)
par: Yoon, Eunseop, et autres
Publié: (2024)
VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech
par: Lin, Yi-Cheng, et autres
Publié: (2026)
par: Lin, Yi-Cheng, et autres
Publié: (2026)
Frozen Large Language Models Can Perceive Paralinguistic Aspects of Speech
par: Kang, Wonjune, et autres
Publié: (2024)
par: Kang, Wonjune, et autres
Publié: (2024)
Enabling Auditory Large Language Models for Automatic Speech Quality Evaluation
par: Wang, Siyin, et autres
Publié: (2024)
par: Wang, Siyin, et autres
Publié: (2024)
BLSP-Emo: Towards Empathetic Large Speech-Language Models
par: Wang, Chen, et autres
Publié: (2024)
par: Wang, Chen, et autres
Publié: (2024)
SpeechVerse: A Large-scale Generalizable Audio Language Model
par: Das, Nilaksh, et autres
Publié: (2024)
par: Das, Nilaksh, et autres
Publié: (2024)
S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models
par: Fang, Yuanbo, et autres
Publié: (2025)
par: Fang, Yuanbo, et autres
Publié: (2025)
SEAL: Speech Embedding Alignment Learning for Speech Large Language Model with Retrieval-Augmented Generation
par: Sun, Chunyu, et autres
Publié: (2025)
par: Sun, Chunyu, et autres
Publié: (2025)
SpeechGuard: Exploring the Adversarial Robustness of Multimodal Large Language Models
par: Peri, Raghuveer, et autres
Publié: (2024)
par: Peri, Raghuveer, et autres
Publié: (2024)
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators
par: Chen, Chen, et autres
Publié: (2025)
par: Chen, Chen, et autres
Publié: (2025)
Paralinguistics-Aware Speech-Empowered Large Language Models for Natural Conversation
par: Kim, Heeseung, et autres
Publié: (2024)
par: Kim, Heeseung, et autres
Publié: (2024)
Investigating Decoder-only Large Language Models for Speech-to-text Translation
par: Huang, Chao-Wei, et autres
Publié: (2024)
par: Huang, Chao-Wei, et autres
Publié: (2024)
SALM-Duplex: Efficient and Direct Duplex Modeling for Speech-to-Speech Language Model
par: Hu, Ke, et autres
Publié: (2025)
par: Hu, Ke, et autres
Publié: (2025)
Speech-Copilot: Leveraging Large Language Models for Speech Processing via Task Decomposition, Modularization, and Program Generation
par: Kuan, Chun-Yi, et autres
Publié: (2024)
par: Kuan, Chun-Yi, et autres
Publié: (2024)
Assessment of L2 Oral Proficiency using Speech Large Language Models
par: Ma, Rao, et autres
Publié: (2025)
par: Ma, Rao, et autres
Publié: (2025)
When Large Language Models Meet Speech: A Survey on Integration Approaches
par: Yang, Zhengdong, et autres
Publié: (2025)
par: Yang, Zhengdong, et autres
Publié: (2025)
Leveraging Large Language Models for Spontaneous Speech-Based Suicide Risk Detection
par: Gao, Yifan, et autres
Publié: (2025)
par: Gao, Yifan, et autres
Publié: (2025)
Pinyin Regularization in Error Correction for Chinese Speech Recognition with Large Language Models
par: Tang, Zhiyuan, et autres
Publié: (2024)
par: Tang, Zhiyuan, et autres
Publié: (2024)
JPPO: Joint Power and Prompt Optimization for Accelerated Large Language Model Services
par: You, Feiran, et autres
Publié: (2024)
par: You, Feiran, et autres
Publié: (2024)
SimulS2S-LLM: Unlocking Simultaneous Inference of Speech LLMs for Speech-to-Speech Translation
par: Deng, Keqi, et autres
Publié: (2025)
par: Deng, Keqi, et autres
Publié: (2025)
ESPnet-SpeechLM: An Open Speech Language Model Toolkit
par: Tian, Jinchuan, et autres
Publié: (2025)
par: Tian, Jinchuan, et autres
Publié: (2025)
VOX-KRIKRI: Unifying Speech and Language through Continuous Fusion
par: Damianos, Dimitrios, et autres
Publié: (2025)
par: Damianos, Dimitrios, et autres
Publié: (2025)
Spontaneous Speech-Based Suicide Risk Detection Using Whisper and Large Language Models
par: Cui, Ziyun, et autres
Publié: (2024)
par: Cui, Ziyun, et autres
Publié: (2024)
Enhancing Large Language Model-based Speech Recognition by Contextualization for Rare and Ambiguous Words
par: Nozawa, Kento, et autres
Publié: (2024)
par: Nozawa, Kento, et autres
Publié: (2024)
Exploring the Integration of Large Language Models into Automatic Speech Recognition Systems: An Empirical Study
par: Min, Zeping, et autres
Publié: (2023)
par: Min, Zeping, et autres
Publié: (2023)
Documents similaires
-
CM-TTS: Enhancing Real Time Text-to-Speech Synthesis Efficiency through Weighted Samplers and Consistency Models
par: Li, Xiang, et autres
Publié: (2024) -
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
par: Zhang, Xin, et autres
Publié: (2023) -
Speech Recognition Rescoring with Large Speech-Text Foundation Models
par: Shivakumar, Prashanth Gurunath, et autres
Publié: (2024) -
StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling
par: Wang, Hui, et autres
Publié: (2025) -
Phonikud: Hebrew Grapheme-to-Phoneme Conversion for Real-Time Text-to-Speech
par: Kolani, Yakov, et autres
Publié: (2025)