PredGen: Accelerated Inference of Large Language Models through Input-Time Speculation for Real-Time Speech Interaction
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Shufan, Grover, Aditya |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CM-TTS: Enhancing Real Time Text-to-Speech Synthesis Efficiency through Weighted Samplers and Consistency Models
di: Li, Xiang, et al.
Pubblicazione: (2024)
di: Li, Xiang, et al.
Pubblicazione: (2024)
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
di: Zhang, Xin, et al.
Pubblicazione: (2023)
di: Zhang, Xin, et al.
Pubblicazione: (2023)
Speech Recognition Rescoring with Large Speech-Text Foundation Models
di: Shivakumar, Prashanth Gurunath, et al.
Pubblicazione: (2024)
di: Shivakumar, Prashanth Gurunath, et al.
Pubblicazione: (2024)
StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling
di: Wang, Hui, et al.
Pubblicazione: (2025)
di: Wang, Hui, et al.
Pubblicazione: (2025)
Phonikud: Hebrew Grapheme-to-Phoneme Conversion for Real-Time Text-to-Speech
di: Kolani, Yakov, et al.
Pubblicazione: (2025)
di: Kolani, Yakov, et al.
Pubblicazione: (2025)
SpeechGPT-Gen: Scaling Chain-of-Information Speech Generation
di: Zhang, Dong, et al.
Pubblicazione: (2024)
di: Zhang, Dong, et al.
Pubblicazione: (2024)
An End-to-End Speech Summarization Using Large Language Model
di: Shang, Hengchao, et al.
Pubblicazione: (2024)
di: Shang, Hengchao, et al.
Pubblicazione: (2024)
StreamUni: Achieving Streaming Speech Translation with a Unified Large Speech-Language Model
di: Guo, Shoutao, et al.
Pubblicazione: (2025)
di: Guo, Shoutao, et al.
Pubblicazione: (2025)
Closing the Modality Reasoning Gap for Speech Large Language Models
di: Wang, Chaoren, et al.
Pubblicazione: (2026)
di: Wang, Chaoren, et al.
Pubblicazione: (2026)
Boosting Large Language Model for Speech Synthesis: An Empirical Study
di: Hao, Hongkun, et al.
Pubblicazione: (2023)
di: Hao, Hongkun, et al.
Pubblicazione: (2023)
Generating Data with Text-to-Speech and Large-Language Models for Conversational Speech Recognition
di: Cornell, Samuele, et al.
Pubblicazione: (2024)
di: Cornell, Samuele, et al.
Pubblicazione: (2024)
Leveraging Large Language Models for Sarcastic Speech Annotation in Sarcasm Detection
di: Li, Zhu, et al.
Pubblicazione: (2025)
di: Li, Zhu, et al.
Pubblicazione: (2025)
Customizing Speech Recognition Model with Large Language Model Feedback
di: Ling, Shaoshi, et al.
Pubblicazione: (2025)
di: Ling, Shaoshi, et al.
Pubblicazione: (2025)
Large Language Models for Dysfluency Detection in Stuttered Speech
di: Wagner, Dominik, et al.
Pubblicazione: (2024)
di: Wagner, Dominik, et al.
Pubblicazione: (2024)
Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving
di: Xie, Jingran, et al.
Pubblicazione: (2025)
di: Xie, Jingran, et al.
Pubblicazione: (2025)
LI-TTA: Language Informed Test-Time Adaptation for Automatic Speech Recognition
di: Yoon, Eunseop, et al.
Pubblicazione: (2024)
di: Yoon, Eunseop, et al.
Pubblicazione: (2024)
VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2026)
di: Lin, Yi-Cheng, et al.
Pubblicazione: (2026)
Frozen Large Language Models Can Perceive Paralinguistic Aspects of Speech
di: Kang, Wonjune, et al.
Pubblicazione: (2024)
di: Kang, Wonjune, et al.
Pubblicazione: (2024)
Enabling Auditory Large Language Models for Automatic Speech Quality Evaluation
di: Wang, Siyin, et al.
Pubblicazione: (2024)
di: Wang, Siyin, et al.
Pubblicazione: (2024)
BLSP-Emo: Towards Empathetic Large Speech-Language Models
di: Wang, Chen, et al.
Pubblicazione: (2024)
di: Wang, Chen, et al.
Pubblicazione: (2024)
SpeechVerse: A Large-scale Generalizable Audio Language Model
di: Das, Nilaksh, et al.
Pubblicazione: (2024)
di: Das, Nilaksh, et al.
Pubblicazione: (2024)
S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models
di: Fang, Yuanbo, et al.
Pubblicazione: (2025)
di: Fang, Yuanbo, et al.
Pubblicazione: (2025)
SEAL: Speech Embedding Alignment Learning for Speech Large Language Model with Retrieval-Augmented Generation
di: Sun, Chunyu, et al.
Pubblicazione: (2025)
di: Sun, Chunyu, et al.
Pubblicazione: (2025)
SpeechGuard: Exploring the Adversarial Robustness of Multimodal Large Language Models
di: Peri, Raghuveer, et al.
Pubblicazione: (2024)
di: Peri, Raghuveer, et al.
Pubblicazione: (2024)
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators
di: Chen, Chen, et al.
Pubblicazione: (2025)
di: Chen, Chen, et al.
Pubblicazione: (2025)
Paralinguistics-Aware Speech-Empowered Large Language Models for Natural Conversation
di: Kim, Heeseung, et al.
Pubblicazione: (2024)
di: Kim, Heeseung, et al.
Pubblicazione: (2024)
Investigating Decoder-only Large Language Models for Speech-to-text Translation
di: Huang, Chao-Wei, et al.
Pubblicazione: (2024)
di: Huang, Chao-Wei, et al.
Pubblicazione: (2024)
SALM-Duplex: Efficient and Direct Duplex Modeling for Speech-to-Speech Language Model
di: Hu, Ke, et al.
Pubblicazione: (2025)
di: Hu, Ke, et al.
Pubblicazione: (2025)
Speech-Copilot: Leveraging Large Language Models for Speech Processing via Task Decomposition, Modularization, and Program Generation
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2024)
Assessment of L2 Oral Proficiency using Speech Large Language Models
di: Ma, Rao, et al.
Pubblicazione: (2025)
di: Ma, Rao, et al.
Pubblicazione: (2025)
When Large Language Models Meet Speech: A Survey on Integration Approaches
di: Yang, Zhengdong, et al.
Pubblicazione: (2025)
di: Yang, Zhengdong, et al.
Pubblicazione: (2025)
Leveraging Large Language Models for Spontaneous Speech-Based Suicide Risk Detection
di: Gao, Yifan, et al.
Pubblicazione: (2025)
di: Gao, Yifan, et al.
Pubblicazione: (2025)
Pinyin Regularization in Error Correction for Chinese Speech Recognition with Large Language Models
di: Tang, Zhiyuan, et al.
Pubblicazione: (2024)
di: Tang, Zhiyuan, et al.
Pubblicazione: (2024)
JPPO: Joint Power and Prompt Optimization for Accelerated Large Language Model Services
di: You, Feiran, et al.
Pubblicazione: (2024)
di: You, Feiran, et al.
Pubblicazione: (2024)
SimulS2S-LLM: Unlocking Simultaneous Inference of Speech LLMs for Speech-to-Speech Translation
di: Deng, Keqi, et al.
Pubblicazione: (2025)
di: Deng, Keqi, et al.
Pubblicazione: (2025)
ESPnet-SpeechLM: An Open Speech Language Model Toolkit
di: Tian, Jinchuan, et al.
Pubblicazione: (2025)
di: Tian, Jinchuan, et al.
Pubblicazione: (2025)
VOX-KRIKRI: Unifying Speech and Language through Continuous Fusion
di: Damianos, Dimitrios, et al.
Pubblicazione: (2025)
di: Damianos, Dimitrios, et al.
Pubblicazione: (2025)
Spontaneous Speech-Based Suicide Risk Detection Using Whisper and Large Language Models
di: Cui, Ziyun, et al.
Pubblicazione: (2024)
di: Cui, Ziyun, et al.
Pubblicazione: (2024)
Enhancing Large Language Model-based Speech Recognition by Contextualization for Rare and Ambiguous Words
di: Nozawa, Kento, et al.
Pubblicazione: (2024)
di: Nozawa, Kento, et al.
Pubblicazione: (2024)
Exploring the Integration of Large Language Models into Automatic Speech Recognition Systems: An Empirical Study
di: Min, Zeping, et al.
Pubblicazione: (2023)
di: Min, Zeping, et al.
Pubblicazione: (2023)
Documenti analoghi
-
CM-TTS: Enhancing Real Time Text-to-Speech Synthesis Efficiency through Weighted Samplers and Consistency Models
di: Li, Xiang, et al.
Pubblicazione: (2024) -
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
di: Zhang, Xin, et al.
Pubblicazione: (2023) -
Speech Recognition Rescoring with Large Speech-Text Foundation Models
di: Shivakumar, Prashanth Gurunath, et al.
Pubblicazione: (2024) -
StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling
di: Wang, Hui, et al.
Pubblicazione: (2025) -
Phonikud: Hebrew Grapheme-to-Phoneme Conversion for Real-Time Text-to-Speech
di: Kolani, Yakov, et al.
Pubblicazione: (2025)