Fast and Slow Generating: An Empirical Study on Large and Small Language Models Collaborative Decoding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Kaiyan, Wang, Jianyu, Ding, Ning, Qi, Biqing, Hua, Ermo, Lv, Xingtai, Zhou, Bowen |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CoGenesis: A Framework Collaborating Large and Small Language Models for Secure Context-Aware Instruction Following
par: Zhang, Kaiyan, et autres
Publié: (2024)
par: Zhang, Kaiyan, et autres
Publié: (2024)
Intuitive Fine-Tuning: Towards Simplifying Alignment into a Single Process
par: Hua, Ermo, et autres
Publié: (2024)
par: Hua, Ermo, et autres
Publié: (2024)
Scalable Efficient Training of Large Language Models with Low-dimensional Projected Attention
par: Lv, Xingtai, et autres
Publié: (2024)
par: Lv, Xingtai, et autres
Publié: (2024)
Fourier Position Embedding: Enhancing Attention's Periodic Extension for Length Generalization
par: Hua, Ermo, et autres
Publié: (2024)
par: Hua, Ermo, et autres
Publié: (2024)
Large Language Models as Biomedical Hypothesis Generators: A Comprehensive Evaluation
par: Qi, Biqing, et autres
Publié: (2024)
par: Qi, Biqing, et autres
Publié: (2024)
Retrieval-Augmented Visual Question Answering via Built-in Autoregressive Search Engines
par: Long, Xinwei, et autres
Publié: (2025)
par: Long, Xinwei, et autres
Publié: (2025)
Online DPO: Online Direct Preference Optimization with Fast-Slow Chasing
par: Qi, Biqing, et autres
Publié: (2024)
par: Qi, Biqing, et autres
Publié: (2024)
How to Synthesize Text Data without Model Collapse?
par: Zhu, Xuekai, et autres
Publié: (2024)
par: Zhu, Xuekai, et autres
Publié: (2024)
Towards Building Specialized Generalist AI with System 1 and System 2 Fusion
par: Zhang, Kaiyan, et autres
Publié: (2024)
par: Zhang, Kaiyan, et autres
Publié: (2024)
UltraMedical: Building Specialized Generalists in Biomedicine
par: Zhang, Kaiyan, et autres
Publié: (2024)
par: Zhang, Kaiyan, et autres
Publié: (2024)
Technologies on Effectiveness and Efficiency: A Survey of State Spaces Models
par: Lv, Xingtai, et autres
Publié: (2025)
par: Lv, Xingtai, et autres
Publié: (2025)
PaD: Program-aided Distillation Can Teach Small Models Reasoning Better than Chain-of-thought Fine-tuning
par: Zhu, Xuekai, et autres
Publié: (2023)
par: Zhu, Xuekai, et autres
Publié: (2023)
Towards a Unified View of Large Language Model Post-Training
par: Lv, Xingtai, et autres
Publié: (2025)
par: Lv, Xingtai, et autres
Publié: (2025)
Accelerating Diffusion Large Language Models with SlowFast Sampling: The Three Golden Principles
par: Wei, Qingyan, et autres
Publié: (2025)
par: Wei, Qingyan, et autres
Publié: (2025)
Self Speculative Decoding for Diffusion Large Language Models
par: Gao, Yifeng, et autres
Publié: (2025)
par: Gao, Yifeng, et autres
Publié: (2025)
MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding
par: Zuo, Yuxin, et autres
Publié: (2025)
par: Zuo, Yuxin, et autres
Publié: (2025)
TTRL: Test-Time Reinforcement Learning
par: Zuo, Yuxin, et autres
Publié: (2025)
par: Zuo, Yuxin, et autres
Publié: (2025)
Mastering Text, Code and Math Simultaneously via Fusing Highly Specialized Language Models
par: Ding, Ning, et autres
Publié: (2024)
par: Ding, Ning, et autres
Publié: (2024)
Generative Multi-Modal Knowledge Retrieval with Large Language Models
par: Long, Xinwei, et autres
Publié: (2024)
par: Long, Xinwei, et autres
Publié: (2024)
GenPRM: Scaling Test-Time Compute of Process Reward Models via Generative Reasoning
par: Zhao, Jian, et autres
Publié: (2025)
par: Zhao, Jian, et autres
Publié: (2025)
Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling
par: Liu, Runze, et autres
Publié: (2025)
par: Liu, Runze, et autres
Publié: (2025)
Fast Large Language Model Collaborative Decoding via Speculation
par: Fu, Jiale, et autres
Publié: (2025)
par: Fu, Jiale, et autres
Publié: (2025)
On Large Language Models' Hallucination with Regard to Known Facts
par: Jiang, Che, et autres
Publié: (2024)
par: Jiang, Che, et autres
Publié: (2024)
Leveraging Adaptive Group Negotiation for Heterogeneous Multi-Robot Collaboration with Large Language Models
par: Song, Siqi, et autres
Publié: (2025)
par: Song, Siqi, et autres
Publié: (2025)
DePass: Unified Feature Attributing by Simple Decomposed Forward Pass
par: Hong, Xiangyu, et autres
Publié: (2025)
par: Hong, Xiangyu, et autres
Publié: (2025)
MARS$^2$: Scaling Multi-Agent Tree Search via Reinforcement Learning for Code Generation
par: Li, Pengfei, et autres
Publié: (2026)
par: Li, Pengfei, et autres
Publié: (2026)
Prompting Large Language Models for Counterfactual Generation: An Empirical Study
par: Li, Yongqi, et autres
Publié: (2023)
par: Li, Yongqi, et autres
Publié: (2023)
Automating Exploratory Proteomics Research via Language Models
par: Ding, Ning, et autres
Publié: (2024)
par: Ding, Ning, et autres
Publié: (2024)
Automating Exploratory Multiomics Research via Language Models
par: Qu, Shang, et autres
Publié: (2025)
par: Qu, Shang, et autres
Publié: (2025)
Fast-Slow-Thinking: Complex Task Solving with Large Language Models
par: Sun, Yiliu, et autres
Publié: (2025)
par: Sun, Yiliu, et autres
Publié: (2025)
A Survey of Reinforcement Learning for Large Reasoning Models
par: Zhang, Kaiyan, et autres
Publié: (2025)
par: Zhang, Kaiyan, et autres
Publié: (2025)
Fast-Slow Thinking RM: Efficient Integration of Scalar and Generative Reward Models
par: Wu, Jiayun, et autres
Publié: (2026)
par: Wu, Jiayun, et autres
Publié: (2026)
DynaThink: Fast or Slow? A Dynamic Decision-Making Framework for Large Language Models
par: Pan, Jiabao, et autres
Publié: (2024)
par: Pan, Jiabao, et autres
Publié: (2024)
Learning Evaluation Models from Large Language Models for Sequence Generation
par: Wang, Chenglong, et autres
Publié: (2023)
par: Wang, Chenglong, et autres
Publié: (2023)
Interactive Continual Learning: Fast and Slow Thinking
par: Qi, Biqing, et autres
Publié: (2024)
par: Qi, Biqing, et autres
Publié: (2024)
Recurrent Drafter for Fast Speculative Decoding in Large Language Models
par: Cheng, Yunfei, et autres
Publié: (2024)
par: Cheng, Yunfei, et autres
Publié: (2024)
FlowRL: Matching Reward Distributions for LLM Reasoning
par: Zhu, Xuekai, et autres
Publié: (2025)
par: Zhu, Xuekai, et autres
Publié: (2025)
Adaptive Draft-Verification for Efficient Large Language Model Decoding
par: Liu, Xukun, et autres
Publié: (2024)
par: Liu, Xukun, et autres
Publié: (2024)
DARE: Diffusion Large Language Models Alignment and Reinforcement Executor
par: Yang, Jingyi, et autres
Publié: (2026)
par: Yang, Jingyi, et autres
Publié: (2026)
Large Language Models as Universal Predictors? An Empirical Study on Small Tabular Datasets
par: Pavlidis, Nikolaos, et autres
Publié: (2025)
par: Pavlidis, Nikolaos, et autres
Publié: (2025)
Documents similaires
-
CoGenesis: A Framework Collaborating Large and Small Language Models for Secure Context-Aware Instruction Following
par: Zhang, Kaiyan, et autres
Publié: (2024) -
Intuitive Fine-Tuning: Towards Simplifying Alignment into a Single Process
par: Hua, Ermo, et autres
Publié: (2024) -
Scalable Efficient Training of Large Language Models with Low-dimensional Projected Attention
par: Lv, Xingtai, et autres
Publié: (2024) -
Fourier Position Embedding: Enhancing Attention's Periodic Extension for Length Generalization
par: Hua, Ermo, et autres
Publié: (2024) -
Large Language Models as Biomedical Hypothesis Generators: A Comprehensive Evaluation
par: Qi, Biqing, et autres
Publié: (2024)