FIRP: Faster LLM inference via future intermediate representation prediction
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wu, Pengfei, Liu, Jiahao, Gong, Zhuocheng, Wang, Qifan, Li, Jinpeng, Wang, Jingang, Cai, Xunliang, Zhao, Dongyan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Parallel Decoding via Hidden Transfer for Lossless Large Language Model Acceleration
von: Wu, Pengfei, et al.
Veröffentlicht: (2024)
von: Wu, Pengfei, et al.
Veröffentlicht: (2024)
Speculative Decoding via Early-exiting for Faster LLM Inference with Thompson Sampling Control Mechanism
von: Liu, Jiahao, et al.
Veröffentlicht: (2024)
von: Liu, Jiahao, et al.
Veröffentlicht: (2024)
Graph-Structured Speculative Decoding
von: Gong, Zhuocheng, et al.
Veröffentlicht: (2024)
von: Gong, Zhuocheng, et al.
Veröffentlicht: (2024)
Dynamic Fisher-weighted Model Merging via Bayesian Optimization
von: Lee, Sanwoo, et al.
Veröffentlicht: (2025)
von: Lee, Sanwoo, et al.
Veröffentlicht: (2025)
What Makes Quantization for Large Language Models Hard? An Empirical Study from the Lens of Perturbation
von: Gong, Zhuocheng, et al.
Veröffentlicht: (2024)
von: Gong, Zhuocheng, et al.
Veröffentlicht: (2024)
ReMamba: Equip Mamba with Effective Long-Sequence Modeling
von: Yuan, Danlong, et al.
Veröffentlicht: (2024)
von: Yuan, Danlong, et al.
Veröffentlicht: (2024)
Latent Preference Coding: Aligning Large Language Models via Discrete Latent Codes
von: Gong, Zhuocheng, et al.
Veröffentlicht: (2025)
von: Gong, Zhuocheng, et al.
Veröffentlicht: (2025)
mCL-NER: Cross-Lingual Named Entity Recognition via Multi-view Contrastive Learning
von: Mo, Ying, et al.
Veröffentlicht: (2023)
von: Mo, Ying, et al.
Veröffentlicht: (2023)
Ltri-LLM: Streaming Long Context Inference for LLMs with Training-Free Dynamic Triangular Attention Pattern
von: Tang, Hongyin, et al.
Veröffentlicht: (2024)
von: Tang, Hongyin, et al.
Veröffentlicht: (2024)
Libra: Assessing and Improving Reward Model by Learning to Think
von: Zhou, Meng, et al.
Veröffentlicht: (2025)
von: Zhou, Meng, et al.
Veröffentlicht: (2025)
C-ICL: Contrastive In-context Learning for Information Extraction
von: Mo, Ying, et al.
Veröffentlicht: (2024)
von: Mo, Ying, et al.
Veröffentlicht: (2024)
MiniDisc: Minimal Distillation Schedule for Language Model Compression
von: Zhang, Chen, et al.
Veröffentlicht: (2022)
von: Zhang, Chen, et al.
Veröffentlicht: (2022)
Towards Detecting LLMs Hallucination via Markov Chain-based Multi-agent Debate Framework
von: Sun, Xiaoxi, et al.
Veröffentlicht: (2024)
von: Sun, Xiaoxi, et al.
Veröffentlicht: (2024)
A Survey on LLM Mid-Training
von: Tu, Chengying, et al.
Veröffentlicht: (2025)
von: Tu, Chengying, et al.
Veröffentlicht: (2025)
Unlocking Implicit Experience: Synthesizing Tool-Use Trajectories from Text
von: Xu, Zhihao, et al.
Veröffentlicht: (2026)
von: Xu, Zhihao, et al.
Veröffentlicht: (2026)
EAVE: Efficient Product Attribute Value Extraction via Lightweight Sparse-layer Interaction
von: Yang, Li, et al.
Veröffentlicht: (2024)
von: Yang, Li, et al.
Veröffentlicht: (2024)
SEAS: Self-Evolving Adversarial Safety Optimization for Large Language Models
von: Diao, Muxi, et al.
Veröffentlicht: (2024)
von: Diao, Muxi, et al.
Veröffentlicht: (2024)
Predictor-Corrector Enhanced Transformers with Exponential Moving Average Coefficient Learning
von: Li, Bei, et al.
Veröffentlicht: (2024)
von: Li, Bei, et al.
Veröffentlicht: (2024)
Earlier Tokens Contribute More: Learning Direct Preference Optimization From Temporal Decay Perspective
von: Shao, Ruichen, et al.
Veröffentlicht: (2025)
von: Shao, Ruichen, et al.
Veröffentlicht: (2025)
FIRE: Flexible Integration of Data Quality Ratings for Effective Pre-Training
von: Xu, Liangyu, et al.
Veröffentlicht: (2025)
von: Xu, Liangyu, et al.
Veröffentlicht: (2025)
Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization
von: Bai, Yang, et al.
Veröffentlicht: (2026)
von: Bai, Yang, et al.
Veröffentlicht: (2026)
E-Bench: Towards Evaluating the Ease-of-Use of Large Language Models
von: Zhang, Zhenyu, et al.
Veröffentlicht: (2024)
von: Zhang, Zhenyu, et al.
Veröffentlicht: (2024)
Mixture-of-Modules: Reinventing Transformers as Dynamic Assemblies of Modules
von: Gong, Zhuocheng, et al.
Veröffentlicht: (2024)
von: Gong, Zhuocheng, et al.
Veröffentlicht: (2024)
NeedleInATable: Exploring Long-Context Capability of Large Language Models towards Long-Structured Tables
von: Wang, Lanrui, et al.
Veröffentlicht: (2025)
von: Wang, Lanrui, et al.
Veröffentlicht: (2025)
LinkQA: Synthesizing Diverse QA from Multiple Seeds Strongly Linked by Knowledge Points
von: Zhang, Xuemiao, et al.
Veröffentlicht: (2025)
von: Zhang, Xuemiao, et al.
Veröffentlicht: (2025)
Large-Scale Diverse Synthesis for Mid-Training
von: Zhang, Xuemiao, et al.
Veröffentlicht: (2025)
von: Zhang, Xuemiao, et al.
Veröffentlicht: (2025)
Shorten After You're Right: Lazy Length Penalties for Reasoning RL
von: Yuan, Danlong, et al.
Veröffentlicht: (2025)
von: Yuan, Danlong, et al.
Veröffentlicht: (2025)
APP: Adaptive Prototypical Pseudo-Labeling for Few-shot OOD Detection
von: Wang, Pei, et al.
Veröffentlicht: (2023)
von: Wang, Pei, et al.
Veröffentlicht: (2023)
FRAME: Boosting LLMs with A Four-Quadrant Multi-Stage Pretraining Strategy
von: Zhang, Xuemiao, et al.
Veröffentlicht: (2025)
von: Zhang, Xuemiao, et al.
Veröffentlicht: (2025)
A Preliminary Study on the Promises and Challenges of Native Top-$k$ Sparse Attention
von: Xiu, Di, et al.
Veröffentlicht: (2025)
von: Xiu, Di, et al.
Veröffentlicht: (2025)
Pre$^3$: Enabling Deterministic Pushdown Automata for Faster Structured LLM Generation
von: Chen, Junyi, et al.
Veröffentlicht: (2025)
von: Chen, Junyi, et al.
Veröffentlicht: (2025)
StyleChat: Learning Recitation-Augmented Memory in LLMs for Stylized Dialogue Generation
von: Li, Jinpeng, et al.
Veröffentlicht: (2024)
von: Li, Jinpeng, et al.
Veröffentlicht: (2024)
Length Desensitization in Direct Preference Optimization
von: Liu, Wei, et al.
Veröffentlicht: (2024)
von: Liu, Wei, et al.
Veröffentlicht: (2024)
Beyond the Known: Investigating LLMs Performance on Out-of-Domain Intent Detection
von: Wang, Pei, et al.
Veröffentlicht: (2024)
von: Wang, Pei, et al.
Veröffentlicht: (2024)
Preference Curriculum: LLMs Should Always Be Pretrained on Their Preferred Data
von: Zhang, Xuemiao, et al.
Veröffentlicht: (2025)
von: Zhang, Xuemiao, et al.
Veröffentlicht: (2025)
Expanding Reasoning Potential in Foundation Model by Learning Diverse Chains of Thought Patterns
von: Zhang, Xuemiao, et al.
Veröffentlicht: (2025)
von: Zhang, Xuemiao, et al.
Veröffentlicht: (2025)
PromptCoT 2.0: Scaling Prompt Synthesis for Large Language Model Reasoning
von: Zhao, Xueliang, et al.
Veröffentlicht: (2025)
von: Zhao, Xueliang, et al.
Veröffentlicht: (2025)
Efficient Temporal Extrapolation of Multimodal Large Language Models with Temporal Grounding Bridge
von: Wang, Yuxuan, et al.
Veröffentlicht: (2024)
von: Wang, Yuxuan, et al.
Veröffentlicht: (2024)
Causal Autoregressive Diffusion Language Model
von: Ruan, Junhao, et al.
Veröffentlicht: (2026)
von: Ruan, Junhao, et al.
Veröffentlicht: (2026)
SampleMix: A Sample-wise Pre-training Data Mixing Strategey by Coordinating Data Quality and Diversity
von: Xi, Xiangyu, et al.
Veröffentlicht: (2025)
von: Xi, Xiangyu, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Parallel Decoding via Hidden Transfer for Lossless Large Language Model Acceleration
von: Wu, Pengfei, et al.
Veröffentlicht: (2024) -
Speculative Decoding via Early-exiting for Faster LLM Inference with Thompson Sampling Control Mechanism
von: Liu, Jiahao, et al.
Veröffentlicht: (2024) -
Graph-Structured Speculative Decoding
von: Gong, Zhuocheng, et al.
Veröffentlicht: (2024) -
Dynamic Fisher-weighted Model Merging via Bayesian Optimization
von: Lee, Sanwoo, et al.
Veröffentlicht: (2025) -
What Makes Quantization for Large Language Models Hard? An Empirical Study from the Lens of Perturbation
von: Gong, Zhuocheng, et al.
Veröffentlicht: (2024)