SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Yiping, Huang, Hanxian, Chen, Yifang, Zhao, Jishen, Du, Simon Shaolei, Tian, Yuandong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
You Only Use Reactive Attention Slice For Long Context Retrieval
por: Soh, Yun Joon, et al.
Publicado: (2024)
por: Soh, Yun Joon, et al.
Publicado: (2024)
Variance Alignment Score: A Simple But Tough-to-Beat Data Selection Method for Multimodal Contrastive Learning
por: Wang, Yiping, et al.
Publicado: (2024)
por: Wang, Yiping, et al.
Publicado: (2024)
JoMA: Demystifying Multilayer Transformers via JOint Dynamics of MLP and Attention
por: Tian, Yuandong, et al.
Publicado: (2023)
por: Tian, Yuandong, et al.
Publicado: (2023)
Multi-modal Learning for WebAssembly Reverse Engineering
por: Huang, Hanxian, et al.
Publicado: (2024)
por: Huang, Hanxian, et al.
Publicado: (2024)
Provable Scaling Laws of Feature Emergence from Learning Dynamics of Grokking
por: Tian, Yuandong
Publicado: (2025)
por: Tian, Yuandong
Publicado: (2025)
A Principled Loss Function for Direct Language Model Alignment
por: Tan, Yuandong
Publicado: (2025)
por: Tan, Yuandong
Publicado: (2025)
Learning to Maximize Mutual Information for Chain-of-Thought Distillation
por: Chen, Xin, et al.
Publicado: (2024)
por: Chen, Xin, et al.
Publicado: (2024)
Policy-Based Trajectory Clustering in Offline Reinforcement Learning
por: Hu, Hao, et al.
Publicado: (2025)
por: Hu, Hao, et al.
Publicado: (2025)
Offline Multi-task Transfer RL with Representational Penalization
por: Bose, Avinandan, et al.
Publicado: (2024)
por: Bose, Avinandan, et al.
Publicado: (2024)
TruthX: Alleviating Hallucinations by Editing Large Language Models in Truthful Space
por: Zhang, Shaolei, et al.
Publicado: (2024)
por: Zhang, Shaolei, et al.
Publicado: (2024)
Cost-Effective Proxy Reward Model Construction with On-Policy and Active Learning
por: Chen, Yifang, et al.
Publicado: (2024)
por: Chen, Yifang, et al.
Publicado: (2024)
AMA-Bench: Evaluating Long-Horizon Memory for Agentic Applications
por: Zhao, Yujie, et al.
Publicado: (2026)
por: Zhao, Yujie, et al.
Publicado: (2026)
SHARP: Sleep-based Hierarchical Accelerated Replay for Long Range Non-Stationary Temporal Pattern Recognition
por: Dey, Jayanta, et al.
Publicado: (2026)
por: Dey, Jayanta, et al.
Publicado: (2026)
WINA: Weight Informed Neuron Activation for Accelerating Large Language Model Inference
por: Chen, Sihan, et al.
Publicado: (2025)
por: Chen, Sihan, et al.
Publicado: (2025)
MobileLLM: Optimizing Sub-billion Parameter Language Models for On-Device Use Cases
por: Liu, Zechun, et al.
Publicado: (2024)
por: Liu, Zechun, et al.
Publicado: (2024)
OrcaLoca: An LLM Agent Framework for Software Issue Localization
por: Yu, Zhongming, et al.
Publicado: (2025)
por: Yu, Zhongming, et al.
Publicado: (2025)
Denoising-based Contractive Imitation Learning
por: Shen, Macheng, et al.
Publicado: (2025)
por: Shen, Macheng, et al.
Publicado: (2025)
Diffusion World Model: Future Modeling Beyond Step-by-Step Rollout for Offline Reinforcement Learning
por: Ding, Zihan, et al.
Publicado: (2024)
por: Ding, Zihan, et al.
Publicado: (2024)
Context-Aware Assistant Selection for Improved Inference Acceleration with Large Language Models
por: Huang, Jerry, et al.
Publicado: (2024)
por: Huang, Jerry, et al.
Publicado: (2024)
Composing Global Solutions to Reasoning Tasks via Algebraic Objects in Neural Nets
por: Tian, Yuandong
Publicado: (2024)
por: Tian, Yuandong
Publicado: (2024)
Reinforcement Learning for Reasoning in Large Language Models with One Training Example
por: Wang, Yiping, et al.
Publicado: (2025)
por: Wang, Yiping, et al.
Publicado: (2025)
Inference Optimization of Foundation Models on AI Accelerators
por: Park, Youngsuk, et al.
Publicado: (2024)
por: Park, Youngsuk, et al.
Publicado: (2024)
Lookahead: An Inference Acceleration Framework for Large Language Model with Lossless Generation Accuracy
por: Zhao, Yao, et al.
Publicado: (2023)
por: Zhao, Yao, et al.
Publicado: (2023)
Parameter-Efficient Fine-Tuning for Foundation Models
por: Zhang, Dan, et al.
Publicado: (2025)
por: Zhang, Dan, et al.
Publicado: (2025)
ALISA: Accelerating Large Language Model Inference via Sparsity-Aware KV Caching
por: Zhao, Youpeng, et al.
Publicado: (2024)
por: Zhao, Youpeng, et al.
Publicado: (2024)
The Path Not Taken: RLVR Provably Learns Off the Principals
por: Zhu, Hanqing, et al.
Publicado: (2025)
por: Zhu, Hanqing, et al.
Publicado: (2025)
Param$Δ$ for Direct Weight Mixing: Post-Train Large Language Model at Zero Cost
por: Cao, Sheng, et al.
Publicado: (2025)
por: Cao, Sheng, et al.
Publicado: (2025)
Multi-objective Optimization by Learning Space Partitions
por: Zhao, Yiyang, et al.
Publicado: (2021)
por: Zhao, Yiyang, et al.
Publicado: (2021)
Sail into the Headwind: Alignment via Robust Rewards and Dynamic Labels against Reward Hacking
por: Rashidinejad, Paria, et al.
Publicado: (2024)
por: Rashidinejad, Paria, et al.
Publicado: (2024)
Understanding the Potential of FPGA-Based Spatial Acceleration for Large Language Model Inference
por: Chen, Hongzheng, et al.
Publicado: (2023)
por: Chen, Hongzheng, et al.
Publicado: (2023)
LoRe: Personalizing LLMs via Low-Rank Reward Modeling
por: Bose, Avinandan, et al.
Publicado: (2025)
por: Bose, Avinandan, et al.
Publicado: (2025)
PSO-Merging: Merging Models Based on Particle Swarm Optimization
por: Zhang, Kehao, et al.
Publicado: (2025)
por: Zhang, Kehao, et al.
Publicado: (2025)
Towards General-Purpose Model-Free Reinforcement Learning
por: Fujimoto, Scott, et al.
Publicado: (2025)
por: Fujimoto, Scott, et al.
Publicado: (2025)
GaLore 2: Large-Scale LLM Pre-Training by Gradient Low-Rank Projection
por: Su, DiJia, et al.
Publicado: (2025)
por: Su, DiJia, et al.
Publicado: (2025)
Hybrid JIT-CUDA Graph Optimization for Low-Latency Large Language Model Inference
por: Yadav, Divakar Kumar, et al.
Publicado: (2026)
por: Yadav, Divakar Kumar, et al.
Publicado: (2026)
Decoupling Long- and Short-Term Patterns in Spatiotemporal Inference
por: Hu, Junfeng, et al.
Publicado: (2021)
por: Hu, Junfeng, et al.
Publicado: (2021)
Ability Transfer and Recovery via Modularized Parameters Localization
por: Jin, Songyao, et al.
Publicado: (2026)
por: Jin, Songyao, et al.
Publicado: (2026)
Membership Inference Attacks Against Fine-tuned Diffusion Language Models
por: Chen, Yuetian, et al.
Publicado: (2026)
por: Chen, Yuetian, et al.
Publicado: (2026)
Extreme Low-Bit Inference in Reasoning Models: Failure Modes and Targeted Recovery
por: Alimaskina, Ekaterina, et al.
Publicado: (2026)
por: Alimaskina, Ekaterina, et al.
Publicado: (2026)
Accelerating Mixture-of-Expert Inference with Adaptive Expert Split Mechanism
por: Yan, Jiaming, et al.
Publicado: (2025)
por: Yan, Jiaming, et al.
Publicado: (2025)
Ejemplares similares
-
You Only Use Reactive Attention Slice For Long Context Retrieval
por: Soh, Yun Joon, et al.
Publicado: (2024) -
Variance Alignment Score: A Simple But Tough-to-Beat Data Selection Method for Multimodal Contrastive Learning
por: Wang, Yiping, et al.
Publicado: (2024) -
JoMA: Demystifying Multilayer Transformers via JOint Dynamics of MLP and Attention
por: Tian, Yuandong, et al.
Publicado: (2023) -
Multi-modal Learning for WebAssembly Reverse Engineering
por: Huang, Hanxian, et al.
Publicado: (2024) -
Provable Scaling Laws of Feature Emergence from Learning Dynamics of Grokking
por: Tian, Yuandong
Publicado: (2025)