Scaling Inference-Efficient Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Bian, Song, Yan, Minghao, Venkataraman, Shivaram |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs
por: Bian, Song, et al.
Publicado: (2025)
por: Bian, Song, et al.
Publicado: (2025)
What Limits Agentic Systems Efficiency?
por: Bian, Song, et al.
Publicado: (2025)
por: Bian, Song, et al.
Publicado: (2025)
Decoding Speculative Decoding
por: Yan, Minghao, et al.
Publicado: (2024)
por: Yan, Minghao, et al.
Publicado: (2024)
LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models
por: Chang, Tzu-Tao, et al.
Publicado: (2025)
por: Chang, Tzu-Tao, et al.
Publicado: (2025)
An Efficient Inference Framework for Early-exit Large Language Models
por: Miao, Ruijie, et al.
Publicado: (2024)
por: Miao, Ruijie, et al.
Publicado: (2024)
DynScaling: Efficient Verifier-free Inference Scaling via Dynamic and Integrated Sampling
por: Wang, Fei, et al.
Publicado: (2025)
por: Wang, Fei, et al.
Publicado: (2025)
Are More Tokens Rational? Inference-Time Scaling in Language Models as Adaptive Resource Rationality
por: Hu, Zhimin, et al.
Publicado: (2026)
por: Hu, Zhimin, et al.
Publicado: (2026)
Scaling Up Membership Inference: When and How Attacks Succeed on Large Language Models
por: Puerto, Haritz, et al.
Publicado: (2024)
por: Puerto, Haritz, et al.
Publicado: (2024)
OpenELM: An Efficient Language Model Family with Open Training and Inference Framework
por: Mehta, Sachin, et al.
Publicado: (2024)
por: Mehta, Sachin, et al.
Publicado: (2024)
LLM in a flash: Efficient Large Language Model Inference with Limited Memory
por: Alizadeh, Keivan, et al.
Publicado: (2023)
por: Alizadeh, Keivan, et al.
Publicado: (2023)
Inference-Time Scaling for Generalist Reward Modeling
por: Liu, Zijun, et al.
Publicado: (2025)
por: Liu, Zijun, et al.
Publicado: (2025)
PGT-I: Scaling Spatiotemporal GNNs with Memory-Efficient Distributed Training
por: Ockerman, Seth, et al.
Publicado: (2025)
por: Ockerman, Seth, et al.
Publicado: (2025)
HMI: Hierarchical Knowledge Management for Efficient Multi-Tenant Inference in Pretrained Language Models
por: Zhang, Jun, et al.
Publicado: (2025)
por: Zhang, Jun, et al.
Publicado: (2025)
MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models
por: Zhang, Junyang, et al.
Publicado: (2025)
por: Zhang, Junyang, et al.
Publicado: (2025)
Model Compression and Efficient Inference for Large Language Models: A Survey
por: Wang, Wenxiao, et al.
Publicado: (2024)
por: Wang, Wenxiao, et al.
Publicado: (2024)
I-LLM: Efficient Integer-Only Inference for Fully-Quantized Low-Bit Large Language Models
por: Hu, Xing, et al.
Publicado: (2024)
por: Hu, Xing, et al.
Publicado: (2024)
Earley-Driven Dynamic Pruning for Efficient Structured Decoding
por: Sun, Xintong, et al.
Publicado: (2025)
por: Sun, Xintong, et al.
Publicado: (2025)
OptScale: Probabilistic Optimality for Inference-time Scaling
por: Wang, Youkang, et al.
Publicado: (2025)
por: Wang, Youkang, et al.
Publicado: (2025)
Syntactic Control of Language Models by Posterior Inference
por: Xefteri, Vicky, et al.
Publicado: (2025)
por: Xefteri, Vicky, et al.
Publicado: (2025)
Causal Inference for Human-Language Model Collaboration
por: Zhang, Bohan, et al.
Publicado: (2024)
por: Zhang, Bohan, et al.
Publicado: (2024)
PolyThrottle: Energy-efficient Neural Network Inference on Edge Devices
por: Yan, Minghao, et al.
Publicado: (2023)
por: Yan, Minghao, et al.
Publicado: (2023)
Training Language Models with Language Feedback at Scale
por: Scheurer, Jérémy, et al.
Publicado: (2023)
por: Scheurer, Jérémy, et al.
Publicado: (2023)
Towards the Law of Capacity Gap in Distilling Language Models
por: Zhang, Chen, et al.
Publicado: (2023)
por: Zhang, Chen, et al.
Publicado: (2023)
Scaling Embeddings Outperforms Scaling Experts in Language Models
por: Liu, Hong, et al.
Publicado: (2026)
por: Liu, Hong, et al.
Publicado: (2026)
Self-Hinting Language Models Enhance Reinforcement Learning
por: Liao, Baohao, et al.
Publicado: (2026)
por: Liao, Baohao, et al.
Publicado: (2026)
Entropy Adaptive Decoding: Dynamic Model Switching for Efficient Inference
por: Simonds, Toby
Publicado: (2025)
por: Simonds, Toby
Publicado: (2025)
MarkovScale: Towards Optimal Sequential Scaling at Inference Time
por: Wang, Youkang, et al.
Publicado: (2026)
por: Wang, Youkang, et al.
Publicado: (2026)
Grow Up and Merge: Scaling Strategies for Efficient Language Adaptation
por: Glocker, Kevin, et al.
Publicado: (2025)
por: Glocker, Kevin, et al.
Publicado: (2025)
CITER: Collaborative Inference for Efficient Large Language Model Decoding with Token-Level Routing
por: Zheng, Wenhao, et al.
Publicado: (2025)
por: Zheng, Wenhao, et al.
Publicado: (2025)
Optimizing Temperature for Language Models with Multi-Sample Inference
por: Du, Weihua, et al.
Publicado: (2025)
por: Du, Weihua, et al.
Publicado: (2025)
Hypothesis Generation and Inductive Inference in Children and Language Models
por: Qin, Jeffrey, et al.
Publicado: (2026)
por: Qin, Jeffrey, et al.
Publicado: (2026)
EfficientLLM: Efficiency in Large Language Models
por: Yuan, Zhengqing, et al.
Publicado: (2025)
por: Yuan, Zhengqing, et al.
Publicado: (2025)
CHAI: Clustered Head Attention for Efficient LLM Inference
por: Agarwal, Saurabh, et al.
Publicado: (2024)
por: Agarwal, Saurabh, et al.
Publicado: (2024)
Scaling Data-Constrained Language Models
por: Muennighoff, Niklas, et al.
Publicado: (2023)
por: Muennighoff, Niklas, et al.
Publicado: (2023)
Jet-Nemotron: Efficient Language Model with Post Neural Architecture Search
por: Gu, Yuxian, et al.
Publicado: (2025)
por: Gu, Yuxian, et al.
Publicado: (2025)
Sliding Window Attention Training for Efficient Large Language Models
por: Fu, Zichuan, et al.
Publicado: (2025)
por: Fu, Zichuan, et al.
Publicado: (2025)
Language Control Diffusion: Efficiently Scaling through Space, Time, and Tasks
por: Zhang, Edwin, et al.
Publicado: (2022)
por: Zhang, Edwin, et al.
Publicado: (2022)
SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models
por: Xiao, Guangxuan, et al.
Publicado: (2022)
por: Xiao, Guangxuan, et al.
Publicado: (2022)
Block Transformer: Global-to-Local Language Modeling for Fast Inference
por: Ho, Namgyu, et al.
Publicado: (2024)
por: Ho, Namgyu, et al.
Publicado: (2024)
Revisiting In-context Learning Inference Circuit in Large Language Models
por: Cho, Hakaze, et al.
Publicado: (2024)
por: Cho, Hakaze, et al.
Publicado: (2024)
Ejemplares similares
-
Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs
por: Bian, Song, et al.
Publicado: (2025) -
What Limits Agentic Systems Efficiency?
por: Bian, Song, et al.
Publicado: (2025) -
Decoding Speculative Decoding
por: Yan, Minghao, et al.
Publicado: (2024) -
LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models
por: Chang, Tzu-Tao, et al.
Publicado: (2025) -
An Efficient Inference Framework for Early-exit Large Language Models
por: Miao, Ruijie, et al.
Publicado: (2024)