Inference Optimization of Foundation Models on AI Accelerators
Fuente:
arXiv
Salvato in:
| Autori principali: | Park, Youngsuk, Budhathoki, Kailash, Chen, Liangfu, Kübler, Jonas, Huang, Jiaji, Kleindessner, Matthäus, Huan, Jun, Cevher, Volkan, Wang, Yida, Karypis, George |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Proximal Operator for Inducing 2:4-Sparsity
di: Kübler, Jonas M, et al.
Pubblicazione: (2025)
di: Kübler, Jonas M, et al.
Pubblicazione: (2025)
Block-Diagonal LoRA for Eliminating Communication Overhead in Tensor Parallel LoRA Serving
di: Wang, Xinyu, et al.
Pubblicazione: (2025)
di: Wang, Xinyu, et al.
Pubblicazione: (2025)
When LLMs get significantly worse: A statistical approach to detect model degradations
di: Kübler, Jonas, et al.
Pubblicazione: (2026)
di: Kübler, Jonas, et al.
Pubblicazione: (2026)
LLM-Rank: A Graph Theoretical Approach to Pruning Large Language Models
di: Hoffmann, David, et al.
Pubblicazione: (2024)
di: Hoffmann, David, et al.
Pubblicazione: (2024)
Revisiting SMoE Language Models by Evaluating Inefficiencies with Task Specific Expert Pruning
di: Sarkar, Soumajyoti, et al.
Pubblicazione: (2024)
di: Sarkar, Soumajyoti, et al.
Pubblicazione: (2024)
ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs
di: Liu, Hongyi, et al.
Pubblicazione: (2025)
di: Liu, Hongyi, et al.
Pubblicazione: (2025)
Extreme Miscalibration and the Illusion of Adversarial Robustness
di: Raina, Vyas, et al.
Pubblicazione: (2024)
di: Raina, Vyas, et al.
Pubblicazione: (2024)
Efficient Large Language Model Inference with Neural Block Linearization
di: Erdogan, Mete, et al.
Pubblicazione: (2025)
di: Erdogan, Mete, et al.
Pubblicazione: (2025)
Pack of LLMs: Model Fusion at Test-Time via Perplexity Optimization
di: Mavromatis, Costas, et al.
Pubblicazione: (2024)
di: Mavromatis, Costas, et al.
Pubblicazione: (2024)
Meaningful Causal Aggregation and Paradoxical Confounding
di: Zhu, Yuchen, et al.
Pubblicazione: (2023)
di: Zhu, Yuchen, et al.
Pubblicazione: (2023)
Not-a-Bandit: Provably No-Regret Drafter Selection in Speculative Decoding for LLMs
di: Liu, Hongyi, et al.
Pubblicazione: (2025)
di: Liu, Hongyi, et al.
Pubblicazione: (2025)
Faster Inference of Flow-Based Generative Models via Improved Data-Noise Coupling
di: Davtyan, Aram, et al.
Pubblicazione: (2026)
di: Davtyan, Aram, et al.
Pubblicazione: (2026)
Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models
di: Deng, Wenlong, et al.
Pubblicazione: (2026)
di: Deng, Wenlong, et al.
Pubblicazione: (2026)
REST: Efficient and Accelerated EEG Seizure Analysis through Residual State Updates
di: Afzal, Arshia, et al.
Pubblicazione: (2024)
di: Afzal, Arshia, et al.
Pubblicazione: (2024)
MT-NAM: An Efficient and Adaptive Model for Epileptic Seizure Detection
di: Afzal, Arshia, et al.
Pubblicazione: (2025)
di: Afzal, Arshia, et al.
Pubblicazione: (2025)
Chameleon: A Flexible Data-mixing Framework for Language Model Pretraining and Finetuning
di: Xie, Wanyun, et al.
Pubblicazione: (2025)
di: Xie, Wanyun, et al.
Pubblicazione: (2025)
MaD-Mix: Multi-Modal Data Mixtures via Latent Space Coupling for Vision-Language Model Training
di: Xie, Wanyun, et al.
Pubblicazione: (2026)
di: Xie, Wanyun, et al.
Pubblicazione: (2026)
Extending Input Contexts of Language Models through Training on Segmented Sequences
di: Karypis, Petros, et al.
Pubblicazione: (2023)
di: Karypis, Petros, et al.
Pubblicazione: (2023)
Optimistic Dual Averaging Unifies Modern Optimizers
di: Pethick, Thomas, et al.
Pubblicazione: (2026)
di: Pethick, Thomas, et al.
Pubblicazione: (2026)
Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs
di: Bian, Song, et al.
Pubblicazione: (2025)
di: Bian, Song, et al.
Pubblicazione: (2025)
Membership Inference Attacks against Large Vision-Language Models
di: Li, Zhan, et al.
Pubblicazione: (2024)
di: Li, Zhan, et al.
Pubblicazione: (2024)
Accelerating Spectral Clustering under Fairness Constraints
di: Tonin, Francesco, et al.
Pubblicazione: (2025)
di: Tonin, Francesco, et al.
Pubblicazione: (2025)
Provably avoiding over-optimization in Direct Preference Optimization without knowing the data distribution
di: Barla, Adam, et al.
Pubblicazione: (2026)
di: Barla, Adam, et al.
Pubblicazione: (2026)
ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining
di: Bal, Melis Ilayda, et al.
Pubblicazione: (2025)
di: Bal, Melis Ilayda, et al.
Pubblicazione: (2025)
SemPool: Simple, robust, and interpretable KG pooling for enhancing language models
di: Mavromatis, Costas, et al.
Pubblicazione: (2024)
di: Mavromatis, Costas, et al.
Pubblicazione: (2024)
Differentially Private Bias-Term Fine-tuning of Foundation Models
di: Bu, Zhiqi, et al.
Pubblicazione: (2022)
di: Bu, Zhiqi, et al.
Pubblicazione: (2022)
GNN-RAG: Graph Neural Retrieval for Large Language Model Reasoning
di: Mavromatis, Costas, et al.
Pubblicazione: (2024)
di: Mavromatis, Costas, et al.
Pubblicazione: (2024)
Learning with Norm Constrained, Over-parameterized, Two-layer Neural Networks
di: Liu, Fanghui, et al.
Pubblicazione: (2024)
di: Liu, Fanghui, et al.
Pubblicazione: (2024)
SAMPa: Sharpness-aware Minimization Parallelized
di: Xie, Wanyun, et al.
Pubblicazione: (2024)
di: Xie, Wanyun, et al.
Pubblicazione: (2024)
Matching Multiple Experts: On the Exploitability of Multi-Agent Imitation Learning
di: Bergerault, Antoine, et al.
Pubblicazione: (2026)
di: Bergerault, Antoine, et al.
Pubblicazione: (2026)
Stable Nonconvex-Nonconcave Training via Linear Interpolation
di: Pethick, Thomas, et al.
Pubblicazione: (2023)
di: Pethick, Thomas, et al.
Pubblicazione: (2023)
IL-SOAR : Imitation Learning with Soft Optimistic Actor cRitic
di: Viel, Stefano, et al.
Pubblicazione: (2025)
di: Viel, Stefano, et al.
Pubblicazione: (2025)
Imitation Learning in Discounted Linear MDPs without exploration assumptions
di: Viano, Luca, et al.
Pubblicazione: (2024)
di: Viano, Luca, et al.
Pubblicazione: (2024)
Universal Gradient Methods for Stochastic Convex Optimization
di: Rodomanov, Anton, et al.
Pubblicazione: (2024)
di: Rodomanov, Anton, et al.
Pubblicazione: (2024)
TritonRL: Training LLMs to Think and Code Triton Without Cheating
di: Woo, Jiin, et al.
Pubblicazione: (2025)
di: Woo, Jiin, et al.
Pubblicazione: (2025)
Improving SAM Requires Rethinking its Optimization Formulation
di: Xie, Wanyun, et al.
Pubblicazione: (2024)
di: Xie, Wanyun, et al.
Pubblicazione: (2024)
High-Dimensional Kernel Methods under Covariate Shift: Data-Dependent Implicit Regularization
di: Chen, Yihang, et al.
Pubblicazione: (2024)
di: Chen, Yihang, et al.
Pubblicazione: (2024)
Adversarial Training for Defense Against Label Poisoning Attacks
di: Bal, Melis Ilayda, et al.
Pubblicazione: (2025)
di: Bal, Melis Ilayda, et al.
Pubblicazione: (2025)
Adversarial Training Should Be Cast as a Non-Zero-Sum Game
di: Robey, Alexander, et al.
Pubblicazione: (2023)
di: Robey, Alexander, et al.
Pubblicazione: (2023)
Learning to Remove Cuts in Integer Linear Programming
di: Puigdemont, Pol, et al.
Pubblicazione: (2024)
di: Puigdemont, Pol, et al.
Pubblicazione: (2024)
Documenti analoghi
-
A Proximal Operator for Inducing 2:4-Sparsity
di: Kübler, Jonas M, et al.
Pubblicazione: (2025) -
Block-Diagonal LoRA for Eliminating Communication Overhead in Tensor Parallel LoRA Serving
di: Wang, Xinyu, et al.
Pubblicazione: (2025) -
When LLMs get significantly worse: A statistical approach to detect model degradations
di: Kübler, Jonas, et al.
Pubblicazione: (2026) -
LLM-Rank: A Graph Theoretical Approach to Pruning Large Language Models
di: Hoffmann, David, et al.
Pubblicazione: (2024) -
Revisiting SMoE Language Models by Evaluating Inefficiencies with Task Specific Expert Pruning
di: Sarkar, Soumajyoti, et al.
Pubblicazione: (2024)