Guardado en:
| Autores principales: | Luo, Cheng, Cai, Zefan, Sun, Hanshi, Xiao, Jinqi, Yuan, Bo, Xiao, Wen, Hu, Junjie, Zhao, Jiawei, Chen, Beidi, Anandkumar, Anima |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2502.12574 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models
por: Zhang, Junyang, et al.
Publicado: (2025)
por: Zhang, Junyang, et al.
Publicado: (2025)
Mini-Sequence Transformer: Optimizing Intermediate Memory for Long Sequences Training
por: Luo, Cheng, et al.
Publicado: (2024)
por: Luo, Cheng, et al.
Publicado: (2024)
GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection
por: Zhao, Jiawei, et al.
Publicado: (2024)
por: Zhao, Jiawei, et al.
Publicado: (2024)
R-KV: Redundancy-aware KV Cache Compression for Reasoning Models
por: Cai, Zefan, et al.
Publicado: (2025)
por: Cai, Zefan, et al.
Publicado: (2025)
InRank: Incremental Low-Rank Learning
por: Zhao, Jiawei, et al.
Publicado: (2023)
por: Zhao, Jiawei, et al.
Publicado: (2023)
EcoSpa: Efficient Transformer Training with Coupled Sparsity
por: Xiao, Jinqi, et al.
Publicado: (2025)
por: Xiao, Jinqi, et al.
Publicado: (2025)
Not All Heads Matter: A Head-Level KV Cache Compression Method with Integrated Retrieval and Reasoning
por: Fu, Yu, et al.
Publicado: (2024)
por: Fu, Yu, et al.
Publicado: (2024)
Delta Attention Residuals
por: Luo, Cheng, et al.
Publicado: (2026)
por: Luo, Cheng, et al.
Publicado: (2026)
TensorGRaD: Tensor Gradient Robust Decomposition for Memory-Efficient Neural Operator Training
por: Loeschcke, Sebastian, et al.
Publicado: (2025)
por: Loeschcke, Sebastian, et al.
Publicado: (2025)
FlexInfer: Breaking Memory Constraint via Flexible and Efficient Offloading for On-Device LLM Inference
por: Du, Hongchao, et al.
Publicado: (2025)
por: Du, Hongchao, et al.
Publicado: (2025)
PerAda: Parameter-Efficient Federated Learning Personalization with Generalization Guarantees
por: Xie, Chulin, et al.
Publicado: (2023)
por: Xie, Chulin, et al.
Publicado: (2023)
ShadowKV: KV Cache in Shadows for High-Throughput Long-Context LLM Inference
por: Sun, Hanshi, et al.
Publicado: (2024)
por: Sun, Hanshi, et al.
Publicado: (2024)
COAP: Memory-Efficient Training with Correlation-Aware Gradient Projection
por: Xiao, Jinqi, et al.
Publicado: (2024)
por: Xiao, Jinqi, et al.
Publicado: (2024)
DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads
por: Xiao, Guangxuan, et al.
Publicado: (2024)
por: Xiao, Guangxuan, et al.
Publicado: (2024)
MENTOR: Efficient Multimodal-Conditioned Tuning for Autoregressive Vision Generation Models
por: Zhao, Haozhe, et al.
Publicado: (2025)
por: Zhao, Haozhe, et al.
Publicado: (2025)
InstInfer: In-Storage Attention Offloading for Cost-Effective Long-Context LLM Inference
por: Pan, Xiurui, et al.
Publicado: (2024)
por: Pan, Xiurui, et al.
Publicado: (2024)
CHAI: Clustered Head Attention for Efficient LLM Inference
por: Agarwal, Saurabh, et al.
Publicado: (2024)
por: Agarwal, Saurabh, et al.
Publicado: (2024)
Diffusion State-Guided Projected Gradient for Inverse Problems
por: Zirvi, Rayhan, et al.
Publicado: (2024)
por: Zirvi, Rayhan, et al.
Publicado: (2024)
Lean Copilot: Large Language Models as Copilots for Theorem Proving in Lean
por: Song, Peiyang, et al.
Publicado: (2024)
por: Song, Peiyang, et al.
Publicado: (2024)
Calibrated Uncertainty Quantification for Operator Learning via Conformal Prediction
por: Ma, Ziqi, et al.
Publicado: (2024)
por: Ma, Ziqi, et al.
Publicado: (2024)
Mechanistic Interpretability with Sparse Autoencoder Neural Operators
por: Tolooshams, Bahareh, et al.
Publicado: (2025)
por: Tolooshams, Bahareh, et al.
Publicado: (2025)
Fourier Neural Operators Explained: A Practical Perspective
por: Duruisseaux, Valentin, et al.
Publicado: (2025)
por: Duruisseaux, Valentin, et al.
Publicado: (2025)
Locret: Enhancing Eviction in Long-Context LLM Inference with Trained Retaining Heads on Consumer-Grade Devices
por: Huang, Yuxiang, et al.
Publicado: (2024)
por: Huang, Yuxiang, et al.
Publicado: (2024)
COMCAT: Towards Efficient Compression and Customization of Attention-Based Vision Models
por: Xiao, Jinqi, et al.
Publicado: (2023)
por: Xiao, Jinqi, et al.
Publicado: (2023)
TriForce: Lossless Acceleration of Long Sequence Generation with Hierarchical Speculative Decoding
por: Sun, Hanshi, et al.
Publicado: (2024)
por: Sun, Hanshi, et al.
Publicado: (2024)
Incremental Spatial and Spectral Learning of Neural Operators for Solving Large-Scale PDEs
por: George, Robert Joseph, et al.
Publicado: (2022)
por: George, Robert Joseph, et al.
Publicado: (2022)
TopV: Compatible Token Pruning with Inference Time Optimization for Fast and Low-Memory Multimodal Vision Language Model
por: Yang, Cheng, et al.
Publicado: (2025)
por: Yang, Cheng, et al.
Publicado: (2025)
Automatic BLAS Offloading on Unified Memory Architecture: A Study on NVIDIA Grace-Hopper
por: Li, Junjie, et al.
Publicado: (2024)
por: Li, Junjie, et al.
Publicado: (2024)
Solving Poisson Equations using Neural Walk-on-Spheres
por: Nam, Hong Chul, et al.
Publicado: (2024)
por: Nam, Hong Chul, et al.
Publicado: (2024)
Prismer: A Vision-Language Model with Multi-Task Experts
por: Liu, Shikun, et al.
Publicado: (2023)
por: Liu, Shikun, et al.
Publicado: (2023)
Improving Vision Transformers by Overlapping Heads in Multi-Head Self-Attention
por: Zhang, Tianxiao, et al.
Publicado: (2024)
por: Zhang, Tianxiao, et al.
Publicado: (2024)
Inferring Functionality of Attention Heads from their Parameters
por: Elhelo, Amit, et al.
Publicado: (2024)
por: Elhelo, Amit, et al.
Publicado: (2024)
FlashHead: Efficient Drop-In Replacement for the Classification Head in Language Model Inference
por: Tranheden, Wilhelm, et al.
Publicado: (2026)
por: Tranheden, Wilhelm, et al.
Publicado: (2026)
MoH: Multi-Head Attention as Mixture-of-Head Attention
por: Jin, Peng, et al.
Publicado: (2024)
por: Jin, Peng, et al.
Publicado: (2024)
MemSifter: Offloading LLM Memory Retrieval via Outcome-Driven Proxy Reasoning
por: Tan, Jiejun, et al.
Publicado: (2026)
por: Tan, Jiejun, et al.
Publicado: (2026)
Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads
por: Cai, Tianle, et al.
Publicado: (2024)
por: Cai, Tianle, et al.
Publicado: (2024)
Geometric Operator Learning with Optimal Transport
por: Li, Xinyi, et al.
Publicado: (2025)
por: Li, Xinyi, et al.
Publicado: (2025)
Fast Training of Diffusion Models with Masked Transformers
por: Zheng, Hongkai, et al.
Publicado: (2023)
por: Zheng, Hongkai, et al.
Publicado: (2023)
ChatGPT Based Data Augmentation for Improved Parameter-Efficient Debiasing of LLMs
por: Han, Pengrui, et al.
Publicado: (2024)
por: Han, Pengrui, et al.
Publicado: (2024)
T-Stitch: Accelerating Sampling in Pre-Trained Diffusion Models with Trajectory Stitching
por: Pan, Zizheng, et al.
Publicado: (2024)
por: Pan, Zizheng, et al.
Publicado: (2024)
Ejemplares similares
-
MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models
por: Zhang, Junyang, et al.
Publicado: (2025) -
Mini-Sequence Transformer: Optimizing Intermediate Memory for Long Sequences Training
por: Luo, Cheng, et al.
Publicado: (2024) -
GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection
por: Zhao, Jiawei, et al.
Publicado: (2024) -
R-KV: Redundancy-aware KV Cache Compression for Reasoning Models
por: Cai, Zefan, et al.
Publicado: (2025) -
InRank: Incremental Low-Rank Learning
por: Zhao, Jiawei, et al.
Publicado: (2023)