Guardado en:
| Autores principales: | Zhou, Yuli, Chen, Qingxuan, Benini, Luca, Sun, Guolei, Li, Yawei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2602.02151 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SliM-LLM: Salience-Driven Mixed-Precision Quantization for Large Language Models
por: Huang, Wei, et al.
Publicado: (2024)
por: Huang, Wei, et al.
Publicado: (2024)
Optimal Brain Restoration for Joint Quantization and Sparsification of LLMs
por: Guo, Hang, et al.
Publicado: (2025)
por: Guo, Hang, et al.
Publicado: (2025)
CamSAM2: Segment Anything Accurately in Camouflaged Videos
por: Zhou, Yuli, et al.
Publicado: (2025)
por: Zhou, Yuli, et al.
Publicado: (2025)
Direct Quantized Training of Language Models with Stochastic Rounding
por: Zhao, Kaiyan, et al.
Publicado: (2024)
por: Zhao, Kaiyan, et al.
Publicado: (2024)
Reparameterized LLM Training via Orthogonal Equivalence Transformation
por: Qiu, Zeju, et al.
Publicado: (2025)
por: Qiu, Zeju, et al.
Publicado: (2025)
When SAM2 Meets Video Camouflaged Object Segmentation: A Comprehensive Evaluation and Adaptation
por: Zhou, Yuli, et al.
Publicado: (2024)
por: Zhou, Yuli, et al.
Publicado: (2024)
Robust Training of Vector Quantized Bottleneck Models
por: Łańcucki, Adrian, et al.
Publicado: (2020)
por: Łańcucki, Adrian, et al.
Publicado: (2020)
ShiftAddLLM: Accelerating Pretrained LLMs via Post-Training Multiplication-Less Reparameterization
por: You, Haoran, et al.
Publicado: (2024)
por: You, Haoran, et al.
Publicado: (2024)
RDKV: Rate-Distortion Bit Allocation for Joint Eviction and Quantization of the KV Cache
por: Zhang, Junkai, et al.
Publicado: (2026)
por: Zhang, Junkai, et al.
Publicado: (2026)
A Reparameterized Discrete Diffusion Model for Text Generation
por: Zheng, Lin, et al.
Publicado: (2023)
por: Zheng, Lin, et al.
Publicado: (2023)
Optimize Weight Rounding via Signed Gradient Descent for the Quantization of LLMs
por: Cheng, Wenhua, et al.
Publicado: (2023)
por: Cheng, Wenhua, et al.
Publicado: (2023)
End-to-End Training for Back-Translation with Categorical Reparameterization Trick
por: Heo, DongNyeong, et al.
Publicado: (2022)
por: Heo, DongNyeong, et al.
Publicado: (2022)
AAAC: Activation-Aware Adaptive Codebooks for 4-bit LLM Weight Quantization
por: IslamBouli, Beshr, et al.
Publicado: (2026)
por: IslamBouli, Beshr, et al.
Publicado: (2026)
FlatQuant: Flatness Matters for LLM Quantization
por: Sun, Yuxuan, et al.
Publicado: (2024)
por: Sun, Yuxuan, et al.
Publicado: (2024)
CRVQ: Channel-Relaxed Vector Quantization for Extreme Compression of LLMs
por: Xu, Yuzhuang, et al.
Publicado: (2024)
por: Xu, Yuzhuang, et al.
Publicado: (2024)
SqueezeLLM: Dense-and-Sparse Quantization
por: Kim, Sehoon, et al.
Publicado: (2023)
por: Kim, Sehoon, et al.
Publicado: (2023)
Robust and Efficient Fine-tuning of LLMs with Bayesian Reparameterization of Low-Rank Adaptation
por: Sengupta, Ayan, et al.
Publicado: (2024)
por: Sengupta, Ayan, et al.
Publicado: (2024)
Revisiting Entropy Regularization: Adaptive Coefficient Unlocks Its Potential for LLM Reinforcement Learning
por: Zhang, Xiaoyun, et al.
Publicado: (2025)
por: Zhang, Xiaoyun, et al.
Publicado: (2025)
RSAVQ: Riemannian Sensitivity-Aware Vector Quantization for Large Language Models
por: Xu, Zukang, et al.
Publicado: (2025)
por: Xu, Zukang, et al.
Publicado: (2025)
HiM2SAM: Enhancing SAM2 with Hierarchical Motion Estimation and Memory Optimization towards Long-term Tracking
por: Chen, Ruixiang, et al.
Publicado: (2025)
por: Chen, Ruixiang, et al.
Publicado: (2025)
MoBiQuant: Mixture-of-Bits Quantization for Token-Adaptive Any-Precision LLM
por: Wang, Dongwei, et al.
Publicado: (2026)
por: Wang, Dongwei, et al.
Publicado: (2026)
Technical Report: Activation Residual Hessian Quantization (ARHQ) for Low-Bit LLM Quantization
por: Wang, YiFeng, et al.
Publicado: (2026)
por: Wang, YiFeng, et al.
Publicado: (2026)
GPTVQ: The Blessing of Dimensionality for LLM Quantization
por: van Baalen, Mart, et al.
Publicado: (2024)
por: van Baalen, Mart, et al.
Publicado: (2024)
Round and Round We Go! What makes Rotary Positional Encodings useful?
por: Barbero, Federico, et al.
Publicado: (2024)
por: Barbero, Federico, et al.
Publicado: (2024)
DartQuant: Efficient Rotational Distribution Calibration for LLM Quantization
por: Shao, Yuantian, et al.
Publicado: (2025)
por: Shao, Yuantian, et al.
Publicado: (2025)
Vector Quantized Latent Concepts: A Scalable Alternative to Clustering-Based Concept Discovery
por: Yu, Xuemin, et al.
Publicado: (2026)
por: Yu, Xuemin, et al.
Publicado: (2026)
Adaptive Task Vectors for Large Language Models
por: Kang, Joonseong, et al.
Publicado: (2025)
por: Kang, Joonseong, et al.
Publicado: (2025)
Revisiting Zeroth-Order Optimization for Memory-Efficient LLM Fine-Tuning: A Benchmark
por: Zhang, Yihua, et al.
Publicado: (2024)
por: Zhang, Yihua, et al.
Publicado: (2024)
RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval
por: Liu, Di, et al.
Publicado: (2024)
por: Liu, Di, et al.
Publicado: (2024)
QUAD: Quantization and Parameter-Efficient Tuning of LLM with Activation Decomposition
por: Hu, Yuxuan, et al.
Publicado: (2025)
por: Hu, Yuxuan, et al.
Publicado: (2025)
Transformer-VQ: Linear-Time Transformers via Vector Quantization
por: Lingle, Lucas D.
Publicado: (2023)
por: Lingle, Lucas D.
Publicado: (2023)
Evaluation Hallucination in Multi-Round Incomplete Information Lateral-Driven Reasoning Tasks
por: Dong, Wenhan, et al.
Publicado: (2025)
por: Dong, Wenhan, et al.
Publicado: (2025)
Scaling Law for Quantization-Aware Training
por: Chen, Mengzhao, et al.
Publicado: (2025)
por: Chen, Mengzhao, et al.
Publicado: (2025)
StableSSM: Alleviating the Curse of Memory in State-space Models through Stable Reparameterization
por: Wang, Shida, et al.
Publicado: (2023)
por: Wang, Shida, et al.
Publicado: (2023)
Cost-Efficient Large Language Model Serving for Multi-turn Conversations with CachedAttention
por: Gao, Bin, et al.
Publicado: (2024)
por: Gao, Bin, et al.
Publicado: (2024)
A Framework for Cost-Effective and Self-Adaptive LLM Shaking and Recovery Mechanism
por: Chen, Zhiyu, et al.
Publicado: (2024)
por: Chen, Zhiyu, et al.
Publicado: (2024)
Back to Basics: Revisiting Exploration in Reinforcement Learning for LLM Reasoning via Generative Probabilities
por: Li, Pengyi, et al.
Publicado: (2026)
por: Li, Pengyi, et al.
Publicado: (2026)
BEATS: Optimizing LLM Mathematical Capabilities with BackVerify and Adaptive Disambiguate based Efficient Tree Search
por: Sun, Linzhuang, et al.
Publicado: (2024)
por: Sun, Linzhuang, et al.
Publicado: (2024)
From Signal Degradation to Computation Collapse: Uncovering the Two Failure Modes of LLM Quantization
por: Zhou, Chenxi, et al.
Publicado: (2026)
por: Zhou, Chenxi, et al.
Publicado: (2026)
Trust in One Round: Confidence Estimation for Large Language Models via Structural Signals
por: Yang, Pengyue, et al.
Publicado: (2026)
por: Yang, Pengyue, et al.
Publicado: (2026)
Ejemplares similares
-
SliM-LLM: Salience-Driven Mixed-Precision Quantization for Large Language Models
por: Huang, Wei, et al.
Publicado: (2024) -
Optimal Brain Restoration for Joint Quantization and Sparsification of LLMs
por: Guo, Hang, et al.
Publicado: (2025) -
CamSAM2: Segment Anything Accurately in Camouflaged Videos
por: Zhou, Yuli, et al.
Publicado: (2025) -
Direct Quantized Training of Language Models with Stochastic Rounding
por: Zhao, Kaiyan, et al.
Publicado: (2024) -
Reparameterized LLM Training via Orthogonal Equivalence Transformation
por: Qiu, Zeju, et al.
Publicado: (2025)