Optimal Quantization for Matrix Multiplication
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ordentlich, Or, Polyanskiy, Yury |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
High-Rate Quantized Matrix Multiplication II
par: Ordentlich, Or, et autres
Publié: (2026)
par: Ordentlich, Or, et autres
Publié: (2026)
High-Rate Quantized Matrix Multiplication I
par: Ordentlich, Or, et autres
Publié: (2026)
par: Ordentlich, Or, et autres
Publié: (2026)
NestQuant: Nested Lattice Quantization for Matrix Products and LLMs
par: Savkin, Semyon, et autres
Publié: (2025)
par: Savkin, Semyon, et autres
Publié: (2025)
Price of universality in vector quantization is at most 0.11 bit
par: Harbuzova, Alina, et autres
Publié: (2026)
par: Harbuzova, Alina, et autres
Publié: (2026)
WaterSIC: information-theoretically (near) optimal linear layer quantization
par: Lifar, Egor, et autres
Publié: (2026)
par: Lifar, Egor, et autres
Publié: (2026)
SQuat: Subspace-orthogonal KV Cache Quantization
par: Wang, Hao, et autres
Publié: (2025)
par: Wang, Hao, et autres
Publié: (2025)
Diff-eRank: A Novel Rank-Based Metric for Evaluating Large Language Models
par: Wei, Lai, et autres
Publié: (2024)
par: Wei, Lai, et autres
Publié: (2024)
Compression Represents Intelligence Linearly
par: Huang, Yuzhen, et autres
Publié: (2024)
par: Huang, Yuzhen, et autres
Publié: (2024)
A Survey on Large Language Models from Concept to Implementation
par: Wang, Chen, et autres
Publié: (2024)
par: Wang, Chen, et autres
Publié: (2024)
The Information of Large Language Model Geometry
par: Tan, Zhiquan, et autres
Publié: (2024)
par: Tan, Zhiquan, et autres
Publié: (2024)
Geometric Signatures of Compositionality Across a Language Model's Lifetime
par: Lee, Jin Hwa, et autres
Publié: (2024)
par: Lee, Jin Hwa, et autres
Publié: (2024)
A Training-free Method for LLM Text Attribution
par: Radvand, Tara, et autres
Publié: (2025)
par: Radvand, Tara, et autres
Publié: (2025)
Self-Play Only Evolves When Self-Synthetic Pipeline Ensures Learnable Information Gain
par: Liu, Wei, et autres
Publié: (2026)
par: Liu, Wei, et autres
Publié: (2026)
Know Your Limits: Entropy Estimation Modeling for Compression and Generalization
par: Badger, Benjamin L., et autres
Publié: (2025)
par: Badger, Benjamin L., et autres
Publié: (2025)
Analyzing and Improving Chain-of-Thought Monitorability Through Information Theory
par: Anwar, Usman, et autres
Publié: (2026)
par: Anwar, Usman, et autres
Publié: (2026)
Language Modeling Is Compression
par: Delétang, Grégoire, et autres
Publié: (2023)
par: Delétang, Grégoire, et autres
Publié: (2023)
Memorization-Compression Cycles Improve Generalization
par: Yu, Fangyuan
Publié: (2025)
par: Yu, Fangyuan
Publié: (2025)
Measuring Uncertainty in Transformer Circuits with Effective Information Consistency
par: Krasnovsky, Anatoly A.
Publié: (2025)
par: Krasnovsky, Anatoly A.
Publié: (2025)
SPEX: Scaling Feature Interaction Explanations for LLMs
par: Kang, Justin Singh, et autres
Publié: (2025)
par: Kang, Justin Singh, et autres
Publié: (2025)
A Communication-Theoretic Framework for LLM Agents: Cost-Aware Adaptive Reliability
par: Omidvar, Hamed, et autres
Publié: (2026)
par: Omidvar, Hamed, et autres
Publié: (2026)
The Stepwise Informativeness Assumption: Why are Entropy Dynamics and Reasoning Correlated in LLMs?
par: Català, Mar Gonzàlez I, et autres
Publié: (2026)
par: Català, Mar Gonzàlez I, et autres
Publié: (2026)
Learning is Forgetting: LLM Training As Lossy Compression
par: Conklin, Henry C., et autres
Publié: (2026)
par: Conklin, Henry C., et autres
Publié: (2026)
Subjective Depth and Timescale Transformers: Learning Where and When to Compute
par: Wieser, Frederico, et autres
Publié: (2025)
par: Wieser, Frederico, et autres
Publié: (2025)
The Detection-Extraction Gap: Models Know the Answer Before They Can Say It
par: Wang, Hanyang, et autres
Publié: (2026)
par: Wang, Hanyang, et autres
Publié: (2026)
An Information Theoretic Perspective on Agentic System Design
par: He, Shizhe, et autres
Publié: (2025)
par: He, Shizhe, et autres
Publié: (2025)
Optimal Online Bookmaking for Binary Games
par: Bhatt, Alankrita, et autres
Publié: (2025)
par: Bhatt, Alankrita, et autres
Publié: (2025)
PrismQuant: Rate-Distortion-Optimal Vector Quantization for Gaussian-Mixture Sources
par: Park, Bumsu, et autres
Publié: (2026)
par: Park, Bumsu, et autres
Publié: (2026)
Hallucination is a Consequence of Space-Optimality: A Rate-Distortion Theorem for Membership Testing
par: Guo, Anxin, et autres
Publié: (2026)
par: Guo, Anxin, et autres
Publié: (2026)
High-Rate Nested-Lattice Quantized Matrix Multiplication with Small Lookup Tables
par: Kaplan, Iris, et autres
Publié: (2025)
par: Kaplan, Iris, et autres
Publié: (2025)
How Many Features Can a Language Model Store Under the Linear Representation Hypothesis?
par: Garg, Nikhil, et autres
Publié: (2026)
par: Garg, Nikhil, et autres
Publié: (2026)
RateQuant: Optimal Mixed-Precision KV Cache Quantization via Rate-Distortion Theory
par: Zuo, Fei, et autres
Publié: (2026)
par: Zuo, Fei, et autres
Publié: (2026)
Semantic Faithfulness and Entropy Production Measures to Tame Your LLM Demons and Manage Hallucinations
par: Halperin, Igor
Publié: (2025)
par: Halperin, Igor
Publié: (2025)
Optimal Scalar Quantization for Matrix Multiplication: Closed-Form Density and Phase Transition
par: Ang, Calvin, et autres
Publié: (2026)
par: Ang, Calvin, et autres
Publié: (2026)
Learning to Bid Optimally and Efficiently in Adversarial First-price Auctions
par: Han, Yanjun, et autres
Publié: (2020)
par: Han, Yanjun, et autres
Publié: (2020)
OD-Stega: LLM-Based Relatively Secure Steganography via Optimized Distributions
par: Huang, Yu-Shin, et autres
Publié: (2024)
par: Huang, Yu-Shin, et autres
Publié: (2024)
MOTIF: Modular Thinking via Reinforcement Fine-tuning in LLMs
par: Mitra, Purbesh, et autres
Publié: (2025)
par: Mitra, Purbesh, et autres
Publié: (2025)
Semantic Soft Bootstrapping: Long Context Reasoning in LLMs without Reinforcement Learning
par: Mitra, Purbesh, et autres
Publié: (2025)
par: Mitra, Purbesh, et autres
Publié: (2025)
The Shape of Learning: Anisotropy and Intrinsic Dimensions in Transformer-Based Models
par: Razzhigaev, Anton, et autres
Publié: (2023)
par: Razzhigaev, Anton, et autres
Publié: (2023)
Retrieval-Augmented Generation as Noisy In-Context Learning: A Unified Theory and Risk Bounds
par: Guo, Yang, et autres
Publié: (2025)
par: Guo, Yang, et autres
Publié: (2025)
Forgetting-MarI: LLM Unlearning via Marginal Information Regularization
par: Xu, Shizhou, et autres
Publié: (2025)
par: Xu, Shizhou, et autres
Publié: (2025)
Documents similaires
-
High-Rate Quantized Matrix Multiplication II
par: Ordentlich, Or, et autres
Publié: (2026) -
High-Rate Quantized Matrix Multiplication I
par: Ordentlich, Or, et autres
Publié: (2026) -
NestQuant: Nested Lattice Quantization for Matrix Products and LLMs
par: Savkin, Semyon, et autres
Publié: (2025) -
Price of universality in vector quantization is at most 0.11 bit
par: Harbuzova, Alina, et autres
Publié: (2026) -
WaterSIC: information-theoretically (near) optimal linear layer quantization
par: Lifar, Egor, et autres
Publié: (2026)