Know Your Limits: Entropy Estimation Modeling for Compression and Generalization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Badger, Benjamin L., Neligeorge, Matthew |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
NanoKnow: How to Know What Your Language Model Knows
par: Gu, Lingwei, et autres
Publié: (2026)
par: Gu, Lingwei, et autres
Publié: (2026)
Language Modeling Is Compression
par: Delétang, Grégoire, et autres
Publié: (2023)
par: Delétang, Grégoire, et autres
Publié: (2023)
The Detection-Extraction Gap: Models Know the Answer Before They Can Say It
par: Wang, Hanyang, et autres
Publié: (2026)
par: Wang, Hanyang, et autres
Publié: (2026)
Memorization-Compression Cycles Improve Generalization
par: Yu, Fangyuan
Publié: (2025)
par: Yu, Fangyuan
Publié: (2025)
Semantic Faithfulness and Entropy Production Measures to Tame Your LLM Demons and Manage Hallucinations
par: Halperin, Igor
Publié: (2025)
par: Halperin, Igor
Publié: (2025)
Language Model Memory and Memory Models for Language
par: Badger, Benjamin L.
Publié: (2026)
par: Badger, Benjamin L.
Publié: (2026)
Learning is Forgetting: LLM Training As Lossy Compression
par: Conklin, Henry C., et autres
Publié: (2026)
par: Conklin, Henry C., et autres
Publié: (2026)
Compression Represents Intelligence Linearly
par: Huang, Yuzhen, et autres
Publié: (2024)
par: Huang, Yuzhen, et autres
Publié: (2024)
The Stepwise Informativeness Assumption: Why are Entropy Dynamics and Reasoning Correlated in LLMs?
par: Català, Mar Gonzàlez I, et autres
Publié: (2026)
par: Català, Mar Gonzàlez I, et autres
Publié: (2026)
Toeplitz MLP Mixers are Low Complexity, Information-Rich Sequence Models
par: Badger, Benjamin L., et autres
Publié: (2026)
par: Badger, Benjamin L., et autres
Publié: (2026)
DIVE: Embedding Compression via Self-Limiting Gradient Updates
par: Zhao, Dongfang
Publié: (2026)
par: Zhao, Dongfang
Publié: (2026)
The Information of Large Language Model Geometry
par: Tan, Zhiquan, et autres
Publié: (2024)
par: Tan, Zhiquan, et autres
Publié: (2024)
A Survey on Large Language Models from Concept to Implementation
par: Wang, Chen, et autres
Publié: (2024)
par: Wang, Chen, et autres
Publié: (2024)
Geometric Signatures of Compositionality Across a Language Model's Lifetime
par: Lee, Jin Hwa, et autres
Publié: (2024)
par: Lee, Jin Hwa, et autres
Publié: (2024)
Diff-eRank: A Novel Rank-Based Metric for Evaluating Large Language Models
par: Wei, Lai, et autres
Publié: (2024)
par: Wei, Lai, et autres
Publié: (2024)
Optimizing Learned Image Compression on Scalar and Entropy-Constraint Quantization
par: Borzechowski, Florian, et autres
Publié: (2025)
par: Borzechowski, Florian, et autres
Publié: (2025)
Familiarity-Aware Evidence Compression for Retrieval-Augmented Generation
par: Jung, Dongwon, et autres
Publié: (2024)
par: Jung, Dongwon, et autres
Publié: (2024)
A Training-free Method for LLM Text Attribution
par: Radvand, Tara, et autres
Publié: (2025)
par: Radvand, Tara, et autres
Publié: (2025)
Measuring Uncertainty in Transformer Circuits with Effective Information Consistency
par: Krasnovsky, Anatoly A.
Publié: (2025)
par: Krasnovsky, Anatoly A.
Publié: (2025)
SPEX: Scaling Feature Interaction Explanations for LLMs
par: Kang, Justin Singh, et autres
Publié: (2025)
par: Kang, Justin Singh, et autres
Publié: (2025)
Subjective Depth and Timescale Transformers: Learning Where and When to Compute
par: Wieser, Frederico, et autres
Publié: (2025)
par: Wieser, Frederico, et autres
Publié: (2025)
SQuat: Subspace-orthogonal KV Cache Quantization
par: Wang, Hao, et autres
Publié: (2025)
par: Wang, Hao, et autres
Publié: (2025)
An Information Theoretic Perspective on Agentic System Design
par: He, Shizhe, et autres
Publié: (2025)
par: He, Shizhe, et autres
Publié: (2025)
Self-Play Only Evolves When Self-Synthetic Pipeline Ensures Learnable Information Gain
par: Liu, Wei, et autres
Publié: (2026)
par: Liu, Wei, et autres
Publié: (2026)
Analyzing and Improving Chain-of-Thought Monitorability Through Information Theory
par: Anwar, Usman, et autres
Publié: (2026)
par: Anwar, Usman, et autres
Publié: (2026)
Optimal Quantization for Matrix Multiplication
par: Ordentlich, Or, et autres
Publié: (2024)
par: Ordentlich, Or, et autres
Publié: (2024)
A Communication-Theoretic Framework for LLM Agents: Cost-Aware Adaptive Reliability
par: Omidvar, Hamed, et autres
Publié: (2026)
par: Omidvar, Hamed, et autres
Publié: (2026)
How Many Features Can a Language Model Store Under the Linear Representation Hypothesis?
par: Garg, Nikhil, et autres
Publié: (2026)
par: Garg, Nikhil, et autres
Publié: (2026)
Intrinsic Dimension Estimation for Robust Detection of AI-Generated Texts
par: Tulchinskii, Eduard, et autres
Publié: (2023)
par: Tulchinskii, Eduard, et autres
Publié: (2023)
HeavyWater and SimplexWater: Distortion-Free LLM Watermarks for Low-Entropy Next-Token Predictions
par: Tsur, Dor, et autres
Publié: (2025)
par: Tsur, Dor, et autres
Publié: (2025)
Fundamental Limits of Prompt Compression: A Rate-Distortion Framework for Black-Box Language Models
par: Nagle, Alliot, et autres
Publié: (2024)
par: Nagle, Alliot, et autres
Publié: (2024)
Retrieval-Augmented Generation as Noisy In-Context Learning: A Unified Theory and Risk Bounds
par: Guo, Yang, et autres
Publié: (2025)
par: Guo, Yang, et autres
Publié: (2025)
Entropy-informed Decoding: Adaptive Information-Driven Branching
par: Evans, Benjamin Patrick, et autres
Publié: (2026)
par: Evans, Benjamin Patrick, et autres
Publié: (2026)
Agentic Entropy-Balanced Policy Optimization
par: Dong, Guanting, et autres
Publié: (2025)
par: Dong, Guanting, et autres
Publié: (2025)
MESSY Estimation: Maximum-Entropy based Stochastic and Symbolic densitY Estimation
par: Tohme, Tony, et autres
Publié: (2023)
par: Tohme, Tony, et autres
Publié: (2023)
The Shape of Learning: Anisotropy and Intrinsic Dimensions in Transformer-Based Models
par: Razzhigaev, Anton, et autres
Publié: (2023)
par: Razzhigaev, Anton, et autres
Publié: (2023)
Deep Generative Sampling in the Dual Divergence Space: A Data-efficient & Interpretative Approach for Generative AI
par: Garg, Sahil, et autres
Publié: (2024)
par: Garg, Sahil, et autres
Publié: (2024)
ComMer: a Framework for Compressing and Merging User Data for Personalization
par: Zeldes, Yoel, et autres
Publié: (2025)
par: Zeldes, Yoel, et autres
Publié: (2025)
Do Large Language Models Know How Much They Know?
par: Prato, Gabriele, et autres
Publié: (2025)
par: Prato, Gabriele, et autres
Publié: (2025)
Beyond RAG: Task-Aware KV Cache Compression for Comprehensive Knowledge Reasoning
par: Corallo, Giulio, et autres
Publié: (2025)
par: Corallo, Giulio, et autres
Publié: (2025)
Documents similaires
-
NanoKnow: How to Know What Your Language Model Knows
par: Gu, Lingwei, et autres
Publié: (2026) -
Language Modeling Is Compression
par: Delétang, Grégoire, et autres
Publié: (2023) -
The Detection-Extraction Gap: Models Know the Answer Before They Can Say It
par: Wang, Hanyang, et autres
Publié: (2026) -
Memorization-Compression Cycles Improve Generalization
par: Yu, Fangyuan
Publié: (2025) -
Semantic Faithfulness and Entropy Production Measures to Tame Your LLM Demons and Manage Hallucinations
par: Halperin, Igor
Publié: (2025)