Know Your Limits: Entropy Estimation Modeling for Compression and Generalization
Fuente:
arXiv
Guardado en:
| Autores principales: | Badger, Benjamin L., Neligeorge, Matthew |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
NanoKnow: How to Know What Your Language Model Knows
por: Gu, Lingwei, et al.
Publicado: (2026)
por: Gu, Lingwei, et al.
Publicado: (2026)
Language Modeling Is Compression
por: Delétang, Grégoire, et al.
Publicado: (2023)
por: Delétang, Grégoire, et al.
Publicado: (2023)
The Detection-Extraction Gap: Models Know the Answer Before They Can Say It
por: Wang, Hanyang, et al.
Publicado: (2026)
por: Wang, Hanyang, et al.
Publicado: (2026)
Memorization-Compression Cycles Improve Generalization
por: Yu, Fangyuan
Publicado: (2025)
por: Yu, Fangyuan
Publicado: (2025)
Semantic Faithfulness and Entropy Production Measures to Tame Your LLM Demons and Manage Hallucinations
por: Halperin, Igor
Publicado: (2025)
por: Halperin, Igor
Publicado: (2025)
Language Model Memory and Memory Models for Language
por: Badger, Benjamin L.
Publicado: (2026)
por: Badger, Benjamin L.
Publicado: (2026)
Learning is Forgetting: LLM Training As Lossy Compression
por: Conklin, Henry C., et al.
Publicado: (2026)
por: Conklin, Henry C., et al.
Publicado: (2026)
Compression Represents Intelligence Linearly
por: Huang, Yuzhen, et al.
Publicado: (2024)
por: Huang, Yuzhen, et al.
Publicado: (2024)
The Stepwise Informativeness Assumption: Why are Entropy Dynamics and Reasoning Correlated in LLMs?
por: Català, Mar Gonzàlez I, et al.
Publicado: (2026)
por: Català, Mar Gonzàlez I, et al.
Publicado: (2026)
Toeplitz MLP Mixers are Low Complexity, Information-Rich Sequence Models
por: Badger, Benjamin L., et al.
Publicado: (2026)
por: Badger, Benjamin L., et al.
Publicado: (2026)
DIVE: Embedding Compression via Self-Limiting Gradient Updates
por: Zhao, Dongfang
Publicado: (2026)
por: Zhao, Dongfang
Publicado: (2026)
The Information of Large Language Model Geometry
por: Tan, Zhiquan, et al.
Publicado: (2024)
por: Tan, Zhiquan, et al.
Publicado: (2024)
A Survey on Large Language Models from Concept to Implementation
por: Wang, Chen, et al.
Publicado: (2024)
por: Wang, Chen, et al.
Publicado: (2024)
Geometric Signatures of Compositionality Across a Language Model's Lifetime
por: Lee, Jin Hwa, et al.
Publicado: (2024)
por: Lee, Jin Hwa, et al.
Publicado: (2024)
Diff-eRank: A Novel Rank-Based Metric for Evaluating Large Language Models
por: Wei, Lai, et al.
Publicado: (2024)
por: Wei, Lai, et al.
Publicado: (2024)
Optimizing Learned Image Compression on Scalar and Entropy-Constraint Quantization
por: Borzechowski, Florian, et al.
Publicado: (2025)
por: Borzechowski, Florian, et al.
Publicado: (2025)
Familiarity-Aware Evidence Compression for Retrieval-Augmented Generation
por: Jung, Dongwon, et al.
Publicado: (2024)
por: Jung, Dongwon, et al.
Publicado: (2024)
A Training-free Method for LLM Text Attribution
por: Radvand, Tara, et al.
Publicado: (2025)
por: Radvand, Tara, et al.
Publicado: (2025)
Measuring Uncertainty in Transformer Circuits with Effective Information Consistency
por: Krasnovsky, Anatoly A.
Publicado: (2025)
por: Krasnovsky, Anatoly A.
Publicado: (2025)
SPEX: Scaling Feature Interaction Explanations for LLMs
por: Kang, Justin Singh, et al.
Publicado: (2025)
por: Kang, Justin Singh, et al.
Publicado: (2025)
Subjective Depth and Timescale Transformers: Learning Where and When to Compute
por: Wieser, Frederico, et al.
Publicado: (2025)
por: Wieser, Frederico, et al.
Publicado: (2025)
SQuat: Subspace-orthogonal KV Cache Quantization
por: Wang, Hao, et al.
Publicado: (2025)
por: Wang, Hao, et al.
Publicado: (2025)
An Information Theoretic Perspective on Agentic System Design
por: He, Shizhe, et al.
Publicado: (2025)
por: He, Shizhe, et al.
Publicado: (2025)
Self-Play Only Evolves When Self-Synthetic Pipeline Ensures Learnable Information Gain
por: Liu, Wei, et al.
Publicado: (2026)
por: Liu, Wei, et al.
Publicado: (2026)
Analyzing and Improving Chain-of-Thought Monitorability Through Information Theory
por: Anwar, Usman, et al.
Publicado: (2026)
por: Anwar, Usman, et al.
Publicado: (2026)
Optimal Quantization for Matrix Multiplication
por: Ordentlich, Or, et al.
Publicado: (2024)
por: Ordentlich, Or, et al.
Publicado: (2024)
A Communication-Theoretic Framework for LLM Agents: Cost-Aware Adaptive Reliability
por: Omidvar, Hamed, et al.
Publicado: (2026)
por: Omidvar, Hamed, et al.
Publicado: (2026)
How Many Features Can a Language Model Store Under the Linear Representation Hypothesis?
por: Garg, Nikhil, et al.
Publicado: (2026)
por: Garg, Nikhil, et al.
Publicado: (2026)
Intrinsic Dimension Estimation for Robust Detection of AI-Generated Texts
por: Tulchinskii, Eduard, et al.
Publicado: (2023)
por: Tulchinskii, Eduard, et al.
Publicado: (2023)
HeavyWater and SimplexWater: Distortion-Free LLM Watermarks for Low-Entropy Next-Token Predictions
por: Tsur, Dor, et al.
Publicado: (2025)
por: Tsur, Dor, et al.
Publicado: (2025)
Fundamental Limits of Prompt Compression: A Rate-Distortion Framework for Black-Box Language Models
por: Nagle, Alliot, et al.
Publicado: (2024)
por: Nagle, Alliot, et al.
Publicado: (2024)
Retrieval-Augmented Generation as Noisy In-Context Learning: A Unified Theory and Risk Bounds
por: Guo, Yang, et al.
Publicado: (2025)
por: Guo, Yang, et al.
Publicado: (2025)
Entropy-informed Decoding: Adaptive Information-Driven Branching
por: Evans, Benjamin Patrick, et al.
Publicado: (2026)
por: Evans, Benjamin Patrick, et al.
Publicado: (2026)
Agentic Entropy-Balanced Policy Optimization
por: Dong, Guanting, et al.
Publicado: (2025)
por: Dong, Guanting, et al.
Publicado: (2025)
MESSY Estimation: Maximum-Entropy based Stochastic and Symbolic densitY Estimation
por: Tohme, Tony, et al.
Publicado: (2023)
por: Tohme, Tony, et al.
Publicado: (2023)
The Shape of Learning: Anisotropy and Intrinsic Dimensions in Transformer-Based Models
por: Razzhigaev, Anton, et al.
Publicado: (2023)
por: Razzhigaev, Anton, et al.
Publicado: (2023)
Deep Generative Sampling in the Dual Divergence Space: A Data-efficient & Interpretative Approach for Generative AI
por: Garg, Sahil, et al.
Publicado: (2024)
por: Garg, Sahil, et al.
Publicado: (2024)
ComMer: a Framework for Compressing and Merging User Data for Personalization
por: Zeldes, Yoel, et al.
Publicado: (2025)
por: Zeldes, Yoel, et al.
Publicado: (2025)
Do Large Language Models Know How Much They Know?
por: Prato, Gabriele, et al.
Publicado: (2025)
por: Prato, Gabriele, et al.
Publicado: (2025)
Beyond RAG: Task-Aware KV Cache Compression for Comprehensive Knowledge Reasoning
por: Corallo, Giulio, et al.
Publicado: (2025)
por: Corallo, Giulio, et al.
Publicado: (2025)
Ejemplares similares
-
NanoKnow: How to Know What Your Language Model Knows
por: Gu, Lingwei, et al.
Publicado: (2026) -
Language Modeling Is Compression
por: Delétang, Grégoire, et al.
Publicado: (2023) -
The Detection-Extraction Gap: Models Know the Answer Before They Can Say It
por: Wang, Hanyang, et al.
Publicado: (2026) -
Memorization-Compression Cycles Improve Generalization
por: Yu, Fangyuan
Publicado: (2025) -
Semantic Faithfulness and Entropy Production Measures to Tame Your LLM Demons and Manage Hallucinations
por: Halperin, Igor
Publicado: (2025)