zip2zip: Inference-Time Adaptive Tokenization via Online Compression
Fuente:
arXiv
Saved in:
| Main Authors: | Geng, Saibo, Ranchin, Nathan, yao, Yunzhen, Peyrard, Maxime, Wendler, Chris, Gastpar, Michael, West, Robert |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Grammar-Constrained Decoding for Structured NLP Tasks without Finetuning
by: Geng, Saibo, et al.
Published: (2023)
by: Geng, Saibo, et al.
Published: (2023)
Byte BPE Tokenization as an Inverse string Homomorphism
by: Geng, Saibo, et al.
Published: (2024)
by: Geng, Saibo, et al.
Published: (2024)
Sketch-Guided Constrained Decoding for Boosting Blackbox Large Language Models without Logit Access
by: Geng, Saibo, et al.
Published: (2024)
by: Geng, Saibo, et al.
Published: (2024)
JSONSchemaBench: A Rigorous Benchmark of Structured Outputs for Language Models
by: Geng, Saibo, et al.
Published: (2025)
by: Geng, Saibo, et al.
Published: (2025)
TRPrompt: Bootstrapping Query-Aware Prompt Optimization from Textual Rewards
by: Nica, Andreea, et al.
Published: (2025)
by: Nica, Andreea, et al.
Published: (2025)
Agentic AI: The Era of Semantic Decoding
by: Peyrard, Maxime, et al.
Published: (2024)
by: Peyrard, Maxime, et al.
Published: (2024)
Mechanistic Interpretability as Statistical Estimation: A Variance Analysis
by: Méloux, Maxime, et al.
Published: (2025)
by: Méloux, Maxime, et al.
Published: (2025)
Leveraging Sparsity for Sample-Efficient Preference Learning: A Theoretical Perspective
by: Yao, Yunzhen, et al.
Published: (2025)
by: Yao, Yunzhen, et al.
Published: (2025)
Non-Asymptotic Analysis of Efficiency in Conformalized Regression
by: Yao, Yunzhen, et al.
Published: (2025)
by: Yao, Yunzhen, et al.
Published: (2025)
Everything, Everywhere, All at Once: Is Mechanistic Interpretability Identifiable?
by: Méloux, Maxime, et al.
Published: (2025)
by: Méloux, Maxime, et al.
Published: (2025)
Date Fragments: A Hidden Bottleneck of Tokenization for Temporal Reasoning
by: Bhatia, Gagan, et al.
Published: (2025)
by: Bhatia, Gagan, et al.
Published: (2025)
Evaluating Language Model Agency through Negotiations
by: Davidson, Tim R., et al.
Published: (2024)
by: Davidson, Tim R., et al.
Published: (2024)
A Glitch in the Matrix? Locating and Detecting Language Model Grounding with Fakepedia
by: Monea, Giovanni, et al.
Published: (2023)
by: Monea, Giovanni, et al.
Published: (2023)
Do Llamas Work in English? On the Latent Language of Multilingual Transformers
by: Wendler, Chris, et al.
Published: (2024)
by: Wendler, Chris, et al.
Published: (2024)
Fundamental Limits of Prompt Compression: A Rate-Distortion Framework for Black-Box Language Models
by: Nagle, Alliot, et al.
Published: (2024)
by: Nagle, Alliot, et al.
Published: (2024)
Lossless Token Sequence Compression via Meta-Tokens
by: Harvill, John, et al.
Published: (2025)
by: Harvill, John, et al.
Published: (2025)
REFINER: Reasoning Feedback on Intermediate Representations
by: Paul, Debjit, et al.
Published: (2023)
by: Paul, Debjit, et al.
Published: (2023)
Are More Tokens Rational? Inference-Time Scaling in Language Models as Adaptive Resource Rationality
by: Hu, Zhimin, et al.
Published: (2026)
by: Hu, Zhimin, et al.
Published: (2026)
Meta-Statistical Learning: Supervised Learning of Statistical Estimators
by: Peyrard, Maxime, et al.
Published: (2025)
by: Peyrard, Maxime, et al.
Published: (2025)
Separating Tongue from Thought: Activation Patching Reveals Language-Agnostic Concept Representations in Transformers
by: Dumas, Clément, et al.
Published: (2024)
by: Dumas, Clément, et al.
Published: (2024)
Inference-Time Hyper-Scaling with KV Cache Compression
by: Łańcucki, Adrian, et al.
Published: (2025)
by: Łańcucki, Adrian, et al.
Published: (2025)
ByteFlow: Language Modeling through Adaptive Byte Compression without a Tokenizer
by: Deng, Chunyuan, et al.
Published: (2026)
by: Deng, Chunyuan, et al.
Published: (2026)
What Really Controls Temporal Reasoning in Large Language Models: Tokenisation or Representation of Time?
by: Bhatia, Gagan, et al.
Published: (2026)
by: Bhatia, Gagan, et al.
Published: (2026)
Discovering Forbidden Topics in Language Models
by: Rager, Can, et al.
Published: (2025)
by: Rager, Can, et al.
Published: (2025)
Multi-word Tokenization for Sequence Compression
by: Gee, Leonidas, et al.
Published: (2024)
by: Gee, Leonidas, et al.
Published: (2024)
Adaptive Layer Selection for Layer-Wise Token Pruning in LLM Inference
by: Taniguchi, Rei, et al.
Published: (2026)
by: Taniguchi, Rei, et al.
Published: (2026)
One Size Does Not Fit All: Token-Wise Adaptive Compression for KV Cache
by: Lu, Liming, et al.
Published: (2026)
by: Lu, Liming, et al.
Published: (2026)
DeLTa: A Decoding Strategy based on Logit Trajectory Prediction Improves Factuality and Reasoning Ability
by: He, Yunzhen, et al.
Published: (2025)
by: He, Yunzhen, et al.
Published: (2025)
Lossless Compression of Large Language Model-Generated Text via Next-Token Prediction
by: Mao, Yu, et al.
Published: (2025)
by: Mao, Yu, et al.
Published: (2025)
Tokens for Learning, Tokens for Unlearning: Mitigating Membership Inference Attacks in Large Language Models via Dual-Purpose Training
by: Tran, Toan, et al.
Published: (2025)
by: Tran, Toan, et al.
Published: (2025)
Cmprsr: Abstractive Token-Level Question-Agnostic Prompt Compressor
by: Zakazov, Ivan, et al.
Published: (2025)
by: Zakazov, Ivan, et al.
Published: (2025)
Token Sparse Attention: Efficient Long-Context Inference with Interleaved Token Selection
by: Jo, Dongwon, et al.
Published: (2026)
by: Jo, Dongwon, et al.
Published: (2026)
From Token to Token Pair: Efficient Prompt Compression for Large Language Models in Clinical Prediction
by: Zhu, Mingcheng, et al.
Published: (2026)
by: Zhu, Mingcheng, et al.
Published: (2026)
Attention with Markov: A Framework for Principled Analysis of Transformers via Markov Chains
by: Makkuva, Ashok Vardhan, et al.
Published: (2024)
by: Makkuva, Ashok Vardhan, et al.
Published: (2024)
Transformers on Markov Data: Constant Depth Suffices
by: Rajaraman, Nived, et al.
Published: (2024)
by: Rajaraman, Nived, et al.
Published: (2024)
Symbolic Autoencoding for Self-Supervised Sequence Learning
by: Amani, Mohammad Hossein, et al.
Published: (2024)
by: Amani, Mohammad Hossein, et al.
Published: (2024)
Communication Compression for Tensor Parallel LLM Inference
by: Hansen-Palmus, Jan, et al.
Published: (2024)
by: Hansen-Palmus, Jan, et al.
Published: (2024)
TIDE: Token-Informed Depth Execution for Per-Token Early Exit in LLM Inference
by: Jaber, Jaber, et al.
Published: (2026)
by: Jaber, Jaber, et al.
Published: (2026)
What Makes an LLM a Good Optimizer? A Trajectory Analysis of LLM-Guided Evolutionary Search
by: Zhang, Xinhao, et al.
Published: (2026)
by: Zhang, Xinhao, et al.
Published: (2026)
Zero-Overhead Introspection for Adaptive Test-Time Compute
by: Manvi, Rohin, et al.
Published: (2025)
by: Manvi, Rohin, et al.
Published: (2025)
Similar Items
-
Grammar-Constrained Decoding for Structured NLP Tasks without Finetuning
by: Geng, Saibo, et al.
Published: (2023) -
Byte BPE Tokenization as an Inverse string Homomorphism
by: Geng, Saibo, et al.
Published: (2024) -
Sketch-Guided Constrained Decoding for Boosting Blackbox Large Language Models without Logit Access
by: Geng, Saibo, et al.
Published: (2024) -
JSONSchemaBench: A Rigorous Benchmark of Structured Outputs for Language Models
by: Geng, Saibo, et al.
Published: (2025) -
TRPrompt: Bootstrapping Query-Aware Prompt Optimization from Textual Rewards
by: Nica, Andreea, et al.
Published: (2025)