Accelerating Constrained Decoding with Token Space Compression
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Sullivan, Michael, Koller, Alexander |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
GRPO is Secretly a Process Reward Model
von: Sullivan, Michael, et al.
Veröffentlicht: (2025)
von: Sullivan, Michael, et al.
Veröffentlicht: (2025)
AuthorMix: Modular Authorship Style Transfer via Layer-wise Adapter Mixing
von: Thillainathan, Sarubi, et al.
Veröffentlicht: (2026)
von: Thillainathan, Sarubi, et al.
Veröffentlicht: (2026)
MemoSight: Unifying Context Compression and Multi Token Prediction for Reasoning Acceleration
von: Liu, Xinyu, et al.
Veröffentlicht: (2026)
von: Liu, Xinyu, et al.
Veröffentlicht: (2026)
Cactus: Accelerating Auto-Regressive Decoding with Constrained Acceptance Speculative Sampling
von: Hao, Yongchang, et al.
Veröffentlicht: (2026)
von: Hao, Yongchang, et al.
Veröffentlicht: (2026)
Accelerating Codec-based Speech Synthesis with Multi-Token Prediction and Speculative Decoding
von: Nguyen, Tan Dat, et al.
Veröffentlicht: (2024)
von: Nguyen, Tan Dat, et al.
Veröffentlicht: (2024)
A*-Decoding: Token-Efficient Inference Scaling
von: Chatziveroglou, Giannis
Veröffentlicht: (2025)
von: Chatziveroglou, Giannis
Veröffentlicht: (2025)
Direct Multi-Token Decoding
von: Luo, Xuan, et al.
Veröffentlicht: (2025)
von: Luo, Xuan, et al.
Veröffentlicht: (2025)
Compressing Sequences in the Latent Embedding Space: $K$-Token Merging for Large Language Models
von: Xu, Zihao, et al.
Veröffentlicht: (2026)
von: Xu, Zihao, et al.
Veröffentlicht: (2026)
Chimera: A Lossless Decoding Method for Accelerating Large Language Models Inference by Fusing all Tokens
von: Zeng, Ziqian, et al.
Veröffentlicht: (2024)
von: Zeng, Ziqian, et al.
Veröffentlicht: (2024)
Constrained Decoding with Speculative Lookaheads
von: Nakshatri, Nishanth, et al.
Veröffentlicht: (2024)
von: Nakshatri, Nishanth, et al.
Veröffentlicht: (2024)
SparAMX: Accelerating Compressed LLMs Token Generation on AMX-powered CPUs
von: AbouElhamayed, Ahmed F., et al.
Veröffentlicht: (2025)
von: AbouElhamayed, Ahmed F., et al.
Veröffentlicht: (2025)
Tokenized Bandit for LLM Decoding and Alignment
von: Shin, Suho, et al.
Veröffentlicht: (2025)
von: Shin, Suho, et al.
Veröffentlicht: (2025)
Primal-Dual Guided Decoding for Constrained Discrete Diffusion
von: Tomasi, Federico, et al.
Veröffentlicht: (2026)
von: Tomasi, Federico, et al.
Veröffentlicht: (2026)
Flexible and Efficient Grammar-Constrained Decoding
von: Park, Kanghee, et al.
Veröffentlicht: (2025)
von: Park, Kanghee, et al.
Veröffentlicht: (2025)
Edit-Constrained Decoding for Sentence Simplification
von: Zetsu, Tatsuya, et al.
Veröffentlicht: (2024)
von: Zetsu, Tatsuya, et al.
Veröffentlicht: (2024)
InternVL-X: Advancing and Accelerating InternVL Series with Efficient Visual Token Compression
von: Lu, Dongchen, et al.
Veröffentlicht: (2025)
von: Lu, Dongchen, et al.
Veröffentlicht: (2025)
OneLatent: Single-Token Compression for Visual Latent Reasoning
von: Lv, Bo, et al.
Veröffentlicht: (2026)
von: Lv, Bo, et al.
Veröffentlicht: (2026)
Lossless Token Sequence Compression via Meta-Tokens
von: Harvill, John, et al.
Veröffentlicht: (2025)
von: Harvill, John, et al.
Veröffentlicht: (2025)
Decoding Compressed Trust: Scrutinizing the Trustworthiness of Efficient LLMs Under Compression
von: Hong, Junyuan, et al.
Veröffentlicht: (2024)
von: Hong, Junyuan, et al.
Veröffentlicht: (2024)
WGRAMMAR: Leverage Prior Knowledge to Accelerate Structured Decoding
von: Wang, Ran, et al.
Veröffentlicht: (2025)
von: Wang, Ran, et al.
Veröffentlicht: (2025)
Token-Guard: Towards Token-Level Hallucination Control via Self-Checking Decoding
von: Zhu, Yifan, et al.
Veröffentlicht: (2026)
von: Zhu, Yifan, et al.
Veröffentlicht: (2026)
DC-Gen: Post-Training Diffusion Acceleration with Deeply Compressed Latent Space
von: He, Wenkun, et al.
Veröffentlicht: (2025)
von: He, Wenkun, et al.
Veröffentlicht: (2025)
Automating the Generation of Prompts for LLM-based Action Choice in PDDL Planning
von: Stein, Katharina, et al.
Veröffentlicht: (2023)
von: Stein, Katharina, et al.
Veröffentlicht: (2023)
SceneTok: A Compressed, Diffusable Token Space for 3D Scenes
von: Asim, Mohammad, et al.
Veröffentlicht: (2026)
von: Asim, Mohammad, et al.
Veröffentlicht: (2026)
GRIFFIN: Effective Token Alignment for Faster Speculative Decoding
von: Hu, Shijing, et al.
Veröffentlicht: (2025)
von: Hu, Shijing, et al.
Veröffentlicht: (2025)
Token Signature: Predicting Chain-of-Thought Gains with Token Decoding Feature in Large Language Models
von: Liu, Peijie, et al.
Veröffentlicht: (2025)
von: Liu, Peijie, et al.
Veröffentlicht: (2025)
Progressive Refinement Regulation for Accelerating Diffusion Language Model Decoding
von: Wan, Lipeng, et al.
Veröffentlicht: (2026)
von: Wan, Lipeng, et al.
Veröffentlicht: (2026)
Token-Oriented Object Notation vs JSON: A Benchmark of Plain and Constrained Decoding Generation
von: Matveev, Ivan
Veröffentlicht: (2026)
von: Matveev, Ivan
Veröffentlicht: (2026)
TokenSkip: Controllable Chain-of-Thought Compression in LLMs
von: Xia, Heming, et al.
Veröffentlicht: (2025)
von: Xia, Heming, et al.
Veröffentlicht: (2025)
TokenSqueeze: Performance-Preserving Compression for Reasoning LLMs
von: Zhang, Yuxiang, et al.
Veröffentlicht: (2025)
von: Zhang, Yuxiang, et al.
Veröffentlicht: (2025)
Exploring Token-Space Manipulation in Latent Audio Tokenizers
von: Paissan, Francesco, et al.
Veröffentlicht: (2026)
von: Paissan, Francesco, et al.
Veröffentlicht: (2026)
The First Token Knows: Single-Decode Confidence for Hallucination Detection
von: Gabriel, Mina
Veröffentlicht: (2026)
von: Gabriel, Mina
Veröffentlicht: (2026)
HybridToken-VLM: Hybrid Token Compression for Vision-Language Models
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
LayerCake: Token-Aware Contrastive Decoding within Large Language Model Layers
von: Zhu, Jingze, et al.
Veröffentlicht: (2025)
von: Zhu, Jingze, et al.
Veröffentlicht: (2025)
TETRIS: Optimal Draft Token Selection for Batch Speculative Decoding
von: Wu, Zhaoxuan, et al.
Veröffentlicht: (2025)
von: Wu, Zhaoxuan, et al.
Veröffentlicht: (2025)
Policy-Space Search: Equivalences, Improvements, and Compression
von: Messa, Frederico, et al.
Veröffentlicht: (2024)
von: Messa, Frederico, et al.
Veröffentlicht: (2024)
Don't Fine-Tune, Decode: Syntax Error-Free Tool Use via Constrained Decoding
von: Zhang, Kexun, et al.
Veröffentlicht: (2023)
von: Zhang, Kexun, et al.
Veröffentlicht: (2023)
Improved Generalized Planning with LLMs through Strategy Refinement and Reflection
von: Stein, Katharina, et al.
Veröffentlicht: (2025)
von: Stein, Katharina, et al.
Veröffentlicht: (2025)
CreditDecoding: Accelerating Parallel Decoding in Diffusion Large Language Models with Trace Credit
von: Wang, Kangyu, et al.
Veröffentlicht: (2025)
von: Wang, Kangyu, et al.
Veröffentlicht: (2025)
Meta-Soft: Leveraging Composable Meta-Tokens for Context-Preserving KV Cache Compression
von: Luo, Wei, et al.
Veröffentlicht: (2026)
von: Luo, Wei, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
GRPO is Secretly a Process Reward Model
von: Sullivan, Michael, et al.
Veröffentlicht: (2025) -
AuthorMix: Modular Authorship Style Transfer via Layer-wise Adapter Mixing
von: Thillainathan, Sarubi, et al.
Veröffentlicht: (2026) -
MemoSight: Unifying Context Compression and Multi Token Prediction for Reasoning Acceleration
von: Liu, Xinyu, et al.
Veröffentlicht: (2026) -
Cactus: Accelerating Auto-Regressive Decoding with Constrained Acceptance Speculative Sampling
von: Hao, Yongchang, et al.
Veröffentlicht: (2026) -
Accelerating Codec-based Speech Synthesis with Multi-Token Prediction and Speculative Decoding
von: Nguyen, Tan Dat, et al.
Veröffentlicht: (2024)