TokenSqueeze: Performance-Preserving Compression for Reasoning LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Yuxiang, Yu, Zhengxu, Pan, Weihang, Jin, Zhongming, Fu, Qiang, Cai, Deng, Lin, Binbin, Ye, Jieping |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Enhancing Spatial Reasoning through Visual and Textual Thinking
di: Liang, Xun, et al.
Pubblicazione: (2025)
di: Liang, Xun, et al.
Pubblicazione: (2025)
SPAR: Support-Preserving Action Rectification
di: Zhao, Jiaxin, et al.
Pubblicazione: (2026)
di: Zhao, Jiaxin, et al.
Pubblicazione: (2026)
Enhancing Chain-of-Thought Reasoning with Critical Representation Fine-tuning
di: Huang, Chenxi, et al.
Pubblicazione: (2025)
di: Huang, Chenxi, et al.
Pubblicazione: (2025)
Plan-on-Graph: Self-Correcting Adaptive Planning of Large Language Model on Knowledge Graphs
di: Chen, Liyi, et al.
Pubblicazione: (2024)
di: Chen, Liyi, et al.
Pubblicazione: (2024)
Controlling Thinking Speed in Reasoning Models
di: Lin, Zhengkai, et al.
Pubblicazione: (2025)
di: Lin, Zhengkai, et al.
Pubblicazione: (2025)
Token-Efficient Prompt Injection Attack: Provoking Cessation in LLM Reasoning via Adaptive Token Compression
di: Cui, Yu, et al.
Pubblicazione: (2025)
di: Cui, Yu, et al.
Pubblicazione: (2025)
Enhancing Multiple Dimensions of Trustworthiness in LLMs via Sparse Activation Control
di: Xiao, Yuxin, et al.
Pubblicazione: (2024)
di: Xiao, Yuxin, et al.
Pubblicazione: (2024)
Process or Result? Manipulated Ending Tokens Can Mislead Reasoning LLMs to Ignore the Correct Reasoning Steps
di: Cui, Yu, et al.
Pubblicazione: (2025)
di: Cui, Yu, et al.
Pubblicazione: (2025)
Meta-Soft: Leveraging Composable Meta-Tokens for Context-Preserving KV Cache Compression
di: Luo, Wei, et al.
Pubblicazione: (2026)
di: Luo, Wei, et al.
Pubblicazione: (2026)
RL Squeezes, SFT Expands: A Comparative Study of Reasoning LLMs
di: Matsutani, Kohsei, et al.
Pubblicazione: (2025)
di: Matsutani, Kohsei, et al.
Pubblicazione: (2025)
MemoSight: Unifying Context Compression and Multi Token Prediction for Reasoning Acceleration
di: Liu, Xinyu, et al.
Pubblicazione: (2026)
di: Liu, Xinyu, et al.
Pubblicazione: (2026)
OneLatent: Single-Token Compression for Visual Latent Reasoning
di: Lv, Bo, et al.
Pubblicazione: (2026)
di: Lv, Bo, et al.
Pubblicazione: (2026)
Pair-In, Pair-Out: Latent Multi-Token Prediction for Efficient LLMs
di: Tan, Wenhui, et al.
Pubblicazione: (2026)
di: Tan, Wenhui, et al.
Pubblicazione: (2026)
TokenSkip: Controllable Chain-of-Thought Compression in LLMs
di: Xia, Heming, et al.
Pubblicazione: (2025)
di: Xia, Heming, et al.
Pubblicazione: (2025)
When Reasoning Meets Compression: Understanding the Effects of LLMs Compression on Large Reasoning Models
di: Zhang, Nan, et al.
Pubblicazione: (2025)
di: Zhang, Nan, et al.
Pubblicazione: (2025)
Chain Of Thought Compression: A Theoretical Analysis
di: Li, Juncai, et al.
Pubblicazione: (2026)
di: Li, Juncai, et al.
Pubblicazione: (2026)
AdaTok: Adaptive Token Compression with Object-Aware Representations for Efficient Multimodal LLMs
di: Zhang, Xinliang, et al.
Pubblicazione: (2025)
di: Zhang, Xinliang, et al.
Pubblicazione: (2025)
MASPO: Unifying Gradient Utilization, Probability Mass, and Signal Reliability for Robust and Sample-Efficient LLM Reasoning
di: Fu, Xiaoliang, et al.
Pubblicazione: (2026)
di: Fu, Xiaoliang, et al.
Pubblicazione: (2026)
Through the Lens of Contrast: Self-Improving Visual Reasoning in VLMs
di: Pan, Zhiyu, et al.
Pubblicazione: (2026)
di: Pan, Zhiyu, et al.
Pubblicazione: (2026)
Say Anything but This: When Tokenizer Betrays Reasoning in LLMs
di: Ayoobi, Navid, et al.
Pubblicazione: (2026)
di: Ayoobi, Navid, et al.
Pubblicazione: (2026)
SpeContext: Enabling Efficient Long-context Reasoning with Speculative Context Sparsity in LLMs
di: Xu, Jiaming, et al.
Pubblicazione: (2025)
di: Xu, Jiaming, et al.
Pubblicazione: (2025)
Model Compression and Efficient Inference for Large Language Models: A Survey
di: Wang, Wenxiao, et al.
Pubblicazione: (2024)
di: Wang, Wenxiao, et al.
Pubblicazione: (2024)
Not All Heads Matter: A Head-Level KV Cache Compression Method with Integrated Retrieval and Reasoning
di: Fu, Yu, et al.
Pubblicazione: (2024)
di: Fu, Yu, et al.
Pubblicazione: (2024)
One-Token Verification for Reasoning Correctness Estimation
di: Zhuang, Zhan, et al.
Pubblicazione: (2026)
di: Zhuang, Zhan, et al.
Pubblicazione: (2026)
A Survey of Deep Learning Methods in Protein Bioinformatics and its Impact on Protein Design
di: Dai, Weihang
Pubblicazione: (2025)
di: Dai, Weihang
Pubblicazione: (2025)
MARGE: Improving Math Reasoning for LLMs with Guided Exploration
di: Gao, Jingyue, et al.
Pubblicazione: (2025)
di: Gao, Jingyue, et al.
Pubblicazione: (2025)
Don't Take Things Out of Context: Attention Intervention for Enhancing Chain-of-Thought Reasoning in Large Language Models
di: Yan, Shaotian, et al.
Pubblicazione: (2025)
di: Yan, Shaotian, et al.
Pubblicazione: (2025)
CodeAgents: A Token-Efficient Framework for Codified Multi-Agent Reasoning in LLMs
di: Yang, Bruce, et al.
Pubblicazione: (2025)
di: Yang, Bruce, et al.
Pubblicazione: (2025)
Concise and Organized Perception Facilitates Reasoning in Large Language Models
di: Liu, Junjie, et al.
Pubblicazione: (2023)
di: Liu, Junjie, et al.
Pubblicazione: (2023)
Does Compression Preserve Uncertainty? A Unified Benchmark for Quantized and Sparse LLMs via Conformal Prediction
di: Tong, Yujia, et al.
Pubblicazione: (2026)
di: Tong, Yujia, et al.
Pubblicazione: (2026)
HybridToken-VLM: Hybrid Token Compression for Vision-Language Models
di: Zhang, Jusheng, et al.
Pubblicazione: (2025)
di: Zhang, Jusheng, et al.
Pubblicazione: (2025)
SmartThinker: Learning to Compress and Preserve Reasoning by Step-Level Length Control
di: He, Xingyang, et al.
Pubblicazione: (2025)
di: He, Xingyang, et al.
Pubblicazione: (2025)
From Tokens to Thoughts: How LLMs and Humans Trade Compression for Meaning
di: Shani, Chen, et al.
Pubblicazione: (2025)
di: Shani, Chen, et al.
Pubblicazione: (2025)
Prompting Multi-Modal Tokens to Enhance End-to-End Autonomous Driving Imitation Learning with LLMs
di: Duan, Yiqun, et al.
Pubblicazione: (2024)
di: Duan, Yiqun, et al.
Pubblicazione: (2024)
Do LLMs Encode Functional Importance of Reasoning Tokens?
di: Singh, Janvijay, et al.
Pubblicazione: (2026)
di: Singh, Janvijay, et al.
Pubblicazione: (2026)
From Skills to Talent: Organising Heterogeneous Agents as a Real-World Company
di: Yu, Zhengxu, et al.
Pubblicazione: (2026)
di: Yu, Zhengxu, et al.
Pubblicazione: (2026)
Tokenization Constraints in LLMs: A Study of Symbolic and Arithmetic Reasoning Limits
di: Zhang, Xiang, et al.
Pubblicazione: (2025)
di: Zhang, Xiang, et al.
Pubblicazione: (2025)
Reasoning Compression with Mixed-Policy Distillation
di: Yang, Han, et al.
Pubblicazione: (2026)
di: Yang, Han, et al.
Pubblicazione: (2026)
Accelerating Constrained Decoding with Token Space Compression
di: Sullivan, Michael, et al.
Pubblicazione: (2026)
di: Sullivan, Michael, et al.
Pubblicazione: (2026)
Thinking with Reasoning Skills: Fewer Tokens, More Accuracy
di: Zhao, Guangxiang, et al.
Pubblicazione: (2026)
di: Zhao, Guangxiang, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Enhancing Spatial Reasoning through Visual and Textual Thinking
di: Liang, Xun, et al.
Pubblicazione: (2025) -
SPAR: Support-Preserving Action Rectification
di: Zhao, Jiaxin, et al.
Pubblicazione: (2026) -
Enhancing Chain-of-Thought Reasoning with Critical Representation Fine-tuning
di: Huang, Chenxi, et al.
Pubblicazione: (2025) -
Plan-on-Graph: Self-Correcting Adaptive Planning of Large Language Model on Knowledge Graphs
di: Chen, Liyi, et al.
Pubblicazione: (2024) -
Controlling Thinking Speed in Reasoning Models
di: Lin, Zhengkai, et al.
Pubblicazione: (2025)