ExpThink: Experience-Guided Reinforcement Learning for Adaptive Chain-of-Thought Compression
Fuente:
arXiv
Guardado en:
| Autores principales: | Bian, Tingcheng, Zhang, Yuzhe, Jin, Jing, Luo, Jinchang, Cheng, MingQuan, Wang, Haiwei, Jiang, Wenyuan, Wang, Miaohui |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
TRiMS: Real-Time Tracking of Minimal Sufficient Length for Efficient Reasoning via RL
por: Bian, Tingcheng, et al.
Publicado: (2026)
por: Bian, Tingcheng, et al.
Publicado: (2026)
GlobalRAG: Enhancing Global Reasoning in Multi-hop Question Answering via Reinforcement Learning
por: Luo, Jinchang, et al.
Publicado: (2025)
por: Luo, Jinchang, et al.
Publicado: (2025)
ThinkDrive: Chain-of-Thought Guided Progressive Reinforcement Learning Fine-Tuning for Autonomous Driving
por: Zhao, Chang, et al.
Publicado: (2026)
por: Zhao, Chang, et al.
Publicado: (2026)
ExpLLM: Towards Chain of Thought for Facial Expression Recognition
por: Lan, Xing, et al.
Publicado: (2024)
por: Lan, Xing, et al.
Publicado: (2024)
Making Slow Thinking Faster: Compressing LLM Chain-of-Thought via Step Entropy
por: Li, Zeju, et al.
Publicado: (2025)
por: Li, Zeju, et al.
Publicado: (2025)
Unified Multimodal Chain-of-Thought Reward Model through Reinforcement Fine-Tuning
por: Wang, Yibin, et al.
Publicado: (2025)
por: Wang, Yibin, et al.
Publicado: (2025)
ExpSeek: Self-Triggered Experience Seeking for Web Agents
por: Zhang, Wenyuan, et al.
Publicado: (2026)
por: Zhang, Wenyuan, et al.
Publicado: (2026)
Think Consistently, Reason Efficiently: Energy-Based Calibration for Implicit Chain-of-Thought
por: Chen, Zhikang, et al.
Publicado: (2025)
por: Chen, Zhikang, et al.
Publicado: (2025)
Think When You Need: Self-Adaptive Chain-of-Thought Learning
por: Yang, Junjie, et al.
Publicado: (2025)
por: Yang, Junjie, et al.
Publicado: (2025)
R1-Compress: Long Chain-of-Thought Compression via Chunk Compression and Search
por: Wang, Yibo, et al.
Publicado: (2025)
por: Wang, Yibo, et al.
Publicado: (2025)
Selective Latent Thinking: Adaptive Compression of LLM Reasoning Chains
por: Xie, Hui, et al.
Publicado: (2026)
por: Xie, Hui, et al.
Publicado: (2026)
ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning
por: Gu, Jiawei, et al.
Publicado: (2025)
por: Gu, Jiawei, et al.
Publicado: (2025)
ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning
por: Hou, Bairu, et al.
Publicado: (2025)
por: Hou, Bairu, et al.
Publicado: (2025)
Thinking Traps in Long Chain-of-Thought: A Measurable Study and Trap-Aware Adaptive Restart
por: Chen, Kang, et al.
Publicado: (2026)
por: Chen, Kang, et al.
Publicado: (2026)
Self-Compression of Chain-of-Thought via Multi-Agent Reinforcement Learning
por: Chen, Yiqun, et al.
Publicado: (2026)
por: Chen, Yiqun, et al.
Publicado: (2026)
Reinforcement Learning for Chain of Thought Compression with One-Domain-to-All Generalization
por: Li, Hanyu, et al.
Publicado: (2025)
por: Li, Hanyu, et al.
Publicado: (2025)
Upfront Chain-of-Thought: A Cooperative Framework for Chain-of-Thought Compression
por: Li, Chengzhengxu, et al.
Publicado: (2025)
por: Li, Chengzhengxu, et al.
Publicado: (2025)
ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and Editing
por: Liu, Huadai, et al.
Publicado: (2025)
por: Liu, Huadai, et al.
Publicado: (2025)
Value-Guided Search for Efficient Chain-of-Thought Reasoning
por: Wang, Kaiwen, et al.
Publicado: (2025)
por: Wang, Kaiwen, et al.
Publicado: (2025)
Compressed Chain of Thought: Efficient Reasoning Through Dense Representations
por: Cheng, Jeffrey, et al.
Publicado: (2024)
por: Cheng, Jeffrey, et al.
Publicado: (2024)
Strategic Chain-of-Thought: Guiding Accurate Reasoning in LLMs through Strategy Elicitation
por: Wang, Yu, et al.
Publicado: (2024)
por: Wang, Yu, et al.
Publicado: (2024)
CoT-Valve: Length-Compressible Chain-of-Thought Tuning
por: Ma, Xinyin, et al.
Publicado: (2025)
por: Ma, Xinyin, et al.
Publicado: (2025)
EntroCoT: Enhancing Chain-of-Thought via Adaptive Entropy-Guided Segmentation
por: Li, Zihang, et al.
Publicado: (2026)
por: Li, Zihang, et al.
Publicado: (2026)
Dynamic Chain-of-Thought: Towards Adaptive Deep Reasoning
por: Wang, Libo
Publicado: (2025)
por: Wang, Libo
Publicado: (2025)
TokenSkip: Controllable Chain-of-Thought Compression in LLMs
por: Xia, Heming, et al.
Publicado: (2025)
por: Xia, Heming, et al.
Publicado: (2025)
Feature Extraction and Steering for Enhanced Chain-of-Thought Reasoning in Language Models
por: Li, Zihao, et al.
Publicado: (2025)
por: Li, Zihao, et al.
Publicado: (2025)
Think Silently, Think Fast: Dynamic Latent Compression of LLM Reasoning Chains
por: Tan, Wenhui, et al.
Publicado: (2025)
por: Tan, Wenhui, et al.
Publicado: (2025)
Deep Thinking by Markov Chain of Continuous Thoughts
por: Liu, Jiayu, et al.
Publicado: (2025)
por: Liu, Jiayu, et al.
Publicado: (2025)
Activation Steering for Chain-of-Thought Compression
por: Azizi, Seyedarmin, et al.
Publicado: (2025)
por: Azizi, Seyedarmin, et al.
Publicado: (2025)
Stop When Enough: Adaptive Early-Stopping for Chain-of-Thought Reasoning
por: Sun, Renliang, et al.
Publicado: (2025)
por: Sun, Renliang, et al.
Publicado: (2025)
How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding
por: Chen, Xi, et al.
Publicado: (2025)
por: Chen, Xi, et al.
Publicado: (2025)
GRACE: Discriminator-Guided Chain-of-Thought Reasoning
por: Khalifa, Muhammad, et al.
Publicado: (2023)
por: Khalifa, Muhammad, et al.
Publicado: (2023)
Shorter, but Still Trustworthy? An Empirical Study of Chain-of-Thought Compression
por: Zeng, Lingjie, et al.
Publicado: (2026)
por: Zeng, Lingjie, et al.
Publicado: (2026)
AdaCoT: Pareto-Optimal Adaptive Chain-of-Thought Triggering via Reinforcement Learning
por: Lou, Chenwei, et al.
Publicado: (2025)
por: Lou, Chenwei, et al.
Publicado: (2025)
RGBX-R1: Visual Modality Chain-of-Thought Guided Reinforcement Learning for Multimodal Grounding
por: Wu, Jiahe, et al.
Publicado: (2026)
por: Wu, Jiahe, et al.
Publicado: (2026)
Reasoning Efficiently Through Adaptive Chain-of-Thought Compression: A Self-Optimizing Framework
por: Huang, Kerui, et al.
Publicado: (2025)
por: Huang, Kerui, et al.
Publicado: (2025)
FreeFly-Thinking : Aligning Chain-of-Thought Reasoning with Continuous UAV Navigation
por: Zhou, Jiaxu, et al.
Publicado: (2026)
por: Zhou, Jiaxu, et al.
Publicado: (2026)
Chain of Thought Still Thinks Fast: APriCoT Helps with Thinking Slow
por: Moore, Kyle, et al.
Publicado: (2024)
por: Moore, Kyle, et al.
Publicado: (2024)
Relation-R1: Progressively Cognitive Chain-of-Thought Guided Reinforcement Learning for Unified Relation Comprehension
por: Li, Lin, et al.
Publicado: (2025)
por: Li, Lin, et al.
Publicado: (2025)
Reinforcing Structured Chain-of-Thought for Video Understanding
por: Wang, Peiyao, et al.
Publicado: (2026)
por: Wang, Peiyao, et al.
Publicado: (2026)
Ejemplares similares
-
TRiMS: Real-Time Tracking of Minimal Sufficient Length for Efficient Reasoning via RL
por: Bian, Tingcheng, et al.
Publicado: (2026) -
GlobalRAG: Enhancing Global Reasoning in Multi-hop Question Answering via Reinforcement Learning
por: Luo, Jinchang, et al.
Publicado: (2025) -
ThinkDrive: Chain-of-Thought Guided Progressive Reinforcement Learning Fine-Tuning for Autonomous Driving
por: Zhao, Chang, et al.
Publicado: (2026) -
ExpLLM: Towards Chain of Thought for Facial Expression Recognition
por: Lan, Xing, et al.
Publicado: (2024) -
Making Slow Thinking Faster: Compressing LLM Chain-of-Thought via Step Entropy
por: Li, Zeju, et al.
Publicado: (2025)