CopT: Contrastive On-Policy Thinking with Continuous Spaces for General and Agentic Reasoning
Fuente:
arXiv
Saved in:
| Main Authors: | Shi, Dachuan, Zhu, Hanlin, Yuan, Xiangchi, Zhao, Wanjia, Xia, Kejing, Xiao, Wen, Lee, Wenke |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SwiReasoning: Switch-Thinking in Latent and Explicit for Pareto-Superior Reasoning LLMs
by: Shi, Dachuan, et al.
Published: (2025)
by: Shi, Dachuan, et al.
Published: (2025)
MetaState: Persistent Working Memory Enhances Reasoning in Discrete Diffusion Language Models
by: Xia, Kejing, et al.
Published: (2026)
by: Xia, Kejing, et al.
Published: (2026)
Superficial Self-Improved Reasoners Benefit from Model Merging
by: Yuan, Xiangchi, et al.
Published: (2025)
by: Yuan, Xiangchi, et al.
Published: (2025)
Mitigating Forgetting Between Supervised and Reinforcement Learning Yields Stronger Reasoners
by: Yuan, Xiangchi, et al.
Published: (2025)
by: Yuan, Xiangchi, et al.
Published: (2025)
Behavior Knowledge Merge in Reinforced Agentic Models
by: Yuan, Xiangchi, et al.
Published: (2026)
by: Yuan, Xiangchi, et al.
Published: (2026)
Soft Thinking: Unlocking the Reasoning Potential of LLMs in Continuous Concept Space
by: Zhang, Zhen, et al.
Published: (2025)
by: Zhang, Zhen, et al.
Published: (2025)
When to Continue Thinking: Adaptive Thinking Mode Switching for Efficient Reasoning
by: Zhang, Xiaoyun, et al.
Published: (2025)
by: Zhang, Xiaoyun, et al.
Published: (2025)
LongMamba: Enhancing Mamba's Long Context Capabilities via Training-Free Receptive Field Enlargement
by: Ye, Zhifan, et al.
Published: (2025)
by: Ye, Zhifan, et al.
Published: (2025)
LaCache: Ladder-Shaped KV Caching for Efficient Long-Context Modeling of Large Language Models
by: Shi, Dachuan, et al.
Published: (2025)
by: Shi, Dachuan, et al.
Published: (2025)
Agent Explorative Policy Optimization for Multimodal Agentic Reasoning
by: Kang, Minki, et al.
Published: (2026)
by: Kang, Minki, et al.
Published: (2026)
Thinking by Subtraction: Confidence-Driven Contrastive Decoding for LLM Reasoning
by: Tang, Lexiang, et al.
Published: (2026)
by: Tang, Lexiang, et al.
Published: (2026)
Vision-and-Language Navigation Generative Pretrained Transformer
by: Hanlin, Wen
Published: (2024)
by: Hanlin, Wen
Published: (2024)
Search More, Think Less: Rethinking Long-Horizon Agentic Search for Efficiency and Generalization
by: Chen, Qianben, et al.
Published: (2026)
by: Chen, Qianben, et al.
Published: (2026)
Could Thinking Multilingually Empower LLM Reasoning?
by: Gao, Changjiang, et al.
Published: (2025)
by: Gao, Changjiang, et al.
Published: (2025)
To Retrieve or To Think? An Agentic Approach for Context Evolution
by: Chen, Rubing, et al.
Published: (2026)
by: Chen, Rubing, et al.
Published: (2026)
Growing Through Experience: Scaling Episodic Grounding in Language Models
by: Zhang, Chunhui, et al.
Published: (2025)
by: Zhang, Chunhui, et al.
Published: (2025)
DSPO: Stable and Efficient Policy Optimization for Agentic Search and Reasoning
by: Gu, Chenyang, et al.
Published: (2025)
by: Gu, Chenyang, et al.
Published: (2025)
Think-While-Generating: On-the-Fly Reasoning for Personalized Long-Form Generation
by: Wang, Chengbing, et al.
Published: (2025)
by: Wang, Chengbing, et al.
Published: (2025)
Efficient Reasoning with Hidden Thinking
by: Shen, Xuan, et al.
Published: (2025)
by: Shen, Xuan, et al.
Published: (2025)
A Comment On "The Illusion of Thinking": Reframing the Reasoning Cliff as an Agentic Gap
by: Khan, Sheraz, et al.
Published: (2025)
by: Khan, Sheraz, et al.
Published: (2025)
Thinking Fast, Thinking Wrong: Intuitiveness Modulates LLM Counterfactual Reasoning in Policy Evaluation
by: He, Yanjie
Published: (2026)
by: He, Yanjie
Published: (2026)
VideoExplorer: Think With Videos For Agentic Long-Video Understanding
by: Yuan, Huaying, et al.
Published: (2025)
by: Yuan, Huaying, et al.
Published: (2025)
When to Think, When to Speak: Learning Disclosure Policies for LLM Reasoning
by: Wei, Jiaqi, et al.
Published: (2026)
by: Wei, Jiaqi, et al.
Published: (2026)
Agentic Reasoning: A Streamlined Framework for Enhancing LLM Reasoning with Agentic Tools
by: Wu, Junde, et al.
Published: (2025)
by: Wu, Junde, et al.
Published: (2025)
AgenticMath: Enhancing LLM Reasoning via Agentic-based Math Data Generation
by: Liu, Xianyang, et al.
Published: (2025)
by: Liu, Xianyang, et al.
Published: (2025)
CARE: Privacy-Compliant Agentic Reasoning with Evidence Discordance
by: Liu, Haochen, et al.
Published: (2026)
by: Liu, Haochen, et al.
Published: (2026)
Scaling Reasoning Tokens via RL and Parallel Thinking: Evidence From Competitive Programming
by: Zhang, Qianfan, et al.
Published: (2026)
by: Zhang, Qianfan, et al.
Published: (2026)
Agentic Reinforced Policy Optimization
by: Dong, Guanting, et al.
Published: (2025)
by: Dong, Guanting, et al.
Published: (2025)
Thinking with Tables: Enhancing Multi-Modal Tabular Understanding via Neuro-Symbolic Reasoning
by: Yu, Kun-Yang, et al.
Published: (2026)
by: Yu, Kun-Yang, et al.
Published: (2026)
ThinkRouter: Efficient Reasoning via Routing Thinking between Latent and Discrete Spaces
by: Xu, Xin, et al.
Published: (2026)
by: Xu, Xin, et al.
Published: (2026)
Think Twice: Enhancing LLM Reasoning by Scaling Multi-round Test-time Thinking
by: Tian, Xiaoyu, et al.
Published: (2025)
by: Tian, Xiaoyu, et al.
Published: (2025)
Modality-Aware Neuron Pruning for Unlearning in Multimodal Large Language Models
by: Liu, Zheyuan, et al.
Published: (2025)
by: Liu, Zheyuan, et al.
Published: (2025)
Agentic Entropy-Balanced Policy Optimization
by: Dong, Guanting, et al.
Published: (2025)
by: Dong, Guanting, et al.
Published: (2025)
Rewarding How Models Think Pedagogically: Integrating Pedagogical Reasoning and Thinking Rewards for LLMs in Education
by: Lee, Unggi, et al.
Published: (2026)
by: Lee, Unggi, et al.
Published: (2026)
Thinking-Free Policy Initialization Makes Distilled Reasoning Models More Effective and Efficient Reasoners
by: Xu, Xin, et al.
Published: (2025)
by: Xu, Xin, et al.
Published: (2025)
ExpLang: Improved Exploration and Exploitation in LLM Reasoning with On-Policy Thinking Language Selection
by: Gao, Changjiang, et al.
Published: (2026)
by: Gao, Changjiang, et al.
Published: (2026)
Reasoning Beyond Language: A Comprehensive Survey on Latent Chain-of-Thought Reasoning
by: Chen, Xinghao, et al.
Published: (2025)
by: Chen, Xinghao, et al.
Published: (2025)
Thinking-while-speaking: A Controlled, Interleaved Reasoning Method for Real-Time Speech Generation
by: Du, Xuan, et al.
Published: (2026)
by: Du, Xuan, et al.
Published: (2026)
Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning
by: Shrivastava, Vaishnavi, et al.
Published: (2025)
by: Shrivastava, Vaishnavi, et al.
Published: (2025)
Harmony in Diversity: Multi-domain Contrastive Policy Optimization for Large Reasoning Models
by: Yu, Zongji, et al.
Published: (2026)
by: Yu, Zongji, et al.
Published: (2026)
Similar Items
-
SwiReasoning: Switch-Thinking in Latent and Explicit for Pareto-Superior Reasoning LLMs
by: Shi, Dachuan, et al.
Published: (2025) -
MetaState: Persistent Working Memory Enhances Reasoning in Discrete Diffusion Language Models
by: Xia, Kejing, et al.
Published: (2026) -
Superficial Self-Improved Reasoners Benefit from Model Merging
by: Yuan, Xiangchi, et al.
Published: (2025) -
Mitigating Forgetting Between Supervised and Reinforcement Learning Yields Stronger Reasoners
by: Yuan, Xiangchi, et al.
Published: (2025) -
Behavior Knowledge Merge in Reinforced Agentic Models
by: Yuan, Xiangchi, et al.
Published: (2026)