Self-Compression of Chain-of-Thought via Multi-Agent Reinforcement Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Yiqun, Feng, Jinyuan, Yang, Wei, Zhong, Meizhi, Shi, Zhengliang, Li, Rui, Wei, Xiaochi, Gao, Yan, Wu, Yi, Hu, Yao, Pu, Zhiqiang, Mao, Jiaxin |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Focus on the Core: Empowering Diffusion Large Language Models by Self-Contrast
by: Feng, Jinyuan, et al.
Published: (2026)
by: Feng, Jinyuan, et al.
Published: (2026)
JADE: Bridging the Strategic-Operational Gap in Dynamic Agentic RAG
by: Chen, Yiqun, et al.
Published: (2026)
by: Chen, Yiqun, et al.
Published: (2026)
Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation
by: Yang, Zixuan, et al.
Published: (2026)
by: Yang, Zixuan, et al.
Published: (2026)
OASES: Outcome-Aligned Search-Evaluation Co-Training for Agentic Search
by: Zhang, Erhan, et al.
Published: (2026)
by: Zhang, Erhan, et al.
Published: (2026)
Knowledge-Graph Paths as Intermediate Supervision for Self-Evolving Search Agents
by: Wu, Huyu, et al.
Published: (2026)
by: Wu, Huyu, et al.
Published: (2026)
UnityMAS-O: A General RL Optimization Framework for LLM-Based Multi-Agent Systems
by: Chen, Yiqun, et al.
Published: (2026)
by: Chen, Yiqun, et al.
Published: (2026)
MA2RL: Masked Autoencoders for Generalizable Multi-Agent Reinforcement Learning
by: Feng, Jinyuan, et al.
Published: (2025)
by: Feng, Jinyuan, et al.
Published: (2025)
Efficient Multi-Task Reinforcement Learning via Task-Specific Action Correction
by: Feng, Jinyuan, et al.
Published: (2024)
by: Feng, Jinyuan, et al.
Published: (2024)
CoMoE: Contrastive Representation for Mixture-of-Experts in Parameter-Efficient Fine-tuning
by: Feng, Jinyuan, et al.
Published: (2025)
by: Feng, Jinyuan, et al.
Published: (2025)
CODI: Compressing Chain-of-Thought into Continuous Space via Self-Distillation
by: Shen, Zhenyi, et al.
Published: (2025)
by: Shen, Zhenyi, et al.
Published: (2025)
PTDE: Personalized Training with Distilled Execution for Multi-Agent Reinforcement Learning
by: Chen, Yiqun, et al.
Published: (2022)
by: Chen, Yiqun, et al.
Published: (2022)
Self-Harmonized Chain of Thought
by: Jin, Ziqi, et al.
Published: (2024)
by: Jin, Ziqi, et al.
Published: (2024)
ZigZagkv: Dynamic KV Cache Compression for Long-context Modeling based on Layer Uncertainty
by: Zhong, Meizhi, et al.
Published: (2024)
by: Zhong, Meizhi, et al.
Published: (2024)
Self-Clustering Hierarchical Multi-Agent Reinforcement Learning with Extensible Cooperation Graph
by: Fu, Qingxu, et al.
Published: (2024)
by: Fu, Qingxu, et al.
Published: (2024)
Reinforcement Learning for Chain of Thought Compression with One-Domain-to-All Generalization
by: Li, Hanyu, et al.
Published: (2025)
by: Li, Hanyu, et al.
Published: (2025)
Measuring Policy Distance for Multi-Agent Reinforcement Learning
by: Hu, Tianyi, et al.
Published: (2024)
by: Hu, Tianyi, et al.
Published: (2024)
Improving Retrieval-Augmented Generation through Multi-Agent Reinforcement Learning
by: Chen, Yiqun, et al.
Published: (2025)
by: Chen, Yiqun, et al.
Published: (2025)
R1-Compress: Long Chain-of-Thought Compression via Chunk Compression and Search
by: Wang, Yibo, et al.
Published: (2025)
by: Wang, Yibo, et al.
Published: (2025)
ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models
by: Zhong, Linqing, et al.
Published: (2026)
by: Zhong, Linqing, et al.
Published: (2026)
Causal Mean Field Multi-Agent Reinforcement Learning
by: Ma, Hao, et al.
Published: (2025)
by: Ma, Hao, et al.
Published: (2025)
MA4DIV: Multi-Agent Reinforcement Learning for Search Result Diversification
by: Chen, Yiqun, et al.
Published: (2024)
by: Chen, Yiqun, et al.
Published: (2024)
Reasoning Efficiently Through Adaptive Chain-of-Thought Compression: A Self-Optimizing Framework
by: Huang, Kerui, et al.
Published: (2025)
by: Huang, Kerui, et al.
Published: (2025)
Knowledge Editing through Chain-of-Thought
by: Wang, Changyue, et al.
Published: (2024)
by: Wang, Changyue, et al.
Published: (2024)
Upfront Chain-of-Thought: A Cooperative Framework for Chain-of-Thought Compression
by: Li, Chengzhengxu, et al.
Published: (2025)
by: Li, Chengzhengxu, et al.
Published: (2025)
Reinforcing Chain-of-Thought Reasoning with Self-Evolving Rubrics
by: Sheng, Leheng, et al.
Published: (2026)
by: Sheng, Leheng, et al.
Published: (2026)
GTR: Guided Thought Reinforcement Prevents Thought Collapse in RL-based VLM Agent Training
by: Wei, Tong, et al.
Published: (2025)
by: Wei, Tong, et al.
Published: (2025)
OMoE: Diversifying Mixture of Low-Rank Adaptation by Orthogonal Finetuning
by: Feng, Jinyuan, et al.
Published: (2025)
by: Feng, Jinyuan, et al.
Published: (2025)
Heterogeneity in Multi-Agent Reinforcement Learning
by: Hu, Tianyi, et al.
Published: (2025)
by: Hu, Tianyi, et al.
Published: (2025)
ExpThink: Experience-Guided Reinforcement Learning for Adaptive Chain-of-Thought Compression
by: Bian, Tingcheng, et al.
Published: (2026)
by: Bian, Tingcheng, et al.
Published: (2026)
Activation Steering for Chain-of-Thought Compression
by: Azizi, Seyedarmin, et al.
Published: (2025)
by: Azizi, Seyedarmin, et al.
Published: (2025)
Reinforcing Structured Chain-of-Thought for Video Understanding
by: Wang, Peiyao, et al.
Published: (2026)
by: Wang, Peiyao, et al.
Published: (2026)
Self-Training with Direct Preference Optimization Improves Chain-of-Thought Reasoning
by: Wang, Tianduo, et al.
Published: (2024)
by: Wang, Tianduo, et al.
Published: (2024)
Diffusion of Thoughts: Chain-of-Thought Reasoning in Diffusion Language Models
by: Ye, Jiacheng, et al.
Published: (2024)
by: Ye, Jiacheng, et al.
Published: (2024)
Curriculum Design for Trajectory-Constrained Agent: Compressing Chain-of-Thought Tokens in LLMs
by: Tzannetos, Georgios, et al.
Published: (2025)
by: Tzannetos, Georgios, et al.
Published: (2025)
RaCT: Ranking-aware Chain-of-Thought Optimization for LLMs
by: Liu, Haowei, et al.
Published: (2024)
by: Liu, Haowei, et al.
Published: (2024)
SearchSkill: Teaching LLMs to Use Search Tools with Evolving Skill Banks
by: Hu, Jinchao, et al.
Published: (2026)
by: Hu, Jinchao, et al.
Published: (2026)
Rethinking Chain-of-Thought Reasoning for Videos
by: Zhong, Yiwu, et al.
Published: (2025)
by: Zhong, Yiwu, et al.
Published: (2025)
Android in the Zoo: Chain-of-Action-Thought for GUI Agents
by: Zhang, Jiwen, et al.
Published: (2024)
by: Zhang, Jiwen, et al.
Published: (2024)
Chain of Preference Optimization: Improving Chain-of-Thought Reasoning in LLMs
by: Zhang, Xuan, et al.
Published: (2024)
by: Zhang, Xuan, et al.
Published: (2024)
Understanding the RoPE Extensions of Long-Context LLMs: An Attention Perspective
by: Zhong, Meizhi, et al.
Published: (2024)
by: Zhong, Meizhi, et al.
Published: (2024)
Similar Items
-
Focus on the Core: Empowering Diffusion Large Language Models by Self-Contrast
by: Feng, Jinyuan, et al.
Published: (2026) -
JADE: Bridging the Strategic-Operational Gap in Dynamic Agentic RAG
by: Chen, Yiqun, et al.
Published: (2026) -
Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation
by: Yang, Zixuan, et al.
Published: (2026) -
OASES: Outcome-Aligned Search-Evaluation Co-Training for Agentic Search
by: Zhang, Erhan, et al.
Published: (2026) -
Knowledge-Graph Paths as Intermediate Supervision for Self-Evolving Search Agents
by: Wu, Huyu, et al.
Published: (2026)