CoVerRL: Breaking the Consensus Trap in Label-Free Reasoning via Generator-Verifier Co-Evolution
Fuente:
arXiv
Salvato in:
| Autori principali: | Pan, Teng, Yan, Yuchen, Wang, Zixuan, Zhang, Ruiqing, Hou, Guiyang, Zhang, Wenqi, Lu, Weiming, Xiao, Jun, Shen, Yongliang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Cooper: Co-Optimizing Policy and Reward Models in Reinforcement Learning for Large Language Models
di: Hong, Haitao, et al.
Pubblicazione: (2025)
di: Hong, Haitao, et al.
Pubblicazione: (2025)
TimeToM: Temporal Space is the Key to Unlocking the Door of Large Language Models' Theory-of-Mind
di: Hou, Guiyang, et al.
Pubblicazione: (2024)
di: Hou, Guiyang, et al.
Pubblicazione: (2024)
EgoSocialArena: Benchmarking the Social Intelligence of Large Language Models from a First-person Perspective
di: Hou, Guiyang, et al.
Pubblicazione: (2024)
di: Hou, Guiyang, et al.
Pubblicazione: (2024)
Active Confusion Expression in Large Language Models: Leveraging World Models toward Better Social Reasoning
di: Du, Jialu, et al.
Pubblicazione: (2025)
di: Du, Jialu, et al.
Pubblicazione: (2025)
Data-Copilot: Bridging Billions of Data and Humans with Autonomous Workflow
di: Zhang, Wenqi, et al.
Pubblicazione: (2023)
di: Zhang, Wenqi, et al.
Pubblicazione: (2023)
Milestone-Guided Policy Learning for Long-Horizon Language Agents
di: Wang, Zixuan, et al.
Pubblicazione: (2026)
di: Wang, Zixuan, et al.
Pubblicazione: (2026)
Let LRMs Break Free from Overthinking via Self-Braking Tuning
di: Zhao, Haoran, et al.
Pubblicazione: (2025)
di: Zhao, Haoran, et al.
Pubblicazione: (2025)
Mind the Gap: Bridging Thought Leap for Improved Chain-of-Thought Tuning
di: Xu, Haolei, et al.
Pubblicazione: (2025)
di: Xu, Haolei, et al.
Pubblicazione: (2025)
TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence
di: Hou, Guiyang, et al.
Pubblicazione: (2025)
di: Hou, Guiyang, et al.
Pubblicazione: (2025)
ViewSpatial-Bench: Evaluating Multi-perspective Spatial Localization in Vision-Language Models
di: Li, Dingming, et al.
Pubblicazione: (2025)
di: Li, Dingming, et al.
Pubblicazione: (2025)
SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
di: Li, Hongxing, et al.
Pubblicazione: (2025)
di: Li, Hongxing, et al.
Pubblicazione: (2025)
STaR-SQL: Self-Taught Reasoner for Text-to-SQL
di: He, Mingqian, et al.
Pubblicazione: (2025)
di: He, Mingqian, et al.
Pubblicazione: (2025)
Multimodal Self-Instruct: Synthetic Abstract Image and Visual Reasoning Instruction Using Language Model
di: Zhang, Wenqi, et al.
Pubblicazione: (2024)
di: Zhang, Wenqi, et al.
Pubblicazione: (2024)
Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive Tasks
di: Zhang, Wenqi, et al.
Pubblicazione: (2025)
di: Zhang, Wenqi, et al.
Pubblicazione: (2025)
Think Twice, Click Once: Enhancing GUI Grounding via Fast and Slow Systems
di: Tang, Fei, et al.
Pubblicazione: (2025)
di: Tang, Fei, et al.
Pubblicazione: (2025)
Agent-Pro: Learning to Evolve via Policy-Level Reflection and Optimization
di: Zhang, Wenqi, et al.
Pubblicazione: (2024)
di: Zhang, Wenqi, et al.
Pubblicazione: (2024)
SVGenius: Benchmarking LLMs in SVG Understanding, Editing and Generation
di: Chen, Siqi, et al.
Pubblicazione: (2025)
di: Chen, Siqi, et al.
Pubblicazione: (2025)
Advancing Process Verification for Large Language Models via Tree-Based Preference Learning
di: He, Mingqian, et al.
Pubblicazione: (2024)
di: He, Mingqian, et al.
Pubblicazione: (2024)
Self-Verifying Reflection Helps Transformers with CoT Reasoning
di: Yu, Zhongwei, et al.
Pubblicazione: (2025)
di: Yu, Zhongwei, et al.
Pubblicazione: (2025)
Pause or Fabricate? Training Language Models for Grounded Reasoning
di: Qiu, Yiwen, et al.
Pubblicazione: (2026)
di: Qiu, Yiwen, et al.
Pubblicazione: (2026)
A Survey on (M)LLM-Based GUI Agents
di: Tang, Fei, et al.
Pubblicazione: (2025)
di: Tang, Fei, et al.
Pubblicazione: (2025)
AskToAct: Enhancing LLMs Tool Use via Self-Correcting Clarification
di: Zhang, Xuan, et al.
Pubblicazione: (2025)
di: Zhang, Xuan, et al.
Pubblicazione: (2025)
GroundAct: Can LLM Agents Ground Actions in Environmental States?
di: Wang, Zixuan, et al.
Pubblicazione: (2025)
di: Wang, Zixuan, et al.
Pubblicazione: (2025)
InftyThink: Breaking the Length Limits of Long-Context Reasoning in Large Language Models
di: Yan, Yuchen, et al.
Pubblicazione: (2025)
di: Yan, Yuchen, et al.
Pubblicazione: (2025)
EasySteer: A Unified Framework for High-Performance and Extensible LLM Steering
di: Xu, Haolei, et al.
Pubblicazione: (2025)
di: Xu, Haolei, et al.
Pubblicazione: (2025)
Self-Contrast: Better Reflection Through Inconsistent Solving Perspectives
di: Zhang, Wenqi, et al.
Pubblicazione: (2024)
di: Zhang, Wenqi, et al.
Pubblicazione: (2024)
RL Tango: Reinforcing Generator and Verifier Together for Language Reasoning
di: Zha, Kaiwen, et al.
Pubblicazione: (2025)
di: Zha, Kaiwen, et al.
Pubblicazione: (2025)
DB-Explore: Automated Database Exploration and Instruction Synthesis for Text-to-SQL
di: Ma, Haoyuan, et al.
Pubblicazione: (2025)
di: Ma, Haoyuan, et al.
Pubblicazione: (2025)
Sci-CoE: Co-evolving Scientific Reasoning LLMs via Geometric Consensus with Sparse Supervision
di: He, Xiaohan, et al.
Pubblicazione: (2026)
di: He, Xiaohan, et al.
Pubblicazione: (2026)
Insert or Attach: Taxonomy Completion via Box Embedding
di: Xue, Wei, et al.
Pubblicazione: (2023)
di: Xue, Wei, et al.
Pubblicazione: (2023)
Hierarchical Budget Policy Optimization for Adaptive Reasoning
di: Lyu, Shangke, et al.
Pubblicazione: (2025)
di: Lyu, Shangke, et al.
Pubblicazione: (2025)
CoT Vectors: Transferring and Probing the Reasoning Mechanisms of LLMs
di: Li, Li, et al.
Pubblicazione: (2025)
di: Li, Li, et al.
Pubblicazione: (2025)
Nanopore Trap for Label‐Free Fingerprinting of Surface‐modified Single Nanoparticles
di: Nianduo Cai, et al.
Pubblicazione: (2025)
di: Nianduo Cai, et al.
Pubblicazione: (2025)
LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization
di: Wu, Xingyu, et al.
Pubblicazione: (2025)
di: Wu, Xingyu, et al.
Pubblicazione: (2025)
CoTZero: Annotation-Free Human-Like Vision Reasoning via Hierarchical Synthetic CoT
di: Du, Chengyi, et al.
Pubblicazione: (2026)
di: Du, Chengyi, et al.
Pubblicazione: (2026)
VERIFY-RL: Verifiable Recursive Decomposition for Reinforcement Learning in Mathematical Reasoning
di: Qasim, Kaleem Ullah, et al.
Pubblicazione: (2026)
di: Qasim, Kaleem Ullah, et al.
Pubblicazione: (2026)
The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs
di: Chen, Jierun, et al.
Pubblicazione: (2025)
di: Chen, Jierun, et al.
Pubblicazione: (2025)
Know What You Know: Metacognitive Entropy Calibration for Verifiable RL Reasoning
di: Zhao, Qiannian, et al.
Pubblicazione: (2026)
di: Zhao, Qiannian, et al.
Pubblicazione: (2026)
EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs
di: Dai, Yang, et al.
Pubblicazione: (2026)
di: Dai, Yang, et al.
Pubblicazione: (2026)
You Need Reasoning to Learn Reasoning: The Limitations of Label-Free RL in Weak Base Models
di: Roy, Shuvendu, et al.
Pubblicazione: (2025)
di: Roy, Shuvendu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Cooper: Co-Optimizing Policy and Reward Models in Reinforcement Learning for Large Language Models
di: Hong, Haitao, et al.
Pubblicazione: (2025) -
TimeToM: Temporal Space is the Key to Unlocking the Door of Large Language Models' Theory-of-Mind
di: Hou, Guiyang, et al.
Pubblicazione: (2024) -
EgoSocialArena: Benchmarking the Social Intelligence of Large Language Models from a First-person Perspective
di: Hou, Guiyang, et al.
Pubblicazione: (2024) -
Active Confusion Expression in Large Language Models: Leveraging World Models toward Better Social Reasoning
di: Du, Jialu, et al.
Pubblicazione: (2025) -
Data-Copilot: Bridging Billions of Data and Humans with Autonomous Workflow
di: Zhang, Wenqi, et al.
Pubblicazione: (2023)