CLUE: Non-parametric Verification from Experience via Hidden-State Clustering
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liang, Zhenwen, Li, Ruosen, Zhou, Yujun, Song, Linfeng, Yu, Dian, Du, Xinya, Mi, Haitao, Yu, Dong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Evolving Language Models without Labels: Majority Drives Selection, Novelty Promotes Variation
par: Zhou, Yujun, et autres
Publié: (2025)
par: Zhou, Yujun, et autres
Publié: (2025)
Save the Good Prefix: Precise Error Penalization via Process-Supervised RL to Enhance LLM Reasoning
par: Liu, Haolin, et autres
Publié: (2026)
par: Liu, Haolin, et autres
Publié: (2026)
FG-PRM: Fine-grained Hallucination Detection and Mitigation in Language Model Mathematical Reasoning
par: Li, Ruosen, et autres
Publié: (2024)
par: Li, Ruosen, et autres
Publié: (2024)
PRD: Peer Rank and Discussion Improve Large Language Model based Evaluations
par: Li, Ruosen, et autres
Publié: (2023)
par: Li, Ruosen, et autres
Publié: (2023)
DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification
par: Liu, Rui, et autres
Publié: (2026)
par: Liu, Rui, et autres
Publié: (2026)
SIaM: Self-Improving Code-Assisted Mathematical Reasoning of Large Language Models
par: Yu, Dian, et autres
Publié: (2024)
par: Yu, Dian, et autres
Publié: (2024)
Stable and Efficient Single-Rollout RL for Multimodal Reasoning
par: Liu, Rui, et autres
Publié: (2025)
par: Liu, Rui, et autres
Publié: (2025)
Verified Critical Step Optimization for LLM Agents
par: Li, Mukai, et autres
Publié: (2026)
par: Li, Mukai, et autres
Publié: (2026)
Every Question Has Its Own Value: Reinforcement Learning with Explicit Human Values
par: Yu, Dian, et autres
Publié: (2025)
par: Yu, Dian, et autres
Publié: (2025)
Toward Self-Improvement of LLMs via Imagination, Searching, and Criticizing
par: Tian, Ye, et autres
Publié: (2024)
par: Tian, Ye, et autres
Publié: (2024)
EconProver: Towards More Economical Test-Time Scaling for Automated Theorem Proving
par: Li, Mukai, et autres
Publié: (2025)
par: Li, Mukai, et autres
Publié: (2025)
Dual-Uncertainty Guided Policy Learning for Multimodal Reasoning
par: Liu, Rui, et autres
Publié: (2025)
par: Liu, Rui, et autres
Publié: (2025)
IQA-EVAL: Automatic Evaluation of Human-Model Interactive Question Answering
par: Li, Ruosen, et autres
Publié: (2024)
par: Li, Ruosen, et autres
Publié: (2024)
Group Distributionally Robust Optimization-Driven Reinforcement Learning for LLM Reasoning
par: Panaganti, Kishan, et autres
Publié: (2026)
par: Panaganti, Kishan, et autres
Publié: (2026)
Teaching LLMs to Refine with Tools
par: Yu, Dian, et autres
Publié: (2024)
par: Yu, Dian, et autres
Publié: (2024)
CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models
par: Dai, Runpeng, et autres
Publié: (2025)
par: Dai, Runpeng, et autres
Publié: (2025)
Towards Self-Improvement of LLMs via MCTS: Leveraging Stepwise Knowledge with Curriculum Preference Learning
par: Wang, Xiyao, et autres
Publié: (2024)
par: Wang, Xiyao, et autres
Publié: (2024)
Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains
par: Su, Yi, et autres
Publié: (2025)
par: Su, Yi, et autres
Publié: (2025)
Improving LLM General Preference Alignment via Optimistic Online Mirror Descent
par: Zhang, Yuheng, et autres
Publié: (2025)
par: Zhang, Yuheng, et autres
Publié: (2025)
Locas: Your Models are Principled Initializers of Locally-Supported Parametric Memories
par: Lu, Sidi, et autres
Publié: (2026)
par: Lu, Sidi, et autres
Publié: (2026)
AALC: Large Language Model Efficient Reasoning via Adaptive Accuracy-Length Control
par: Li, Ruosen, et autres
Publié: (2025)
par: Li, Ruosen, et autres
Publié: (2025)
Inconsistent dialogue responses and how to recover from them
par: Zhang, Mian, et autres
Publié: (2024)
par: Zhang, Mian, et autres
Publié: (2024)
LiteSearch: Efficacious Tree Search for LLM
par: Wang, Ante, et autres
Publié: (2024)
par: Wang, Ante, et autres
Publié: (2024)
Don't Get Lost in the Trees: Streamlining LLM Reasoning by Overcoming Tree Search Exploration Pitfalls
par: Wang, Ante, et autres
Publié: (2025)
par: Wang, Ante, et autres
Publié: (2025)
Guided Self-Evolving LLMs with Minimal Human Supervision
par: Yu, Wenhao, et autres
Publié: (2025)
par: Yu, Wenhao, et autres
Publié: (2025)
A Knowledge Plug-and-Play Test Bed for Open-domain Dialogue Generation
par: Li, Xiangci, et autres
Publié: (2024)
par: Li, Xiangci, et autres
Publié: (2024)
Towards Solving More Challenging IMO Problems via Decoupled Reasoning and Proving
par: Liang, Zhenwen, et autres
Publié: (2025)
par: Liang, Zhenwen, et autres
Publié: (2025)
Iterative Nash Policy Optimization: Aligning LLMs with General Preferences via No-Regret Learning
par: Zhang, Yuheng, et autres
Publié: (2024)
par: Zhang, Yuheng, et autres
Publié: (2024)
DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning
par: He, Zhiwei, et autres
Publié: (2025)
par: He, Zhiwei, et autres
Publié: (2025)
Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data
par: Liang, Zhenwen, et autres
Publié: (2026)
par: Liang, Zhenwen, et autres
Publié: (2026)
Entropy Guided Extrapolative Decoding to Improve Factuality in Large Language Models
par: Das, Souvik, et autres
Publié: (2024)
par: Das, Souvik, et autres
Publié: (2024)
Collaborative decoding of critical tokens for boosting factuality of large language models
par: Jin, Lifeng, et autres
Publié: (2024)
par: Jin, Lifeng, et autres
Publié: (2024)
DOTS: Learning to Reason Dynamically in LLMs via Optimal Reasoning Trajectories Search
par: Yue, Murong, et autres
Publié: (2024)
par: Yue, Murong, et autres
Publié: (2024)
Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis
par: Shi, Yucheng, et autres
Publié: (2026)
par: Shi, Yucheng, et autres
Publié: (2026)
R-Zero: Self-Evolving Reasoning LLM from Zero Data
par: Huang, Chengsong, et autres
Publié: (2025)
par: Huang, Chengsong, et autres
Publié: (2025)
DeepTheorem: Advancing LLM Reasoning for Theorem Proving Through Natural Language and Reinforcement Learning
par: Zhang, Ziyin, et autres
Publié: (2025)
par: Zhang, Ziyin, et autres
Publié: (2025)
Can LLMs Guide Their Own Exploration? Gradient-Guided Reinforcement Learning for LLM Reasoning
par: Liang, Zhenwen, et autres
Publié: (2025)
par: Liang, Zhenwen, et autres
Publié: (2025)
MPS-Prover: Advancing Stepwise Theorem Proving by Multi-Perspective Search and Data Curation
par: Liang, Zhenwen, et autres
Publié: (2025)
par: Liang, Zhenwen, et autres
Publié: (2025)
HunyuanProver: A Scalable Data Synthesis Framework and Guided Tree Search for Automated Theorem Proving
par: Li, Yang, et autres
Publié: (2024)
par: Li, Yang, et autres
Publié: (2024)
Scaling Synthetic Data Creation with 1,000,000,000 Personas
par: Ge, Tao, et autres
Publié: (2024)
par: Ge, Tao, et autres
Publié: (2024)
Documents similaires
-
Evolving Language Models without Labels: Majority Drives Selection, Novelty Promotes Variation
par: Zhou, Yujun, et autres
Publié: (2025) -
Save the Good Prefix: Precise Error Penalization via Process-Supervised RL to Enhance LLM Reasoning
par: Liu, Haolin, et autres
Publié: (2026) -
FG-PRM: Fine-grained Hallucination Detection and Mitigation in Language Model Mathematical Reasoning
par: Li, Ruosen, et autres
Publié: (2024) -
PRD: Peer Rank and Discussion Improve Large Language Model based Evaluations
par: Li, Ruosen, et autres
Publié: (2023) -
DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification
par: Liu, Rui, et autres
Publié: (2026)