Silence the Judge: Reinforcement Learning with Self-Verifier via Latent Geometric Clustering
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Nonghai, Ma, Weitao, Ma, Zhanyu, Xu, Jun, Gao, Jiuchong, Hao, Jinghua, He, Renqing, Xu, Jingwen |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
UserLM-R1: Modeling Human Reasoning in User Language Models with Multi-Reward Reinforcement Learning
par: Zhang, Feng, et autres
Publié: (2026)
par: Zhang, Feng, et autres
Publié: (2026)
Fine-Mem: Fine-Grained Feedback Alignment for Long-Horizon Memory Management
par: Ma, Weitao, et autres
Publié: (2026)
par: Ma, Weitao, et autres
Publié: (2026)
LTS-VoiceAgent: A Listen-Think-Speak Framework for Efficient Streaming Voice Interaction via Semantic Triggering and Incremental Reasoning
par: Zou, Wenhao, et autres
Publié: (2026)
par: Zou, Wenhao, et autres
Publié: (2026)
MUSE: Multi-Domain Chinese User Simulation via Self-Evolving Profiles and Rubric-Guided Alignment
par: Liu, Zihao, et autres
Publié: (2026)
par: Liu, Zihao, et autres
Publié: (2026)
Hidden States Know Where Reasoning Diverges: Credit Assignment via Span-Level Wasserstein Distance
par: Chen, Xinzhu, et autres
Publié: (2026)
par: Chen, Xinzhu, et autres
Publié: (2026)
GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR
par: Zhang, Jiaying, et autres
Publié: (2026)
par: Zhang, Jiaying, et autres
Publié: (2026)
Long-term Task-oriented Agent: Proactive Long-term Intent Maintenance in Dynamic Environments
par: Shi, Qinglong, et autres
Publié: (2026)
par: Shi, Qinglong, et autres
Publié: (2026)
State Rank Dynamics in Linear Attention LLMs
par: Sun, Ao, et autres
Publié: (2026)
par: Sun, Ao, et autres
Publié: (2026)
Efficient Paths and Dense Rewards: Probabilistic Flow Reasoning for Large Language Models
par: Liu, Yan, et autres
Publié: (2026)
par: Liu, Yan, et autres
Publié: (2026)
From Absolute to Relative: Rethinking Reward Shaping in Group-Based Reinforcement Learning
par: Niu, Wenzhe, et autres
Publié: (2026)
par: Niu, Wenzhe, et autres
Publié: (2026)
Incentivizing Agentic Reasoning in LLM Judges via Tool-Integrated Reinforcement Learning
par: Xu, Ran, et autres
Publié: (2025)
par: Xu, Ran, et autres
Publié: (2025)
Masked-and-Reordered Self-Supervision for Reinforcement Learning from Verifiable Rewards
par: Wang, Zhen, et autres
Publié: (2025)
par: Wang, Zhen, et autres
Publié: (2025)
Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards
par: Ma, Zhengzhao, et autres
Publié: (2026)
par: Ma, Zhengzhao, et autres
Publié: (2026)
Adaptive Rollout Allocation for Online Reinforcement Learning with Verifiable Rewards
par: Nguyen, Hieu Trung, et autres
Publié: (2026)
par: Nguyen, Hieu Trung, et autres
Publié: (2026)
Trust, But Verify: A Self-Verification Approach to Reinforcement Learning with Verifiable Rewards
par: Liu, Xiaoyuan, et autres
Publié: (2025)
par: Liu, Xiaoyuan, et autres
Publié: (2025)
Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward
par: Tang, Xinyu, et autres
Publié: (2025)
par: Tang, Xinyu, et autres
Publié: (2025)
NOVER: Incentive Training for Language Models via Verifier-Free Reinforcement Learning
par: Liu, Wei, et autres
Publié: (2025)
par: Liu, Wei, et autres
Publié: (2025)
PAG: Multi-Turn Reinforced LLM Self-Correction with Policy as Generative Verifier
par: Jiang, Yuhua, et autres
Publié: (2025)
par: Jiang, Yuhua, et autres
Publié: (2025)
Low-probability Tokens Sustain Exploration in Reinforcement Learning with Verifiable Reward
par: Huang, Guanhua, et autres
Publié: (2025)
par: Huang, Guanhua, et autres
Publié: (2025)
When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards
par: Wang, Li, et autres
Publié: (2026)
par: Wang, Li, et autres
Publié: (2026)
S$^2$R: Teaching LLMs to Self-verify and Self-correct via Reinforcement Learning
par: Ma, Ruotian, et autres
Publié: (2025)
par: Ma, Ruotian, et autres
Publié: (2025)
Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains
par: Gunjal, Anisha, et autres
Publié: (2025)
par: Gunjal, Anisha, et autres
Publié: (2025)
Chart-RL: Generalized Chart Comprehension via Reinforcement Learning with Verifiable Rewards
par: Zhang, Xin, et autres
Publié: (2026)
par: Zhang, Xin, et autres
Publié: (2026)
The Hidden Signal of Verifier Strictness: Controlling and Improving Step-Wise Verification via Selective Latent Steering
par: Zhou, Yefan, et autres
Publié: (2026)
par: Zhou, Yefan, et autres
Publié: (2026)
RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments
par: Zeng, Zhiyuan, et autres
Publié: (2025)
par: Zeng, Zhiyuan, et autres
Publié: (2025)
Alternating Reinforcement Learning for Rubric-Based Reward Modeling in Non-Verifiable LLM Post-Training
par: Xu, Ran, et autres
Publié: (2026)
par: Xu, Ran, et autres
Publié: (2026)
VerifierQ: Enhancing LLM Test Time Compute with Q-Learning-based Verifiers
par: Qi, Jianing, et autres
Publié: (2024)
par: Qi, Jianing, et autres
Publié: (2024)
Towards Transparent RAG: Fostering Evidence Traceability in LLM Generation via Reinforcement Learning
par: Ren, Jingyi, et autres
Publié: (2025)
par: Ren, Jingyi, et autres
Publié: (2025)
Reinforcement Learning-based Knowledge Distillation with LLM-as-a-Judge
par: Shen, Yiyang, et autres
Publié: (2026)
par: Shen, Yiyang, et autres
Publié: (2026)
Let it Calm: Exploratory Annealed Decoding for Verifiable Reinforcement Learning
par: Yang, Chenghao, et autres
Publié: (2025)
par: Yang, Chenghao, et autres
Publié: (2025)
J1: Incentivizing Thinking in LLM-as-a-Judge via Reinforcement Learning
par: Whitehouse, Chenxi, et autres
Publié: (2025)
par: Whitehouse, Chenxi, et autres
Publié: (2025)
Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning
par: Feng, Weitao, et autres
Publié: (2025)
par: Feng, Weitao, et autres
Publié: (2025)
Reinforcing General Reasoning without Verifiers
par: Zhou, Xiangxin, et autres
Publié: (2025)
par: Zhou, Xiangxin, et autres
Publié: (2025)
ANCORA: Learning to Question via Manifold-Anchored Self-Play for Verifiable Reasoning
par: Yang, Chengcao
Publié: (2026)
par: Yang, Chengcao
Publié: (2026)
SEVerA: Verified Synthesis of Self-Evolving Agents
par: Banerjee, Debangshu, et autres
Publié: (2026)
par: Banerjee, Debangshu, et autres
Publié: (2026)
Boosting Reinforcement Learning with Verifiable Rewards via Randomly Selected Few-Shot Guidance
par: Yan, Kai, et autres
Publié: (2026)
par: Yan, Kai, et autres
Publié: (2026)
Examining Reasoning LLMs-as-Judges in Non-Verifiable LLM Post-Training
par: Liu, Yixin, et autres
Publié: (2026)
par: Liu, Yixin, et autres
Publié: (2026)
OPV: Outcome-based Process Verifier for Efficient Long Chain-of-Thought Verification
par: Wu, Zijian, et autres
Publié: (2025)
par: Wu, Zijian, et autres
Publié: (2025)
GNN-as-Judge: Unleashing the Power of LLMs for Graph Learning with GNN Feedback
par: Xu, Ruiyao, et autres
Publié: (2026)
par: Xu, Ruiyao, et autres
Publié: (2026)
Silenced Biases: The Dark Side LLMs Learned to Refuse
par: Himelstein, Rom, et autres
Publié: (2025)
par: Himelstein, Rom, et autres
Publié: (2025)
Documents similaires
-
UserLM-R1: Modeling Human Reasoning in User Language Models with Multi-Reward Reinforcement Learning
par: Zhang, Feng, et autres
Publié: (2026) -
Fine-Mem: Fine-Grained Feedback Alignment for Long-Horizon Memory Management
par: Ma, Weitao, et autres
Publié: (2026) -
LTS-VoiceAgent: A Listen-Think-Speak Framework for Efficient Streaming Voice Interaction via Semantic Triggering and Incremental Reasoning
par: Zou, Wenhao, et autres
Publié: (2026) -
MUSE: Multi-Domain Chinese User Simulation via Self-Evolving Profiles and Rubric-Guided Alignment
par: Liu, Zihao, et autres
Publié: (2026) -
Hidden States Know Where Reasoning Diverges: Credit Assignment via Span-Level Wasserstein Distance
par: Chen, Xinzhu, et autres
Publié: (2026)