Silence the Judge: Reinforcement Learning with Self-Verifier via Latent Geometric Clustering
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Nonghai, Ma, Weitao, Ma, Zhanyu, Xu, Jun, Gao, Jiuchong, Hao, Jinghua, He, Renqing, Xu, Jingwen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
UserLM-R1: Modeling Human Reasoning in User Language Models with Multi-Reward Reinforcement Learning
di: Zhang, Feng, et al.
Pubblicazione: (2026)
di: Zhang, Feng, et al.
Pubblicazione: (2026)
Fine-Mem: Fine-Grained Feedback Alignment for Long-Horizon Memory Management
di: Ma, Weitao, et al.
Pubblicazione: (2026)
di: Ma, Weitao, et al.
Pubblicazione: (2026)
LTS-VoiceAgent: A Listen-Think-Speak Framework for Efficient Streaming Voice Interaction via Semantic Triggering and Incremental Reasoning
di: Zou, Wenhao, et al.
Pubblicazione: (2026)
di: Zou, Wenhao, et al.
Pubblicazione: (2026)
MUSE: Multi-Domain Chinese User Simulation via Self-Evolving Profiles and Rubric-Guided Alignment
di: Liu, Zihao, et al.
Pubblicazione: (2026)
di: Liu, Zihao, et al.
Pubblicazione: (2026)
Hidden States Know Where Reasoning Diverges: Credit Assignment via Span-Level Wasserstein Distance
di: Chen, Xinzhu, et al.
Pubblicazione: (2026)
di: Chen, Xinzhu, et al.
Pubblicazione: (2026)
GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR
di: Zhang, Jiaying, et al.
Pubblicazione: (2026)
di: Zhang, Jiaying, et al.
Pubblicazione: (2026)
Long-term Task-oriented Agent: Proactive Long-term Intent Maintenance in Dynamic Environments
di: Shi, Qinglong, et al.
Pubblicazione: (2026)
di: Shi, Qinglong, et al.
Pubblicazione: (2026)
State Rank Dynamics in Linear Attention LLMs
di: Sun, Ao, et al.
Pubblicazione: (2026)
di: Sun, Ao, et al.
Pubblicazione: (2026)
Efficient Paths and Dense Rewards: Probabilistic Flow Reasoning for Large Language Models
di: Liu, Yan, et al.
Pubblicazione: (2026)
di: Liu, Yan, et al.
Pubblicazione: (2026)
From Absolute to Relative: Rethinking Reward Shaping in Group-Based Reinforcement Learning
di: Niu, Wenzhe, et al.
Pubblicazione: (2026)
di: Niu, Wenzhe, et al.
Pubblicazione: (2026)
Incentivizing Agentic Reasoning in LLM Judges via Tool-Integrated Reinforcement Learning
di: Xu, Ran, et al.
Pubblicazione: (2025)
di: Xu, Ran, et al.
Pubblicazione: (2025)
Masked-and-Reordered Self-Supervision for Reinforcement Learning from Verifiable Rewards
di: Wang, Zhen, et al.
Pubblicazione: (2025)
di: Wang, Zhen, et al.
Pubblicazione: (2025)
Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards
di: Ma, Zhengzhao, et al.
Pubblicazione: (2026)
di: Ma, Zhengzhao, et al.
Pubblicazione: (2026)
Adaptive Rollout Allocation for Online Reinforcement Learning with Verifiable Rewards
di: Nguyen, Hieu Trung, et al.
Pubblicazione: (2026)
di: Nguyen, Hieu Trung, et al.
Pubblicazione: (2026)
Trust, But Verify: A Self-Verification Approach to Reinforcement Learning with Verifiable Rewards
di: Liu, Xiaoyuan, et al.
Pubblicazione: (2025)
di: Liu, Xiaoyuan, et al.
Pubblicazione: (2025)
Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward
di: Tang, Xinyu, et al.
Pubblicazione: (2025)
di: Tang, Xinyu, et al.
Pubblicazione: (2025)
NOVER: Incentive Training for Language Models via Verifier-Free Reinforcement Learning
di: Liu, Wei, et al.
Pubblicazione: (2025)
di: Liu, Wei, et al.
Pubblicazione: (2025)
PAG: Multi-Turn Reinforced LLM Self-Correction with Policy as Generative Verifier
di: Jiang, Yuhua, et al.
Pubblicazione: (2025)
di: Jiang, Yuhua, et al.
Pubblicazione: (2025)
Low-probability Tokens Sustain Exploration in Reinforcement Learning with Verifiable Reward
di: Huang, Guanhua, et al.
Pubblicazione: (2025)
di: Huang, Guanhua, et al.
Pubblicazione: (2025)
When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards
di: Wang, Li, et al.
Pubblicazione: (2026)
di: Wang, Li, et al.
Pubblicazione: (2026)
S$^2$R: Teaching LLMs to Self-verify and Self-correct via Reinforcement Learning
di: Ma, Ruotian, et al.
Pubblicazione: (2025)
di: Ma, Ruotian, et al.
Pubblicazione: (2025)
Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains
di: Gunjal, Anisha, et al.
Pubblicazione: (2025)
di: Gunjal, Anisha, et al.
Pubblicazione: (2025)
Chart-RL: Generalized Chart Comprehension via Reinforcement Learning with Verifiable Rewards
di: Zhang, Xin, et al.
Pubblicazione: (2026)
di: Zhang, Xin, et al.
Pubblicazione: (2026)
The Hidden Signal of Verifier Strictness: Controlling and Improving Step-Wise Verification via Selective Latent Steering
di: Zhou, Yefan, et al.
Pubblicazione: (2026)
di: Zhou, Yefan, et al.
Pubblicazione: (2026)
RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments
di: Zeng, Zhiyuan, et al.
Pubblicazione: (2025)
di: Zeng, Zhiyuan, et al.
Pubblicazione: (2025)
Alternating Reinforcement Learning for Rubric-Based Reward Modeling in Non-Verifiable LLM Post-Training
di: Xu, Ran, et al.
Pubblicazione: (2026)
di: Xu, Ran, et al.
Pubblicazione: (2026)
VerifierQ: Enhancing LLM Test Time Compute with Q-Learning-based Verifiers
di: Qi, Jianing, et al.
Pubblicazione: (2024)
di: Qi, Jianing, et al.
Pubblicazione: (2024)
Towards Transparent RAG: Fostering Evidence Traceability in LLM Generation via Reinforcement Learning
di: Ren, Jingyi, et al.
Pubblicazione: (2025)
di: Ren, Jingyi, et al.
Pubblicazione: (2025)
Reinforcement Learning-based Knowledge Distillation with LLM-as-a-Judge
di: Shen, Yiyang, et al.
Pubblicazione: (2026)
di: Shen, Yiyang, et al.
Pubblicazione: (2026)
Let it Calm: Exploratory Annealed Decoding for Verifiable Reinforcement Learning
di: Yang, Chenghao, et al.
Pubblicazione: (2025)
di: Yang, Chenghao, et al.
Pubblicazione: (2025)
J1: Incentivizing Thinking in LLM-as-a-Judge via Reinforcement Learning
di: Whitehouse, Chenxi, et al.
Pubblicazione: (2025)
di: Whitehouse, Chenxi, et al.
Pubblicazione: (2025)
Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning
di: Feng, Weitao, et al.
Pubblicazione: (2025)
di: Feng, Weitao, et al.
Pubblicazione: (2025)
Reinforcing General Reasoning without Verifiers
di: Zhou, Xiangxin, et al.
Pubblicazione: (2025)
di: Zhou, Xiangxin, et al.
Pubblicazione: (2025)
ANCORA: Learning to Question via Manifold-Anchored Self-Play for Verifiable Reasoning
di: Yang, Chengcao
Pubblicazione: (2026)
di: Yang, Chengcao
Pubblicazione: (2026)
SEVerA: Verified Synthesis of Self-Evolving Agents
di: Banerjee, Debangshu, et al.
Pubblicazione: (2026)
di: Banerjee, Debangshu, et al.
Pubblicazione: (2026)
Boosting Reinforcement Learning with Verifiable Rewards via Randomly Selected Few-Shot Guidance
di: Yan, Kai, et al.
Pubblicazione: (2026)
di: Yan, Kai, et al.
Pubblicazione: (2026)
Examining Reasoning LLMs-as-Judges in Non-Verifiable LLM Post-Training
di: Liu, Yixin, et al.
Pubblicazione: (2026)
di: Liu, Yixin, et al.
Pubblicazione: (2026)
OPV: Outcome-based Process Verifier for Efficient Long Chain-of-Thought Verification
di: Wu, Zijian, et al.
Pubblicazione: (2025)
di: Wu, Zijian, et al.
Pubblicazione: (2025)
GNN-as-Judge: Unleashing the Power of LLMs for Graph Learning with GNN Feedback
di: Xu, Ruiyao, et al.
Pubblicazione: (2026)
di: Xu, Ruiyao, et al.
Pubblicazione: (2026)
Silenced Biases: The Dark Side LLMs Learned to Refuse
di: Himelstein, Rom, et al.
Pubblicazione: (2025)
di: Himelstein, Rom, et al.
Pubblicazione: (2025)
Documenti analoghi
-
UserLM-R1: Modeling Human Reasoning in User Language Models with Multi-Reward Reinforcement Learning
di: Zhang, Feng, et al.
Pubblicazione: (2026) -
Fine-Mem: Fine-Grained Feedback Alignment for Long-Horizon Memory Management
di: Ma, Weitao, et al.
Pubblicazione: (2026) -
LTS-VoiceAgent: A Listen-Think-Speak Framework for Efficient Streaming Voice Interaction via Semantic Triggering and Incremental Reasoning
di: Zou, Wenhao, et al.
Pubblicazione: (2026) -
MUSE: Multi-Domain Chinese User Simulation via Self-Evolving Profiles and Rubric-Guided Alignment
di: Liu, Zihao, et al.
Pubblicazione: (2026) -
Hidden States Know Where Reasoning Diverges: Credit Assignment via Span-Level Wasserstein Distance
di: Chen, Xinzhu, et al.
Pubblicazione: (2026)