Beyond Majority Voting: Towards Fine-grained and More Reliable Reward Signal for Test-Time Reinforcement Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Weiqin, Wang, Yile, Chen, Kehao, Huang, Hui |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Ranked Voting based Self-Consistency of Large Language Models
by: Wang, Weiqin, et al.
Published: (2025)
by: Wang, Weiqin, et al.
Published: (2025)
DySem: Uncovering Dynamic Semantic Components of Large Language Models for Calculating Semantic Textual Similarity
by: Zheng, Kaijie, et al.
Published: (2026)
by: Zheng, Kaijie, et al.
Published: (2026)
SemPA: Improving Sentence Embeddings of Large Language Models through Semantic Preference Alignment
by: Chen, Ziyang, et al.
Published: (2026)
by: Chen, Ziyang, et al.
Published: (2026)
AnchorMem: Anchored Facts with Associative Contexts for Building Memory in Large Language Models
by: Shen, Zhanyu, et al.
Published: (2026)
by: Shen, Zhanyu, et al.
Published: (2026)
Distribution-Aware Reward Estimation for Test-Time Reinforcement Learning
by: Du, Bodong, et al.
Published: (2026)
by: Du, Bodong, et al.
Published: (2026)
Beyond Imitation: Leveraging Fine-grained Quality Signals for Alignment
by: Guo, Geyang, et al.
Published: (2023)
by: Guo, Geyang, et al.
Published: (2023)
Training Language Models to Generate Text with Citations via Fine-grained Rewards
by: Huang, Chengyu, et al.
Published: (2024)
by: Huang, Chengyu, et al.
Published: (2024)
TLCR: Token-Level Continuous Reward for Fine-grained Reinforcement Learning from Human Feedback
by: Yoon, Eunseop, et al.
Published: (2024)
by: Yoon, Eunseop, et al.
Published: (2024)
LDIR: Low-Dimensional Dense and Interpretable Text Embeddings with Relative Representations
by: Wang, Yile, et al.
Published: (2025)
by: Wang, Yile, et al.
Published: (2025)
Assessment of Generative Named Entity Recognition in the Era of Large Language Models
by: Zhan, Qi, et al.
Published: (2026)
by: Zhan, Qi, et al.
Published: (2026)
Beyond Majority Voting: Efficient Best-Of-N with Radial Consensus Score
by: Nguyen, Manh, et al.
Published: (2026)
by: Nguyen, Manh, et al.
Published: (2026)
Mirror-Consistency: Harnessing Inconsistency in Majority Voting
by: Huang, Siyuan, et al.
Published: (2024)
by: Huang, Siyuan, et al.
Published: (2024)
AttriLens-Mol: Attribute Guided Reinforcement Learning for Molecular Property Prediction with Large Language Models
by: Lin, Xuan, et al.
Published: (2025)
by: Lin, Xuan, et al.
Published: (2025)
DualReward: A Dynamic Reinforcement Learning Framework for Cloze Tests Distractor Generation
by: Huang, Tianyou, et al.
Published: (2025)
by: Huang, Tianyou, et al.
Published: (2025)
UniARM: Towards a Unified Autoregressive Reward Model for Multi-Objective Test-Time Alignment
by: Xie, Hongyan, et al.
Published: (2026)
by: Xie, Hongyan, et al.
Published: (2026)
DeCoVec: Building Decoding Space based Task Vector for Large Language Models via In-Context Learning
by: Li, Feiyang, et al.
Published: (2026)
by: Li, Feiyang, et al.
Published: (2026)
Process Rewards with Learned Reliability
by: Li, Jinyuan, et al.
Published: (2026)
by: Li, Jinyuan, et al.
Published: (2026)
Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains
by: Gunjal, Anisha, et al.
Published: (2025)
by: Gunjal, Anisha, et al.
Published: (2025)
Agentic Reward Modeling: Integrating Human Preferences with Verifiable Correctness Signals for Reliable Reward Systems
by: Peng, Hao, et al.
Published: (2025)
by: Peng, Hao, et al.
Published: (2025)
Bayesian Preference Learning for Test-Time Steerable Reward Models
by: Hong, Jiwoo, et al.
Published: (2026)
by: Hong, Jiwoo, et al.
Published: (2026)
Critique Fine-Tuning: Learning to Critique is More Effective than Learning to Imitate
by: Wang, Yubo, et al.
Published: (2025)
by: Wang, Yubo, et al.
Published: (2025)
MedPRMBench: A Fine-grained Benchmark for Process Reward Models in Medical Reasoning
by: Wu, Lingyan, et al.
Published: (2026)
by: Wu, Lingyan, et al.
Published: (2026)
Agentic Reinforcement Learning with Implicit Step Rewards
by: Liu, Xiaoqian, et al.
Published: (2025)
by: Liu, Xiaoqian, et al.
Published: (2025)
Beyond Majority Voting: Agreement-Based Clustering to Model Annotator Perspectives in Subjective NLP Tasks
by: Belay, Tadesse Destaw, et al.
Published: (2026)
by: Belay, Tadesse Destaw, et al.
Published: (2026)
Understanding and Mitigating Spurious Signal Amplification in Test-Time Reinforcement Learning for Math Reasoning
by: Yu, Yongcan, et al.
Published: (2026)
by: Yu, Yongcan, et al.
Published: (2026)
Metacognition as Reward: Reinforcing LLM Reasoning via Knowledge and Regulation Signals
by: Chen, Sirui, et al.
Published: (2026)
by: Chen, Sirui, et al.
Published: (2026)
DiVA: Fine-grained Factuality Verification with Agentic-Discriminative Verifier
by: Huang, Hui, et al.
Published: (2026)
by: Huang, Hui, et al.
Published: (2026)
Beyond Query-Level Comparison: Fine-Grained Reinforcement Learning for Text-to-SQL with Automated Interpretable Critiques
by: Wang, Guifeng, et al.
Published: (2025)
by: Wang, Guifeng, et al.
Published: (2025)
From Mathematical Reasoning to Code: Generalization of Process Reward Models in Test-Time Scaling
by: Chen, Zhengyu, et al.
Published: (2025)
by: Chen, Zhengyu, et al.
Published: (2025)
Self-Explore: Enhancing Mathematical Reasoning in Language Models with Fine-grained Rewards
by: Hwang, Hyeonbin, et al.
Published: (2024)
by: Hwang, Hyeonbin, et al.
Published: (2024)
RLAR: An Agentic Reward System for Multi-task Reinforcement Learning on Large Language Models
by: Feng, Andrew Zhuoer, et al.
Published: (2026)
by: Feng, Andrew Zhuoer, et al.
Published: (2026)
Improving Large Language Models via Fine-grained Reinforcement Learning with Minimum Editing Constraint
by: Chen, Zhipeng, et al.
Published: (2024)
by: Chen, Zhipeng, et al.
Published: (2024)
Prioritizing the Best: Incentivizing Reliable Multimodal Reasoning by Rewarding Beyond Answer Correctness
by: Jia, Mengzhao, et al.
Published: (2026)
by: Jia, Mengzhao, et al.
Published: (2026)
Tool Verification for Test-Time Reinforcement Learning
by: Liao, Ruotong, et al.
Published: (2026)
by: Liao, Ruotong, et al.
Published: (2026)
Revisiting Metric Reliability for Fine-grained Evaluation of Machine Translation and Summarization in Indian Languages
by: Yari, Amir Hossein, et al.
Published: (2025)
by: Yari, Amir Hossein, et al.
Published: (2025)
RESTRAIN: From Spurious Votes to Signals -- Self-Driven RL with Self-Penalization
by: Yu, Zhaoning, et al.
Published: (2025)
by: Yu, Zhaoning, et al.
Published: (2025)
Towards Generative Class Prompt Learning for Fine-grained Visual Recognition
by: Chattopadhyay, Soumitri, et al.
Published: (2024)
by: Chattopadhyay, Soumitri, et al.
Published: (2024)
Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward
by: Tang, Xinyu, et al.
Published: (2025)
by: Tang, Xinyu, et al.
Published: (2025)
Beyond Prompt: Fine-grained Simulation of Cognitively Impaired Standardized Patients via Stochastic Steering
by: Zhang, Weikang, et al.
Published: (2026)
by: Zhang, Weikang, et al.
Published: (2026)
RLSR: Reinforcement Learning with Supervised Reward Outperforms SFT in Instruction Following
by: Wang, Zhichao, et al.
Published: (2025)
by: Wang, Zhichao, et al.
Published: (2025)
Similar Items
-
Ranked Voting based Self-Consistency of Large Language Models
by: Wang, Weiqin, et al.
Published: (2025) -
DySem: Uncovering Dynamic Semantic Components of Large Language Models for Calculating Semantic Textual Similarity
by: Zheng, Kaijie, et al.
Published: (2026) -
SemPA: Improving Sentence Embeddings of Large Language Models through Semantic Preference Alignment
by: Chen, Ziyang, et al.
Published: (2026) -
AnchorMem: Anchored Facts with Associative Contexts for Building Memory in Large Language Models
by: Shen, Zhanyu, et al.
Published: (2026) -
Distribution-Aware Reward Estimation for Test-Time Reinforcement Learning
by: Du, Bodong, et al.
Published: (2026)