PairJudge RM: Perform Best-of-N Sampling with Knockout Tournament
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Yantao, Yao, Zijun, Min, Rui, Cao, Yixin, Hou, Lei, Li, Juanzi |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
RM-Bench: Benchmarking Reward Models of Language Models with Subtlety and Style
by: Liu, Yantao, et al.
Published: (2024)
by: Liu, Yantao, et al.
Published: (2024)
Aligning Teacher with Student Preferences for Tailored Training Data Generation
by: Liu, Yantao, et al.
Published: (2024)
by: Liu, Yantao, et al.
Published: (2024)
Evaluating Generative Language Models in Information Extraction as Subjective Question Correction
by: Fan, Yuchen, et al.
Published: (2024)
by: Fan, Yuchen, et al.
Published: (2024)
Untangle the KNOT: Interweaving Conflicting Knowledge and Reasoning Skills in Large Language Models
by: Liu, Yantao, et al.
Published: (2024)
by: Liu, Yantao, et al.
Published: (2024)
StockBench: Can LLM Agents Trade Stocks Profitably In Real-world Markets?
by: Chen, Yanxu, et al.
Published: (2025)
by: Chen, Yanxu, et al.
Published: (2025)
Auxiliary Metrics Help Decoding Skill Neurons in the Wild
by: Zhao, Yixiu, et al.
Published: (2025)
by: Zhao, Yixiu, et al.
Published: (2025)
Are Reasoning Models More Prone to Hallucination?
by: Yao, Zijun, et al.
Published: (2025)
by: Yao, Zijun, et al.
Published: (2025)
AtomR: Atomic Operator-Empowered Large Language Models for Heterogeneous Knowledge Reasoning
by: Xin, Amy, et al.
Published: (2024)
by: Xin, Amy, et al.
Published: (2024)
DICE: Detecting In-distribution Contamination in LLM's Fine-tuning Phase for Math Reasoning
by: Tu, Shangqing, et al.
Published: (2024)
by: Tu, Shangqing, et al.
Published: (2024)
SeaKR: Self-aware Knowledge Retrieval for Adaptive Retrieval Augmented Generation
by: Yao, Zijun, et al.
Published: (2024)
by: Yao, Zijun, et al.
Published: (2024)
WildReward: Learning Reward Models from In-the-Wild Human Interactions
by: Peng, Hao, et al.
Published: (2026)
by: Peng, Hao, et al.
Published: (2026)
LinguaLens: Towards Interpreting Linguistic Mechanisms of Large Language Models via Sparse Auto-Encoder
by: Jing, Yi, et al.
Published: (2025)
by: Jing, Yi, et al.
Published: (2025)
Towards Understanding Safety Alignment: A Mechanistic Perspective from Safety Neurons
by: Chen, Jianhui, et al.
Published: (2024)
by: Chen, Jianhui, et al.
Published: (2024)
Agentic Reward Modeling: Integrating Human Preferences with Verifiable Correctness Signals for Reliable Reward Systems
by: Peng, Hao, et al.
Published: (2025)
by: Peng, Hao, et al.
Published: (2025)
Pre-training Distillation for Large Language Models: A Design Space Exploration
by: Peng, Hao, et al.
Published: (2024)
by: Peng, Hao, et al.
Published: (2024)
LLMAEL: Large Language Models are Good Context Augmenters for Entity Linking
by: Xin, Amy, et al.
Published: (2024)
by: Xin, Amy, et al.
Published: (2024)
A Cause-Effect Look at Alleviating Hallucination of Knowledge-grounded Dialogue Generation
by: Yu, Jifan, et al.
Published: (2024)
by: Yu, Jifan, et al.
Published: (2024)
Guiding LLM Post-training Data Engineering with Model Internals from Sparse Autoencoders
by: Jing, Yi, et al.
Published: (2026)
by: Jing, Yi, et al.
Published: (2026)
MM-THEBench: Do Reasoning MLLMs Think Reasonably?
by: Huang, Zhidian, et al.
Published: (2026)
by: Huang, Zhidian, et al.
Published: (2026)
Event-level Knowledge Editing
by: Peng, Hao, et al.
Published: (2024)
by: Peng, Hao, et al.
Published: (2024)
ToolRM: Towards Agentic Tool-Use Reward Modeling
by: Li, Renhao, et al.
Published: (2025)
by: Li, Renhao, et al.
Published: (2025)
T1: Advancing Language Model Reasoning through Reinforcement Learning and Inference Scaling
by: Hou, Zhenyu, et al.
Published: (2025)
by: Hou, Zhenyu, et al.
Published: (2025)
KB-Plugin: A Plug-and-play Framework for Large Language Models to Induce Programs over Low-resourced Knowledge Bases
by: Zhang, Jiajie, et al.
Published: (2024)
by: Zhang, Jiajie, et al.
Published: (2024)
Reverse That Number! Decoding Order Matters in Arithmetic Learning
by: Zhang-Li, Daniel, et al.
Published: (2024)
by: Zhang-Li, Daniel, et al.
Published: (2024)
MRCEval: A Comprehensive, Challenging and Accessible Machine Reading Comprehension Benchmark
by: Ma, Shengkun, et al.
Published: (2025)
by: Ma, Shengkun, et al.
Published: (2025)
Transferable and Efficient Non-Factual Content Detection via Probe Training with Offline Consistency Checking
by: Zhang, Xiaokang, et al.
Published: (2024)
by: Zhang, Xiaokang, et al.
Published: (2024)
Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric Rewards
by: Zhang, Jiajie, et al.
Published: (2026)
by: Zhang, Jiajie, et al.
Published: (2026)
OpenEP: Open-Ended Future Event Prediction
by: Guan, Yong, et al.
Published: (2024)
by: Guan, Yong, et al.
Published: (2024)
MM-MATH: Advancing Multimodal Math Evaluation with Process Evaluation and Fine-grained Classification
by: Sun, Kai, et al.
Published: (2024)
by: Sun, Kai, et al.
Published: (2024)
WebSeer: Training Deeper Search Agents through Reinforcement Learning with Self-Reflection
by: He, Guanzhong, et al.
Published: (2025)
by: He, Guanzhong, et al.
Published: (2025)
Boundary-Guided Policy Optimization for Memory-efficient RL of Diffusion Large Language Models
by: Lin, Nianyi, et al.
Published: (2025)
by: Lin, Nianyi, et al.
Published: (2025)
How Proficient Are Large Language Models in Formal Languages? An In-Depth Insight for Knowledge Base Question Answering
by: Liu, Jinxin, et al.
Published: (2024)
by: Liu, Jinxin, et al.
Published: (2024)
DeepPrune: Parallel Scaling without Inter-trace Redundancy
by: Tu, Shangqing, et al.
Published: (2025)
by: Tu, Shangqing, et al.
Published: (2025)
Precise Localization of Memories: A Fine-grained Neuron-level Knowledge Editing Technique for LLMs
by: Pan, Haowen, et al.
Published: (2025)
by: Pan, Haowen, et al.
Published: (2025)
Sampling-Efficient Test-Time Scaling: Self-Estimating the Best-of-N Sampling in Early Decoding
by: Wang, Yiming, et al.
Published: (2025)
by: Wang, Yiming, et al.
Published: (2025)
Adaptive Manipulation for Coalitions in Knockout Tournaments
by: Chaudhary, Juhi, et al.
Published: (2024)
by: Chaudhary, Juhi, et al.
Published: (2024)
ReaRAG: Knowledge-guided Reasoning Enhances Factuality of Large Reasoning Models with Iterative Retrieval Augmented Generation
by: Lee, Zhicheng, et al.
Published: (2025)
by: Lee, Zhicheng, et al.
Published: (2025)
Evaluation of Best-of-N Sampling Strategies for Language Model Alignment
by: Ichihara, Yuki, et al.
Published: (2025)
by: Ichihara, Yuki, et al.
Published: (2025)
Establishing Trustworthy LLM Evaluation via Shortcut Neuron Analysis
by: Zhu, Kejian, et al.
Published: (2025)
by: Zhu, Kejian, et al.
Published: (2025)
ADELIE: Aligning Large Language Models on Information Extraction
by: Qi, Yunjia, et al.
Published: (2024)
by: Qi, Yunjia, et al.
Published: (2024)
Similar Items
-
RM-Bench: Benchmarking Reward Models of Language Models with Subtlety and Style
by: Liu, Yantao, et al.
Published: (2024) -
Aligning Teacher with Student Preferences for Tailored Training Data Generation
by: Liu, Yantao, et al.
Published: (2024) -
Evaluating Generative Language Models in Information Extraction as Subjective Question Correction
by: Fan, Yuchen, et al.
Published: (2024) -
Untangle the KNOT: Interweaving Conflicting Knowledge and Reasoning Skills in Large Language Models
by: Liu, Yantao, et al.
Published: (2024) -
StockBench: Can LLM Agents Trade Stocks Profitably In Real-world Markets?
by: Chen, Yanxu, et al.
Published: (2025)