Training AI Co-Scientists Using Rubric Rewards
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Goel, Shashwat, Hazra, Rishi, Jayalath, Dulhan, Willi, Timon, Jain, Parag, Shen, William F., Leontiadis, Ilias, Barbieri, Francesco, Bachrach, Yoram, Geiping, Jonas, Whitehouse, Chenxi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Rethinking Rubric Generation for Improving LLM Judge and Reward Modeling for Open-ended Tasks
par: Shen, William F., et autres
Publié: (2026)
par: Shen, William F., et autres
Publié: (2026)
Balanced Accuracy: The Right Metric for Evaluating LLM Judges -- Explained through Youden's J statistic
par: Collot, Stephane, et autres
Publié: (2025)
par: Collot, Stephane, et autres
Publié: (2025)
Compute as Teacher: Turning Inference Compute Into Reference-Free Supervision
par: Jayalath, Dulhan, et autres
Publié: (2025)
par: Jayalath, Dulhan, et autres
Publié: (2025)
Scaling Open-Ended Reasoning to Predict the Future
par: Chandak, Nikhil, et autres
Publié: (2025)
par: Chandak, Nikhil, et autres
Publié: (2025)
Answer Matching Outperforms Multiple Choice for Language Model Evaluation
par: Chandak, Nikhil, et autres
Publié: (2025)
par: Chandak, Nikhil, et autres
Publié: (2025)
Towards Knowledge-Grounded Natural Language Understanding and Generation
par: Whitehouse, Chenxi
Publié: (2024)
par: Whitehouse, Chenxi
Publié: (2024)
MEG-XL: Data-Efficient Brain-to-Text via Long-Context Pre-Training
par: Jayalath, Dulhan, et autres
Publié: (2026)
par: Jayalath, Dulhan, et autres
Publié: (2026)
FutureSim: Replaying World Events to Evaluate Adaptive Agents
par: Goel, Shashwat, et autres
Publié: (2026)
par: Goel, Shashwat, et autres
Publié: (2026)
Pitfalls in Evaluating Language Model Forecasters
par: Paleka, Daniel, et autres
Publié: (2025)
par: Paleka, Daniel, et autres
Publié: (2025)
Neural Mean-Field Games: Extending Mean-Field Game Theory with Neural Stochastic Differential Equations
par: Thöni, Anna C. M., et autres
Publié: (2025)
par: Thöni, Anna C. M., et autres
Publié: (2025)
APRES: An Agentic Paper Revision and Evaluation System
par: Zhao, Bingchen, et autres
Publié: (2026)
par: Zhao, Bingchen, et autres
Publié: (2026)
The Decrypto Benchmark for Multi-Agent Reasoning and Theory of Mind
par: Lupu, Andrei, et autres
Publié: (2025)
par: Lupu, Andrei, et autres
Publié: (2025)
Generalising Multi-Agent Cooperation through Task-Agnostic Communication
par: Jayalath, Dulhan, et autres
Publié: (2024)
par: Jayalath, Dulhan, et autres
Publié: (2024)
Scaling Small Agents Through Strategy Auctions
par: Alazraki, Lisa, et autres
Publié: (2026)
par: Alazraki, Lisa, et autres
Publié: (2026)
AutoRubric: Rubric-Based Generative Rewards for Faithful Multimodal Reasoning
par: Jia, Mengzhao, et autres
Publié: (2025)
par: Jia, Mengzhao, et autres
Publié: (2025)
Efficiently Dispatching Flash Attention For Partially Filled Attention Masks
par: Sharma, Agniv, et autres
Publié: (2024)
par: Sharma, Agniv, et autres
Publié: (2024)
Structsum Generation for Faster Text Comprehension
par: Jain, Parag, et autres
Publié: (2024)
par: Jain, Parag, et autres
Publié: (2024)
OpenRubrics: Towards Scalable Synthetic Rubric Generation for Reward Modeling and LLM Alignment
par: Liu, Tianci, et autres
Publié: (2025)
par: Liu, Tianci, et autres
Publié: (2025)
Unlocking Non-Invasive Brain-to-Text
par: Jayalath, Dulhan, et autres
Publié: (2025)
par: Jayalath, Dulhan, et autres
Publié: (2025)
Great Models Think Alike and this Undermines AI Oversight
par: Goel, Shashwat, et autres
Publié: (2025)
par: Goel, Shashwat, et autres
Publié: (2025)
Integrating Large Language Models with Graph-based Reasoning for Conversational Question Answering
par: Jain, Parag, et autres
Publié: (2024)
par: Jain, Parag, et autres
Publié: (2024)
The Illusion of Diminishing Returns: Measuring Long Horizon Execution in LLMs
par: Sinha, Akshit, et autres
Publié: (2025)
par: Sinha, Akshit, et autres
Publié: (2025)
RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards
par: Li, Gaotang, et autres
Publié: (2026)
par: Li, Gaotang, et autres
Publié: (2026)
AdaRubric: Task-Adaptive Rubrics for Reliable LLM Agent Evaluation and Reward Learning
par: Ding, Liang
Publié: (2026)
par: Ding, Liang
Publié: (2026)
Visual Preference Optimization with Rubric Rewards
par: Yu, Ya-Qi, et autres
Publié: (2026)
par: Yu, Ya-Qi, et autres
Publié: (2026)
Reinforcement Learning with Robust Rubric Rewards
par: Yu, Ya-Qi, et autres
Publié: (2026)
par: Yu, Ya-Qi, et autres
Publié: (2026)
REvolve: Reward Evolution with Large Language Models using Human Feedback
par: Hazra, Rishi, et autres
Publié: (2024)
par: Hazra, Rishi, et autres
Publié: (2024)
Efficient Parallel Samplers for Recurrent-Depth Models and Their Connection to Diffusion Language Models
par: Geiping, Jonas, et autres
Publié: (2025)
par: Geiping, Jonas, et autres
Publié: (2025)
Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks
par: Xu, Tianze, et autres
Publié: (2026)
par: Xu, Tianze, et autres
Publié: (2026)
OmniScientist: Toward a Co-evolving Ecosystem of Human and AI Scientists
par: Shao, Chenyang, et autres
Publié: (2025)
par: Shao, Chenyang, et autres
Publié: (2025)
Curing Miracle Steps in LLM Mathematical Reasoning with Rubric Rewards
par: Yuan, Youliang, et autres
Publié: (2025)
par: Yuan, Youliang, et autres
Publié: (2025)
Proportional Aggregation of Preferences for Sequential Decision Making
par: Chandak, Nikhil, et autres
Publié: (2023)
par: Chandak, Nikhil, et autres
Publié: (2023)
Rubric-Guided Process Reward for Stepwise Model Routing
par: Ye, Shenghao, et autres
Publié: (2026)
par: Ye, Shenghao, et autres
Publié: (2026)
A Grading Rubric for AI Safety Frameworks
par: Alaga, Jide, et autres
Publié: (2024)
par: Alaga, Jide, et autres
Publié: (2024)
DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification
par: Liu, Rui, et autres
Publié: (2026)
par: Liu, Rui, et autres
Publié: (2026)
Feature Likelihood Divergence: Evaluating the Generalization of Generative Models Using Samples
par: Jiralerspong, Marco, et autres
Publié: (2023)
par: Jiralerspong, Marco, et autres
Publié: (2023)
RubricRL: Simple Generalizable Rewards for Text-to-Image Generation
par: Feng, Xuelu, et autres
Publié: (2025)
par: Feng, Xuelu, et autres
Publié: (2025)
R3: Robust Rubric-Agnostic Reward Models
par: Anugraha, David, et autres
Publié: (2025)
par: Anugraha, David, et autres
Publié: (2025)
Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains
par: Gunjal, Anisha, et autres
Publié: (2025)
par: Gunjal, Anisha, et autres
Publié: (2025)
Segment-Level Diffusion: A Framework for Controllable Long-Form Generation with Diffusion Language Models
par: Zhu, Xiaochen, et autres
Publié: (2024)
par: Zhu, Xiaochen, et autres
Publié: (2024)
Documents similaires
-
Rethinking Rubric Generation for Improving LLM Judge and Reward Modeling for Open-ended Tasks
par: Shen, William F., et autres
Publié: (2026) -
Balanced Accuracy: The Right Metric for Evaluating LLM Judges -- Explained through Youden's J statistic
par: Collot, Stephane, et autres
Publié: (2025) -
Compute as Teacher: Turning Inference Compute Into Reference-Free Supervision
par: Jayalath, Dulhan, et autres
Publié: (2025) -
Scaling Open-Ended Reasoning to Predict the Future
par: Chandak, Nikhil, et autres
Publié: (2025) -
Answer Matching Outperforms Multiple Choice for Language Model Evaluation
par: Chandak, Nikhil, et autres
Publié: (2025)