Deep Research as Rubric for Reinforcement Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Mei, Wangyi, Gu, Zhouhong, Bai, Zhenhan, Cai, Yin, Zhang, Lefan, Ding, Zhenxin, Chen, Bo, Gao, Yan, Wu, Yi, Hu, Yao, Liang, Jiaqing, Yang, Deqing |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Logical Consistency is Vital: Neural-Symbolic Information Retrieval for Negative-Constraint Queries
by: Xu, Ganlin, et al.
Published: (2025)
by: Xu, Ganlin, et al.
Published: (2025)
MARO: Learning Stronger Reasoning from Social Interaction
by: Cai, Yin, et al.
Published: (2026)
by: Cai, Yin, et al.
Published: (2026)
Scaling Behavior of Single LLM-Driven Multi-Agent Systems
by: Li, Jialing, et al.
Published: (2026)
by: Li, Jialing, et al.
Published: (2026)
RLAP: A Reinforcement Learning Enhanced Adaptive Planning Framework for Multi-step NLP Task Solving
by: Ding, Zepeng, et al.
Published: (2025)
by: Ding, Zepeng, et al.
Published: (2025)
ConcEPT: Concept-Enhanced Pre-Training for Language Models
by: Wang, Xintao, et al.
Published: (2024)
by: Wang, Xintao, et al.
Published: (2024)
DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research
by: Shao, Rulin, et al.
Published: (2025)
by: Shao, Rulin, et al.
Published: (2025)
GORACS: Group-level Optimal Transport-guided Coreset Selection for LLM-based Recommender Systems
by: Mei, Tiehua, et al.
Published: (2025)
by: Mei, Tiehua, et al.
Published: (2025)
ResearchRubrics: A Benchmark of Prompts and Rubrics For Evaluating Deep Research Agents
by: Sharma, Manasi, et al.
Published: (2025)
by: Sharma, Manasi, et al.
Published: (2025)
AdaRubric: Task-Adaptive Rubrics for Reliable LLM Agent Evaluation and Reward Learning
by: Ding, Liang
Published: (2026)
by: Ding, Liang
Published: (2026)
ScholarGym: Benchmarking Large Language Model Capabilities in the Information-Gathering Stage of Deep Research
by: Shen, Hao, et al.
Published: (2026)
by: Shen, Hao, et al.
Published: (2026)
Reinforcement Learning with Rubric Anchors
by: Huang, Zenan, et al.
Published: (2025)
by: Huang, Zenan, et al.
Published: (2025)
Adaptive Reinforcement Learning Planning: Harnessing Large Language Models for Complex Information Extraction
by: Ding, Zepeng, et al.
Published: (2024)
by: Ding, Zepeng, et al.
Published: (2024)
Improving Recall of Large Language Models: A Model Collaboration Approach for Relational Triple Extraction
by: Ding, Zepeng, et al.
Published: (2024)
by: Ding, Zepeng, et al.
Published: (2024)
ProRL: Effective Reinforcement Learning for Proactive Recommendation via Rectified Policy Gradient Estimation
by: Hou, Hongru, et al.
Published: (2026)
by: Hou, Hongru, et al.
Published: (2026)
Focal Reward: Balanced Reinforcement Learning under Rubric-Based Rewards
by: Huang, Yu, et al.
Published: (2026)
by: Huang, Yu, et al.
Published: (2026)
AutoScraper: A Progressive Understanding Web Agent for Web Scraper Generation
by: Huang, Wenhao, et al.
Published: (2024)
by: Huang, Wenhao, et al.
Published: (2024)
Open Rubric System: Scaling Reinforcement Learning with Pairwise Adaptive Rubric
by: Jia, Ruipeng, et al.
Published: (2026)
by: Jia, Ruipeng, et al.
Published: (2026)
AMARIS: A Memory-Augmented Rubric Improvement System for Rubric-Based Reinforcement Learning
by: Wu, Peilin, et al.
Published: (2026)
by: Wu, Peilin, et al.
Published: (2026)
EvoRubric: Self-Evolving Rubric-Driven RL for Open-Ended Generation
by: Guan, Xin, et al.
Published: (2026)
by: Guan, Xin, et al.
Published: (2026)
Preference-Aware Rubric Learning for Personalized Evaluation
by: Qiu, Yilun, et al.
Published: (2026)
by: Qiu, Yilun, et al.
Published: (2026)
Reinforcement Learning with Robust Rubric Rewards
by: Yu, Ya-Qi, et al.
Published: (2026)
by: Yu, Ya-Qi, et al.
Published: (2026)
EDGE: Enhanced Grounded GUI Understanding with Enriched Multi-Granularity Synthetic Data
by: Chen, Xuetian, et al.
Published: (2024)
by: Chen, Xuetian, et al.
Published: (2024)
Adaptive Ordered Information Extraction with Deep Reinforcement Learning
by: Huang, Wenhao, et al.
Published: (2023)
by: Huang, Wenhao, et al.
Published: (2023)
Manipulation Planning for Construction Activities with Repetitive Tasks
by: Liu, Wangyi, et al.
Published: (2026)
by: Liu, Wangyi, et al.
Published: (2026)
GOVERN: Gradient Orientation Vote Ensemble for Multi-Teacher Reinforced Distillation
by: Zhou, Wenjie, et al.
Published: (2024)
by: Zhou, Wenjie, et al.
Published: (2024)
Self-Rewarding Rubric-Based Reinforcement Learning for Open-Ended Reasoning
by: Ye, Zhiling, et al.
Published: (2025)
by: Ye, Zhiling, et al.
Published: (2025)
AgentGroupChat: An Interactive Group Chat Simulacra For Better Eliciting Emergent Behavior
by: Gu, Zhouhong, et al.
Published: (2024)
by: Gu, Zhouhong, et al.
Published: (2024)
DeepResearch Bench II: Diagnosing Deep Research Agents via Rubrics from Expert Report
by: Li, Ruizhe, et al.
Published: (2026)
by: Li, Ruizhe, et al.
Published: (2026)
Auto-Rubric: Learning From Implicit Weights to Explicit Rubrics for Reward Modeling
by: Xie, Lipeng, et al.
Published: (2025)
by: Xie, Lipeng, et al.
Published: (2025)
BookWorld: From Novels to Interactive Agent Societies for Creative Story Generation
by: Ran, Yiting, et al.
Published: (2025)
by: Ran, Yiting, et al.
Published: (2025)
ToNER: Type-oriented Named Entity Recognition with Generative Language Model
by: Jiang, Guochao, et al.
Published: (2024)
by: Jiang, Guochao, et al.
Published: (2024)
ANALOGYKB: Unlocking Analogical Reasoning of Language Models with A Million-scale Knowledge Base
by: Yuan, Siyu, et al.
Published: (2023)
by: Yuan, Siyu, et al.
Published: (2023)
PADetBench: Towards Benchmarking Physical Attacks against Object Detection
by: Lian, Jiawei, et al.
Published: (2024)
by: Lian, Jiawei, et al.
Published: (2024)
Semantic Representation Attack against Aligned Large Language Models
by: Lian, Jiawei, et al.
Published: (2025)
by: Lian, Jiawei, et al.
Published: (2025)
Revealing the Intrinsic Ethical Vulnerability of Aligned Large Language Models
by: Lian, Jiawei, et al.
Published: (2025)
by: Lian, Jiawei, et al.
Published: (2025)
Tokenization Matters! Degrading Large Language Models through Challenging Their Tokenization
by: Wang, Dixuan, et al.
Published: (2024)
by: Wang, Dixuan, et al.
Published: (2024)
Skeletons Matter: Dynamic Data Augmentation for Text-to-Query
by: Ji, Yuchen, et al.
Published: (2025)
by: Ji, Yuchen, et al.
Published: (2025)
Reward Hacking in Rubric-Based Reinforcement Learning
by: Mahmoud, Anas, et al.
Published: (2026)
by: Mahmoud, Anas, et al.
Published: (2026)
PII-Bench: Evaluating Query-Aware Privacy Protection Systems
by: Shen, Hao, et al.
Published: (2025)
by: Shen, Hao, et al.
Published: (2025)
On the Imprisonment of Fictitious Concepts in the Development of Physics
by: Yan, Jiaqing
Published: (2026)
by: Yan, Jiaqing
Published: (2026)
Similar Items
-
Logical Consistency is Vital: Neural-Symbolic Information Retrieval for Negative-Constraint Queries
by: Xu, Ganlin, et al.
Published: (2025) -
MARO: Learning Stronger Reasoning from Social Interaction
by: Cai, Yin, et al.
Published: (2026) -
Scaling Behavior of Single LLM-Driven Multi-Agent Systems
by: Li, Jialing, et al.
Published: (2026) -
RLAP: A Reinforcement Learning Enhanced Adaptive Planning Framework for Multi-step NLP Task Solving
by: Ding, Zepeng, et al.
Published: (2025) -
ConcEPT: Concept-Enhanced Pre-Training for Language Models
by: Wang, Xintao, et al.
Published: (2024)