Reinforcement Learning with Rubric Anchors
Fuente:
arXiv
Saved in:
| Main Authors: | Huang, Zenan, Zhuang, Yihong, Lu, Guoshan, Qin, Zeyu, Xu, Haokai, Zhao, Tianyu, Peng, Ru, Hu, Jiaqi, Shen, Zhanming, Hu, Xiaomeng, Gu, Xijun, Tu, Peiyi, Liu, Jiaxin, Chen, Wenyu, Fu, Yuzhuo, Fan, Zhiting, Gu, Yanmei, Wang, Yuanyuan, Yang, Zhengkai, Li, Jianguo, Zhao, Junbo |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Optimsyn: Influence-Guided Rubrics Optimization for Synthetic Data Generation
by: Fan, Zhiting, et al.
Published: (2026)
by: Fan, Zhiting, et al.
Published: (2026)
Merge-of-Thought Distillation
by: Shen, Zhanming, et al.
Published: (2025)
by: Shen, Zhanming, et al.
Published: (2025)
Training-Trajectory-Aware Token Selection
by: Shen, Zhanming, et al.
Published: (2026)
by: Shen, Zhanming, et al.
Published: (2026)
HeartBench: Probing Core Dimensions of Anthropomorphic Intelligence in LLMs
by: Liu, Jiaxin, et al.
Published: (2025)
by: Liu, Jiaxin, et al.
Published: (2025)
ABench-Physics: Benchmarking Physical Reasoning in LLMs via High-Difficulty and Dynamic Physics Problems
by: Zhang, Yiming, et al.
Published: (2025)
by: Zhang, Yiming, et al.
Published: (2025)
A Syllogistic Probe: Tracing the Evolution of Logic Reasoning in Large Language Models
by: Zang, Zhengqing, et al.
Published: (2026)
by: Zang, Zhengqing, et al.
Published: (2026)
Supervised Fine-Tuning Needs to Unlock the Potential of Token Priority
by: Shen, Zhanming, et al.
Published: (2026)
by: Shen, Zhanming, et al.
Published: (2026)
Grove MoE: Towards Efficient and Superior MoE LLMs with Adjugate Experts
by: Wu, Haoyuan, et al.
Published: (2025)
by: Wu, Haoyuan, et al.
Published: (2025)
CYCLE-INSTRUCT: Fully Seed-Free Instruction Tuning via Dual Self-Training and Cycle Consistency
by: Shen, Zhanming, et al.
Published: (2025)
by: Shen, Zhanming, et al.
Published: (2025)
Energy-based Automated Model Evaluation
by: Peng, Ru, et al.
Published: (2024)
by: Peng, Ru, et al.
Published: (2024)
MultiEdit: Advancing Instruction-based Image Editing on Diverse and Challenging Tasks
by: Li, Mingsong, et al.
Published: (2025)
by: Li, Mingsong, et al.
Published: (2025)
dInfer: An Efficient Inference Framework for Diffusion Language Models
by: Ma, Yuxin, et al.
Published: (2025)
by: Ma, Yuxin, et al.
Published: (2025)
EvoRubric: Self-Evolving Rubric-Driven RL for Open-Ended Generation
by: Guan, Xin, et al.
Published: (2026)
by: Guan, Xin, et al.
Published: (2026)
Predicting drug‐perturbed transcriptional responses using multi‐conditional diffusion transformer
by: Qifan Hu, et al.
Published: (2025)
by: Qifan Hu, et al.
Published: (2025)
Identification of the Novel HLA‐DQB1*05:32:02 Allele in a Chinese Individual
by: Xiaomeng Gu, et al.
Published: (2025)
by: Xiaomeng Gu, et al.
Published: (2025)
Operator splitting based diffusion samplers and improved convergence analysis
by: Liu, Peiyi, et al.
Published: (2026)
by: Liu, Peiyi, et al.
Published: (2026)
Towards Cross-Table Masked Pretraining for Web Data Mining
by: Ye, Chao, et al.
Published: (2023)
by: Ye, Chao, et al.
Published: (2023)
Focal Reward: Balanced Reinforcement Learning under Rubric-Based Rewards
by: Huang, Yu, et al.
Published: (2026)
by: Huang, Yu, et al.
Published: (2026)
Deep Research as Rubric for Reinforcement Learning
by: Mei, Wangyi, et al.
Published: (2026)
by: Mei, Wangyi, et al.
Published: (2026)
LLaDA2.0: Scaling Up Diffusion Language Models to 100B
by: Bie, Tiwei, et al.
Published: (2025)
by: Bie, Tiwei, et al.
Published: (2025)
PII-Bench: Evaluating Query-Aware Privacy Protection Systems
by: Shen, Hao, et al.
Published: (2025)
by: Shen, Hao, et al.
Published: (2025)
A Stage-Wise Learning Strategy with Fixed Anchors for Robust Speaker Verification
by: Gu, Bin, et al.
Published: (2025)
by: Gu, Bin, et al.
Published: (2025)
Validity of relaxation models arising from numerical schemes for hyperbolic-parabolic systems
by: Ma, Zhiting, et al.
Published: (2025)
by: Ma, Zhiting, et al.
Published: (2025)
FLaG: Fine-Grained Latent Grouping for Hallucination Detection
by: Ye, Wentao, et al.
Published: (2026)
by: Ye, Wentao, et al.
Published: (2026)
Can LLMs Act as Historians? Evaluating Historical Research Capabilities of LLMs via the Chinese Imperial Examination
by: Gao, Lirong, et al.
Published: (2026)
by: Gao, Lirong, et al.
Published: (2026)
AIGT: AI Generative Table Based on Prompt
by: Zhang, Mingming, et al.
Published: (2024)
by: Zhang, Mingming, et al.
Published: (2024)
Robust Optimal Consensus Control for Nonlinear Multi‐agent Systems: Two Hybrid Dynamic Event‐Triggered‐Based Approach
by: Haoming Zou, et al.
Published: (2024)
by: Haoming Zou, et al.
Published: (2024)
A better approach to diagnose retinal diseases: Combining our Segmentation-based Vascular Enhancement with deep learning features
by: Chen, Yuzhuo, et al.
Published: (2024)
by: Chen, Yuzhuo, et al.
Published: (2024)
LLaDA-MoE: A Sparse MoE Diffusion Language Model
by: Zhu, Fengqi, et al.
Published: (2025)
by: Zhu, Fengqi, et al.
Published: (2025)
DORY: Deliberative Prompt Recovery for LLM
by: Gao, Lirong, et al.
Published: (2024)
by: Gao, Lirong, et al.
Published: (2024)
Preference-Aware Rubric Learning for Personalized Evaluation
by: Qiu, Yilun, et al.
Published: (2026)
by: Qiu, Yilun, et al.
Published: (2026)
Strong Underwater Supramolecular Adhesives via Fluorinated Ionic Liquids
by: Yinxia Hu, et al.
Published: (2025)
by: Yinxia Hu, et al.
Published: (2025)
RORPCap: Retrieval-based Objects and Relations Prompt for Image Captioning
by: Gu, Jinjing, et al.
Published: (2025)
by: Gu, Jinjing, et al.
Published: (2025)
Self-Rewarding Rubric-Based Reinforcement Learning for Open-Ended Reasoning
by: Ye, Zhiling, et al.
Published: (2025)
by: Ye, Zhiling, et al.
Published: (2025)
A climate–habitat–network robustness framework reveals climate‐driven habitat shifts and corridor resilience for milu in China
by: Mengdi Fu, et al.
Published: (2026)
by: Mengdi Fu, et al.
Published: (2026)
The Implicit Bias of Heterogeneity towards Invariance: A Study of Multi-Environment Matrix Sensing
by: Xu, Yang, et al.
Published: (2024)
by: Xu, Yang, et al.
Published: (2024)
Optimal estimation of a factorizable density using diffusion models with ReLU neural networks
by: Fan, Jianqing, et al.
Published: (2025)
by: Fan, Jianqing, et al.
Published: (2025)
Neural Generative Distributional Regression
by: Chai, Jinhang, et al.
Published: (2026)
by: Chai, Jinhang, et al.
Published: (2026)
Investigating the Impact of Data Selection Strategies on Language Model Performance
by: Gu, Jiayao, et al.
Published: (2025)
by: Gu, Jiayao, et al.
Published: (2025)
Aligned Anchor Groups Guided Line Segment Detector
by: Li, Zeyu, et al.
Published: (2025)
by: Li, Zeyu, et al.
Published: (2025)
Similar Items
-
Optimsyn: Influence-Guided Rubrics Optimization for Synthetic Data Generation
by: Fan, Zhiting, et al.
Published: (2026) -
Merge-of-Thought Distillation
by: Shen, Zhanming, et al.
Published: (2025) -
Training-Trajectory-Aware Token Selection
by: Shen, Zhanming, et al.
Published: (2026) -
HeartBench: Probing Core Dimensions of Anthropomorphic Intelligence in LLMs
by: Liu, Jiaxin, et al.
Published: (2025) -
ABench-Physics: Benchmarking Physical Reasoning in LLMs via High-Difficulty and Dynamic Physics Problems
by: Zhang, Yiming, et al.
Published: (2025)