DFPO: Scaling Value Modeling via Distributional Flow towards Robust and Generalizable LLM Post-Training
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhu, Dingwei, Xi, Zhiheng, Dou, Shihan, Li, Jiahan, Huang, Chenhao, Ye, Junjie, Li, Sixian, Chai, Mingxu, Wang, Yuhui, Yang, Yajie, Zhang, Ming, Zhang, Jiazheng, Liu, Shichun, Huang, Caishuang, Zhang, Yunke, Wang, Yuran, Gui, Tao, Qiu, Xipeng, Zhang, Qi, Huang, Xuanjing |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DVPO: Distributional Value Modeling-based Policy Optimization for LLM Post-Training
par: Zhu, Dingwei, et autres
Publié: (2025)
par: Zhu, Dingwei, et autres
Publié: (2025)
VRPO: Rethinking Value Modeling for Robust RL Training under Noisy Supervision
par: Zhu, Dingwei, et autres
Publié: (2025)
par: Zhu, Dingwei, et autres
Publié: (2025)
LLMEval-Med: A Real-world Clinical Benchmark for Medical LLMs with Physician Validation
par: Zhang, Ming, et autres
Publié: (2025)
par: Zhang, Ming, et autres
Publié: (2025)
TransferTOD: A Generalizable Chinese Multi-Domain Task-Oriented Dialogue System with Transfer Capabilities
par: Zhang, Ming, et autres
Publié: (2024)
par: Zhang, Ming, et autres
Publié: (2024)
CodeChameleon: Personalized Encryption Framework for Jailbreaking Large Language Models
par: Lv, Huijie, et autres
Publié: (2024)
par: Lv, Huijie, et autres
Publié: (2024)
Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control
par: Zhang, Jiazheng, et autres
Publié: (2026)
par: Zhang, Jiazheng, et autres
Publié: (2026)
ToolEyes: Fine-Grained Evaluation for Tool Learning Capabilities of Large Language Models in Real-world Scenarios
par: Ye, Junjie, et autres
Publié: (2024)
par: Ye, Junjie, et autres
Publié: (2024)
From Scores to Preferences: Redefining MOS Benchmarking for Speech Quality Reward Modeling
par: Cao, Yifei, et autres
Publié: (2025)
par: Cao, Yifei, et autres
Publié: (2025)
ToolSword: Unveiling Safety Issues of Large Language Models in Tool Learning Across Three Stages
par: Ye, Junjie, et autres
Publié: (2024)
par: Ye, Junjie, et autres
Publié: (2024)
EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training
par: Pan, Chengjun, et autres
Publié: (2026)
par: Pan, Chengjun, et autres
Publié: (2026)
JFTA-Bench: Evaluate LLM's Ability of Tracking and Analyzing Malfunctions Using Fault Trees
par: Wang, Yuhui, et autres
Publié: (2026)
par: Wang, Yuhui, et autres
Publié: (2026)
Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment
par: Zhang, Jiazheng, et autres
Publié: (2025)
par: Zhang, Jiazheng, et autres
Publié: (2025)
Can RL Improve Generalization of LLM Agents? An Empirical Study
par: Xi, Zhiheng, et autres
Publié: (2026)
par: Xi, Zhiheng, et autres
Publié: (2026)
Self-Demos: Eliciting Out-of-Demonstration Generalizability in Large Language Models
par: He, Wei, et autres
Publié: (2024)
par: He, Wei, et autres
Publié: (2024)
SafeAligner: Safety Alignment against Jailbreak Attacks via Response Disparity Guidance
par: Huang, Caishuang, et autres
Publié: (2024)
par: Huang, Caishuang, et autres
Publié: (2024)
Beyond Boundaries: Learning a Universal Entity Taxonomy across Datasets and Languages for Open Named Entity Recognition
par: Yang, Yuming, et autres
Publié: (2024)
par: Yang, Yuming, et autres
Publié: (2024)
RoTBench: A Multi-Level Benchmark for Evaluating the Robustness of Large Language Models in Tool Learning
par: Ye, Junjie, et autres
Publié: (2024)
par: Ye, Junjie, et autres
Publié: (2024)
DocFusion: A Unified Framework for Document Parsing Tasks
par: Chai, Mingxu, et autres
Publié: (2024)
par: Chai, Mingxu, et autres
Publié: (2024)
LLMEval-Fair: A Large-Scale Longitudinal Study on Robust and Fair Evaluation of Large Language Models
par: Zhang, Ming, et autres
Publié: (2025)
par: Zhang, Ming, et autres
Publié: (2025)
AgentV-RL: Scaling Reward Modeling with Agentic Verifier
par: Zhang, Jiazheng, et autres
Publié: (2026)
par: Zhang, Jiazheng, et autres
Publié: (2026)
Compression Hacking: A Supplementary Perspective on Informatics Properties of Language Models from Geometric Distortion
par: Zang, Jianxiang, et autres
Publié: (2025)
par: Zang, Jianxiang, et autres
Publié: (2025)
Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization
par: Wang, Junzhe, et autres
Publié: (2026)
par: Wang, Junzhe, et autres
Publié: (2026)
Prefix-Adaptive Block Diffusion for Efficient Document Recognition
par: Chai, Mingxu, et autres
Publié: (2026)
par: Chai, Mingxu, et autres
Publié: (2026)
What's Wrong with Your Code Generated by Large Language Models? An Extensive Study
par: Dou, Shihan, et autres
Publié: (2024)
par: Dou, Shihan, et autres
Publié: (2024)
EasyJailbreak: A Unified Framework for Jailbreaking Large Language Models
par: Zhou, Weikang, et autres
Publié: (2024)
par: Zhou, Weikang, et autres
Publié: (2024)
Advancing Translation Preference Modeling with RLHF: A Step Towards Cost-Effective Solution
par: Xu, Nuo, et autres
Publié: (2024)
par: Xu, Nuo, et autres
Publié: (2024)
Improving RL Exploration for LLM Reasoning through Retrospective Replay
par: Dou, Shihan, et autres
Publié: (2025)
par: Dou, Shihan, et autres
Publié: (2025)
Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses
par: Lin, Jiahang, et autres
Publié: (2026)
par: Lin, Jiahang, et autres
Publié: (2026)
FRoM-W1: Towards General Humanoid Whole-Body Control with Language Instructions
par: Li, Peng, et autres
Publié: (2026)
par: Li, Peng, et autres
Publié: (2026)
Emergent Structured Representations Support Flexible In-Context Inference in Large Language Models
par: Xu, Ningyu, et autres
Publié: (2026)
par: Xu, Ningyu, et autres
Publié: (2026)
RoCoIns: Enhancing Robustness of Large Language Models through Code-Style Instructions
par: Zhang, Yuansen, et autres
Publié: (2024)
par: Zhang, Yuansen, et autres
Publié: (2024)
MM-Doc-R1: Training Agents for Long Document Visual Question Answering through Multi-turn Reinforcement Learning
par: Lin, Jiahang, et autres
Publié: (2026)
par: Lin, Jiahang, et autres
Publié: (2026)
EvaLearn: Quantifying the Learning Capability and Efficiency of LLMs via Sequential Problem Solving
par: Dou, Shihan, et autres
Publié: (2025)
par: Dou, Shihan, et autres
Publié: (2025)
Steering LLMs via Scalable Interactive Oversight
par: Zhou, Enyu, et autres
Publié: (2026)
par: Zhou, Enyu, et autres
Publié: (2026)
StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback
par: Dou, Shihan, et autres
Publié: (2024)
par: Dou, Shihan, et autres
Publié: (2024)
Pre-Trained Policy Discriminators are General Reward Models
par: Dou, Shihan, et autres
Publié: (2025)
par: Dou, Shihan, et autres
Publié: (2025)
Dynamic and Generalizable Process Reward Modeling
par: Yin, Zhangyue, et autres
Publié: (2025)
par: Yin, Zhangyue, et autres
Publié: (2025)
SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents
par: Shen, Yujiong, et autres
Publié: (2026)
par: Shen, Yujiong, et autres
Publié: (2026)
Subspace Defense: Discarding Adversarial Perturbations by Learning a Subspace for Clean Signals
par: Zheng, Rui, et autres
Publié: (2024)
par: Zheng, Rui, et autres
Publié: (2024)
MagicGUI: A Foundational Mobile GUI Agent with Scalable Data Pipeline and Reinforcement Fine-tuning
par: Tang, Liujian, et autres
Publié: (2025)
par: Tang, Liujian, et autres
Publié: (2025)
Documents similaires
-
DVPO: Distributional Value Modeling-based Policy Optimization for LLM Post-Training
par: Zhu, Dingwei, et autres
Publié: (2025) -
VRPO: Rethinking Value Modeling for Robust RL Training under Noisy Supervision
par: Zhu, Dingwei, et autres
Publié: (2025) -
LLMEval-Med: A Real-world Clinical Benchmark for Medical LLMs with Physician Validation
par: Zhang, Ming, et autres
Publié: (2025) -
TransferTOD: A Generalizable Chinese Multi-Domain Task-Oriented Dialogue System with Transfer Capabilities
par: Zhang, Ming, et autres
Publié: (2024) -
CodeChameleon: Personalized Encryption Framework for Jailbreaking Large Language Models
par: Lv, Huijie, et autres
Publié: (2024)