Enhancing LLM Reasoning with Iterative DPO: A Comprehensive Empirical Investigation
Fuente:
arXiv
Salvato in:
| Autori principali: | Tu, Songjun, Lin, Jiahao, Tian, Xiangyu, Zhang, Qichao, Li, Linjing, Fu, Yuqian, Xu, Nan, He, Wei, Lan, Xiangyuan, Jiang, Dongmei, Zhao, Dongbin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Learning When to Think: Shaping Adaptive Reasoning in R1-Style Models via Multi-Stage RL
di: Tu, Songjun, et al.
Pubblicazione: (2025)
di: Tu, Songjun, et al.
Pubblicazione: (2025)
Perception-Consistency Multimodal Large Language Models Reasoning via Caption-Regularized Policy Optimization
di: Tu, Songjun, et al.
Pubblicazione: (2025)
di: Tu, Songjun, et al.
Pubblicazione: (2025)
PaperAudit-Bench: Benchmarking Error Detection in Research Papers for Critical Automated Peer Review
di: Tu, Songjun, et al.
Pubblicazione: (2026)
di: Tu, Songjun, et al.
Pubblicazione: (2026)
Online Preference-based Reinforcement Learning with Self-augmented Feedback from Large Language Model
di: Tu, Songjun, et al.
Pubblicazione: (2024)
di: Tu, Songjun, et al.
Pubblicazione: (2024)
Dynamic Dual-Granularity Skill Bank for Agentic RL
di: Tu, Songjun, et al.
Pubblicazione: (2026)
di: Tu, Songjun, et al.
Pubblicazione: (2026)
SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning
di: Fu, Yuqian, et al.
Pubblicazione: (2025)
di: Fu, Yuqian, et al.
Pubblicazione: (2025)
Salience-Invariant Consistent Policy Learning for Generalization in Visual Reinforcement Learning
di: Sun, Jingbo, et al.
Pubblicazione: (2025)
di: Sun, Jingbo, et al.
Pubblicazione: (2025)
Are Full Rollouts Necessary for On-Policy Distillation?
di: Zhang, Yaocheng, et al.
Pubblicazione: (2026)
di: Zhang, Yaocheng, et al.
Pubblicazione: (2026)
In-Dataset Trajectory Return Regularization for Offline Preference-based Reinforcement Learning
di: Tu, Songjun, et al.
Pubblicazione: (2024)
di: Tu, Songjun, et al.
Pubblicazione: (2024)
Saliency-Guided Representation with Consistency Policy Learning for Visual Unsupervised Reinforcement Learning
di: Sun, Jingbo, et al.
Pubblicazione: (2026)
di: Sun, Jingbo, et al.
Pubblicazione: (2026)
RLAE: Reinforcement Learning-Assisted Ensemble for LLMs
di: Fu, Yuqian, et al.
Pubblicazione: (2025)
di: Fu, Yuqian, et al.
Pubblicazione: (2025)
Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes
di: Fu, Yuqian, et al.
Pubblicazione: (2026)
di: Fu, Yuqian, et al.
Pubblicazione: (2026)
Bolster Hallucination Detection via Prompt-Guided Data Augmentation
di: Li, Wenyun, et al.
Pubblicazione: (2025)
di: Li, Wenyun, et al.
Pubblicazione: (2025)
Transferable Adversarial Face Attack with Text Controlled Attribute
di: Li, Wenyun, et al.
Pubblicazione: (2024)
di: Li, Wenyun, et al.
Pubblicazione: (2024)
AutoSearch: Adaptive Search Depth for Efficient Agentic RAG via Reinforcement Learning
di: Sun, Jingbo, et al.
Pubblicazione: (2026)
di: Sun, Jingbo, et al.
Pubblicazione: (2026)
$π$-Play: Multi-Agent Self-Play via Privileged Self-Distillation without External Data
di: Zhang, Yaocheng, et al.
Pubblicazione: (2026)
di: Zhang, Yaocheng, et al.
Pubblicazione: (2026)
Towards Comprehensive Metagenomic Recovery and Data Mining of Complex Environmental DNA Viromes
di: Mengzhi Ji, et al.
Pubblicazione: (2025)
di: Mengzhi Ji, et al.
Pubblicazione: (2025)
AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment
di: Li, Yan, et al.
Pubblicazione: (2024)
di: Li, Yan, et al.
Pubblicazione: (2024)
AlignMamba-2: Enhancing Multimodal Fusion and Sentiment Analysis with Modality-Aware Mamba
di: Li, Yan, et al.
Pubblicazione: (2026)
di: Li, Yan, et al.
Pubblicazione: (2026)
DipLLM: Fine-Tuning LLM for Strategic Decision-making in Diplomacy
di: Xu, Kaixuan, et al.
Pubblicazione: (2025)
di: Xu, Kaixuan, et al.
Pubblicazione: (2025)
Is DPO Superior to PPO for LLM Alignment? A Comprehensive Study
di: Xu, Shusheng, et al.
Pubblicazione: (2024)
di: Xu, Shusheng, et al.
Pubblicazione: (2024)
Efficient Adversarial Training via Criticality-Aware Fine-Tuning
di: Li, Wenyun, et al.
Pubblicazione: (2026)
di: Li, Wenyun, et al.
Pubblicazione: (2026)
Spec-o3: A Tool-Augmented Vision-Language Agent for Rare Celestial Object Candidate Vetting via Automated Spectral Inspection
di: Jia, Minghui, et al.
Pubblicazione: (2026)
di: Jia, Minghui, et al.
Pubblicazione: (2026)
Critical Tokens Matter: Token-Level Contrastive Estimation Enhances LLM's Reasoning Capability
di: Lin, Zicheng, et al.
Pubblicazione: (2024)
di: Lin, Zicheng, et al.
Pubblicazione: (2024)
Cross-DINO: Cross the Deep MLP and Transformer for Small Object Detection
di: Cao, Guiping, et al.
Pubblicazione: (2025)
di: Cao, Guiping, et al.
Pubblicazione: (2025)
DS-Det: Single-Query Paradigm and Attention Disentangled Learning for Flexible Object Detection
di: Cao, Guiping, et al.
Pubblicazione: (2025)
di: Cao, Guiping, et al.
Pubblicazione: (2025)
CricaVPR: Cross-image Correlation-aware Representation Learning for Visual Place Recognition
di: Lu, Feng, et al.
Pubblicazione: (2024)
di: Lu, Feng, et al.
Pubblicazione: (2024)
Open-Det: An Efficient Learning Framework for Open-Ended Detection
di: Cao, Guiping, et al.
Pubblicazione: (2025)
di: Cao, Guiping, et al.
Pubblicazione: (2025)
daDPO: Distribution-Aware DPO for Distilling Conversational Abilities
di: Zhang, Zhengze, et al.
Pubblicazione: (2025)
di: Zhang, Zhengze, et al.
Pubblicazione: (2025)
SP^2DPO: An LLM-assisted Semantic Per-Pair DPO Generalization
di: He, Chaoyue, et al.
Pubblicazione: (2026)
di: He, Chaoyue, et al.
Pubblicazione: (2026)
ISR-DPO: Aligning Large Multimodal Models for Videos by Iterative Self-Retrospective DPO
di: Ahn, Daechul, et al.
Pubblicazione: (2024)
di: Ahn, Daechul, et al.
Pubblicazione: (2024)
Dancing with Critiques: Enhancing LLM Reasoning with Stepwise Natural Language Self-Critique
di: Li, Yansi, et al.
Pubblicazione: (2025)
di: Li, Yansi, et al.
Pubblicazione: (2025)
TPMM-DPO: Trajectory-aware Preference-guided Model Merging for Iterative Direct Preference Optimization
di: Fu, Lingling, et al.
Pubblicazione: (2026)
di: Fu, Lingling, et al.
Pubblicazione: (2026)
Dream to Drive with Predictive Individual World Model
di: Gao, Yinfeng, et al.
Pubblicazione: (2025)
di: Gao, Yinfeng, et al.
Pubblicazione: (2025)
Temporal turnover of viral biodiversity and functional potential in intertidal wetlands
di: Ji, Mengzhi, et al.
Pubblicazione: (2023)
di: Ji, Mengzhi, et al.
Pubblicazione: (2023)
EMMA: Empowering Multi-modal Mamba with Structural and Hierarchical Alignment
di: Xing, Yifei, et al.
Pubblicazione: (2024)
di: Xing, Yifei, et al.
Pubblicazione: (2024)
Deep Homography Estimation for Visual Place Recognition
di: Lu, Feng, et al.
Pubblicazione: (2024)
di: Lu, Feng, et al.
Pubblicazione: (2024)
SurveyEval: Towards Comprehensive Evaluation of LLM-Generated Academic Surveys
di: Zhao, Jiahao, et al.
Pubblicazione: (2025)
di: Zhao, Jiahao, et al.
Pubblicazione: (2025)
ReasonPlan: Unified Scene Prediction and Decision Reasoning for Closed-loop Autonomous Driving
di: Liu, Xueyi, et al.
Pubblicazione: (2025)
di: Liu, Xueyi, et al.
Pubblicazione: (2025)
A Survey on Unlearnable Data
di: Li, Jiahao, et al.
Pubblicazione: (2025)
di: Li, Jiahao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Learning When to Think: Shaping Adaptive Reasoning in R1-Style Models via Multi-Stage RL
di: Tu, Songjun, et al.
Pubblicazione: (2025) -
Perception-Consistency Multimodal Large Language Models Reasoning via Caption-Regularized Policy Optimization
di: Tu, Songjun, et al.
Pubblicazione: (2025) -
PaperAudit-Bench: Benchmarking Error Detection in Research Papers for Critical Automated Peer Review
di: Tu, Songjun, et al.
Pubblicazione: (2026) -
Online Preference-based Reinforcement Learning with Self-augmented Feedback from Large Language Model
di: Tu, Songjun, et al.
Pubblicazione: (2024) -
Dynamic Dual-Granularity Skill Bank for Agentic RL
di: Tu, Songjun, et al.
Pubblicazione: (2026)