FIPO: Eliciting Deep Reasoning with Future-KL Influenced Policy Optimization
Fuente:
arXiv
Saved in:
| Main Authors: | Ma, Chiyu, Yang, Shuo, Huang, Kexin, Lu, Jinda, Meng, Haoming, Wang, Shangshang, Ding, Bolin, Vosoughi, Soroush, Wang, Guoyin, Zhou, Jingren |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
One-Way Policy Optimization for Self-Evolving LLMs
by: Yang, Shuo, et al.
Published: (2026)
by: Yang, Shuo, et al.
Published: (2026)
Sparse but Critical: A Token-Level Analysis of Distributional Shifts in RLVR Fine-Tuning of LLMs
by: Meng, Haoming, et al.
Published: (2026)
by: Meng, Haoming, et al.
Published: (2026)
On the Direction of RLVR Updates for LLM Reasoning: Identification and Exploitation
by: Huang, Kexin, et al.
Published: (2026)
by: Huang, Kexin, et al.
Published: (2026)
Achieving Domain-Independent Certified Robustness via Knowledge Continuity
by: Sun, Alan, et al.
Published: (2024)
by: Sun, Alan, et al.
Published: (2024)
Bridging Perception and Reasoning: Token Reweighting for RLVR in Multimodal LLMs
by: Lu, Jinda, et al.
Published: (2026)
by: Lu, Jinda, et al.
Published: (2026)
KCES: Training-Free Defense for Robust Graph Neural Networks via Kernel Complexity
by: Jia, Yaning, et al.
Published: (2025)
by: Jia, Yaning, et al.
Published: (2025)
On-Policy RL Meets Off-Policy Experts: Harmonizing Supervised Fine-Tuning and Reinforcement Learning via Dynamic Weighting
by: Zhang, Wenhao, et al.
Published: (2025)
by: Zhang, Wenhao, et al.
Published: (2025)
What Makes a Good Curriculum? Disentangling the Effects of Data Ordering on LLM Mathematical Reasoning
by: Jia, Yaning, et al.
Published: (2025)
by: Jia, Yaning, et al.
Published: (2025)
Judging the Judges: A Systematic Study of Position Bias in LLM-as-a-Judge
by: Shi, Lin, et al.
Published: (2024)
by: Shi, Lin, et al.
Published: (2024)
Interpretable Image Classification with Adaptive Prototype-based Vision Transformers
by: Ma, Chiyu, et al.
Published: (2024)
by: Ma, Chiyu, et al.
Published: (2024)
SoundMind: RL-Incentivized Logic Reasoning for Audio-Language Models
by: Diao, Xingjian, et al.
Published: (2025)
by: Diao, Xingjian, et al.
Published: (2025)
Towards Interpretable Deep Reinforcement Learning Models via Inverse Reinforcement Learning
by: Xie, Sean, et al.
Published: (2022)
by: Xie, Sean, et al.
Published: (2022)
Disordered-DABS: A Benchmark for Dynamic Aspect-Based Summarization in Disordered Texts
by: Guo, Xiaobo, et al.
Published: (2024)
by: Guo, Xiaobo, et al.
Published: (2024)
MODABS: Multi-Objective Learning for Dynamic Aspect-Based Summarization
by: Guo, Xiaobo, et al.
Published: (2024)
by: Guo, Xiaobo, et al.
Published: (2024)
Serial Position Effects of Large Language Models
by: Guo, Xiaobo, et al.
Published: (2024)
by: Guo, Xiaobo, et al.
Published: (2024)
NushuRescue: Revitalization of the Endangered Nushu Language with AI
by: Yang, Ivory, et al.
Published: (2024)
by: Yang, Ivory, et al.
Published: (2024)
FIPO: Free-form Instruction-oriented Prompt Optimization with Preference Dataset and Modular Fine-tuning Schema
by: Lu, Junru, et al.
Published: (2024)
by: Lu, Junru, et al.
Published: (2024)
Rethinking Visual Content Refinement in Low-Shot CLIP Adaptation
by: Lu, Jinda, et al.
Published: (2024)
by: Lu, Jinda, et al.
Published: (2024)
Is It Navajo? Accurate Language Detection in Endangered Athabaskan Languages
by: Yang, Ivory, et al.
Published: (2025)
by: Yang, Ivory, et al.
Published: (2025)
MentalManip: A Dataset For Fine-grained Analysis of Mental Manipulation in Conversations
by: Wang, Yuxin, et al.
Published: (2024)
by: Wang, Yuxin, et al.
Published: (2024)
Semantic Compositions Enhance Vision-Language Contrastive Learning
by: Aladago, Maxwell, et al.
Published: (2024)
by: Aladago, Maxwell, et al.
Published: (2024)
Addressing Overthinking in Large Vision-Language Models via Gated Perception-Reasoning Optimization
by: Diao, Xingjian, et al.
Published: (2026)
by: Diao, Xingjian, et al.
Published: (2026)
Accelerating Diffusion Transformer via Gradient-Optimized Cache
by: Qiu, Junxiang, et al.
Published: (2025)
by: Qiu, Junxiang, et al.
Published: (2025)
Output Scaling: YingLong-Delayed Chain of Thought in a Large Pretrained Time Series Forecasting Model
by: Wang, Xue, et al.
Published: (2025)
by: Wang, Xue, et al.
Published: (2025)
Designing Algorithms Empowered by Language Models: An Analytical Framework, Case Studies, and Insights
by: Chen, Yanxi, et al.
Published: (2024)
by: Chen, Yanxi, et al.
Published: (2024)
MedAD-R1: Eliciting Consistent Reasoning in Interpretible Medical Anomaly Detection via Consistency-Reinforced Policy Optimization
by: Zhang, Haitao, et al.
Published: (2026)
by: Zhang, Haitao, et al.
Published: (2026)
SMARTFEAT: Efficient Feature Construction through Feature-Level Foundation Model Interactions
by: Lin, Yin, et al.
Published: (2023)
by: Lin, Yin, et al.
Published: (2023)
Trustworthy Intelligent Education: A Systematic Perspective on Progress, Challenges, and Future Directions
by: Yu, Xiaoshan, et al.
Published: (2026)
by: Yu, Xiaoshan, et al.
Published: (2026)
Judging with Many Minds: Do More Perspectives Mean Less Prejudice? On Bias Amplifications and Resistance in Multi-Agent Based LLM-as-Judge
by: Ma, Chiyu, et al.
Published: (2025)
by: Ma, Chiyu, et al.
Published: (2025)
Accelerating Diffusion Transformer via Error-Optimized Cache
by: Qiu, Junxiang, et al.
Published: (2025)
by: Qiu, Junxiang, et al.
Published: (2025)
ImpScore: A Learnable Metric For Quantifying The Implicitness Level of Sentence
by: Wang, Yuxin, et al.
Published: (2024)
by: Wang, Yuxin, et al.
Published: (2024)
Growing Through Experience: Scaling Episodic Grounding in Language Models
by: Zhang, Chunhui, et al.
Published: (2025)
by: Zhang, Chunhui, et al.
Published: (2025)
Probing Association Biases in LLM Moderation Over-Sensitivity
by: Wang, Yuxin, et al.
Published: (2025)
by: Wang, Yuxin, et al.
Published: (2025)
How to Train Your Deep Research Agent? Prompt, Reward, and Policy Optimization in Search-R1
by: Xu, Yinuo, et al.
Published: (2026)
by: Xu, Yinuo, et al.
Published: (2026)
Scaled Supervision is an Implicit Lipschitz Regularizer
by: Ouyang, Zhongyu, et al.
Published: (2025)
by: Ouyang, Zhongyu, et al.
Published: (2025)
Enhanced Detection of Conversational Mental Manipulation Through Advanced Prompting Techniques
by: Yang, Ivory, et al.
Published: (2024)
by: Yang, Ivory, et al.
Published: (2024)
Non-parametric Graph Convolution for Re-ranking in Recommendation Systems
by: Ouyang, Zhongyu, et al.
Published: (2025)
by: Ouyang, Zhongyu, et al.
Published: (2025)
Pretrained Image-Text Models are Secretly Video Captioners
by: Zhang, Chunhui, et al.
Published: (2025)
by: Zhang, Chunhui, et al.
Published: (2025)
BridgeScope: A Universal Toolkit for Bridging Large Language Models and Databases
by: Weng, Lianggui, et al.
Published: (2025)
by: Weng, Lianggui, et al.
Published: (2025)
EE-LLM: Large-Scale Training and Inference of Early-Exit Large Language Models with 3D Parallelism
by: Chen, Yanxi, et al.
Published: (2023)
by: Chen, Yanxi, et al.
Published: (2023)
Similar Items
-
One-Way Policy Optimization for Self-Evolving LLMs
by: Yang, Shuo, et al.
Published: (2026) -
Sparse but Critical: A Token-Level Analysis of Distributional Shifts in RLVR Fine-Tuning of LLMs
by: Meng, Haoming, et al.
Published: (2026) -
On the Direction of RLVR Updates for LLM Reasoning: Identification and Exploitation
by: Huang, Kexin, et al.
Published: (2026) -
Achieving Domain-Independent Certified Robustness via Knowledge Continuity
by: Sun, Alan, et al.
Published: (2024) -
Bridging Perception and Reasoning: Token Reweighting for RLVR in Multimodal LLMs
by: Lu, Jinda, et al.
Published: (2026)