AIPO: Improving Training Objective for Iterative Preference Optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shen, Yaojie, Wang, Xinyao, Niu, Yulei, Zhou, Ying, Tang, Lexin, Zhang, Libo, Chen, Fan, Wen, Longyin |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DiffLM: Controllable Synthetic Data Generation via Diffusion Language Models
par: Zhou, Ying, et autres
Publié: (2024)
par: Zhou, Ying, et autres
Publié: (2024)
Where do Large Vision-Language Models Look at when Answering Questions?
par: Xing, Xiaoying, et autres
Publié: (2025)
par: Xing, Xiaoying, et autres
Publié: (2025)
Referring Layer Decomposition
par: Chen, Fangyi, et autres
Publié: (2026)
par: Chen, Fangyi, et autres
Publié: (2026)
AIPO: Learning to Reason from Active Interaction
par: Liu, Junnan, et autres
Publié: (2026)
par: Liu, Junnan, et autres
Publié: (2026)
Accurate and Fast Compressed Video Captioning
par: Shen, Yaojie, et autres
Publié: (2023)
par: Shen, Yaojie, et autres
Publié: (2023)
Improving Multilingual Social Media Insights: Aspect-based Comment Analysis
par: Zhang, Longyin, et autres
Publié: (2025)
par: Zhang, Longyin, et autres
Publié: (2025)
APT: Improving Specialist LLM Performance with Weakness Case Acquisition and Iterative Preference Training
par: Rao, Jun, et autres
Publié: (2025)
par: Rao, Jun, et autres
Publié: (2025)
Two Causal Principles for Improving Visual Dialog
par: Qi, Jiaxin, et autres
Publié: (2019)
par: Qi, Jiaxin, et autres
Publié: (2019)
Self-Training with Direct Preference Optimization Improves Chain-of-Thought Reasoning
par: Wang, Tianduo, et autres
Publié: (2024)
par: Wang, Tianduo, et autres
Publié: (2024)
Iterative Reasoning Preference Optimization
par: Pang, Richard Yuanzhe, et autres
Publié: (2024)
par: Pang, Richard Yuanzhe, et autres
Publié: (2024)
Self-Steering Optimization: Autonomous Preference Optimization for Large Language Models
par: Xiang, Hao, et autres
Publié: (2024)
par: Xiang, Hao, et autres
Publié: (2024)
Pre-DPO: Improving Data Utilization in Direct Preference Optimization Using a Guiding Reference Model
par: Pan, Junshu, et autres
Publié: (2025)
par: Pan, Junshu, et autres
Publié: (2025)
Multi-Hop Question Generation via Dual-Perspective Keyword Guidance
par: Li, Maodong, et autres
Publié: (2025)
par: Li, Maodong, et autres
Publié: (2025)
Controllable Preference Optimization: Toward Controllable Multi-Objective Alignment
par: Guo, Yiju, et autres
Publié: (2024)
par: Guo, Yiju, et autres
Publié: (2024)
CiPO: Counterfactual Unlearning for Large Reasoning Models through Iterative Preference Optimization
par: Li, Junyi, et autres
Publié: (2026)
par: Li, Junyi, et autres
Publié: (2026)
Structured Context Learning for Generic Event Boundary Detection
par: Gu, Xin, et autres
Publié: (2025)
par: Gu, Xin, et autres
Publié: (2025)
Fine-Grained Preference Optimization Improves Spatial Reasoning in VLMs
par: Shen, Yifan, et autres
Publié: (2025)
par: Shen, Yifan, et autres
Publié: (2025)
Test-Time Preference Optimization: On-the-Fly Alignment via Iterative Textual Feedback
par: Li, Yafu, et autres
Publié: (2025)
par: Li, Yafu, et autres
Publié: (2025)
Plug-and-Play Training Framework for Preference Optimization
par: Ma, Jingyuan, et autres
Publié: (2024)
par: Ma, Jingyuan, et autres
Publié: (2024)
A-IPO: Adaptive Intent-driven Preference Optimization
par: Wang, Wenqing, et autres
Publié: (2025)
par: Wang, Wenqing, et autres
Publié: (2025)
Unlocking the Capabilities of Thought: A Reasoning Boundary Framework to Quantify and Optimize Chain-of-Thought
par: Chen, Qiguang, et autres
Publié: (2024)
par: Chen, Qiguang, et autres
Publié: (2024)
Statistical Rejection Sampling Improves Preference Optimization
par: Liu, Tianqi, et autres
Publié: (2023)
par: Liu, Tianqi, et autres
Publié: (2023)
TSO: Self-Training with Scaled Preference Optimization
par: Chen, Kaihui, et autres
Publié: (2024)
par: Chen, Kaihui, et autres
Publié: (2024)
Direct Judgement Preference Optimization
par: Wang, Peifeng, et autres
Publié: (2024)
par: Wang, Peifeng, et autres
Publié: (2024)
Toward Real-World Chinese Psychological Support Dialogues: CPsDD Dataset and a Co-Evolving Multi-Agent System
par: Shi, Yuanchen, et autres
Publié: (2025)
par: Shi, Yuanchen, et autres
Publié: (2025)
Improving Factual Consistency of News Summarization by Contrastive Preference Optimization
par: Feng, Huawen, et autres
Publié: (2023)
par: Feng, Huawen, et autres
Publié: (2023)
REWARD CONSISTENCY: Improving Multi-Objective Alignment from a Data-Centric Perspective
par: Xu, Zhihao, et autres
Publié: (2025)
par: Xu, Zhihao, et autres
Publié: (2025)
A$^2$Search: Ambiguity-Aware Question Answering with Reinforcement Learning
par: Zhang, Fengji, et autres
Publié: (2025)
par: Zhang, Fengji, et autres
Publié: (2025)
An Efficient Task-Oriented Dialogue Policy: Evolutionary Reinforcement Learning Injected by Elite Individuals
par: Zhao, Yangyang, et autres
Publié: (2025)
par: Zhao, Yangyang, et autres
Publié: (2025)
LISTEN to Your Preferences: An LLM Framework for Multi-Objective Selection
par: Jovine, Adam S., et autres
Publié: (2025)
par: Jovine, Adam S., et autres
Publié: (2025)
Training-Free Group Relative Policy Optimization
par: Cai, Yuzheng, et autres
Publié: (2025)
par: Cai, Yuzheng, et autres
Publié: (2025)
Ambiguity Awareness Optimization: Towards Semantic Disambiguation for Direct Preference Optimization
par: Li, Jian, et autres
Publié: (2025)
par: Li, Jian, et autres
Publié: (2025)
MOSAIC: Multi-Objective Slice-Aware Iterative Curation for Alignment
par: Dou, Yipu, et autres
Publié: (2026)
par: Dou, Yipu, et autres
Publié: (2026)
Iterative Length-Regularized Direct Preference Optimization: A Case Study on Improving 7B Language Models to GPT-4 Level
par: Liu, Jie, et autres
Publié: (2024)
par: Liu, Jie, et autres
Publié: (2024)
MaLei at MultiClinSUM: Summarisation of Clinical Documents using Perspective-Aware Iterative Self-Prompting with LLMs
par: Ren, Libo, et autres
Publié: (2025)
par: Ren, Libo, et autres
Publié: (2025)
CYCLE-INSTRUCT: Fully Seed-Free Instruction Tuning via Dual Self-Training and Cycle Consistency
par: Shen, Zhanming, et autres
Publié: (2025)
par: Shen, Zhanming, et autres
Publié: (2025)
Impact of Stickers on Multimodal Sentiment and Intent in Social Media: A New Task, Dataset and Baseline
par: Shi, Yuanchen, et autres
Publié: (2024)
par: Shi, Yuanchen, et autres
Publié: (2024)
Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts
par: Wang, Haoxiang, et autres
Publié: (2024)
par: Wang, Haoxiang, et autres
Publié: (2024)
An LLM Feature-based Framework for Dialogue Constructiveness Assessment
par: Zhou, Lexin, et autres
Publié: (2024)
par: Zhou, Lexin, et autres
Publié: (2024)
EchoFoley: Event-Centric Hierarchical Control for Video Grounded Creative Sound Generation
par: Li, Bingxuan, et autres
Publié: (2025)
par: Li, Bingxuan, et autres
Publié: (2025)
Documents similaires
-
DiffLM: Controllable Synthetic Data Generation via Diffusion Language Models
par: Zhou, Ying, et autres
Publié: (2024) -
Where do Large Vision-Language Models Look at when Answering Questions?
par: Xing, Xiaoying, et autres
Publié: (2025) -
Referring Layer Decomposition
par: Chen, Fangyi, et autres
Publié: (2026) -
AIPO: Learning to Reason from Active Interaction
par: Liu, Junnan, et autres
Publié: (2026) -
Accurate and Fast Compressed Video Captioning
par: Shen, Yaojie, et autres
Publié: (2023)