SPOGW: a Score-based Preference Optimization method via Group-Wise comparison for workflows
Fuente:
arXiv
Salvato in:
| Autori principali: | Cui, Yitong, Liu, Liu, Yu, Baosheng, Qiu, Jiayan, Zhang, Xikai, Xiao, Likang, Liu, Yixing, Chen, Quan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Recycling Failures: Salvaging Exploration in RLVR via Fine-Grained Off-Policy Guidance
di: Ren, Yanwei, et al.
Pubblicazione: (2026)
di: Ren, Yanwei, et al.
Pubblicazione: (2026)
ContextPRM: Leveraging Contextual Coherence for multi-domain Test-Time Scaling
di: Zhang, Haotian, et al.
Pubblicazione: (2025)
di: Zhang, Haotian, et al.
Pubblicazione: (2025)
Instruction Learning Paradigms: A Dual Perspective on White-box and Black-box LLMs
di: Ren, Yanwei, et al.
Pubblicazione: (2025)
di: Ren, Yanwei, et al.
Pubblicazione: (2025)
IMAGINE: Integrating Multi-Agent System into One Model for Complex Reasoning and Planning
di: Zhang, Xikai, et al.
Pubblicazione: (2025)
di: Zhang, Xikai, et al.
Pubblicazione: (2025)
Re-Initialization Token Learning for Tool-Augmented Large Language Models
di: Li, Chenghao, et al.
Pubblicazione: (2025)
di: Li, Chenghao, et al.
Pubblicazione: (2025)
Remodeling Semantic Relationships in Vision-Language Fine-Tuning
di: Wu, Xiangyang, et al.
Pubblicazione: (2025)
di: Wu, Xiangyang, et al.
Pubblicazione: (2025)
LARGO: Low-Rank Regulated Gradient Projection for Robust Parameter Efficient Fine-Tuning
di: Zhang, Haotian, et al.
Pubblicazione: (2025)
di: Zhang, Haotian, et al.
Pubblicazione: (2025)
IVR-R1: Refining Trajectories through Iterative Visual-Grounded Reasoning in Reinforcement Learning
di: Li, Chenghao, et al.
Pubblicazione: (2026)
di: Li, Chenghao, et al.
Pubblicazione: (2026)
SIGMA: Refining Large Language Model Reasoning via Sibling-Guided Monte Carlo Augmentation
di: Ren, Yanwei, et al.
Pubblicazione: (2025)
di: Ren, Yanwei, et al.
Pubblicazione: (2025)
FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning
di: Zhang, Xikai, et al.
Pubblicazione: (2026)
di: Zhang, Xikai, et al.
Pubblicazione: (2026)
Towards Self-Improvement of Diffusion Models via Group Preference Optimization
di: Chen, Renjie, et al.
Pubblicazione: (2025)
di: Chen, Renjie, et al.
Pubblicazione: (2025)
FocalPO: Enhancing Preference Optimizing by Focusing on Correct Preference Rankings
di: Liu, Tong, et al.
Pubblicazione: (2025)
di: Liu, Tong, et al.
Pubblicazione: (2025)
Adaptive Batch-Wise Sample Scheduling for Direct Preference Optimization
di: Huang, Zixuan, et al.
Pubblicazione: (2025)
di: Huang, Zixuan, et al.
Pubblicazione: (2025)
Radiology Report Generation via Multi-objective Preference Optimization
di: Xiao, Ting, et al.
Pubblicazione: (2024)
di: Xiao, Ting, et al.
Pubblicazione: (2024)
Aligning CodeLLMs with Direct Preference Optimization
di: Miao, Yibo, et al.
Pubblicazione: (2024)
di: Miao, Yibo, et al.
Pubblicazione: (2024)
VAGPO: Vision-augmented Asymmetric Group Preference Optimization for Graph Routing Problems
di: Liu, Shiyan, et al.
Pubblicazione: (2025)
di: Liu, Shiyan, et al.
Pubblicazione: (2025)
Mitigating Mismatch within Reference-based Preference Optimization
di: Yuan, Suqin, et al.
Pubblicazione: (2026)
di: Yuan, Suqin, et al.
Pubblicazione: (2026)
FlipGuard: Defending Preference Alignment against Update Regression with Constrained Optimization
di: Zhu, Mingye, et al.
Pubblicazione: (2024)
di: Zhu, Mingye, et al.
Pubblicazione: (2024)
Hindsight Preference Learning for Offline Preference-based Reinforcement Learning
di: Gao, Chen-Xiao, et al.
Pubblicazione: (2024)
di: Gao, Chen-Xiao, et al.
Pubblicazione: (2024)
Preference Elicitation for Step-Wise Explanations in Logic Puzzles
di: Foschini, Marco, et al.
Pubblicazione: (2025)
di: Foschini, Marco, et al.
Pubblicazione: (2025)
Road Traffic Sign Recognition method using Siamese network Combining Efficient-CNN based Encoder
di: Xi, Zhenghao, et al.
Pubblicazione: (2025)
di: Xi, Zhenghao, et al.
Pubblicazione: (2025)
CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation
di: Cui, Guofeng, et al.
Pubblicazione: (2025)
di: Cui, Guofeng, et al.
Pubblicazione: (2025)
Generative Retrieval with Preference Optimization for E-commerce Search
di: Li, Mingming, et al.
Pubblicazione: (2024)
di: Li, Mingming, et al.
Pubblicazione: (2024)
MetaGDPO: Alleviating Catastrophic Forgetting with Metacognitive Knowledge through Group Direct Preference Optimization
di: Zhang, Lanxue, et al.
Pubblicazione: (2025)
di: Zhang, Lanxue, et al.
Pubblicazione: (2025)
POPI: Personalizing LLMs via Optimized Natural Language Preference Inference
di: Chen, Yizhuo, et al.
Pubblicazione: (2025)
di: Chen, Yizhuo, et al.
Pubblicazione: (2025)
Bridging the Last Mile of Prediction: Enhancing Time Series Forecasting with Conditional Guided Flow Matching
di: Xu, Huibo, et al.
Pubblicazione: (2025)
di: Xu, Huibo, et al.
Pubblicazione: (2025)
Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator
di: Chen, Zhuotong, et al.
Pubblicazione: (2025)
di: Chen, Zhuotong, et al.
Pubblicazione: (2025)
ICPO: Intrinsic Confidence-Driven Group Relative Preference Optimization for Efficient Reinforcement Learning
di: Wang, Jinpeng, et al.
Pubblicazione: (2025)
di: Wang, Jinpeng, et al.
Pubblicazione: (2025)
Controllable Protein Sequence Generation with LLM Preference Optimization
di: Liu, Xiangyu, et al.
Pubblicazione: (2025)
di: Liu, Xiangyu, et al.
Pubblicazione: (2025)
Token-Importance Guided Direct Preference Optimization
di: Yang, Ning, et al.
Pubblicazione: (2025)
di: Yang, Ning, et al.
Pubblicazione: (2025)
Unlearning of Knowledge Graph Embedding via Preference Optimization
di: Liu, Jiajun, et al.
Pubblicazione: (2025)
di: Liu, Jiajun, et al.
Pubblicazione: (2025)
One Size, Many Fits: Aligning Diverse Group-Wise Click Preferences in Large-Scale Advertising Image Generation
di: Lu, Shuo, et al.
Pubblicazione: (2026)
di: Lu, Shuo, et al.
Pubblicazione: (2026)
AdPO: Enhancing the Adversarial Robustness of Large Vision-Language Models with Preference Optimization
di: Liu, Chaohu, et al.
Pubblicazione: (2025)
di: Liu, Chaohu, et al.
Pubblicazione: (2025)
Contrastive Learning with Edge‐Wise Augmentation for Rumor Detection
di: Nan Liu, et al.
Pubblicazione: (2024)
di: Nan Liu, et al.
Pubblicazione: (2024)
PROF: An LLM-based Reward Code Preference Optimization Framework for Offline Imitation Learning
di: Sun, Shengjie, et al.
Pubblicazione: (2025)
di: Sun, Shengjie, et al.
Pubblicazione: (2025)
Hindsight Preference Optimization for Financial Time Series Advisory
di: Cui, Yanwei, et al.
Pubblicazione: (2026)
di: Cui, Yanwei, et al.
Pubblicazione: (2026)
How to Alleviate Catastrophic Forgetting in LLMs Finetuning? Hierarchical Layer-Wise and Element-Wise Regularization
di: Song, Shezheng, et al.
Pubblicazione: (2025)
di: Song, Shezheng, et al.
Pubblicazione: (2025)
Research on an intelligent fault diagnosis method for nuclear power plants based on ETCN-SSA combined algorithm
di: Fang, Jiayan, et al.
Pubblicazione: (2024)
di: Fang, Jiayan, et al.
Pubblicazione: (2024)
On the Role of Preference Variance in Preference Optimization
di: Guo, Jiacheng, et al.
Pubblicazione: (2025)
di: Guo, Jiacheng, et al.
Pubblicazione: (2025)
Improving Safety Alignment via Balanced Direct Preference Optimization
di: Zhao, Shiji, et al.
Pubblicazione: (2026)
di: Zhao, Shiji, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Recycling Failures: Salvaging Exploration in RLVR via Fine-Grained Off-Policy Guidance
di: Ren, Yanwei, et al.
Pubblicazione: (2026) -
ContextPRM: Leveraging Contextual Coherence for multi-domain Test-Time Scaling
di: Zhang, Haotian, et al.
Pubblicazione: (2025) -
Instruction Learning Paradigms: A Dual Perspective on White-box and Black-box LLMs
di: Ren, Yanwei, et al.
Pubblicazione: (2025) -
IMAGINE: Integrating Multi-Agent System into One Model for Complex Reasoning and Planning
di: Zhang, Xikai, et al.
Pubblicazione: (2025) -
Re-Initialization Token Learning for Tool-Augmented Large Language Models
di: Li, Chenghao, et al.
Pubblicazione: (2025)