Online Self-Preferring Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Zhai, Yuanzhao, Zhang, Zhuo, Xu, Kele, Peng, Hanyang, Yu, Yue, Feng, Dawei, Yang, Cheng, Ding, Bo, Wang, Huaimin |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Uncertainty-Penalized Reinforcement Learning from Human Feedback with Diverse Reward LoRA Ensembles
by: Zhai, Yuanzhao, et al.
Published: (2023)
by: Zhai, Yuanzhao, et al.
Published: (2023)
Optimistic Model Rollouts for Pessimistic Offline Policy Optimization
by: Zhai, Yuanzhao, et al.
Published: (2024)
by: Zhai, Yuanzhao, et al.
Published: (2024)
Enhancing Decision-Making for LLM Agents via Step-Level Q-Value Models
by: Zhai, Yuanzhao, et al.
Published: (2024)
by: Zhai, Yuanzhao, et al.
Published: (2024)
Scaffold-Conditioned Preference Triplets for Controllable Molecular Optimization with Large Language Models
by: Xiong, Yi, et al.
Published: (2026)
by: Xiong, Yi, et al.
Published: (2026)
Correcting Large Language Model Behavior via Influence Function
by: Zhang, Han, et al.
Published: (2024)
by: Zhang, Han, et al.
Published: (2024)
COPR: Continual Learning Human Preference through Optimal Policy Regularization
by: Zhang, Han, et al.
Published: (2023)
by: Zhang, Han, et al.
Published: (2023)
MAny: Merge Anything for Multimodal Continual Instruction Tuning
by: Gao, Zijian, et al.
Published: (2026)
by: Gao, Zijian, et al.
Published: (2026)
Self-Exploring Language Models: Active Preference Elicitation for Online Alignment
by: Zhang, Shenao, et al.
Published: (2024)
by: Zhang, Shenao, et al.
Published: (2024)
Symphony-MoE: Harmonizing Disparate Pre-trained Models into a Coherent Mixture-of-Experts
by: Wang, Qi, et al.
Published: (2025)
by: Wang, Qi, et al.
Published: (2025)
COPR: Continual Human Preference Learning via Optimal Policy Regularization
by: Zhang, Han, et al.
Published: (2024)
by: Zhang, Han, et al.
Published: (2024)
Online Preference Alignment for Language Models via Count-based Exploration
by: Bai, Chenjia, et al.
Published: (2025)
by: Bai, Chenjia, et al.
Published: (2025)
Information Shapes Koopman Representation
by: Cheng, Xiaoyuan, et al.
Published: (2025)
by: Cheng, Xiaoyuan, et al.
Published: (2025)
RelPrism: A Multi-Faceted Pre-training Framework with Self-Generated Tasks for Relational Databases
by: Yang, Jinyu, et al.
Published: (2026)
by: Yang, Jinyu, et al.
Published: (2026)
Self-Play Preference Optimization for Language Model Alignment
by: Wu, Yue, et al.
Published: (2024)
by: Wu, Yue, et al.
Published: (2024)
Online Irregular Multivariate Time Series Forecasting via Uncertainty-Driven Dual-Expert Calibration
by: Wen, Haonan, et al.
Published: (2026)
by: Wen, Haonan, et al.
Published: (2026)
AutoFeedback: An LLM-based Framework for Efficient and Accurate API Request Generation
by: Liu, Huanxi, et al.
Published: (2024)
by: Liu, Huanxi, et al.
Published: (2024)
Online Preference-based Reinforcement Learning with Self-augmented Feedback from Large Language Model
by: Tu, Songjun, et al.
Published: (2024)
by: Tu, Songjun, et al.
Published: (2024)
Bayesian Optimization with Preference Exploration using a Monotonic Neural Network Ensemble
by: Wang, Hanyang, et al.
Published: (2025)
by: Wang, Hanyang, et al.
Published: (2025)
Semantically-Guided Inference for Conditional Diffusion Models: Enhancing Covariate Consistency in Time Series Forecasting
by: Ding, Rui, et al.
Published: (2025)
by: Ding, Rui, et al.
Published: (2025)
Context parroting: A simple but tough-to-beat baseline for foundation models in scientific machine learning
by: Zhang, Yuanzhao, et al.
Published: (2025)
by: Zhang, Yuanzhao, et al.
Published: (2025)
Zero-shot forecasting of chaotic systems
by: Zhang, Yuanzhao, et al.
Published: (2024)
by: Zhang, Yuanzhao, et al.
Published: (2024)
Fast Track to Winning Tickets: Repowering One-Shot Pruning for Graph Neural Networks
by: Yue, Yanwei, et al.
Published: (2024)
by: Yue, Yanwei, et al.
Published: (2024)
IntAttention: A Fully Integer Attention Pipeline for Efficient Edge Inference
by: Zhong, Wanli, et al.
Published: (2025)
by: Zhong, Wanli, et al.
Published: (2025)
Self-Improvement Towards Pareto Optimality: Mitigating Preference Conflicts in Multi-Objective Alignment
by: Li, Moxin, et al.
Published: (2025)
by: Li, Moxin, et al.
Published: (2025)
Dynamical system prediction from sparse observations using deep neural networks with Voronoi tessellation and physics constraint
by: Wang, Hanyang, et al.
Published: (2024)
by: Wang, Hanyang, et al.
Published: (2024)
SilentStriker:Toward Stealthy Bit-Flip Attacks on Large Language Models
by: Xu, Haotian, et al.
Published: (2025)
by: Xu, Haotian, et al.
Published: (2025)
What Is Preference Optimization Doing, and Why?
by: Wang, Yue, et al.
Published: (2025)
by: Wang, Yue, et al.
Published: (2025)
Towards Understanding Valuable Preference Data for Large Language Model Alignment
by: Zhang, Zizhuo, et al.
Published: (2025)
by: Zhang, Zizhuo, et al.
Published: (2025)
Beyond Bradley-Terry Models: A General Preference Model for Language Model Alignment
by: Zhang, Yifan, et al.
Published: (2024)
by: Zhang, Yifan, et al.
Published: (2024)
RPO: Fine-Tuning Visual Generative Models via Rich Vision-Language Preferences
by: Zhao, Hanyang, et al.
Published: (2025)
by: Zhao, Hanyang, et al.
Published: (2025)
Contractive Diffusion Probabilistic Models
by: Tang, Wenpin, et al.
Published: (2024)
by: Tang, Wenpin, et al.
Published: (2024)
SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam
by: Peng, Hanyang, et al.
Published: (2025)
by: Peng, Hanyang, et al.
Published: (2025)
SecP-Tuning: Efficient Privacy-Preserving Prompt Tuning for Large Language Models via MPC
by: Luo, Jinglong, et al.
Published: (2025)
by: Luo, Jinglong, et al.
Published: (2025)
Hypergraph Self-supervised Learning with Sampling-efficient Signals
by: Li, Fan, et al.
Published: (2024)
by: Li, Fan, et al.
Published: (2024)
PCDVQ: Enhancing Vector Quantization for Large Language Models via Polar Coordinate Decoupling
by: Yue, Yuxuan, et al.
Published: (2025)
by: Yue, Yuxuan, et al.
Published: (2025)
Spatio-Temporal Conformal Prediction for Power Outage Data
by: Jiang, Hanyang, et al.
Published: (2024)
by: Jiang, Hanyang, et al.
Published: (2024)
The Limits of Differential Privacy in Online Learning
by: Li, Bo, et al.
Published: (2024)
by: Li, Bo, et al.
Published: (2024)
Human Alignment of Large Language Models through Online Preference Optimisation
by: Calandriello, Daniele, et al.
Published: (2024)
by: Calandriello, Daniele, et al.
Published: (2024)
SAIL: Self-Improving Efficient Online Alignment of Large Language Models
by: Ding, Mucong, et al.
Published: (2024)
by: Ding, Mucong, et al.
Published: (2024)
ROPO: Robust Preference Optimization for Large Language Models
by: Liang, Xize, et al.
Published: (2024)
by: Liang, Xize, et al.
Published: (2024)
Similar Items
-
Uncertainty-Penalized Reinforcement Learning from Human Feedback with Diverse Reward LoRA Ensembles
by: Zhai, Yuanzhao, et al.
Published: (2023) -
Optimistic Model Rollouts for Pessimistic Offline Policy Optimization
by: Zhai, Yuanzhao, et al.
Published: (2024) -
Enhancing Decision-Making for LLM Agents via Step-Level Q-Value Models
by: Zhai, Yuanzhao, et al.
Published: (2024) -
Scaffold-Conditioned Preference Triplets for Controllable Molecular Optimization with Large Language Models
by: Xiong, Yi, et al.
Published: (2026) -
Correcting Large Language Model Behavior via Influence Function
by: Zhang, Han, et al.
Published: (2024)