GEM: Generative Entropy-Guided Preference Modeling for Few-shot Alignment of LLMs
Fuente:
arXiv
Saved in:
| Main Authors: | Zhao, Yiyang, Bai, Huiyu, Zhao, Xuejiao |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
GFRIEND: Generative Few-shot Reward Inference through EfficieNt DPO
by: Zhao, Yiyang, et al.
Published: (2025)
by: Zhao, Yiyang, et al.
Published: (2025)
ICPL: Few-shot In-context Preference Learning via LLMs
by: Yu, Chao, et al.
Published: (2024)
by: Yu, Chao, et al.
Published: (2024)
Group Preference Optimization: Few-Shot Alignment of Large Language Models
by: Zhao, Siyan, et al.
Published: (2023)
by: Zhao, Siyan, et al.
Published: (2023)
Meta-Aligner: Bidirectional Preference-Policy Optimization for Multi-Objective LLMs Alignment
by: Xu, Wenzhe, et al.
Published: (2026)
by: Xu, Wenzhe, et al.
Published: (2026)
APPA: Adaptive Preference Pluralistic Alignment for Fair Federated RLHF of LLMs
by: Srewa, Mahmoud, et al.
Published: (2026)
by: Srewa, Mahmoud, et al.
Published: (2026)
Reflective Preference Optimization (RPO): Enhancing On-Policy Alignment via Hint-Guided Reflection
by: Zhao, Zihui, et al.
Published: (2025)
by: Zhao, Zihui, et al.
Published: (2025)
LAMPO: Large Language Models as Preference Machines for Few-shot Ordinal Classification
by: Qin, Zhen, et al.
Published: (2024)
by: Qin, Zhen, et al.
Published: (2024)
Few-shot Steerable Alignment: Adapting Rewards and LLM Policies with Neural Processes
by: Kobalczyk, Katarzyna, et al.
Published: (2024)
by: Kobalczyk, Katarzyna, et al.
Published: (2024)
EARL: Entropy-Aware RL Alignment of LLMs for Reliable RTL Code Generation
by: Shi, Jiahe, et al.
Published: (2025)
by: Shi, Jiahe, et al.
Published: (2025)
Few-shot Personalization of LLMs with Mis-aligned Responses
by: Kim, Jaehyung, et al.
Published: (2024)
by: Kim, Jaehyung, et al.
Published: (2024)
Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards
by: Wang, Haoxiang, et al.
Published: (2024)
by: Wang, Haoxiang, et al.
Published: (2024)
HEALing Entropy Collapse: Enhancing Exploration in Few-Shot RLVR via Hybrid-Domain Entropy Dynamics Alignment
by: Liu, Zhanyu, et al.
Published: (2026)
by: Liu, Zhanyu, et al.
Published: (2026)
GEM: A Gym for Agentic LLMs
by: Liu, Zichen, et al.
Published: (2025)
by: Liu, Zichen, et al.
Published: (2025)
Reward-Augmented Data Enhances Direct Preference Alignment of LLMs
by: Zhang, Shenao, et al.
Published: (2024)
by: Zhang, Shenao, et al.
Published: (2024)
Sample Efficient Preference Alignment in LLMs via Active Exploration
by: Mehta, Viraj, et al.
Published: (2023)
by: Mehta, Viraj, et al.
Published: (2023)
Are Heterogeneous Graph Neural Networks Truly Effective? A Causal Perspective
by: Yang, Xiao, et al.
Published: (2025)
by: Yang, Xiao, et al.
Published: (2025)
A Generalizable Anomaly Detection Method in Dynamic Graphs
by: Yang, Xiao, et al.
Published: (2024)
by: Yang, Xiao, et al.
Published: (2024)
Neural Force Field: Few-shot Learning of Generalized Physical Reasoning
by: Li, Shiqian, et al.
Published: (2025)
by: Li, Shiqian, et al.
Published: (2025)
Revisiting Chain-of-Thought Prompting: Zero-shot Can Be Stronger than Few-shot
by: Cheng, Xiang, et al.
Published: (2025)
by: Cheng, Xiang, et al.
Published: (2025)
Large Language Models are Few-shot Multivariate Time Series Classifiers
by: Chen, Yakun, et al.
Published: (2025)
by: Chen, Yakun, et al.
Published: (2025)
Entropy-Guided Dynamic Tokens for Graph-LLM Alignment in Molecular Understanding
by: Jing, Zihao, et al.
Published: (2026)
by: Jing, Zihao, et al.
Published: (2026)
GEM-T: Generative Tabular Data via Fitting Moments
by: Li, Miao, et al.
Published: (2025)
by: Li, Miao, et al.
Published: (2025)
DARA: Few-shot Budget Allocation in Online Advertising via In-Context Decision Making with RL-Finetuned LLMs
by: Song, Mingxuan, et al.
Published: (2026)
by: Song, Mingxuan, et al.
Published: (2026)
Preference-Based Alignment of Discrete Diffusion Models
by: Borso, Umberto, et al.
Published: (2025)
by: Borso, Umberto, et al.
Published: (2025)
AnomalyGFM: Graph Foundation Model for Zero/Few-shot Anomaly Detection
by: Qiao, Hezhe, et al.
Published: (2025)
by: Qiao, Hezhe, et al.
Published: (2025)
Episodic-free Task Selection for Few-shot Learning
by: Zhang, Tao
Published: (2024)
by: Zhang, Tao
Published: (2024)
How to Guide Your Flow: Few-Step Alignment via Flow Map Reward Guidance
by: Huang, Jerry Y., et al.
Published: (2026)
by: Huang, Jerry Y., et al.
Published: (2026)
Inference-Time Alignment in Diffusion Models with Reward-Guided Generation: Tutorial and Review
by: Uehara, Masatoshi, et al.
Published: (2025)
by: Uehara, Masatoshi, et al.
Published: (2025)
Generalized Preference Optimization: A Unified Approach to Offline Alignment
by: Tang, Yunhao, et al.
Published: (2024)
by: Tang, Yunhao, et al.
Published: (2024)
Towards Few-shot Self-explaining Graph Neural Networks
by: Peng, Jingyu, et al.
Published: (2024)
by: Peng, Jingyu, et al.
Published: (2024)
Few-shot Cross-country Generalization of Tabular Machine Learning and Foundation Models for Childhood Anemia Prediction under Distribution Shift
by: Brima, Yusuf, et al.
Published: (2026)
by: Brima, Yusuf, et al.
Published: (2026)
Direct Alignment with Heterogeneous Preferences
by: Shirali, Ali, et al.
Published: (2025)
by: Shirali, Ali, et al.
Published: (2025)
Synthesizing Attitudes, Predicting Actions (SAPA): Behavioral Theory-Guided LLMs for Ridesourcing Mode Choice Modeling
by: Sameen, Mustafa, et al.
Published: (2025)
by: Sameen, Mustafa, et al.
Published: (2025)
See it, Think it, Sorted: Large Multimodal Models are Few-shot Time Series Anomaly Analyzers
by: Zhuang, Jiaxin, et al.
Published: (2024)
by: Zhuang, Jiaxin, et al.
Published: (2024)
FaultDiffusion: Few-Shot Fault Time Series Generation with Diffusion Model
by: Xu, Yi, et al.
Published: (2025)
by: Xu, Yi, et al.
Published: (2025)
Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning
by: Diwan, Nirav, et al.
Published: (2025)
by: Diwan, Nirav, et al.
Published: (2025)
Dynamic User-controllable Privacy-preserving Few-shot Sensing Framework
by: Chathoth, Ajesh Koyatan, et al.
Published: (2025)
by: Chathoth, Ajesh Koyatan, et al.
Published: (2025)
TransNet: Transfer Knowledge for Few-shot Knowledge Graph Completion
by: Liu, Lihui, et al.
Published: (2025)
by: Liu, Lihui, et al.
Published: (2025)
Training-free LLM Verification via Recycling Few-shot Examples
by: Lee, Dongseok, et al.
Published: (2025)
by: Lee, Dongseok, et al.
Published: (2025)
Improving Graph Few-shot Learning with Hyperbolic Space and Denoising Diffusion
by: Liu, Yonghao, et al.
Published: (2026)
by: Liu, Yonghao, et al.
Published: (2026)
Similar Items
-
GFRIEND: Generative Few-shot Reward Inference through EfficieNt DPO
by: Zhao, Yiyang, et al.
Published: (2025) -
ICPL: Few-shot In-context Preference Learning via LLMs
by: Yu, Chao, et al.
Published: (2024) -
Group Preference Optimization: Few-Shot Alignment of Large Language Models
by: Zhao, Siyan, et al.
Published: (2023) -
Meta-Aligner: Bidirectional Preference-Policy Optimization for Multi-Objective LLMs Alignment
by: Xu, Wenzhe, et al.
Published: (2026) -
APPA: Adaptive Preference Pluralistic Alignment for Fair Federated RLHF of LLMs
by: Srewa, Mahmoud, et al.
Published: (2026)