GFRIEND: Generative Few-shot Reward Inference through EfficieNt DPO
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhao, Yiyang, Bai, Huiyu, Zhao, Xuejiao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GEM: Generative Entropy-Guided Preference Modeling for Few-shot Alignment of LLMs
par: Zhao, Yiyang, et autres
Publié: (2025)
par: Zhao, Yiyang, et autres
Publié: (2025)
SENDAI: A Hierarchical Sparse-measurement, EfficieNt Data AssImilation Framework
par: Zhang, Xingyue, et autres
Publié: (2026)
par: Zhang, Xingyue, et autres
Publié: (2026)
Few-shot Steerable Alignment: Adapting Rewards and LLM Policies with Neural Processes
par: Kobalczyk, Katarzyna, et autres
Publié: (2024)
par: Kobalczyk, Katarzyna, et autres
Publié: (2024)
FASTEN: Towards a FAult-tolerant and STorage EfficieNt Cloud: Balancing Between Replication and Deduplication
par: Ahmed, Sabbir, et autres
Publié: (2023)
par: Ahmed, Sabbir, et autres
Publié: (2023)
$ξ$-DPO: Direct Preference Optimization via Ratio Reward Margin
par: Fan, Zhengyuan, et autres
Publié: (2026)
par: Fan, Zhengyuan, et autres
Publié: (2026)
Margin Adaptive DPO: Leveraging Reward Model for Granular Control in Preference Optimization
par: Rho, Hyung Gyu
Publié: (2025)
par: Rho, Hyung Gyu
Publié: (2025)
AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization
par: Wu, Junkang, et autres
Publié: (2024)
par: Wu, Junkang, et autres
Publié: (2024)
Chem-FINESE: Validating Fine-Grained Few-shot Entity Extraction through Text Reconstruction
par: Wang, Qingyun, et autres
Publié: (2024)
par: Wang, Qingyun, et autres
Publié: (2024)
Are Heterogeneous Graph Neural Networks Truly Effective? A Causal Perspective
par: Yang, Xiao, et autres
Publié: (2025)
par: Yang, Xiao, et autres
Publié: (2025)
A Generalizable Anomaly Detection Method in Dynamic Graphs
par: Yang, Xiao, et autres
Publié: (2024)
par: Yang, Xiao, et autres
Publié: (2024)
Neural Force Field: Few-shot Learning of Generalized Physical Reasoning
par: Li, Shiqian, et autres
Publié: (2025)
par: Li, Shiqian, et autres
Publié: (2025)
Revisiting Chain-of-Thought Prompting: Zero-shot Can Be Stronger than Few-shot
par: Cheng, Xiang, et autres
Publié: (2025)
par: Cheng, Xiang, et autres
Publié: (2025)
Difficulty-Based Preference Data Selection by DPO Implicit Reward Gap
par: Qi, Xuan, et autres
Publié: (2025)
par: Qi, Xuan, et autres
Publié: (2025)
Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections
par: Wang, Bo, et autres
Publié: (2025)
par: Wang, Bo, et autres
Publié: (2025)
SP^2DPO: An LLM-assisted Semantic Per-Pair DPO Generalization
par: He, Chaoyue, et autres
Publié: (2026)
par: He, Chaoyue, et autres
Publié: (2026)
Episodic-free Task Selection for Few-shot Learning
par: Zhang, Tao
Publié: (2024)
par: Zhang, Tao
Publié: (2024)
What Matters in Data for DPO?
par: Pan, Yu, et autres
Publié: (2025)
par: Pan, Yu, et autres
Publié: (2025)
Inference-Time Alignment in Diffusion Models with Reward-Guided Generation: Tutorial and Review
par: Uehara, Masatoshi, et autres
Publié: (2025)
par: Uehara, Masatoshi, et autres
Publié: (2025)
ICPL: Few-shot In-context Preference Learning via LLMs
par: Yu, Chao, et autres
Publié: (2024)
par: Yu, Chao, et autres
Publié: (2024)
Towards Few-shot Self-explaining Graph Neural Networks
par: Peng, Jingyu, et autres
Publié: (2024)
par: Peng, Jingyu, et autres
Publié: (2024)
Transductive Reward Inference on Graph
par: Qu, Bohao, et autres
Publié: (2024)
par: Qu, Bohao, et autres
Publié: (2024)
Auxiliary Reward Generation with Transition Distance Representation Learning
par: Li, Siyuan, et autres
Publié: (2024)
par: Li, Siyuan, et autres
Publié: (2024)
daDPO: Distribution-Aware DPO for Distilling Conversational Abilities
par: Zhang, Zhengze, et autres
Publié: (2025)
par: Zhang, Zhengze, et autres
Publié: (2025)
Large Language Models are Few-shot Multivariate Time Series Classifiers
par: Chen, Yakun, et autres
Publié: (2025)
par: Chen, Yakun, et autres
Publié: (2025)
Dynamic User-controllable Privacy-preserving Few-shot Sensing Framework
par: Chathoth, Ajesh Koyatan, et autres
Publié: (2025)
par: Chathoth, Ajesh Koyatan, et autres
Publié: (2025)
TransNet: Transfer Knowledge for Few-shot Knowledge Graph Completion
par: Liu, Lihui, et autres
Publié: (2025)
par: Liu, Lihui, et autres
Publié: (2025)
Training-free LLM Verification via Recycling Few-shot Examples
par: Lee, Dongseok, et autres
Publié: (2025)
par: Lee, Dongseok, et autres
Publié: (2025)
Improving Graph Few-shot Learning with Hyperbolic Space and Denoising Diffusion
par: Liu, Yonghao, et autres
Publié: (2026)
par: Liu, Yonghao, et autres
Publié: (2026)
Aligning Few-Step Generative Models by Amortizing Sample-based Variational Inference
par: Lee, Jaewoo, et autres
Publié: (2026)
par: Lee, Jaewoo, et autres
Publié: (2026)
Multi-Objective Neural Architecture Search by Learning Search Space Partitions
par: Zhao, Yiyang, et autres
Publié: (2024)
par: Zhao, Yiyang, et autres
Publié: (2024)
DPO Meets PPO: Reinforced Token Optimization for RLHF
par: Zhong, Han, et autres
Publié: (2024)
par: Zhong, Han, et autres
Publié: (2024)
AnomalyGFM: Graph Foundation Model for Zero/Few-shot Anomaly Detection
par: Qiao, Hezhe, et autres
Publié: (2025)
par: Qiao, Hezhe, et autres
Publié: (2025)
Few-shot Class-incremental Learning for Classification and Object Detection: A Survey
par: Zhang, Jinghua, et autres
Publié: (2023)
par: Zhang, Jinghua, et autres
Publié: (2023)
Frequency Enhanced Pre-training for Cross-city Few-shot Traffic Forecasting
par: Liu, Zhanyu, et autres
Publié: (2024)
par: Liu, Zhanyu, et autres
Publié: (2024)
Mix- and MoE-DPO: A Variational Inference Approach to Direct Preference Optimization
par: Bohne, Jason, et autres
Publié: (2025)
par: Bohne, Jason, et autres
Publié: (2025)
Few-shot Quality-Diversity Optimization
par: Salehi, Achkan, et autres
Publié: (2021)
par: Salehi, Achkan, et autres
Publié: (2021)
An Enhanced Privacy-preserving Federated Few-shot Learning Framework for Respiratory Disease Diagnosis
par: Wang, Ming, et autres
Publié: (2025)
par: Wang, Ming, et autres
Publié: (2025)
Self-cross Feature based Spiking Neural Networks for Efficient Few-shot Learning
par: Xu, Qi, et autres
Publié: (2025)
par: Xu, Qi, et autres
Publié: (2025)
Prompt Tuning with Diffusion for Few-Shot Pre-trained Policy Generalization
par: Hu, Shengchao, et autres
Publié: (2024)
par: Hu, Shengchao, et autres
Publié: (2024)
Few-shot Cross-country Generalization of Tabular Machine Learning and Foundation Models for Childhood Anemia Prediction under Distribution Shift
par: Brima, Yusuf, et autres
Publié: (2026)
par: Brima, Yusuf, et autres
Publié: (2026)
Documents similaires
-
GEM: Generative Entropy-Guided Preference Modeling for Few-shot Alignment of LLMs
par: Zhao, Yiyang, et autres
Publié: (2025) -
SENDAI: A Hierarchical Sparse-measurement, EfficieNt Data AssImilation Framework
par: Zhang, Xingyue, et autres
Publié: (2026) -
Few-shot Steerable Alignment: Adapting Rewards and LLM Policies with Neural Processes
par: Kobalczyk, Katarzyna, et autres
Publié: (2024) -
FASTEN: Towards a FAult-tolerant and STorage EfficieNt Cloud: Balancing Between Replication and Deduplication
par: Ahmed, Sabbir, et autres
Publié: (2023) -
$ξ$-DPO: Direct Preference Optimization via Ratio Reward Margin
par: Fan, Zhengyuan, et autres
Publié: (2026)