HAF-RM: A Hybrid Alignment Framework for Reward Model Training
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Shujun, Shen, Xiaoyu, Lai, Yuhang, Wang, Siyuan, Yue, Shengbin, Huang, Zengfeng, Huang, Xuanjing, Wei, Zhongyu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ALaRM: Align Language Models via Hierarchical Rewards Modeling
por: Lai, Yuhang, et al.
Publicado: (2024)
por: Lai, Yuhang, et al.
Publicado: (2024)
Synergistic Multi-Agent Framework with Trajectory Learning for Knowledge-Intensive Tasks
por: Yue, Shengbin, et al.
Publicado: (2024)
por: Yue, Shengbin, et al.
Publicado: (2024)
Multi-Agent Simulator Drives Language Models for Legal Intensive Interaction
por: Yue, Shengbin, et al.
Publicado: (2025)
por: Yue, Shengbin, et al.
Publicado: (2025)
How Jailbreak Defenses Work and Ensemble? A Mechanistic Investigation
por: Long, Zhuohang, et al.
Publicado: (2025)
por: Long, Zhuohang, et al.
Publicado: (2025)
Benchmark Self-Evolving: A Multi-Agent Framework for Dynamic LLM Evaluation
por: Wang, Siyuan, et al.
Publicado: (2024)
por: Wang, Siyuan, et al.
Publicado: (2024)
LifeSim: Long-Horizon User Life Simulator for Personalized Assistant Evaluation
por: Duan, Feiyu, et al.
Publicado: (2026)
por: Duan, Feiyu, et al.
Publicado: (2026)
Unveiling the Truth and Facilitating Change: Towards Agent-based Large-scale Social Movement Simulation
por: Mou, Xinyi, et al.
Publicado: (2024)
por: Mou, Xinyi, et al.
Publicado: (2024)
CURP: Codebook-based Continuous User Representation for Personalized Generation with LLMs
por: Wang, Liang, et al.
Publicado: (2026)
por: Wang, Liang, et al.
Publicado: (2026)
RM-Distiller: Exploiting Generative LLM for Reward Model Distillation
por: Zhou, Hongli, et al.
Publicado: (2026)
por: Zhou, Hongli, et al.
Publicado: (2026)
EcoLANG: Efficient and Effective Agent Communication Language Induction for Social Simulation
por: Mou, Xinyi, et al.
Publicado: (2025)
por: Mou, Xinyi, et al.
Publicado: (2025)
RMB: Comprehensively Benchmarking Reward Models in LLM Alignment
por: Zhou, Enyu, et al.
Publicado: (2024)
por: Zhou, Enyu, et al.
Publicado: (2024)
MetaRM: Shifted Distributions Alignment via Meta-Learning
por: Dou, Shihan, et al.
Publicado: (2024)
por: Dou, Shihan, et al.
Publicado: (2024)
OViP: Online Vision-Language Preference Learning for VLM Hallucination
por: Liu, Shujun, et al.
Publicado: (2025)
por: Liu, Shujun, et al.
Publicado: (2025)
Debatrix: Multi-dimensional Debate Judge with Iterative Chronological Analysis Based on LLM
por: Liang, Jingcong, et al.
Publicado: (2024)
por: Liang, Jingcong, et al.
Publicado: (2024)
Prompt-Level Reward Specifications for Open-Ended Post-Training
por: Weng, Zijun, et al.
Publicado: (2026)
por: Weng, Zijun, et al.
Publicado: (2026)
ToolRM: Towards Agentic Tool-Use Reward Modeling
por: Li, Renhao, et al.
Publicado: (2025)
por: Li, Renhao, et al.
Publicado: (2025)
EmbSpatial-Bench: Benchmarking Spatial Understanding for Embodied Tasks with Large Vision-Language Models
por: Du, Mengfei, et al.
Publicado: (2024)
por: Du, Mengfei, et al.
Publicado: (2024)
SteerRM: Debiasing Reward Models via Sparse Autoencoders
por: Sun, Mengyuan, et al.
Publicado: (2026)
por: Sun, Mengyuan, et al.
Publicado: (2026)
ConsistRM: Improving Generative Reward Models via Consistency-Aware Self-Training
por: Liang, Yu, et al.
Publicado: (2026)
por: Liang, Yu, et al.
Publicado: (2026)
Dynamic and Generalizable Process Reward Modeling
por: Yin, Zhangyue, et al.
Publicado: (2025)
por: Yin, Zhangyue, et al.
Publicado: (2025)
RM-Bench: Benchmarking Reward Models of Language Models with Subtlety and Style
por: Liu, Yantao, et al.
Publicado: (2024)
por: Liu, Yantao, et al.
Publicado: (2024)
HyLaT: Efficient Multi-Agent Communication via Hybrid Latent-Text Protocol
por: Mou, Xinyi, et al.
Publicado: (2026)
por: Mou, Xinyi, et al.
Publicado: (2026)
RM-R1: Reward Modeling as Reasoning
por: Chen, Xiusi, et al.
Publicado: (2025)
por: Chen, Xiusi, et al.
Publicado: (2025)
DELAN: Dual-Level Alignment for Vision-and-Language Navigation by Cross-Modal Contrastive Learning
por: Du, Mengfei, et al.
Publicado: (2024)
por: Du, Mengfei, et al.
Publicado: (2024)
P-GenRM: Personalized Generative Reward Model with Test-time User-based Scaling
por: Zhang, Pinyi, et al.
Publicado: (2026)
por: Zhang, Pinyi, et al.
Publicado: (2026)
VoCoT: Unleashing Visually Grounded Multi-Step Reasoning in Large Multi-Modal Models
por: Li, Zejun, et al.
Publicado: (2024)
por: Li, Zejun, et al.
Publicado: (2024)
Symbolic Working Memory Enhances Language Models for Complex Rule Application
por: Wang, Siyuan, et al.
Publicado: (2024)
por: Wang, Siyuan, et al.
Publicado: (2024)
SimpleTool: Parallel Decoding for Real-Time LLM Function Calling
por: Shi, Xiaoxin, et al.
Publicado: (2026)
por: Shi, Xiaoxin, et al.
Publicado: (2026)
ReflectRM: Boosting Generative Reward Models via Self-Reflection within a Unified Judgment Framework
por: Qin, Kai, et al.
Publicado: (2026)
por: Qin, Kai, et al.
Publicado: (2026)
Proof-RM: A Scalable and Generalizable Reward Model for Math Proof
por: Yang, Haotong, et al.
Publicado: (2026)
por: Yang, Haotong, et al.
Publicado: (2026)
CauESC: A Causal Aware Model for Emotional Support Conversation
por: Chen, Wei, et al.
Publicado: (2024)
por: Chen, Wei, et al.
Publicado: (2024)
PIORS: Personalized Intelligent Outpatient Reception based on Large Language Model with Multi-Agents Medical Scenario Simulation
por: Bao, Zhijie, et al.
Publicado: (2024)
por: Bao, Zhijie, et al.
Publicado: (2024)
Hybrid Alignment Training for Large Language Models
por: Wang, Chenglong, et al.
Publicado: (2024)
por: Wang, Chenglong, et al.
Publicado: (2024)
LongRM: Revealing and Unlocking the Context Boundary of Reward Modeling
por: Tang, Zecheng, et al.
Publicado: (2025)
por: Tang, Zecheng, et al.
Publicado: (2025)
CommunityBench: Benchmarking Community-Level Alignment across Diverse Groups and Tasks
por: Lin, Jiayu, et al.
Publicado: (2026)
por: Lin, Jiayu, et al.
Publicado: (2026)
TTPA: Token-level Tool-use Preference Alignment Training Framework with Fine-grained Evaluation
por: Huang, Chengrui, et al.
Publicado: (2025)
por: Huang, Chengrui, et al.
Publicado: (2025)
AgentRM: Enhancing Agent Generalization with Reward Modeling
por: Xia, Yu, et al.
Publicado: (2025)
por: Xia, Yu, et al.
Publicado: (2025)
ToolRM: Outcome Reward Models for Tool-Calling Large Language Models
por: Agarwal, Mayank, et al.
Publicado: (2025)
por: Agarwal, Mayank, et al.
Publicado: (2025)
DogeRM: Equipping Reward Models with Domain Knowledge through Model Merging
por: Lin, Tzu-Han, et al.
Publicado: (2024)
por: Lin, Tzu-Han, et al.
Publicado: (2024)
ImplicitRM: Unbiased Reward Modeling from Implicit Preference Data for LLM alignment
por: Wang, Hao, et al.
Publicado: (2026)
por: Wang, Hao, et al.
Publicado: (2026)
Ejemplares similares
-
ALaRM: Align Language Models via Hierarchical Rewards Modeling
por: Lai, Yuhang, et al.
Publicado: (2024) -
Synergistic Multi-Agent Framework with Trajectory Learning for Knowledge-Intensive Tasks
por: Yue, Shengbin, et al.
Publicado: (2024) -
Multi-Agent Simulator Drives Language Models for Legal Intensive Interaction
por: Yue, Shengbin, et al.
Publicado: (2025) -
How Jailbreak Defenses Work and Ensemble? A Mechanistic Investigation
por: Long, Zhuohang, et al.
Publicado: (2025) -
Benchmark Self-Evolving: A Multi-Agent Framework for Dynamic LLM Evaluation
por: Wang, Siyuan, et al.
Publicado: (2024)