WildReward: Learning Reward Models from In-the-Wild Human Interactions
Fuente:
arXiv
Guardado en:
| Autores principales: | Peng, Hao, Qi, Yunjia, Wang, Xiaozhi, Yao, Zijun, Hou, Lei, Li, Juanzi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Agentic Reward Modeling: Integrating Human Preferences with Verifiable Correctness Signals for Reliable Reward Systems
por: Peng, Hao, et al.
Publicado: (2025)
por: Peng, Hao, et al.
Publicado: (2025)
StoryAlign: Evaluating and Training Reward Models for Story Generation
por: Xia, Haotian, et al.
Publicado: (2026)
por: Xia, Haotian, et al.
Publicado: (2026)
VerIF: Verification Engineering for Reinforcement Learning in Instruction Following
por: Peng, Hao, et al.
Publicado: (2025)
por: Peng, Hao, et al.
Publicado: (2025)
Constraint Back-translation Improves Complex Instruction Following of Large Language Models
por: Qi, Yunjia, et al.
Publicado: (2024)
por: Qi, Yunjia, et al.
Publicado: (2024)
StoryWriter: A Multi-Agent Framework for Long Story Generation
por: Xia, Haotian, et al.
Publicado: (2025)
por: Xia, Haotian, et al.
Publicado: (2025)
Auxiliary Metrics Help Decoding Skill Neurons in the Wild
por: Zhao, Yixiu, et al.
Publicado: (2025)
por: Zhao, Yixiu, et al.
Publicado: (2025)
AGENTIF: Benchmarking Instruction Following of Large Language Models in Agentic Scenarios
por: Qi, Yunjia, et al.
Publicado: (2025)
por: Qi, Yunjia, et al.
Publicado: (2025)
Towards Understanding Safety Alignment: A Mechanistic Perspective from Safety Neurons
por: Chen, Jianhui, et al.
Publicado: (2024)
por: Chen, Jianhui, et al.
Publicado: (2024)
Guiding LLM Post-training Data Engineering with Model Internals from Sparse Autoencoders
por: Jing, Yi, et al.
Publicado: (2026)
por: Jing, Yi, et al.
Publicado: (2026)
Pre-training Distillation for Large Language Models: A Design Space Exploration
por: Peng, Hao, et al.
Publicado: (2024)
por: Peng, Hao, et al.
Publicado: (2024)
ADELIE: Aligning Large Language Models on Information Extraction
por: Qi, Yunjia, et al.
Publicado: (2024)
por: Qi, Yunjia, et al.
Publicado: (2024)
Rewarding Creativity: A Human-Aligned Generative Reward Model for Reinforcement Learning in Storytelling
por: Li, Zhaoyan, et al.
Publicado: (2026)
por: Li, Zhaoyan, et al.
Publicado: (2026)
Event-level Knowledge Editing
por: Peng, Hao, et al.
Publicado: (2024)
por: Peng, Hao, et al.
Publicado: (2024)
ChatLog: Carefully Evaluating the Evolution of ChatGPT Across Time
por: Tu, Shangqing, et al.
Publicado: (2023)
por: Tu, Shangqing, et al.
Publicado: (2023)
MRCEval: A Comprehensive, Challenging and Accessible Machine Reading Comprehension Benchmark
por: Ma, Shengkun, et al.
Publicado: (2025)
por: Ma, Shengkun, et al.
Publicado: (2025)
RM-Bench: Benchmarking Reward Models of Language Models with Subtlety and Style
por: Liu, Yantao, et al.
Publicado: (2024)
por: Liu, Yantao, et al.
Publicado: (2024)
WildSci: Advancing Scientific Reasoning from In-the-Wild Literature
por: Liu, Tengxiao, et al.
Publicado: (2026)
por: Liu, Tengxiao, et al.
Publicado: (2026)
Inference-Time Scaling for Generalist Reward Modeling
por: Liu, Zijun, et al.
Publicado: (2025)
por: Liu, Zijun, et al.
Publicado: (2025)
TacoERE: Cluster-aware Compression for Event Relation Extraction
por: Guan, Yong, et al.
Publicado: (2024)
por: Guan, Yong, et al.
Publicado: (2024)
WildVision: Evaluating Vision-Language Models in the Wild with Human Preferences
por: Lu, Yujie, et al.
Publicado: (2024)
por: Lu, Yujie, et al.
Publicado: (2024)
MAVEN-Fact: A Large-scale Event Factuality Detection Dataset
por: Li, Chunyang, et al.
Publicado: (2024)
por: Li, Chunyang, et al.
Publicado: (2024)
Reward Shaping to Mitigate Reward Hacking in RLHF
por: Fu, Jiayi, et al.
Publicado: (2025)
por: Fu, Jiayi, et al.
Publicado: (2025)
A Cause-Effect Look at Alleviating Hallucination of Knowledge-grounded Dialogue Generation
por: Yu, Jifan, et al.
Publicado: (2024)
por: Yu, Jifan, et al.
Publicado: (2024)
Improving Reinforcement Learning from Human Feedback Using Contrastive Rewards
por: Shen, Wei, et al.
Publicado: (2024)
por: Shen, Wei, et al.
Publicado: (2024)
R-Eval: A Unified Toolkit for Evaluating Domain Knowledge of Retrieval Augmented Large Language Models
por: Tu, Shangqing, et al.
Publicado: (2024)
por: Tu, Shangqing, et al.
Publicado: (2024)
WildIFEval: Instruction Following in the Wild
por: Lior, Gili, et al.
Publicado: (2025)
por: Lior, Gili, et al.
Publicado: (2025)
Reverse That Number! Decoding Order Matters in Arithmetic Learning
por: Zhang-Li, Daniel, et al.
Publicado: (2024)
por: Zhang-Li, Daniel, et al.
Publicado: (2024)
Reward Model Perspectives: Whose Opinions Do Reward Models Reward?
por: Elle
Publicado: (2025)
por: Elle
Publicado: (2025)
MemoryRewardBench: Benchmarking Reward Models for Long-Term Memory Management in Large Language Models
por: Tang, Zecheng, et al.
Publicado: (2026)
por: Tang, Zecheng, et al.
Publicado: (2026)
GRAM: A Generative Foundation Reward Model for Reward Generalization
por: Wang, Chenglong, et al.
Publicado: (2025)
por: Wang, Chenglong, et al.
Publicado: (2025)
Exploring Reasoning Reward Model for Agents
por: Fan, Kaixuan, et al.
Publicado: (2026)
por: Fan, Kaixuan, et al.
Publicado: (2026)
Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs
por: Liu, Chris Yuhao, et al.
Publicado: (2024)
por: Liu, Chris Yuhao, et al.
Publicado: (2024)
Process Reward Models That Think
por: Khalifa, Muhammad, et al.
Publicado: (2025)
por: Khalifa, Muhammad, et al.
Publicado: (2025)
Fine-Tuning Language Models with Reward Learning on Policy
por: Lang, Hao, et al.
Publicado: (2024)
por: Lang, Hao, et al.
Publicado: (2024)
Self-Evolved Reward Learning for LLMs
por: Huang, Chenghua, et al.
Publicado: (2024)
por: Huang, Chenghua, et al.
Publicado: (2024)
WildBench: Benchmarking LLMs with Challenging Tasks from Real Users in the Wild
por: Lin, Bill Yuchen, et al.
Publicado: (2024)
por: Lin, Bill Yuchen, et al.
Publicado: (2024)
Reward Models Identify Consistency, Not Causality
por: Xu, Yuhui, et al.
Publicado: (2025)
por: Xu, Yuhui, et al.
Publicado: (2025)
Reward Is Enough: LLMs Are In-Context Reinforcement Learners
por: Song, Kefan, et al.
Publicado: (2025)
por: Song, Kefan, et al.
Publicado: (2025)
Gradient Regularization Prevents Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards
por: Ackermann, Johannes, et al.
Publicado: (2026)
por: Ackermann, Johannes, et al.
Publicado: (2026)
Beyond Sparse Rewards: Enhancing Reinforcement Learning with Language Model Critique in Text Generation
por: Cao, Meng, et al.
Publicado: (2024)
por: Cao, Meng, et al.
Publicado: (2024)
Ejemplares similares
-
Agentic Reward Modeling: Integrating Human Preferences with Verifiable Correctness Signals for Reliable Reward Systems
por: Peng, Hao, et al.
Publicado: (2025) -
StoryAlign: Evaluating and Training Reward Models for Story Generation
por: Xia, Haotian, et al.
Publicado: (2026) -
VerIF: Verification Engineering for Reinforcement Learning in Instruction Following
por: Peng, Hao, et al.
Publicado: (2025) -
Constraint Back-translation Improves Complex Instruction Following of Large Language Models
por: Qi, Yunjia, et al.
Publicado: (2024) -
StoryWriter: A Multi-Agent Framework for Long Story Generation
por: Xia, Haotian, et al.
Publicado: (2025)