Generalist Reward Models: Found Inside Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Yi-Chen, Xu, Tian, Yu, Yang, Zhang, Xuqin, Chen, Xiong-Hui, Ling, Zhongxiang, Chao, Ningjing, Yuan, Lei, Zhou, Zhi-Hua |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Sentence-level Reward Model can Generalize Better for Aligning LLM from Human Preference
por: Qiu, Wenjie, et al.
Publicado: (2025)
por: Qiu, Wenjie, et al.
Publicado: (2025)
URPO: A Unified Reward & Policy Optimization Framework for Large Language Models
por: Lu, Songshuo, et al.
Publicado: (2025)
por: Lu, Songshuo, et al.
Publicado: (2025)
Towards Generalist Prompting for Large Language Models by Mental Models
por: Guan, Haoxiang, et al.
Publicado: (2024)
por: Guan, Haoxiang, et al.
Publicado: (2024)
Inference-Time Scaling for Generalist Reward Modeling
por: Liu, Zijun, et al.
Publicado: (2025)
por: Liu, Zijun, et al.
Publicado: (2025)
An Explicit Syllogistic Legal Reasoning Framework for Large Language Models
por: Zhang, Kepu, et al.
Publicado: (2025)
por: Zhang, Kepu, et al.
Publicado: (2025)
Off-Policy Value-Based Reinforcement Learning for Large Language Models
por: Wang, Peng-Yuan, et al.
Publicado: (2026)
por: Wang, Peng-Yuan, et al.
Publicado: (2026)
From Generalist to Specialist: A Survey of Large Language Models for Chemistry
por: Han, Yang, et al.
Publicado: (2024)
por: Han, Yang, et al.
Publicado: (2024)
Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences
por: Jin, Zhuoran, et al.
Publicado: (2025)
por: Jin, Zhuoran, et al.
Publicado: (2025)
Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey
por: Liu, Qiyuan, et al.
Publicado: (2025)
por: Liu, Qiyuan, et al.
Publicado: (2025)
Tool-Augmented Reward Modeling
por: Li, Lei, et al.
Publicado: (2023)
por: Li, Lei, et al.
Publicado: (2023)
Exploring the Nexus of Large Language Models and Legal Systems: A Short Survey
por: Qin, Weicong, et al.
Publicado: (2024)
por: Qin, Weicong, et al.
Publicado: (2024)
Geometry-Calibrated Conformal Abstention for Language Models
por: Xu, Rui, et al.
Publicado: (2026)
por: Xu, Rui, et al.
Publicado: (2026)
ProBench: Benchmarking Large Language Models in Competitive Programming
por: Yang, Lei, et al.
Publicado: (2025)
por: Yang, Lei, et al.
Publicado: (2025)
Neighboring Perturbations of Knowledge Editing on Large Language Models
por: Ma, Jun-Yu, et al.
Publicado: (2024)
por: Ma, Jun-Yu, et al.
Publicado: (2024)
CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards
por: Zhang, Taolin, et al.
Publicado: (2025)
por: Zhang, Taolin, et al.
Publicado: (2025)
Beyond Exact Match: Semantically Reassessing Event Extraction by Large Language Models
por: Lu, Yi-Fan, et al.
Publicado: (2024)
por: Lu, Yi-Fan, et al.
Publicado: (2024)
DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models
por: Li, Zherui, et al.
Publicado: (2025)
por: Li, Zherui, et al.
Publicado: (2025)
Generalists vs. Specialists: Evaluating Large Language Models for Urdu
por: Arif, Samee, et al.
Publicado: (2024)
por: Arif, Samee, et al.
Publicado: (2024)
Sparse Reward Subsystem in Large Language Models
por: Xu, Guowei, et al.
Publicado: (2026)
por: Xu, Guowei, et al.
Publicado: (2026)
BiomedGPT: A Generalist Vision-Language Foundation Model for Diverse Biomedical Tasks
por: Zhang, Kai, et al.
Publicado: (2023)
por: Zhang, Kai, et al.
Publicado: (2023)
ReasonGRM: Enhancing Generative Reward Models through Large Reasoning Models
por: Chen, Bin, et al.
Publicado: (2025)
por: Chen, Bin, et al.
Publicado: (2025)
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
por: Ding, Meidan, et al.
Publicado: (2025)
por: Ding, Meidan, et al.
Publicado: (2025)
Aligning Large Language Models with Searcher Preferences
por: Wu, Wei, et al.
Publicado: (2026)
por: Wu, Wei, et al.
Publicado: (2026)
Model Editing Harms General Abilities of Large Language Models: Regularization to the Rescue
por: Gu, Jia-Chen, et al.
Publicado: (2024)
por: Gu, Jia-Chen, et al.
Publicado: (2024)
TESS 2: A Large-Scale Generalist Diffusion Language Model
por: Tae, Jaesung, et al.
Publicado: (2025)
por: Tae, Jaesung, et al.
Publicado: (2025)
Generalist Large Language Models Outperform Clinical Tools on Medical Benchmarks
por: Vishwanath, Krithik, et al.
Publicado: (2025)
por: Vishwanath, Krithik, et al.
Publicado: (2025)
HFT: Half Fine-Tuning for Large Language Models
por: Hui, Tingfeng, et al.
Publicado: (2024)
por: Hui, Tingfeng, et al.
Publicado: (2024)
Biomedical Large Languages Models Seem not to be Superior to Generalist Models on Unseen Medical Data
por: Dorfner, Felix J., et al.
Publicado: (2024)
por: Dorfner, Felix J., et al.
Publicado: (2024)
Predicting Rewards Alongside Tokens: Non-disruptive Parameter Insertion for Efficient Inference Intervention in Large Language Model
por: Yuan, Chenhan, et al.
Publicado: (2024)
por: Yuan, Chenhan, et al.
Publicado: (2024)
Behavioral Fingerprinting of Large Language Models
por: Pei, Zehua, et al.
Publicado: (2025)
por: Pei, Zehua, et al.
Publicado: (2025)
PASER: Post-Training Data Selection for Efficient Pruned Large Language Model Recovery
por: He, Bowei, et al.
Publicado: (2025)
por: He, Bowei, et al.
Publicado: (2025)
Hey, That's My Data! Token-Only Dataset Inference in Large Language Models
por: Xiong, Chen, et al.
Publicado: (2025)
por: Xiong, Chen, et al.
Publicado: (2025)
A Survey on Large Language Models for Mathematical Reasoning
por: Wang, Peng-Yuan, et al.
Publicado: (2025)
por: Wang, Peng-Yuan, et al.
Publicado: (2025)
PERM: Psychology-grounded Empathetic Reward Modeling for Large Language Models
por: Wang, Chengbing, et al.
Publicado: (2026)
por: Wang, Chengbing, et al.
Publicado: (2026)
Alignment for Efficient Tool Calling of Large Language Models
por: Xu, Hongshen, et al.
Publicado: (2025)
por: Xu, Hongshen, et al.
Publicado: (2025)
Fin-PRM: A Domain-Specialized Process Reward Model for Financial Reasoning in Large Language Models
por: Zhu, Jie, et al.
Publicado: (2025)
por: Zhu, Jie, et al.
Publicado: (2025)
LargePiG: Your Large Language Model is Secretly a Pointer Generator
por: Sun, Zhongxiang, et al.
Publicado: (2024)
por: Sun, Zhongxiang, et al.
Publicado: (2024)
LongReward: Improving Long-context Large Language Models with AI Feedback
por: Zhang, Jiajie, et al.
Publicado: (2024)
por: Zhang, Jiajie, et al.
Publicado: (2024)
Reward Models Identify Consistency, Not Causality
por: Xu, Yuhui, et al.
Publicado: (2025)
por: Xu, Yuhui, et al.
Publicado: (2025)
Self-Rewarding Language Models
por: Yuan, Weizhe, et al.
Publicado: (2024)
por: Yuan, Weizhe, et al.
Publicado: (2024)
Ejemplares similares
-
Sentence-level Reward Model can Generalize Better for Aligning LLM from Human Preference
por: Qiu, Wenjie, et al.
Publicado: (2025) -
URPO: A Unified Reward & Policy Optimization Framework for Large Language Models
por: Lu, Songshuo, et al.
Publicado: (2025) -
Towards Generalist Prompting for Large Language Models by Mental Models
por: Guan, Haoxiang, et al.
Publicado: (2024) -
Inference-Time Scaling for Generalist Reward Modeling
por: Liu, Zijun, et al.
Publicado: (2025) -
An Explicit Syllogistic Legal Reasoning Framework for Large Language Models
por: Zhang, Kepu, et al.
Publicado: (2025)