Probabilistic Uncertain Reward Model
Fuente:
arXiv
Salvato in:
| Autori principali: | Sun, Wangtao, Cheng, Xiang, Yu, Xing, Xu, Haotian, Yang, Zhao, He, Shizhu, Zhao, Jun, Liu, Kang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Shuttle Between the Instructions and the Parameters of Large Language Models
di: Sun, Wangtao, et al.
Pubblicazione: (2025)
di: Sun, Wangtao, et al.
Pubblicazione: (2025)
From Chain to Tree: Refining Chain-like Rules into Tree-like Rules on Knowledge Graphs
di: Sun, Wangtao, et al.
Pubblicazione: (2024)
di: Sun, Wangtao, et al.
Pubblicazione: (2024)
ExpNote: Black-box Large Language Models are Better Task Solvers with Experience Notebook
di: Sun, Wangtao, et al.
Pubblicazione: (2023)
di: Sun, Wangtao, et al.
Pubblicazione: (2023)
ItD: Large Language Models Can Teach Themselves Induction through Deduction
di: Sun, Wangtao, et al.
Pubblicazione: (2024)
di: Sun, Wangtao, et al.
Pubblicazione: (2024)
Towards Agentic Self-Learning LLMs in Search Environment
di: Sun, Wangtao, et al.
Pubblicazione: (2025)
di: Sun, Wangtao, et al.
Pubblicazione: (2025)
Beyond Hard and Soft: Hybrid Context Compression for Balancing Local and Global Information Retention
di: Liao, Huanxuan, et al.
Pubblicazione: (2025)
di: Liao, Huanxuan, et al.
Pubblicazione: (2025)
DATA: Decomposed Attention-based Task Adaptation for Rehearsal-Free Continual Learning
di: Liao, Huanxuan, et al.
Pubblicazione: (2025)
di: Liao, Huanxuan, et al.
Pubblicazione: (2025)
Ask a Strong LLM Judge when Your Reward Model is Uncertain
di: Xu, Zhenghao, et al.
Pubblicazione: (2025)
di: Xu, Zhenghao, et al.
Pubblicazione: (2025)
LLaSA: Large Language and Structured Data Assistant
di: Xu, Yao, et al.
Pubblicazione: (2024)
di: Xu, Yao, et al.
Pubblicazione: (2024)
A Probabilistic Perspective on Model Collapse
di: Xu, Shirong, et al.
Pubblicazione: (2025)
di: Xu, Shirong, et al.
Pubblicazione: (2025)
From $P(y|x)$ to $P(y)$: Investigating Reinforcement Learning in Pre-train Space
di: Tan, Yuqiao, et al.
Pubblicazione: (2026)
di: Tan, Yuqiao, et al.
Pubblicazione: (2026)
Probabilistic Federated Learning on Uncertain and Heterogeneous Data with Model Personalization
di: Rahman, Ratun, et al.
Pubblicazione: (2026)
di: Rahman, Ratun, et al.
Pubblicazione: (2026)
SparK: Query-Aware Unstructured Sparsity with Recoverable KV Cache Channel Pruning
di: Liao, Huanxuan, et al.
Pubblicazione: (2025)
di: Liao, Huanxuan, et al.
Pubblicazione: (2025)
Beyond Instruction Following: Evaluating Inferential Rule Following of Large Language Models
di: Sun, Wangtao, et al.
Pubblicazione: (2024)
di: Sun, Wangtao, et al.
Pubblicazione: (2024)
Learning Personalized Ad Impact via Contextual Reinforcement Learning under Delayed Rewards
di: Cheng, Yuwei, et al.
Pubblicazione: (2025)
di: Cheng, Yuwei, et al.
Pubblicazione: (2025)
CycloneMAE: A Scalable Multi-Task Learning Model for Global Tropical Cyclone Probabilistic Forecasting
di: Hang, Renlong, et al.
Pubblicazione: (2026)
di: Hang, Renlong, et al.
Pubblicazione: (2026)
Contractive Diffusion Probabilistic Models
di: Tang, Wenpin, et al.
Pubblicazione: (2024)
di: Tang, Wenpin, et al.
Pubblicazione: (2024)
Provably Efficient Online RLHF with One-Pass Reward Modeling
di: Li, Long-Fei, et al.
Pubblicazione: (2025)
di: Li, Long-Fei, et al.
Pubblicazione: (2025)
Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward
di: Jia, Zhiwei, et al.
Pubblicazione: (2024)
di: Jia, Zhiwei, et al.
Pubblicazione: (2024)
Semi-Supervised Reward Modeling via Iterative Self-Training
di: He, Yifei, et al.
Pubblicazione: (2024)
di: He, Yifei, et al.
Pubblicazione: (2024)
The Power of the Pareto Front: Balancing Uncertain Rewards for Adaptive Experimentation in scanning probe microscopy
di: Liu, Yu, et al.
Pubblicazione: (2025)
di: Liu, Yu, et al.
Pubblicazione: (2025)
Data-driven Probabilistic Trajectory Learning with High Temporal Resolution in Terminal Airspace
di: Xiang, Jun, et al.
Pubblicazione: (2024)
di: Xiang, Jun, et al.
Pubblicazione: (2024)
GDRO: Group-level Reward Post-training Suitable for Diffusion Models
di: Wang, Yiyang, et al.
Pubblicazione: (2026)
di: Wang, Yiyang, et al.
Pubblicazione: (2026)
Eliminating Inductive Bias in Reward Models with Information-Theoretic Guidance
di: Li, Zhuo, et al.
Pubblicazione: (2025)
di: Li, Zhuo, et al.
Pubblicazione: (2025)
Adversarial Training of Reward Models
di: Bukharin, Alexander, et al.
Pubblicazione: (2025)
di: Bukharin, Alexander, et al.
Pubblicazione: (2025)
Boosting Graph Foundation Model from Structural Perspective
di: Cheng, Yao, et al.
Pubblicazione: (2024)
di: Cheng, Yao, et al.
Pubblicazione: (2024)
Learning a Pessimistic Reward Model in RLHF
di: Xu, Yinglun, et al.
Pubblicazione: (2025)
di: Xu, Yinglun, et al.
Pubblicazione: (2025)
Chain of Uncertain Rewards with Large Language Models for Reinforcement Learning
di: Mo, Shentong
Pubblicazione: (2026)
di: Mo, Shentong
Pubblicazione: (2026)
Beyond Simple Sum of Delayed Rewards: Non-Markovian Reward Modeling for Reinforcement Learning
di: Tang, Yuting, et al.
Pubblicazione: (2024)
di: Tang, Yuting, et al.
Pubblicazione: (2024)
Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization
di: Ma, Qiyao, et al.
Pubblicazione: (2026)
di: Ma, Qiyao, et al.
Pubblicazione: (2026)
Probabilistic Rank and Reward: A Scalable Model for Slate Recommendation
di: Aouali, Imad, et al.
Pubblicazione: (2022)
di: Aouali, Imad, et al.
Pubblicazione: (2022)
Probabilistic QoS Metric Forecasting in Delay-Tolerant Networks Using Conditional Diffusion Models on Latent Dynamics
di: Zhang, Enming, et al.
Pubblicazione: (2025)
di: Zhang, Enming, et al.
Pubblicazione: (2025)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
di: Xie, Tianbao, et al.
Pubblicazione: (2023)
di: Xie, Tianbao, et al.
Pubblicazione: (2023)
Human Cognition Inspired RAG with Knowledge Graph for Complex Problem Solving
di: Cheng, Yao, et al.
Pubblicazione: (2025)
di: Cheng, Yao, et al.
Pubblicazione: (2025)
Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models
di: Hong, Ilgee, et al.
Pubblicazione: (2025)
di: Hong, Ilgee, et al.
Pubblicazione: (2025)
PRCL: Probabilistic Representation Contrastive Learning for Semi-Supervised Semantic Segmentation
di: Xie, Haoyu, et al.
Pubblicazione: (2024)
di: Xie, Haoyu, et al.
Pubblicazione: (2024)
DavIR: Data Selection via Implicit Reward for Large Language Models
di: Zhou, Haotian, et al.
Pubblicazione: (2023)
di: Zhou, Haotian, et al.
Pubblicazione: (2023)
Alternating Reinforcement Learning for Rubric-Based Reward Modeling in Non-Verifiable LLM Post-Training
di: Xu, Ran, et al.
Pubblicazione: (2026)
di: Xu, Ran, et al.
Pubblicazione: (2026)
Learning to Reason without External Rewards
di: Zhao, Xuandong, et al.
Pubblicazione: (2025)
di: Zhao, Xuandong, et al.
Pubblicazione: (2025)
Focal Reward: Balanced Reinforcement Learning under Rubric-Based Rewards
di: Huang, Yu, et al.
Pubblicazione: (2026)
di: Huang, Yu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Shuttle Between the Instructions and the Parameters of Large Language Models
di: Sun, Wangtao, et al.
Pubblicazione: (2025) -
From Chain to Tree: Refining Chain-like Rules into Tree-like Rules on Knowledge Graphs
di: Sun, Wangtao, et al.
Pubblicazione: (2024) -
ExpNote: Black-box Large Language Models are Better Task Solvers with Experience Notebook
di: Sun, Wangtao, et al.
Pubblicazione: (2023) -
ItD: Large Language Models Can Teach Themselves Induction through Deduction
di: Sun, Wangtao, et al.
Pubblicazione: (2024) -
Towards Agentic Self-Learning LLMs in Search Environment
di: Sun, Wangtao, et al.
Pubblicazione: (2025)