Tool-Augmented Reward Modeling
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Lei, Chai, Yekun, Wang, Shuohuan, Sun, Yu, Tian, Hao, Zhang, Ningyu, Wu, Hua |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Curiosity-Driven Reinforcement Learning from Human Feedback
par: Sun, Haoran, et autres
Publié: (2025)
par: Sun, Haoran, et autres
Publié: (2025)
MA-RLHF: Reinforcement Learning from Human Feedback with Macro Actions
par: Chai, Yekun, et autres
Publié: (2024)
par: Chai, Yekun, et autres
Publié: (2024)
On Training Data Influence of GPT Models
par: Chai, Yekun, et autres
Publié: (2024)
par: Chai, Yekun, et autres
Publié: (2024)
Autoregressive Pre-Training on Pixels and Texts
par: Chai, Yekun, et autres
Publié: (2024)
par: Chai, Yekun, et autres
Publié: (2024)
EvolKV: Evolutionary KV Cache Compression for LLM Inference
par: Yu, Bohan, et autres
Publié: (2025)
par: Yu, Bohan, et autres
Publié: (2025)
CodeMixBench: Evaluating Code-Mixing Capabilities of LLMs Across 18 Languages
par: Yang, Yilun, et autres
Publié: (2025)
par: Yang, Yilun, et autres
Publié: (2025)
HFT: Half Fine-Tuning for Large Language Models
par: Hui, Tingfeng, et autres
Publié: (2024)
par: Hui, Tingfeng, et autres
Publié: (2024)
HumanEval-XL: A Multilingual Code Generation Benchmark for Cross-lingual Natural Language Generalization
par: Peng, Qiwei, et autres
Publié: (2024)
par: Peng, Qiwei, et autres
Publié: (2024)
Tokenization Falling Short: On Subword Robustness in Large Language Models
par: Chai, Yekun, et autres
Publié: (2024)
par: Chai, Yekun, et autres
Publié: (2024)
Understanding Subword Compositionality of Large Language Models
par: Peng, Qiwei, et autres
Publié: (2025)
par: Peng, Qiwei, et autres
Publié: (2025)
Upcycling Instruction Tuning from Dense to Mixture-of-Experts via Parameter Merging
par: Hui, Tingfeng, et autres
Publié: (2024)
par: Hui, Tingfeng, et autres
Publié: (2024)
Advantageous Parameter Expansion Training Makes Better Large Language Models
par: Gu, Naibin, et autres
Publié: (2025)
par: Gu, Naibin, et autres
Publié: (2025)
Mixture of Hidden-Dimensions Transformer
par: Chen, Yilong, et autres
Publié: (2024)
par: Chen, Yilong, et autres
Publié: (2024)
Generalist Reward Models: Found Inside Large Language Models
par: Li, Yi-Chen, et autres
Publié: (2025)
par: Li, Yi-Chen, et autres
Publié: (2025)
NACL: A General and Effective KV Cache Eviction Framework for LLMs at Inference Time
par: Chen, Yilong, et autres
Publié: (2024)
par: Chen, Yilong, et autres
Publié: (2024)
MARBLE: A Hard Benchmark for Multimodal Spatial Reasoning and Planning
par: Jiang, Yulun, et autres
Publié: (2025)
par: Jiang, Yulun, et autres
Publié: (2025)
BeamLoRA: Beam-Constraint Low-Rank Adaptation
par: Gu, Naibin, et autres
Publié: (2025)
par: Gu, Naibin, et autres
Publié: (2025)
Debiasing Multilingual LLMs in Cross-lingual Latent Space
par: Peng, Qiwei, et autres
Publié: (2025)
par: Peng, Qiwei, et autres
Publié: (2025)
AWPO: Enhancing Tool-Use of Large Language Models through Adaptive Integration of Reasoning Rewards
par: Lin, Zihan, et autres
Publié: (2025)
par: Lin, Zihan, et autres
Publié: (2025)
Inner Thinking Transformer: Leveraging Dynamic Depth Scaling to Foster Adaptive Internal Thinking
par: Chen, Yilong, et autres
Publié: (2025)
par: Chen, Yilong, et autres
Publié: (2025)
Neighboring Perturbations of Knowledge Editing on Large Language Models
par: Ma, Jun-Yu, et autres
Publié: (2024)
par: Ma, Jun-Yu, et autres
Publié: (2024)
RAG-DDR: Optimizing Retrieval-Augmented Generation Using Differentiable Data Rewards
par: Li, Xinze, et autres
Publié: (2024)
par: Li, Xinze, et autres
Publié: (2024)
ReARTeR: Retrieval-Augmented Reasoning with Trustworthy Process Rewarding
par: Sun, Zhongxiang, et autres
Publié: (2025)
par: Sun, Zhongxiang, et autres
Publié: (2025)
Reward Modeling from Natural Language Human Feedback
par: Wang, Zongqi, et autres
Publié: (2026)
par: Wang, Zongqi, et autres
Publié: (2026)
WildReward: Learning Reward Models from In-the-Wild Human Interactions
par: Peng, Hao, et autres
Publié: (2026)
par: Peng, Hao, et autres
Publié: (2026)
ToolkenGPT: Augmenting Frozen Language Models with Massive Tools via Tool Embeddings
par: Hao, Shibo, et autres
Publié: (2023)
par: Hao, Shibo, et autres
Publié: (2023)
ReflecTool: Towards Reflection-Aware Tool-Augmented Clinical Agents
par: Liao, Yusheng, et autres
Publié: (2024)
par: Liao, Yusheng, et autres
Publié: (2024)
ToolRM: Outcome Reward Models for Tool-Calling Large Language Models
par: Agarwal, Mayank, et autres
Publié: (2025)
par: Agarwal, Mayank, et autres
Publié: (2025)
Rewarding Creativity: A Human-Aligned Generative Reward Model for Reinforcement Learning in Storytelling
par: Li, Zhaoyan, et autres
Publié: (2026)
par: Li, Zhaoyan, et autres
Publié: (2026)
ToolRM: Towards Agentic Tool-Use Reward Modeling
par: Li, Renhao, et autres
Publié: (2025)
par: Li, Renhao, et autres
Publié: (2025)
Rewarding the Scientific Process: Process-Level Reward Modeling for Agentic Data Analysis
par: Qiu, Zhisong, et autres
Publié: (2026)
par: Qiu, Zhisong, et autres
Publié: (2026)
Implicit Hierarchical GRPO: Decoupling Tool Invocation from Execution for Tool-Integrated Mathematical Reasoning
par: Wang, Li, et autres
Publié: (2026)
par: Wang, Li, et autres
Publié: (2026)
Sparse Growing Transformer: Training-Time Sparse Depth Allocation via Progressive Attention Looping
par: Chen, Yao, et autres
Publié: (2026)
par: Chen, Yao, et autres
Publié: (2026)
Adaptive Tool Generation with Models as Tools and Reinforcement Learning
par: Wang, Chenpeng, et autres
Publié: (2025)
par: Wang, Chenpeng, et autres
Publié: (2025)
Constraining Sequential Model Editing with Editing Anchor Compression
par: Xu, Hao-Xiang, et autres
Publié: (2025)
par: Xu, Hao-Xiang, et autres
Publié: (2025)
Agentic Reward Modeling: Integrating Human Preferences with Verifiable Correctness Signals for Reliable Reward Systems
par: Peng, Hao, et autres
Publié: (2025)
par: Peng, Hao, et autres
Publié: (2025)
Beyond Correctness: Rewarding Faithful Reasoning in Retrieval-Augmented Generation
par: Xu, Zhichao, et autres
Publié: (2025)
par: Xu, Zhichao, et autres
Publié: (2025)
Reward-Augmented Decoding: Efficient Controlled Text Generation With a Unidirectional Reward Model
par: Deng, Haikang, et autres
Publié: (2023)
par: Deng, Haikang, et autres
Publié: (2023)
DHA: Learning Decoupled-Head Attention from Transformer Checkpoints via Adaptive Heads Fusion
par: Chen, Yilong, et autres
Publié: (2024)
par: Chen, Yilong, et autres
Publié: (2024)
SeRTS: Self-Rewarding Tree Search for Biomedical Retrieval-Augmented Generation
par: Hu, Minda, et autres
Publié: (2024)
par: Hu, Minda, et autres
Publié: (2024)
Documents similaires
-
Curiosity-Driven Reinforcement Learning from Human Feedback
par: Sun, Haoran, et autres
Publié: (2025) -
MA-RLHF: Reinforcement Learning from Human Feedback with Macro Actions
par: Chai, Yekun, et autres
Publié: (2024) -
On Training Data Influence of GPT Models
par: Chai, Yekun, et autres
Publié: (2024) -
Autoregressive Pre-Training on Pixels and Texts
par: Chai, Yekun, et autres
Publié: (2024) -
EvolKV: Evolutionary KV Cache Compression for LLM Inference
par: Yu, Bohan, et autres
Publié: (2025)