R2IF: Aligning Reasoning with Decisions via Composite Rewards for Interpretable LLM Function Calling
Fuente:
arXiv
Guardado en:
| Autores principales: | Cheng, Aijia, Wang, Kailong, Shi, Ling, Zhao, Yongxin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Interpretable Reward Model via Sparse Autoencoder
por: Zhang, Shuyi, et al.
Publicado: (2025)
por: Zhang, Shuyi, et al.
Publicado: (2025)
Step-wise Rubric Rewards for LLM Reasoning
por: Xie, Weichu, et al.
Publicado: (2026)
por: Xie, Weichu, et al.
Publicado: (2026)
Self-Aligned Reward: Towards Effective and Efficient Reasoners
por: Han, Peixuan, et al.
Publicado: (2025)
por: Han, Peixuan, et al.
Publicado: (2025)
To Call or Not to Call: Diagnosing Intrinsic Over-Calling Bias in LLM Agents
por: Shi, Wei, et al.
Publicado: (2026)
por: Shi, Wei, et al.
Publicado: (2026)
Random Policy Valuation is Enough for LLM Reasoning with Verifiable Rewards
por: He, Haoran, et al.
Publicado: (2025)
por: He, Haoran, et al.
Publicado: (2025)
Guiding LLM Decision-Making with Fairness Reward Models
por: Hall, Zara, et al.
Publicado: (2025)
por: Hall, Zara, et al.
Publicado: (2025)
RM-R1: Reward Modeling as Reasoning
por: Chen, Xiusi, et al.
Publicado: (2025)
por: Chen, Xiusi, et al.
Publicado: (2025)
Reinforcing Multi-Turn Reasoning in LLM Agents via Turn-Level Reward Design
por: Wei, Quan, et al.
Publicado: (2025)
por: Wei, Quan, et al.
Publicado: (2025)
Model-Editing-Based Jailbreak against Safety-aligned Large Language Models
por: Li, Yuxi, et al.
Publicado: (2024)
por: Li, Yuxi, et al.
Publicado: (2024)
Think-Augmented Function Calling: Improving LLM Parameter Accuracy Through Embedded Reasoning
por: Wei, Lei, et al.
Publicado: (2026)
por: Wei, Lei, et al.
Publicado: (2026)
Accelerating LLM Reasoning via Early Rejection with Partial Reward Modeling
por: Cheshmi, Seyyed Saeid, et al.
Publicado: (2025)
por: Cheshmi, Seyyed Saeid, et al.
Publicado: (2025)
Uncovering Logit Suppression Vulnerabilities in LLM Safety Alignment
por: Li, Yuxi, et al.
Publicado: (2024)
por: Li, Yuxi, et al.
Publicado: (2024)
Hammer: Robust Function-Calling for On-Device Language Models via Function Masking
por: Lin, Qiqiang, et al.
Publicado: (2024)
por: Lin, Qiqiang, et al.
Publicado: (2024)
GRAM-R$^2$: Self-Training Generative Foundation Reward Models for Reward Reasoning
por: Wang, Chenglong, et al.
Publicado: (2025)
por: Wang, Chenglong, et al.
Publicado: (2025)
When Is Compositional Reasoning Learnable from Verifiable Rewards?
por: Barzilai, Daniel, et al.
Publicado: (2026)
por: Barzilai, Daniel, et al.
Publicado: (2026)
SaFeR-ToolKit: Structured Reasoning via Virtual Tool Calling for Multimodal Safety
por: Xu, Zixuan, et al.
Publicado: (2026)
por: Xu, Zixuan, et al.
Publicado: (2026)
Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization
por: Ma, Qiyao, et al.
Publicado: (2026)
por: Ma, Qiyao, et al.
Publicado: (2026)
Boosting LLM Reasoning via Human-Inspired Reward Shaping
por: Lin, Wenze, et al.
Publicado: (2026)
por: Lin, Wenze, et al.
Publicado: (2026)
Grad2Reward: From Sparse Judgment to Dense Rewards for Improving Open-Ended LLM Reasoning
por: Zhang, Zheng, et al.
Publicado: (2026)
por: Zhang, Zheng, et al.
Publicado: (2026)
NeuSemSlice: Towards Effective DNN Model Maintenance via Neuron-level Semantic Slicing
por: Zhou, Shide, et al.
Publicado: (2024)
por: Zhou, Shide, et al.
Publicado: (2024)
From Stochastic Answers to Verifiable Reasoning: Interpretable Decision-Making with LLM-Generated Code
por: Mahesh, Anirudh Jaidev, et al.
Publicado: (2026)
por: Mahesh, Anirudh Jaidev, et al.
Publicado: (2026)
Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts
por: Wang, Haoxiang, et al.
Publicado: (2024)
por: Wang, Haoxiang, et al.
Publicado: (2024)
DGRO: Enhancing LLM Reasoning via Exploration-Exploitation Control and Reward Variance Management
por: Su, Xuerui, et al.
Publicado: (2025)
por: Su, Xuerui, et al.
Publicado: (2025)
Accordion-Thinking: Self-Regulated Step Summaries for Efficient and Readable LLM Reasoning
por: Yang, Zhicheng, et al.
Publicado: (2026)
por: Yang, Zhicheng, et al.
Publicado: (2026)
ReMoDetect: Reward Models Recognize Aligned LLM's Generations
por: Lee, Hyunseok, et al.
Publicado: (2024)
por: Lee, Hyunseok, et al.
Publicado: (2024)
ToolACE: Winning the Points of LLM Function Calling
por: Liu, Weiwen, et al.
Publicado: (2024)
por: Liu, Weiwen, et al.
Publicado: (2024)
Automated Rewards via LLM-Generated Progress Functions
por: Sarukkai, Vishnu, et al.
Publicado: (2024)
por: Sarukkai, Vishnu, et al.
Publicado: (2024)
Bayesian Reward Models for LLM Alignment
por: Yang, Adam X., et al.
Publicado: (2024)
por: Yang, Adam X., et al.
Publicado: (2024)
Linking Process to Outcome: Conditional Reward Modeling for LLM Reasoning
por: Zhang, Zheng, et al.
Publicado: (2025)
por: Zhang, Zheng, et al.
Publicado: (2025)
An Explainable and Interpretable Composite Indicator Based on Decision Rules
por: Corrente, Salvatore, et al.
Publicado: (2025)
por: Corrente, Salvatore, et al.
Publicado: (2025)
FunReason: Enhancing Large Language Models' Function Calling via Self-Refinement Multiscale Loss and Automated Data Refinement
por: Hao, Bingguang, et al.
Publicado: (2025)
por: Hao, Bingguang, et al.
Publicado: (2025)
ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates
por: Yang, Ling, et al.
Publicado: (2025)
por: Yang, Ling, et al.
Publicado: (2025)
Structural Compositional Function Networks: Interpretable Functional Compositions for Tabular Discovery
por: Li, Fang
Publicado: (2026)
por: Li, Fang
Publicado: (2026)
Reasoning through Exploration: A Reinforcement Learning Framework for Robust Function Calling
por: Hao, Bingguang, et al.
Publicado: (2025)
por: Hao, Bingguang, et al.
Publicado: (2025)
SELAUR: Self Evolving LLM Agent via Uncertainty-aware Rewards
por: Zhang, Dengjia, et al.
Publicado: (2026)
por: Zhang, Dengjia, et al.
Publicado: (2026)
Aligning LLMs with Domain Invariant Reward Models
por: Wu, David, et al.
Publicado: (2025)
por: Wu, David, et al.
Publicado: (2025)
Return-Aligned Decision Transformer
por: Tanaka, Tsunehiko, et al.
Publicado: (2024)
por: Tanaka, Tsunehiko, et al.
Publicado: (2024)
Can Differentiable Decision Trees Enable Interpretable Reward Learning from Human Feedback?
por: Kalra, Akansha, et al.
Publicado: (2023)
por: Kalra, Akansha, et al.
Publicado: (2023)
LLM Reasoning with Process Rewards for Outcome-Guided Steps
por: Rezaei, Mohammad, et al.
Publicado: (2026)
por: Rezaei, Mohammad, et al.
Publicado: (2026)
ALIGN: Aligned Delegation with Performance Guarantees for Multi-Agent LLM Reasoning
por: Zhu, Tong, et al.
Publicado: (2026)
por: Zhu, Tong, et al.
Publicado: (2026)
Ejemplares similares
-
Interpretable Reward Model via Sparse Autoencoder
por: Zhang, Shuyi, et al.
Publicado: (2025) -
Step-wise Rubric Rewards for LLM Reasoning
por: Xie, Weichu, et al.
Publicado: (2026) -
Self-Aligned Reward: Towards Effective and Efficient Reasoners
por: Han, Peixuan, et al.
Publicado: (2025) -
To Call or Not to Call: Diagnosing Intrinsic Over-Calling Bias in LLM Agents
por: Shi, Wei, et al.
Publicado: (2026) -
Random Policy Valuation is Enough for LLM Reasoning with Verifiable Rewards
por: He, Haoran, et al.
Publicado: (2025)