Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Yuchen, Feng, Yingjie, Qin, Lixiong, Chen, Jiasi, Yu, Jianing, Gao, Sheng, Yang, Sheng, Xu, Weiran |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SALT: Step-level Advantage Assignment for Long-horizon Agents via Trajectory Graph
di: Li, Jiazheng, et al.
Pubblicazione: (2025)
di: Li, Jiazheng, et al.
Pubblicazione: (2025)
RTMC: Step-Level Credit Assignment via Rollout Trees
di: Wang, Tao, et al.
Pubblicazione: (2026)
di: Wang, Tao, et al.
Pubblicazione: (2026)
Reinforcing 3D Understanding in Point-VLMs via Geometric Reward Credit Assignment
di: Chen, Jingkun, et al.
Pubblicazione: (2026)
di: Chen, Jingkun, et al.
Pubblicazione: (2026)
PiCA: Pivot-Based Credit Assignment for Search Agentic Reinforcement Learning
di: Liu, Dongyi, et al.
Pubblicazione: (2026)
di: Liu, Dongyi, et al.
Pubblicazione: (2026)
Beyond Uniform Credit: Causal Credit Assignment for Policy Optimization
di: Khandoga, Mykola, et al.
Pubblicazione: (2026)
di: Khandoga, Mykola, et al.
Pubblicazione: (2026)
Every Step Counts: Step-Level Credit Assignment for Tool-Integrated Text-to-SQL
di: Dai, Yaxun, et al.
Pubblicazione: (2026)
di: Dai, Yaxun, et al.
Pubblicazione: (2026)
Fake-in-Facext: Towards Fine-Grained Explainable DeepFake Analysis
di: Qin, Lixiong, et al.
Pubblicazione: (2025)
di: Qin, Lixiong, et al.
Pubblicazione: (2025)
Search-Based Credit Assignment for Offline Preference-Based Reinforcement Learning
di: Gao, Xiancheng, et al.
Pubblicazione: (2025)
di: Gao, Xiancheng, et al.
Pubblicazione: (2025)
Beyond Uniform Credit Assignment: Selective Eligibility Traces for RLVR
di: Mou, Chaoli, et al.
Pubblicazione: (2026)
di: Mou, Chaoli, et al.
Pubblicazione: (2026)
Explicit Credit Assignment through Local Rewards and Dependence Graphs in Multi-Agent Reinforcement Learning
di: Le, Bang Giang, et al.
Pubblicazione: (2026)
di: Le, Bang Giang, et al.
Pubblicazione: (2026)
Stepwise Credit Assignment for GRPO on Flow-Matching Models
di: Savani, Yash, et al.
Pubblicazione: (2026)
di: Savani, Yash, et al.
Pubblicazione: (2026)
From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models
di: Zhang, Chenchen
Pubblicazione: (2026)
di: Zhang, Chenchen
Pubblicazione: (2026)
Graph-GRPO: Dependency-Aware Credit Assignment for Generative E-commerce Search Relevance
di: Che, Jiarui, et al.
Pubblicazione: (2026)
di: Che, Jiarui, et al.
Pubblicazione: (2026)
Latent Reward: LLM-Empowered Credit Assignment in Episodic Reinforcement Learning
di: Qu, Yun, et al.
Pubblicazione: (2024)
di: Qu, Yun, et al.
Pubblicazione: (2024)
CriticSearch: Fine-Grained Credit Assignment for Search Agents via a Retrospective Critic
di: Zhang, Yaocheng, et al.
Pubblicazione: (2025)
di: Zhang, Yaocheng, et al.
Pubblicazione: (2025)
In-Context Credit Assignment via the Core
di: Harris, Keegan, et al.
Pubblicazione: (2026)
di: Harris, Keegan, et al.
Pubblicazione: (2026)
Stop Summation: Min-Form Credit Assignment Is All Process Reward Model Needs for Reasoning
di: Cheng, Jie, et al.
Pubblicazione: (2025)
di: Cheng, Jie, et al.
Pubblicazione: (2025)
Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents
di: Tang, Wenjie, et al.
Pubblicazione: (2026)
di: Tang, Wenjie, et al.
Pubblicazione: (2026)
Credit Assignment with Resets in Language Model Reasoning
di: Samanta, Ankur, et al.
Pubblicazione: (2026)
di: Samanta, Ankur, et al.
Pubblicazione: (2026)
APEX-Searcher: Refining Credit Assignment with Subgoaling for Agentic Retrieval-Augmented Generation
di: Chen, Kun, et al.
Pubblicazione: (2026)
di: Chen, Kun, et al.
Pubblicazione: (2026)
Logic Error Localization in Student Programming Assignments Using Pseudocode and Graph Neural Networks
di: Xu, Zhenyu, et al.
Pubblicazione: (2024)
di: Xu, Zhenyu, et al.
Pubblicazione: (2024)
Econometric Inference with Machine-Learned Proxies: Partial Identification via Data Combination
di: Li, Lixiong
Pubblicazione: (2026)
di: Li, Lixiong
Pubblicazione: (2026)
Face-Human-Bench: A Comprehensive Benchmark of Face and Human Understanding for Multi-modal Assistants
di: Qin, Lixiong, et al.
Pubblicazione: (2025)
di: Qin, Lixiong, et al.
Pubblicazione: (2025)
Faceptor: A Generalist Model for Face Perception
di: Qin, Lixiong, et al.
Pubblicazione: (2024)
di: Qin, Lixiong, et al.
Pubblicazione: (2024)
Predefined-time synchronization of 5D Hindmarsh–Rose neuron networks via backstepping design and application in secure communication
di: Lixiong Lin
Pubblicazione: (2022)
di: Lixiong Lin
Pubblicazione: (2022)
TraCeS: Trajectory Based Credit Assignment From Sparse Safety Feedback
di: Low, Siow Meng, et al.
Pubblicazione: (2025)
di: Low, Siow Meng, et al.
Pubblicazione: (2025)
EGL-SCA: Structural Credit Assignment for Co-Evolving Instructions and Tools in Graph Reasoning Agents
di: Yuan, Zike, et al.
Pubblicazione: (2026)
di: Yuan, Zike, et al.
Pubblicazione: (2026)
Identification and Counterfactual Analysis in Incomplete Models with Support and Moment Restrictions
di: Li, Lixiong
Pubblicazione: (2026)
di: Li, Lixiong
Pubblicazione: (2026)
Hindsight Credit Assignment for Long-Horizon LLM Agents
di: Tan, Hui-Ze, et al.
Pubblicazione: (2026)
di: Tan, Hui-Ze, et al.
Pubblicazione: (2026)
DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards
di: Zhang, Kaiyi, et al.
Pubblicazione: (2026)
di: Zhang, Kaiyi, et al.
Pubblicazione: (2026)
Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning
di: Venugopal, Aravind, et al.
Pubblicazione: (2026)
di: Venugopal, Aravind, et al.
Pubblicazione: (2026)
Agentic Reinforcement Learning with Implicit Step Rewards
di: Liu, Xiaoqian, et al.
Pubblicazione: (2025)
di: Liu, Xiaoqian, et al.
Pubblicazione: (2025)
Detecting Credit Card Fraud via Heterogeneous Graph Neural Networks with Graph Attention
di: Sha, Qiuwu, et al.
Pubblicazione: (2025)
di: Sha, Qiuwu, et al.
Pubblicazione: (2025)
RewardFlow: Topology-Aware Reward Propagation on State Graphs for Agentic RL with Large Language Models
di: Feng, Xiao, et al.
Pubblicazione: (2026)
di: Feng, Xiao, et al.
Pubblicazione: (2026)
Credit Assignment via Neural Manifold Noise Correlation
di: Kang, Byungwoo, et al.
Pubblicazione: (2026)
di: Kang, Byungwoo, et al.
Pubblicazione: (2026)
Lean Refactor: Multi-Objective Controllable Proof Optimization via Agentic Strategy Search
di: Lu, Jialin, et al.
Pubblicazione: (2026)
di: Lu, Jialin, et al.
Pubblicazione: (2026)
GraphWalker: Agentic Knowledge Graph Question Answering via Synthetic Trajectory Curriculum
di: Xu, Shuwen, et al.
Pubblicazione: (2026)
di: Xu, Shuwen, et al.
Pubblicazione: (2026)
Dynamic Graph-based Fingerprinting of In-browser Cryptomining
di: Sermchaiwong, Tanapoom, et al.
Pubblicazione: (2025)
di: Sermchaiwong, Tanapoom, et al.
Pubblicazione: (2025)
Diffusion of Neuromodulators for Temporal Credit Assignment
di: Barretto-Bittar, João, et al.
Pubblicazione: (2026)
di: Barretto-Bittar, João, et al.
Pubblicazione: (2026)
LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization
di: Zhang, Qi, et al.
Pubblicazione: (2025)
di: Zhang, Qi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SALT: Step-level Advantage Assignment for Long-horizon Agents via Trajectory Graph
di: Li, Jiazheng, et al.
Pubblicazione: (2025) -
RTMC: Step-Level Credit Assignment via Rollout Trees
di: Wang, Tao, et al.
Pubblicazione: (2026) -
Reinforcing 3D Understanding in Point-VLMs via Geometric Reward Credit Assignment
di: Chen, Jingkun, et al.
Pubblicazione: (2026) -
PiCA: Pivot-Based Credit Assignment for Search Agentic Reinforcement Learning
di: Liu, Dongyi, et al.
Pubblicazione: (2026) -
Beyond Uniform Credit: Causal Credit Assignment for Policy Optimization
di: Khandoga, Mykola, et al.
Pubblicazione: (2026)