SALT: Step-level Advantage Assignment for Long-horizon Agents via Trajectory Graph
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Jiazheng, Wang, Yawei, Yan, David, Tian, Yijun, Xu, Zhichao, Song, Huan, Xu, Panpan, Cheong, Lin Lee |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SDRT: Enhance Vision-Language Models by Self-Distillation with Diverse Reasoning Traces
di: Wu, Guande, et al.
Pubblicazione: (2025)
di: Wu, Guande, et al.
Pubblicazione: (2025)
Reinforcement Learning for Self-Improving Agent with Skill Library
di: Wang, Jiongxiao, et al.
Pubblicazione: (2025)
di: Wang, Jiongxiao, et al.
Pubblicazione: (2025)
CLEAR: Context Augmentation from Contrastive Learning of Experience via Agentic Reflection
di: Liu, Linbo, et al.
Pubblicazione: (2026)
di: Liu, Linbo, et al.
Pubblicazione: (2026)
CSPLADE: Learned Sparse Retrieval with Causal Language Models
di: Xu, Zhichao, et al.
Pubblicazione: (2025)
di: Xu, Zhichao, et al.
Pubblicazione: (2025)
Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling
di: Liu, Yuchen, et al.
Pubblicazione: (2026)
di: Liu, Yuchen, et al.
Pubblicazione: (2026)
Graph Neural Prompting with Large Language Models
di: Tian, Yijun, et al.
Pubblicazione: (2023)
di: Tian, Yijun, et al.
Pubblicazione: (2023)
A Sober Look at Agentic Misalignment in Automated Workflows
di: Ye, Wenqian, et al.
Pubblicazione: (2026)
di: Ye, Wenqian, et al.
Pubblicazione: (2026)
RECON: Reasoning with Condensation for Efficient Retrieval-Augmented Generation
di: Xu, Zhichao, et al.
Pubblicazione: (2025)
di: Xu, Zhichao, et al.
Pubblicazione: (2025)
Reinforcement Mid-Training
di: Tian, Yijun, et al.
Pubblicazione: (2025)
di: Tian, Yijun, et al.
Pubblicazione: (2025)
Multi-level Advantage Credit Assignment for Cooperative Multi-Agent Reinforcement Learning
di: Zhao, Xutong, et al.
Pubblicazione: (2025)
di: Zhao, Xutong, et al.
Pubblicazione: (2025)
RTMC: Step-Level Credit Assignment via Rollout Trees
di: Wang, Tao, et al.
Pubblicazione: (2026)
di: Wang, Tao, et al.
Pubblicazione: (2026)
SOLAR-RL: Semi-Online Long-horizon Assignment Reinforcement Learning
di: Wang, Jichao, et al.
Pubblicazione: (2026)
di: Wang, Jichao, et al.
Pubblicazione: (2026)
Learning to Ideate for Machine Learning Engineering Agents
di: Zhang, Yunxiang, et al.
Pubblicazione: (2026)
di: Zhang, Yunxiang, et al.
Pubblicazione: (2026)
WildGEN: Long-horizon Trajectory Generation for Wildlife
di: Al-Lawati, Ali, et al.
Pubblicazione: (2023)
di: Al-Lawati, Ali, et al.
Pubblicazione: (2023)
UAV Task Assignment and Path Planning: Problem Definition, Integration, and Challenges
di: Huan Meng, et al.
Pubblicazione: (2026)
di: Huan Meng, et al.
Pubblicazione: (2026)
PIVOT: Bridging Planning and Execution in LLM Agents via Trajectory Refinement
di: Zhang, Tuo, et al.
Pubblicazione: (2026)
di: Zhang, Tuo, et al.
Pubblicazione: (2026)
QuarkMedSearch: A Long-Horizon Deep Search Agent for Exploring Medical Intelligence
di: Lin, Zhichao, et al.
Pubblicazione: (2026)
di: Lin, Zhichao, et al.
Pubblicazione: (2026)
Diffusion Trajectory-guided Policy for Long-horizon Robot Manipulation
di: Fan, Shichao, et al.
Pubblicazione: (2025)
di: Fan, Shichao, et al.
Pubblicazione: (2025)
Co-ReAct: Rubrics as Step-Level Collaborators for ReAct Agents
di: Kang, Jiazheng, et al.
Pubblicazione: (2026)
di: Kang, Jiazheng, et al.
Pubblicazione: (2026)
LACONIC: Dense-Level Effectiveness for Scalable Sparse Retrieval via a Two-Phase Training Curriculum
di: Xu, Zhichao, et al.
Pubblicazione: (2026)
di: Xu, Zhichao, et al.
Pubblicazione: (2026)
StepOPSD: Step-Aware Online Preference Distillation for Agent Reinforcement Learning
di: Zhang, Yanfei, et al.
Pubblicazione: (2026)
di: Zhang, Yanfei, et al.
Pubblicazione: (2026)
STeCa: Step-level Trajectory Calibration for LLM Agent Learning
di: Wang, Hanlin, et al.
Pubblicazione: (2025)
di: Wang, Hanlin, et al.
Pubblicazione: (2025)
Ensemble Quadratic Assignment Network for Graph Matching
di: Tan, Haoru, et al.
Pubblicazione: (2024)
di: Tan, Haoru, et al.
Pubblicazione: (2024)
Tree of Agents: Improving Long-Context Capabilities of Large Language Models through Multi-Perspective Reasoning
di: Yu, Song, et al.
Pubblicazione: (2025)
di: Yu, Song, et al.
Pubblicazione: (2025)
Beyond Correctness: Rewarding Faithful Reasoning in Retrieval-Augmented Generation
di: Xu, Zhichao, et al.
Pubblicazione: (2025)
di: Xu, Zhichao, et al.
Pubblicazione: (2025)
LMEB: Long-horizon Memory Embedding Benchmark
di: Zhao, Xinping, et al.
Pubblicazione: (2026)
di: Zhao, Xinping, et al.
Pubblicazione: (2026)
SALT4Decompile: Inferring Source-level Abstract Logic Tree for LLM-Based Binary Decompilation
di: Wang, Yongpan, et al.
Pubblicazione: (2025)
di: Wang, Yongpan, et al.
Pubblicazione: (2025)
Hindsight Credit Assignment for Long-Horizon LLM Agents
di: Tan, Hui-Ze, et al.
Pubblicazione: (2026)
di: Tan, Hui-Ze, et al.
Pubblicazione: (2026)
Collaborative LLM Numerical Reasoning with Local Data Protection
di: Zhang, Min, et al.
Pubblicazione: (2025)
di: Zhang, Min, et al.
Pubblicazione: (2025)
The SALT response index: Overcoming limitations of the SALT score for evaluating treatment response
di: Marc Hernández‐Santacana, et al.
Pubblicazione: (2026)
di: Marc Hernández‐Santacana, et al.
Pubblicazione: (2026)
Graph is a Substrate Across Data Modalities
di: Li, Ziming, et al.
Pubblicazione: (2026)
di: Li, Ziming, et al.
Pubblicazione: (2026)
Long-horizon Reasoning Agent for Olympiad-Level Mathematical Problem Solving
di: Gao, Songyang, et al.
Pubblicazione: (2025)
di: Gao, Songyang, et al.
Pubblicazione: (2025)
SeeNav-Agent: Enhancing Vision-Language Navigation with Visual Prompt and Step-Level Policy Optimization
di: Wang, Zhengcheng, et al.
Pubblicazione: (2025)
di: Wang, Zhengcheng, et al.
Pubblicazione: (2025)
ACON: Optimizing Context Compression for Long-horizon LLM Agents
di: Kang, Minki, et al.
Pubblicazione: (2025)
di: Kang, Minki, et al.
Pubblicazione: (2025)
LUMINA: Long-horizon Understanding for Multi-turn Interactive Agents
di: Rakhsha, Amin, et al.
Pubblicazione: (2026)
di: Rakhsha, Amin, et al.
Pubblicazione: (2026)
KLong: Training LLM Agent for Extremely Long-horizon Tasks
di: Liu, Yue, et al.
Pubblicazione: (2026)
di: Liu, Yue, et al.
Pubblicazione: (2026)
M$^2$: Dual-Memory Augmentation for Long-Horizon Web Agents via Trajectory Summarization and Insight Retrieval
di: Yan, Dawei, et al.
Pubblicazione: (2026)
di: Yan, Dawei, et al.
Pubblicazione: (2026)
AndroTMem: From Interaction Trajectories to Anchored Memory in Long-Horizon GUI Agents
di: Shi, Yibo, et al.
Pubblicazione: (2026)
di: Shi, Yibo, et al.
Pubblicazione: (2026)
Path Learning with Trajectory Advantage Regression
di: Miyaguchi, Kohei
Pubblicazione: (2025)
di: Miyaguchi, Kohei
Pubblicazione: (2025)
Cooperative Multi-Agent Assignment over Stochastic Graphs via Constrained Reinforcement Learning
di: Agorio, Leopoldo, et al.
Pubblicazione: (2025)
di: Agorio, Leopoldo, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SDRT: Enhance Vision-Language Models by Self-Distillation with Diverse Reasoning Traces
di: Wu, Guande, et al.
Pubblicazione: (2025) -
Reinforcement Learning for Self-Improving Agent with Skill Library
di: Wang, Jiongxiao, et al.
Pubblicazione: (2025) -
CLEAR: Context Augmentation from Contrastive Learning of Experience via Agentic Reflection
di: Liu, Linbo, et al.
Pubblicazione: (2026) -
CSPLADE: Learned Sparse Retrieval with Causal Language Models
di: Xu, Zhichao, et al.
Pubblicazione: (2025) -
Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling
di: Liu, Yuchen, et al.
Pubblicazione: (2026)