STeCa: Step-level Trajectory Calibration for LLM Agent Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Hanlin, Wang, Jian, Leong, Chak Tou, Li, Wenjie |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
E2CL: Exploration-based Error Correction Learning for Embodied Agents
di: Wang, Hanlin, et al.
Pubblicazione: (2024)
di: Wang, Hanlin, et al.
Pubblicazione: (2024)
SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution
di: Wang, Hanlin, et al.
Pubblicazione: (2025)
di: Wang, Hanlin, et al.
Pubblicazione: (2025)
Seeing Isn't Believing: Mitigating Belief Inertia via Active Intervention in Embodied Agents
di: Wang, Hanlin, et al.
Pubblicazione: (2026)
di: Wang, Hanlin, et al.
Pubblicazione: (2026)
Scaling over Scaling: Exploring Test-Time Scaling Plateau in Large Reasoning Models
di: Wang, Jian, et al.
Pubblicazione: (2025)
di: Wang, Jian, et al.
Pubblicazione: (2025)
Imagine-then-Plan: Agent Learning from Adaptive Lookahead with World Models
di: Liu, Youwei, et al.
Pubblicazione: (2026)
di: Liu, Youwei, et al.
Pubblicazione: (2026)
Why Safeguarded Ships Run Aground? Aligned Large Language Models' Safety Mechanisms Tend to Be Anchored in The Template Region
di: Leong, Chak Tou, et al.
Pubblicazione: (2025)
di: Leong, Chak Tou, et al.
Pubblicazione: (2025)
TokenSkip: Controllable Chain-of-Thought Compression in LLMs
di: Xia, Heming, et al.
Pubblicazione: (2025)
di: Xia, Heming, et al.
Pubblicazione: (2025)
Watch Every Step! LLM Agent Learning via Iterative Step-Level Process Refinement
di: Xiong, Weimin, et al.
Pubblicazione: (2024)
di: Xiong, Weimin, et al.
Pubblicazione: (2024)
Instruct Once, Chat Consistently in Multiple Rounds: An Efficient Tuning Framework for Dialogue
di: Wang, Jian, et al.
Pubblicazione: (2024)
di: Wang, Jian, et al.
Pubblicazione: (2024)
COMAP: Co-Evolving World Models and Agent Policies for LLM Agents
di: Liu, Youwei, et al.
Pubblicazione: (2026)
di: Liu, Youwei, et al.
Pubblicazione: (2026)
Finding RELIEF: Shaping Reasoning Behavior without Reasoning Supervision via Belief Engineering
di: Leong, Chak Tou, et al.
Pubblicazione: (2026)
di: Leong, Chak Tou, et al.
Pubblicazione: (2026)
Supervised Reinforcement Learning: From Expert Trajectories to Step-wise Reasoning
di: Deng, Yihe, et al.
Pubblicazione: (2025)
di: Deng, Yihe, et al.
Pubblicazione: (2025)
LLM Reasoning as Trajectories: Step-Specific Representation Geometry and Correctness Signals
di: Sun, Lihao, et al.
Pubblicazione: (2026)
di: Sun, Lihao, et al.
Pubblicazione: (2026)
A Study on the Calibration of In-context Learning
di: Zhang, Hanlin, et al.
Pubblicazione: (2023)
di: Zhang, Hanlin, et al.
Pubblicazione: (2023)
Offline Reinforcement Learning for LLM Multi-Step Reasoning
di: Wang, Huaijie, et al.
Pubblicazione: (2024)
di: Wang, Huaijie, et al.
Pubblicazione: (2024)
Trial and Error: Exploration-Based Trajectory Optimization for LLM Agents
di: Song, Yifan, et al.
Pubblicazione: (2024)
di: Song, Yifan, et al.
Pubblicazione: (2024)
StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason
di: Zhang, Kaiyi, et al.
Pubblicazione: (2025)
di: Zhang, Kaiyi, et al.
Pubblicazione: (2025)
Merlin's Whisper: Enabling Efficient Reasoning in Large Language Models via Black-box Persuasive Prompting
di: Xia, Heming, et al.
Pubblicazione: (2025)
di: Xia, Heming, et al.
Pubblicazione: (2025)
TrajAgent: An LLM-Agent Framework for Trajectory Modeling via Large-and-Small Model Collaboration
di: Du, Yuwei, et al.
Pubblicazione: (2024)
di: Du, Yuwei, et al.
Pubblicazione: (2024)
Decoupling KL and Trajectories: A Unified Perspective for SFT, DAgger, Offline RL, and OPD in LLM Distillation
di: Zhao, Anhao, et al.
Pubblicazione: (2026)
di: Zhao, Anhao, et al.
Pubblicazione: (2026)
ATLaS: Agent Tuning via Learning Critical Steps
di: Chen, Zhixun, et al.
Pubblicazione: (2025)
di: Chen, Zhixun, et al.
Pubblicazione: (2025)
CaRT: Teaching LLM Agents to Know When They Know Enough
di: Liu, Grace, et al.
Pubblicazione: (2025)
di: Liu, Grace, et al.
Pubblicazione: (2025)
Induction Head Toxicity Mechanistically Explains Repetition Curse in Large Language Models
di: Wang, Shuxun, et al.
Pubblicazione: (2025)
di: Wang, Shuxun, et al.
Pubblicazione: (2025)
TSR: Trajectory-Search Rollouts for Multi-Turn RL of LLM Agents
di: Djuhera, Aladin, et al.
Pubblicazione: (2026)
di: Djuhera, Aladin, et al.
Pubblicazione: (2026)
RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning
di: Wang, Zihan, et al.
Pubblicazione: (2025)
di: Wang, Zihan, et al.
Pubblicazione: (2025)
On the Limitations of Language Targeted Pruning: Investigating the Calibration Language Impact in Multilingual LLM Pruning
di: Kurz, Simon, et al.
Pubblicazione: (2024)
di: Kurz, Simon, et al.
Pubblicazione: (2024)
Federated In-Context LLM Agent Learning
di: Wu, Panlong, et al.
Pubblicazione: (2024)
di: Wu, Panlong, et al.
Pubblicazione: (2024)
SkillAdaptor: Self-Adapting Skills for LLM Agents from Trajectories
di: Yu, Zhuoyun, et al.
Pubblicazione: (2026)
di: Yu, Zhuoyun, et al.
Pubblicazione: (2026)
Encoding Agent Trajectories as Representations with Sequence Transformers
di: Tsiligkaridis, Athanasios, et al.
Pubblicazione: (2024)
di: Tsiligkaridis, Athanasios, et al.
Pubblicazione: (2024)
TIER: Trajectory-Invariant Execution Rewards for Multi-Step Tool Composition
di: Kulkarni, Anay, et al.
Pubblicazione: (2026)
di: Kulkarni, Anay, et al.
Pubblicazione: (2026)
EMSEdit: Efficient Multi-Step Meta-Learning-based Model Editing
di: Li, Xiaopeng, et al.
Pubblicazione: (2025)
di: Li, Xiaopeng, et al.
Pubblicazione: (2025)
BAGEN: Are LLM Agents Budget-Aware?
di: Lin, Yuxiang, et al.
Pubblicazione: (2026)
di: Lin, Yuxiang, et al.
Pubblicazione: (2026)
LLM-AutoDP: Automatic Data Processing via LLM Agents for Model Fine-tuning
di: Huang, Wei, et al.
Pubblicazione: (2026)
di: Huang, Wei, et al.
Pubblicazione: (2026)
Sample-Efficient Online Learning in LM Agents via Hindsight Trajectory Rewriting
di: Hu, Michael Y., et al.
Pubblicazione: (2025)
di: Hu, Michael Y., et al.
Pubblicazione: (2025)
MPO: Boosting LLM Agents with Meta Plan Optimization
di: Xiong, Weimin, et al.
Pubblicazione: (2025)
di: Xiong, Weimin, et al.
Pubblicazione: (2025)
Trajectory as the Teacher: Few-Step Discrete Flow Matching via Energy-Navigated Distillation
di: Monsefi, Amin Karimi, et al.
Pubblicazione: (2026)
di: Monsefi, Amin Karimi, et al.
Pubblicazione: (2026)
ML-Agent: Reinforcing LLM Agents for Autonomous Machine Learning Engineering
di: Liu, Zexi, et al.
Pubblicazione: (2025)
di: Liu, Zexi, et al.
Pubblicazione: (2025)
R$^2$PO: Decoupling Training Trajectories from Inference Responses for LLM Reasoning
di: Wang, Jingchu, et al.
Pubblicazione: (2026)
di: Wang, Jingchu, et al.
Pubblicazione: (2026)
SSR-Zero: Simple Self-Rewarding Reinforcement Learning for Machine Translation
di: Yang, Wenjie, et al.
Pubblicazione: (2025)
di: Yang, Wenjie, et al.
Pubblicazione: (2025)
AgentRewardBench: Evaluating Automatic Evaluations of Web Agent Trajectories
di: Lù, Xing Han, et al.
Pubblicazione: (2025)
di: Lù, Xing Han, et al.
Pubblicazione: (2025)
Documenti analoghi
-
E2CL: Exploration-based Error Correction Learning for Embodied Agents
di: Wang, Hanlin, et al.
Pubblicazione: (2024) -
SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution
di: Wang, Hanlin, et al.
Pubblicazione: (2025) -
Seeing Isn't Believing: Mitigating Belief Inertia via Active Intervention in Embodied Agents
di: Wang, Hanlin, et al.
Pubblicazione: (2026) -
Scaling over Scaling: Exploring Test-Time Scaling Plateau in Large Reasoning Models
di: Wang, Jian, et al.
Pubblicazione: (2025) -
Imagine-then-Plan: Agent Learning from Adaptive Lookahead with World Models
di: Liu, Youwei, et al.
Pubblicazione: (2026)