SPPO: Sequence-Level PPO for Long-Horizon Reasoning Tasks
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Tianyi, Li, Yixia, Li, Long, Chen, Yibiao, Huang, Shaohan, Chen, Yun, Li, Peng, Liu, Yang, Chen, Guanhua |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Anchored Policy Optimization: Mitigating Exploration Collapse Via Support-Constrained Rectification
por: Wang, Tianyi, et al.
Publicado: (2026)
por: Wang, Tianyi, et al.
Publicado: (2026)
SeTAR: Out-of-Distribution Detection with Selective Low-Rank Approximation
por: Li, Yixia, et al.
Publicado: (2024)
por: Li, Yixia, et al.
Publicado: (2024)
Recurrent Reasoning with Vision-Language Models for Estimating Long-Horizon Embodied Task Progress
por: Zhang, Yuelin, et al.
Publicado: (2026)
por: Zhang, Yuelin, et al.
Publicado: (2026)
Segmental Advantage Estimation: Enhancing PPO for Long-Context LLM Training
por: Gong, Xue, et al.
Publicado: (2026)
por: Gong, Xue, et al.
Publicado: (2026)
When to Re-Commit: Temporal Abstraction Discovery for Long-Horizon Vision-Language Reasoning
por: Li, Chen, et al.
Publicado: (2026)
por: Li, Chen, et al.
Publicado: (2026)
Heterogeneous Multi-Expert Reinforcement Learning for Long-Horizon Multi-Goal Tasks in Autonomous Forklifts
por: Chen, Yun, et al.
Publicado: (2026)
por: Chen, Yun, et al.
Publicado: (2026)
AgentFugue: Agent Scaling for Long-Horizon Tasks through Collective Reasoning
por: Hu, Yuyang, et al.
Publicado: (2026)
por: Hu, Yuyang, et al.
Publicado: (2026)
GUI-Shepherd: Reliable Process Reward and Verification for Long-Sequence GUI Tasks
por: Chen, Cong, et al.
Publicado: (2025)
por: Chen, Cong, et al.
Publicado: (2025)
Learning Agent-Compatible Context Management for Long-Horizon Tasks
por: Yi, Lu, et al.
Publicado: (2026)
por: Yi, Lu, et al.
Publicado: (2026)
ClothPPO: A Proximal Policy Optimization Enhancing Framework for Robotic Cloth Manipulation with Observation-Aligned Action Spaces
por: Yang, Libing, et al.
Publicado: (2024)
por: Yang, Libing, et al.
Publicado: (2024)
RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents
por: Zhang, Zijing, et al.
Publicado: (2025)
por: Zhang, Zijing, et al.
Publicado: (2025)
Co-Evolving LLM Decision and Skill Bank Agents for Long-Horizon Tasks
por: Wu, Xiyang, et al.
Publicado: (2026)
por: Wu, Xiyang, et al.
Publicado: (2026)
No More Stale Feedback: Co-Evolving Critics for Open-World Agent Learning
por: Li, Zhicong, et al.
Publicado: (2026)
por: Li, Zhicong, et al.
Publicado: (2026)
STRUCTUREDAGENT: Planning with AND/OR Trees for Long-Horizon Web Tasks
por: Lobo, ELita, et al.
Publicado: (2026)
por: Lobo, ELita, et al.
Publicado: (2026)
SAG-Agent: Enabling Long-Horizon Reasoning in Strategy Games via Dynamic Knowledge Graphs
por: Tang, Chenwei, et al.
Publicado: (2025)
por: Tang, Chenwei, et al.
Publicado: (2025)
SeeUPO: Sequence-Level Agentic-RL with Convergence Guarantees
por: Hu, Tianyi, et al.
Publicado: (2026)
por: Hu, Tianyi, et al.
Publicado: (2026)
VisCodex: Unified Multimodal Code Generation via Merging Vision and Coding Models
por: Jiang, Lingjie, et al.
Publicado: (2025)
por: Jiang, Lingjie, et al.
Publicado: (2025)
Rethinking the Role of Entropy in Optimizing Tool-Use Behaviors for Large Language Model Agents
por: Li, Zeping, et al.
Publicado: (2026)
por: Li, Zeping, et al.
Publicado: (2026)
RoboClaw: An Agentic Framework for Scalable Long-Horizon Robotic Tasks
por: Li, Ruiying, et al.
Publicado: (2026)
por: Li, Ruiying, et al.
Publicado: (2026)
GTA: Generating Long-Horizon Tasks for Web Agents at Scale
por: Huang, Tenghao, et al.
Publicado: (2026)
por: Huang, Tenghao, et al.
Publicado: (2026)
MemOCR: Layout-Aware Visual Memory for Efficient Long-Horizon Reasoning
por: Shi, Yaorui, et al.
Publicado: (2026)
por: Shi, Yaorui, et al.
Publicado: (2026)
Optimus-1: Hybrid Multimodal Memory Empowered Agents Excel in Long-Horizon Tasks
por: Li, Zaijing, et al.
Publicado: (2024)
por: Li, Zaijing, et al.
Publicado: (2024)
DETACH: Cross-domain Learning for Long-Horizon Tasks via Mixture of Disentangled Experts
por: Shen, Yutong, et al.
Publicado: (2025)
por: Shen, Yutong, et al.
Publicado: (2025)
Towards Fair and Comprehensive Evaluation of Routers in Collaborative LLM Systems
por: Wu, Wanxing, et al.
Publicado: (2026)
por: Wu, Wanxing, et al.
Publicado: (2026)
Thinking in Text and Images: Interleaved Vision--Language Reasoning Traces for Long-Horizon Robot Manipulation
por: Liu, Jinkun, et al.
Publicado: (2026)
por: Liu, Jinkun, et al.
Publicado: (2026)
LifeBench: A Benchmark for Long-Horizon Multi-Source Memory
por: Cheng, Zihao, et al.
Publicado: (2026)
por: Cheng, Zihao, et al.
Publicado: (2026)
From Abstract to Contextual: What LLMs Still Cannot Do in Mathematics
por: Cao, Bowen, et al.
Publicado: (2026)
por: Cao, Bowen, et al.
Publicado: (2026)
ELHPlan: Efficient Long-Horizon Task Planning for Multi-Agent Collaboration
por: Ling, Shaobin, et al.
Publicado: (2025)
por: Ling, Shaobin, et al.
Publicado: (2025)
SkillTree: Explainable Skill-Based Deep Reinforcement Learning for Long-Horizon Control Tasks
por: Wen, Yongyan, et al.
Publicado: (2024)
por: Wen, Yongyan, et al.
Publicado: (2024)
NaturalGAIA: A Verifiable Benchmark and Hierarchical Framework for Long-Horizon GUI Tasks
por: Zheng, Zihan, et al.
Publicado: (2025)
por: Zheng, Zihan, et al.
Publicado: (2025)
Beyond Entangled Planning: Task-Decoupled Planning for Long-Horizon Agents
por: Li, Yunfan, et al.
Publicado: (2026)
por: Li, Yunfan, et al.
Publicado: (2026)
Enhancing Large Language Model Reasoning via Selective Critical Token Fine-Tuning
por: Ruan, Zhiwen, et al.
Publicado: (2025)
por: Ruan, Zhiwen, et al.
Publicado: (2025)
Non-Markovian Long-Horizon Robot Manipulation via Keyframe Chaining
por: Chen, Yipeng, et al.
Publicado: (2026)
por: Chen, Yipeng, et al.
Publicado: (2026)
SKETCH: Semantic Key-Point Conditioning for Long-Horizon Vessel Trajectory Prediction
por: Gan, Linyong, et al.
Publicado: (2026)
por: Gan, Linyong, et al.
Publicado: (2026)
Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only
por: Zhang, Qingru, et al.
Publicado: (2025)
por: Zhang, Qingru, et al.
Publicado: (2025)
Can LLM Agents Be CFOs? Benchmarking Long-Horizon Resource Allocation in an Uncertain Enterprise Environment
por: Han, Yi, et al.
Publicado: (2026)
por: Han, Yi, et al.
Publicado: (2026)
Interaction as Intelligence Part II: Asynchronous Human-Agent Rollout for Long-Horizon Task Training
por: Fu, Dayuan, et al.
Publicado: (2025)
por: Fu, Dayuan, et al.
Publicado: (2025)
Distract Large Language Models for Automatic Jailbreak Attack
por: Xiao, Zeguan, et al.
Publicado: (2024)
por: Xiao, Zeguan, et al.
Publicado: (2024)
LongSeeker: Elastic Context Orchestration for Long-Horizon Search Agents
por: Lu, Yijun, et al.
Publicado: (2026)
por: Lu, Yijun, et al.
Publicado: (2026)
TOPPO: Rethinking PPO for Multi-Task Reinforcement Learning with Critic Balancing
por: Li, Yuanpeng, et al.
Publicado: (2026)
por: Li, Yuanpeng, et al.
Publicado: (2026)
Ejemplares similares
-
Anchored Policy Optimization: Mitigating Exploration Collapse Via Support-Constrained Rectification
por: Wang, Tianyi, et al.
Publicado: (2026) -
SeTAR: Out-of-Distribution Detection with Selective Low-Rank Approximation
por: Li, Yixia, et al.
Publicado: (2024) -
Recurrent Reasoning with Vision-Language Models for Estimating Long-Horizon Embodied Task Progress
por: Zhang, Yuelin, et al.
Publicado: (2026) -
Segmental Advantage Estimation: Enhancing PPO for Long-Context LLM Training
por: Gong, Xue, et al.
Publicado: (2026) -
When to Re-Commit: Temporal Abstraction Discovery for Long-Horizon Vision-Language Reasoning
por: Li, Chen, et al.
Publicado: (2026)