Spark: Strategic Policy-Aware Exploration via Dynamic Branching for Long-Horizon Agentic Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Jinyang, Yang, Shuo, Yang, Changpeng, Shen, Yuhao, Zhang, Shuai, Wen, Zhengqi, Tao, Jianhua |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Atlas: Orchestrating Heterogeneous Models and Tools for Multi-Domain Complex Reasoning
par: Wu, Jinyang, et autres
Publié: (2026)
par: Wu, Jinyang, et autres
Publié: (2026)
SSL: Sweet Spot Learning for Differentiated Guidance in Agentic Optimization
par: Wu, Jinyang, et autres
Publié: (2026)
par: Wu, Jinyang, et autres
Publié: (2026)
TemplateRL: Structured Template-Guided Reinforcement Learning for LLM Reasoning
par: Wu, Jinyang, et autres
Publié: (2025)
par: Wu, Jinyang, et autres
Publié: (2025)
Exploring Knowledge Purification in Multi-Teacher Knowledge Distillation for LLMs
par: Jin, Ruihan, et autres
Publié: (2026)
par: Jin, Ruihan, et autres
Publié: (2026)
RadialRouter: Structured Representation for Efficient and Robust Large Language Models Routing
par: Jin, Ruihan, et autres
Publié: (2025)
par: Jin, Ruihan, et autres
Publié: (2025)
Maestro: Reinforcement Learning to Orchestrate Hierarchical Model-Skill Ensembles
par: Wu, Jinyang, et autres
Publié: (2026)
par: Wu, Jinyang, et autres
Publié: (2026)
Beyond Examples: High-level Automated Reasoning Paradigm in In-Context Learning via MCTS
par: Wu, Jinyang, et autres
Publié: (2024)
par: Wu, Jinyang, et autres
Publié: (2024)
DReSS: Data-driven Regularized Structured Streamlining for Large Language Models
par: Feng, Mingkuan, et autres
Publié: (2025)
par: Feng, Mingkuan, et autres
Publié: (2025)
BranPO: Scalable Contrastive Branch Sampling for Long-Horizon Agentic Reinforcement Learning
par: Zhao, Yubao, et autres
Publié: (2026)
par: Zhao, Yubao, et autres
Publié: (2026)
Fake News Detection and Manipulation Reasoning via Large Vision-Language Models
par: Jin, Ruihan, et autres
Publié: (2024)
par: Jin, Ruihan, et autres
Publié: (2024)
AStar: Boosting Multimodal Reasoning with Automated Structured Thinking
par: Wu, Jinyang, et autres
Publié: (2025)
par: Wu, Jinyang, et autres
Publié: (2025)
Lost in the Maze: Overcoming Context Limitations in Long-Horizon Agentic Search
par: Yen, Howard, et autres
Publié: (2025)
par: Yen, Howard, et autres
Publié: (2025)
Two-Stage Regularization-Based Structured Pruning for LLMs
par: Feng, Mingkuan, et autres
Publié: (2025)
par: Feng, Mingkuan, et autres
Publié: (2025)
EvoSpark: Endogenous Interactive Agent Societies for Unified Long-Horizon Narrative Evolution
par: He, Shiyu, et autres
Publié: (2026)
par: He, Shiyu, et autres
Publié: (2026)
KS-LLM: Knowledge Selection of Large Language Models with Evidence Document for Question Answering
par: Zheng, Xinxin, et autres
Publié: (2024)
par: Zheng, Xinxin, et autres
Publié: (2024)
Agentic Aggregation for Parallel Scaling of Long-Horizon Agentic Tasks
par: Lee, Yoonsang, et autres
Publié: (2026)
par: Lee, Yoonsang, et autres
Publié: (2026)
Implicit Strategic Optimization: Rethinking Long-Horizon Decision-Making in Adversarial Poker Environments
par: Xia, Boyang, et autres
Publié: (2026)
par: Xia, Boyang, et autres
Publié: (2026)
Context as a Tool: Context Management for Long-Horizon SWE-Agents
par: Liu, Shukai, et autres
Publié: (2025)
par: Liu, Shukai, et autres
Publié: (2025)
Milestone-Guided Policy Learning for Long-Horizon Language Agents
par: Wang, Zixuan, et autres
Publié: (2026)
par: Wang, Zixuan, et autres
Publié: (2026)
Debunk and Infer: Multimodal Fake News Detection via Diffusion-Generated Evidence and LLM Reasoning
par: Yan, Kaiying, et autres
Publié: (2025)
par: Yan, Kaiying, et autres
Publié: (2025)
Learning on the Job: An Experience-Driven Self-Evolving Agent for Long-Horizon Tasks
par: Yang, Cheng, et autres
Publié: (2025)
par: Yang, Cheng, et autres
Publié: (2025)
MemWeaver: Weaving Hybrid Memories for Traceable Long-Horizon Agentic Reasoning
par: Ye, Juexiang, et autres
Publié: (2026)
par: Ye, Juexiang, et autres
Publié: (2026)
Sparks of Cooperative Reasoning: LLMs as Strategic Hanabi Agents
par: Ramesh, Mahesh, et autres
Publié: (2026)
par: Ramesh, Mahesh, et autres
Publié: (2026)
DeepPlanning: Benchmarking Long-Horizon Agentic Planning with Verifiable Constraints
par: Zhang, Yinger, et autres
Publié: (2026)
par: Zhang, Yinger, et autres
Publié: (2026)
From Imitation to Discrimination: Toward A Generalized Curriculum Advantage Mechanism Enhancing Cross-Domain Reasoning Tasks
par: Yang, Changpeng, et autres
Publié: (2025)
par: Yang, Changpeng, et autres
Publié: (2025)
OCR-Memory: Optical Context Retrieval for Long-Horizon Agent Memory
par: Li, Jinze, et autres
Publié: (2026)
par: Li, Jinze, et autres
Publié: (2026)
Pandora's Box or Aladdin's Lamp: A Comprehensive Analysis Revealing the Role of RAG Noise in Large Language Models
par: Wu, Jinyang, et autres
Publié: (2024)
par: Wu, Jinyang, et autres
Publié: (2024)
Double: Breaking the Acceleration Limit via Double Retrieval Speculative Parallelism
par: Shen, Yuhao, et autres
Publié: (2026)
par: Shen, Yuhao, et autres
Publié: (2026)
Can large language models understand uncommon meanings of common words?
par: Wu, Jinyang, et autres
Publié: (2024)
par: Wu, Jinyang, et autres
Publié: (2024)
JADE: Bridging the Strategic-Operational Gap in Dynamic Agentic RAG
par: Chen, Yiqun, et autres
Publié: (2026)
par: Chen, Yiqun, et autres
Publié: (2026)
Learning Agentic Policy from Action Guidance
par: Ji, Yuxiang, et autres
Publié: (2026)
par: Ji, Yuxiang, et autres
Publié: (2026)
Agent Explorative Policy Optimization for Multimodal Agentic Reasoning
par: Kang, Minki, et autres
Publié: (2026)
par: Kang, Minki, et autres
Publié: (2026)
CARL: Criticality-Aware Agentic Reinforcement Learning
par: Shen, Leyang, et autres
Publié: (2025)
par: Shen, Leyang, et autres
Publié: (2025)
Search More, Think Less: Rethinking Long-Horizon Agentic Search for Efficiency and Generalization
par: Chen, Qianben, et autres
Publié: (2026)
par: Chen, Qianben, et autres
Publié: (2026)
Internal Planning in Language Models: Characterizing Horizon and Branch Awareness
par: Ustaomeroglu, Muhammed, et autres
Publié: (2025)
par: Ustaomeroglu, Muhammed, et autres
Publié: (2025)
Don't Break the Cache: An Evaluation of Prompt Caching for Long-Horizon Agentic Tasks
par: Lumer, Elias, et autres
Publié: (2026)
par: Lumer, Elias, et autres
Publié: (2026)
Table-as-Search: Formulate Long-Horizon Agentic Information Seeking as Table Completion
par: Lan, Tian, et autres
Publié: (2026)
par: Lan, Tian, et autres
Publié: (2026)
Deep Learning Approaches for Multimodal Intent Recognition: A Survey
par: Zhao, Jingwei, et autres
Publié: (2025)
par: Zhao, Jingwei, et autres
Publié: (2025)
StepPO: Step-Aligned Policy Optimization for Agentic Reinforcement Learning
par: Wang, Daoyu, et autres
Publié: (2026)
par: Wang, Daoyu, et autres
Publié: (2026)
Beyond Templates: Dynamic Adaptation of Reasoning Demonstrations via Feasibility-Aware Exploration
par: Wu, Yong, et autres
Publié: (2025)
par: Wu, Yong, et autres
Publié: (2025)
Documents similaires
-
Atlas: Orchestrating Heterogeneous Models and Tools for Multi-Domain Complex Reasoning
par: Wu, Jinyang, et autres
Publié: (2026) -
SSL: Sweet Spot Learning for Differentiated Guidance in Agentic Optimization
par: Wu, Jinyang, et autres
Publié: (2026) -
TemplateRL: Structured Template-Guided Reinforcement Learning for LLM Reasoning
par: Wu, Jinyang, et autres
Publié: (2025) -
Exploring Knowledge Purification in Multi-Teacher Knowledge Distillation for LLMs
par: Jin, Ruihan, et autres
Publié: (2026) -
RadialRouter: Structured Representation for Efficient and Robust Large Language Models Routing
par: Jin, Ruihan, et autres
Publié: (2025)