Agent World Model: Infinity Synthetic Environments for Agentic Reinforcement Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Zhaoyang, Xu, Canwen, Liu, Boyi, Wang, Yite, Han, Siwei, Yao, Zhewei, Yao, Huaxiu, He, Yuxiong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Learning to Self-Evolve
por: Chen, Xiaoyin, et al.
Publicado: (2026)
por: Chen, Xiaoyin, et al.
Publicado: (2026)
DARE-bench: Evaluating Modeling and Instruction Fidelity of LLMs in Data Science
por: Shu, Fan, et al.
Publicado: (2026)
por: Shu, Fan, et al.
Publicado: (2026)
Learning to Hint for Reinforcement Learning
por: Xia, Yu, et al.
Publicado: (2026)
por: Xia, Yu, et al.
Publicado: (2026)
ExCoT: Optimizing Reasoning for Text-to-SQL with Execution Feedback
por: Zhai, Bohan, et al.
Publicado: (2025)
por: Zhai, Bohan, et al.
Publicado: (2025)
MedOrch: Medical Diagnosis with Tool-Augmented Reasoning Agents for Flexible Extensibility
por: He, Yexiao, et al.
Publicado: (2025)
por: He, Yexiao, et al.
Publicado: (2025)
SwiftKV: Fast Prefill-Optimized Inference with Knowledge-Preserving Model Transformation
por: Qiao, Aurick, et al.
Publicado: (2024)
por: Qiao, Aurick, et al.
Publicado: (2024)
SynthAgent: Adapting Web Agents with Synthetic Supervision
por: Wang, Zhaoyang, et al.
Publicado: (2025)
por: Wang, Zhaoyang, et al.
Publicado: (2025)
R$^3$-SQL: Ranking Reward and Resampling for Text-to-SQL
por: Han, Hojae, et al.
Publicado: (2026)
por: Han, Hojae, et al.
Publicado: (2026)
Efficient Long CoT Reasoning in Small Language Models
por: Wang, Zhaoyang, et al.
Publicado: (2025)
por: Wang, Zhaoyang, et al.
Publicado: (2025)
ConvCodeWorld: Benchmarking Conversational Code Generation in Reproducible Feedback Environments
por: Han, Hojae, et al.
Publicado: (2025)
por: Han, Hojae, et al.
Publicado: (2025)
ClawArena: Benchmarking AI Agents in Evolving Information Environments
por: Ji, Haonian, et al.
Publicado: (2026)
por: Ji, Haonian, et al.
Publicado: (2026)
Generating Chain-of-Thoughts with a Pairwise-Comparison Approach to Searching for the Most Promising Intermediate Thought
por: Zhang, Zhen-Yu, et al.
Publicado: (2024)
por: Zhang, Zhen-Yu, et al.
Publicado: (2024)
Agentic Verification for Ambiguous Query Disambiguation
por: Lee, Youngwon, et al.
Publicado: (2025)
por: Lee, Youngwon, et al.
Publicado: (2025)
From EduVisBench to EduVisAgent: A Benchmark and Multi-Agent Framework for Reasoning-Driven Pedagogical Visualization
por: Ji, Haonian, et al.
Publicado: (2025)
por: Ji, Haonian, et al.
Publicado: (2025)
Self-Distilled Agentic Reinforcement Learning
por: Lu, Zhengxi, et al.
Publicado: (2026)
por: Lu, Zhengxi, et al.
Publicado: (2026)
WebXSkill: Skill Learning for Autonomous Web Agents
por: Wang, Zhaoyang, et al.
Publicado: (2026)
por: Wang, Zhaoyang, et al.
Publicado: (2026)
AutoForge: Automated Environment Synthesis for Agentic Reinforcement Learning
por: Cai, Shihao, et al.
Publicado: (2025)
por: Cai, Shihao, et al.
Publicado: (2025)
Ever: Mitigating Hallucination in Large Language Models through Real-Time Verification and Rectification
por: Kang, Haoqiang, et al.
Publicado: (2023)
por: Kang, Haoqiang, et al.
Publicado: (2023)
Arctic-Text2SQL-R1: Simple Rewards, Strong Reasoning in Text-to-SQL
por: Yao, Zhewei, et al.
Publicado: (2025)
por: Yao, Zhewei, et al.
Publicado: (2025)
Anyprefer: An Agentic Framework for Preference Data Synthesis
por: Zhou, Yiyang, et al.
Publicado: (2025)
por: Zhou, Yiyang, et al.
Publicado: (2025)
SEW: Self-Evolving Agentic Workflows for Automated Code Generation
por: Liu, Siwei, et al.
Publicado: (2025)
por: Liu, Siwei, et al.
Publicado: (2025)
ReFoRCE: A Text-to-SQL Agent with Self-Refinement, Consensus Enforcement, and Column Exploration
por: Deng, Minghang, et al.
Publicado: (2025)
por: Deng, Minghang, et al.
Publicado: (2025)
Terminal-World: Scaling Terminal-Agent Environments via Agent Skills
por: Cheng, Zihao, et al.
Publicado: (2026)
por: Cheng, Zihao, et al.
Publicado: (2026)
When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial Reasoning
por: Yu, Shoubin, et al.
Publicado: (2026)
por: Yu, Shoubin, et al.
Publicado: (2026)
O-Researcher: An Open Ended Deep Research Model via Multi-Agent Distillation and Agentic RL
por: Yao, Yi, et al.
Publicado: (2026)
por: Yao, Yi, et al.
Publicado: (2026)
Chain-of-Agents: End-to-End Agent Foundation Models via Multi-Agent Distillation and Agentic RL
por: Li, Weizhen, et al.
Publicado: (2025)
por: Li, Weizhen, et al.
Publicado: (2025)
GUI-Libra: Training Native GUI Agents to Reason and Act with Action-aware Supervision and Partially Verifiable RL
por: Yang, Rui, et al.
Publicado: (2026)
por: Yang, Rui, et al.
Publicado: (2026)
Inference Scaling for Bridging Retrieval and Augmented Generation
por: Lee, Youngwon, et al.
Publicado: (2024)
por: Lee, Youngwon, et al.
Publicado: (2024)
CORD: Balancing COnsistency and Rank Distillation for Robust Retrieval-Augmented Generation
por: Lee, Youngwon, et al.
Publicado: (2024)
por: Lee, Youngwon, et al.
Publicado: (2024)
REMAC: Self-Reflective and Self-Evolving Multi-Agent Collaboration for Long-Horizon Robot Manipulation
por: Yuan, Puzhen, et al.
Publicado: (2025)
por: Yuan, Puzhen, et al.
Publicado: (2025)
Agentic Reinforcement Learning for Real-World Code Repair
por: Zhu, Siyu, et al.
Publicado: (2025)
por: Zhu, Siyu, et al.
Publicado: (2025)
Your Agent, Their Asset: A Real-World Safety Analysis of OpenClaw
por: Wang, Zijun, et al.
Publicado: (2026)
por: Wang, Zijun, et al.
Publicado: (2026)
VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents
por: Wang, Kangrui, et al.
Publicado: (2025)
por: Wang, Kangrui, et al.
Publicado: (2025)
Infinity Parser: Layout Aware Reinforcement Learning for Scanned Document Parsing
por: Wang, Baode, et al.
Publicado: (2025)
por: Wang, Baode, et al.
Publicado: (2025)
AOrchestra: Automating Sub-Agent Creation for Agentic Orchestration
por: Ruan, Jianhao, et al.
Publicado: (2026)
por: Ruan, Jianhao, et al.
Publicado: (2026)
A Comprehensive Survey on Reinforcement Learning-based Agentic Search: Foundations, Roles, Optimizations, Evaluations, and Applications
por: Lin, Minhua, et al.
Publicado: (2025)
por: Lin, Minhua, et al.
Publicado: (2025)
Strategic Navigation or Stochastic Search? How Agents and Humans Reason Over Document Collections
por: Borchmann, Łukasz, et al.
Publicado: (2026)
por: Borchmann, Łukasz, et al.
Publicado: (2026)
Aligning Agentic World Models via Knowledgeable Experience Learning
por: Ren, Baochang, et al.
Publicado: (2026)
por: Ren, Baochang, et al.
Publicado: (2026)
DeepSpeed Data Efficiency: Improving Deep Learning Model Quality and Training Efficiency via Efficient Data Sampling and Routing
por: Li, Conglong, et al.
Publicado: (2022)
por: Li, Conglong, et al.
Publicado: (2022)
AutoEnv: Automated Environments for Measuring Cross-Environment Agent Learning
por: Zhang, Jiayi, et al.
Publicado: (2025)
por: Zhang, Jiayi, et al.
Publicado: (2025)
Ejemplares similares
-
Learning to Self-Evolve
por: Chen, Xiaoyin, et al.
Publicado: (2026) -
DARE-bench: Evaluating Modeling and Instruction Fidelity of LLMs in Data Science
por: Shu, Fan, et al.
Publicado: (2026) -
Learning to Hint for Reinforcement Learning
por: Xia, Yu, et al.
Publicado: (2026) -
ExCoT: Optimizing Reasoning for Text-to-SQL with Execution Feedback
por: Zhai, Bohan, et al.
Publicado: (2025) -
MedOrch: Medical Diagnosis with Tool-Augmented Reasoning Agents for Flexible Extensibility
por: He, Yexiao, et al.
Publicado: (2025)