Training One Model to Master Cross-Level Agentic Actions via Reinforcement Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | He, Kaichen, Wang, Zihao, Li, Muyao, Liu, Anji, Liang, Yitao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
OpenHA: A Series of Open-Source Hierarchical Agentic Models in Minecraft
di: Wang, Zihao, et al.
Pubblicazione: (2025)
di: Wang, Zihao, et al.
Pubblicazione: (2025)
JARVIS-VLA: Post-Training Large-Scale Vision Language Models to Play Visual Games with Keyboards and Mouse
di: Li, Muyao, et al.
Pubblicazione: (2025)
di: Li, Muyao, et al.
Pubblicazione: (2025)
ROCKET-2: Steering Visuomotor Policy via Cross-View Goal Alignment
di: Cai, Shaofei, et al.
Pubblicazione: (2025)
di: Cai, Shaofei, et al.
Pubblicazione: (2025)
Lookahead Path Likelihood Optimization for Diffusion LLMs
di: Liu, Xuejie, et al.
Pubblicazione: (2026)
di: Liu, Xuejie, et al.
Pubblicazione: (2026)
OmniJARVIS: Unified Vision-Language-Action Tokenization Enables Open-World Instruction Following Agents
di: Wang, Zihao, et al.
Pubblicazione: (2024)
di: Wang, Zihao, et al.
Pubblicazione: (2024)
GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents
di: Cai, Shaofei, et al.
Pubblicazione: (2024)
di: Cai, Shaofei, et al.
Pubblicazione: (2024)
MCU: An Evaluation Framework for Open-Ended Game Agents
di: Zheng, Xinyue, et al.
Pubblicazione: (2023)
di: Zheng, Xinyue, et al.
Pubblicazione: (2023)
A Tractable Inference Perspective of Offline RL
di: Liu, Xuejie, et al.
Pubblicazione: (2023)
di: Liu, Xuejie, et al.
Pubblicazione: (2023)
Sequential Bayesian Optimal Experimental Design in Infinite Dimensions via Policy Gradient Reinforcement Learning
di: Shen, Kaichen, et al.
Pubblicazione: (2026)
di: Shen, Kaichen, et al.
Pubblicazione: (2026)
Refining Multidimensional Video Reward Models via Disentangled Influence Functions
di: Wang, Muyao, et al.
Pubblicazione: (2026)
di: Wang, Muyao, et al.
Pubblicazione: (2026)
SLEA-RL: Step-Level Experience Augmented Reinforcement Learning for Multi-Turn Agentic Training
di: Wang, Prince Zizhuang, et al.
Pubblicazione: (2026)
di: Wang, Prince Zizhuang, et al.
Pubblicazione: (2026)
Tractable Transformers for Flexible Conditional Generation
di: Liu, Anji, et al.
Pubblicazione: (2025)
di: Liu, Anji, et al.
Pubblicazione: (2025)
Resolving Action Bottleneck: Agentic Reinforcement Learning Informed by Token-Level Energy
di: He, Langzhou, et al.
Pubblicazione: (2026)
di: He, Langzhou, et al.
Pubblicazione: (2026)
Reinforcement Learning for Reasoning in Large Language Models with One Training Example
di: Wang, Yiping, et al.
Pubblicazione: (2025)
di: Wang, Yiping, et al.
Pubblicazione: (2025)
Tree Training: Accelerating Agentic LLMs Training via Shared Prefix Reuse
di: Wang, Jinghui, et al.
Pubblicazione: (2025)
di: Wang, Jinghui, et al.
Pubblicazione: (2025)
Model-Based Reinforcement Learning with Multi-Task Offline Pretraining
di: Pan, Minting, et al.
Pubblicazione: (2023)
di: Pan, Minting, et al.
Pubblicazione: (2023)
Video-Enhanced Offline Reinforcement Learning: A Model-Based Approach
di: Pan, Minting, et al.
Pubblicazione: (2025)
di: Pan, Minting, et al.
Pubblicazione: (2025)
Agentic Transformers Provably Learn to Search via Reinforcement Learning
di: Yang, Tong, et al.
Pubblicazione: (2026)
di: Yang, Tong, et al.
Pubblicazione: (2026)
Agent World Model: Infinity Synthetic Environments for Agentic Reinforcement Learning
di: Wang, Zhaoyang, et al.
Pubblicazione: (2026)
di: Wang, Zhaoyang, et al.
Pubblicazione: (2026)
DAWM: Diffusion Action World Models for Offline Reinforcement Learning via Action-Inferred Transitions
di: Li, Zongyue, et al.
Pubblicazione: (2025)
di: Li, Zongyue, et al.
Pubblicazione: (2025)
TimeMaster: Training Time-Series Multimodal LLMs to Reason via Reinforcement Learning
di: Zhang, Junru, et al.
Pubblicazione: (2025)
di: Zhang, Junru, et al.
Pubblicazione: (2025)
Rethinking Probabilistic Circuit Parameter Learning
di: Liu, Anji, et al.
Pubblicazione: (2025)
di: Liu, Anji, et al.
Pubblicazione: (2025)
NOVER: Incentive Training for Language Models via Verifier-Free Reinforcement Learning
di: Liu, Wei, et al.
Pubblicazione: (2025)
di: Liu, Wei, et al.
Pubblicazione: (2025)
Latent Nonlinear Denoising Score Matching for Enhanced Learning of Structured Distributions
di: Shen, Kaichen, et al.
Pubblicazione: (2025)
di: Shen, Kaichen, et al.
Pubblicazione: (2025)
Image Inpainting via Tractable Steering of Diffusion Models
di: Liu, Anji, et al.
Pubblicazione: (2023)
di: Liu, Anji, et al.
Pubblicazione: (2023)
RobustVLA: Robustness-Aware Reinforcement Post-Training for Vision-Language-Action Models
di: Zhang, Hongyin, et al.
Pubblicazione: (2025)
di: Zhang, Hongyin, et al.
Pubblicazione: (2025)
Action Shapley: A Training Data Selection Metric for World Model in Reinforcement Learning
di: Ghosh, Rajat, et al.
Pubblicazione: (2026)
di: Ghosh, Rajat, et al.
Pubblicazione: (2026)
Real-World Reinforcement Learning of Active Perception Behaviors
di: Hu, Edward S., et al.
Pubblicazione: (2025)
di: Hu, Edward S., et al.
Pubblicazione: (2025)
AcceRL: A Distributed Asynchronous Reinforcement Learning and World Model Framework for Vision-Language-Action Models
di: Lu, Chengxuan, et al.
Pubblicazione: (2026)
di: Lu, Chengxuan, et al.
Pubblicazione: (2026)
Treating Brain-inspired Memories as Priors for Diffusion Model to Forecast Multivariate Time Series
di: Wang, Muyao, et al.
Pubblicazione: (2024)
di: Wang, Muyao, et al.
Pubblicazione: (2024)
One for All: Towards Training One Graph Model for All Classification Tasks
di: Liu, Hao, et al.
Pubblicazione: (2023)
di: Liu, Hao, et al.
Pubblicazione: (2023)
Vintix: Action Model via In-Context Reinforcement Learning
di: Polubarov, Andrey, et al.
Pubblicazione: (2025)
di: Polubarov, Andrey, et al.
Pubblicazione: (2025)
Training Language Models to Self-Correct via Reinforcement Learning
di: Kumar, Aviral, et al.
Pubblicazione: (2024)
di: Kumar, Aviral, et al.
Pubblicazione: (2024)
Behavior Knowledge Merge in Reinforced Agentic Models
di: Yuan, Xiangchi, et al.
Pubblicazione: (2026)
di: Yuan, Xiangchi, et al.
Pubblicazione: (2026)
Boosting Maximum Entropy Reinforcement Learning via One-Step Flow Matching
di: Li, Zeqiao, et al.
Pubblicazione: (2026)
di: Li, Zeqiao, et al.
Pubblicazione: (2026)
CoAction: Cross-task Correlation-aware Pareto Set Learning
di: Chen, Xinyue, et al.
Pubblicazione: (2026)
di: Chen, Xinyue, et al.
Pubblicazione: (2026)
Mastering Massive Multi-Task Reinforcement Learning via Mixture-of-Expert Decision Transformer
di: Kong, Yilun, et al.
Pubblicazione: (2025)
di: Kong, Yilun, et al.
Pubblicazione: (2025)
FedCVT: Semi-supervised Vertical Federated Learning with Cross-view Training
di: Kang, Yan, et al.
Pubblicazione: (2020)
di: Kang, Yan, et al.
Pubblicazione: (2020)
One-Layer Transformer Provably Learns One-Nearest Neighbor In Context
di: Li, Zihao, et al.
Pubblicazione: (2024)
di: Li, Zihao, et al.
Pubblicazione: (2024)
Reducing Action Space for Deep Reinforcement Learning via Causal Effect Estimation
di: Liu, Wenzhang, et al.
Pubblicazione: (2025)
di: Liu, Wenzhang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
OpenHA: A Series of Open-Source Hierarchical Agentic Models in Minecraft
di: Wang, Zihao, et al.
Pubblicazione: (2025) -
JARVIS-VLA: Post-Training Large-Scale Vision Language Models to Play Visual Games with Keyboards and Mouse
di: Li, Muyao, et al.
Pubblicazione: (2025) -
ROCKET-2: Steering Visuomotor Policy via Cross-View Goal Alignment
di: Cai, Shaofei, et al.
Pubblicazione: (2025) -
Lookahead Path Likelihood Optimization for Diffusion LLMs
di: Liu, Xuejie, et al.
Pubblicazione: (2026) -
OmniJARVIS: Unified Vision-Language-Action Tokenization Enables Open-World Instruction Following Agents
di: Wang, Zihao, et al.
Pubblicazione: (2024)