L0: Reinforcement Learning to Become General Agents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Junjie, Xi, Jingyi, Song, Zhuoyang, Lu, Junyu, Ke, Yuhua, Sun, Ting, Yang, Yukun, Zhang, Jiaxing, Zhang, Songxin, Xie, Zejian |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Orcust: Stepwise-Feedback Reinforcement Learning for GUI Agent
par: Lu, Junyu, et autres
Publié: (2025)
par: Lu, Junyu, et autres
Publié: (2025)
Lyrics: Boosting Fine-grained Language-Vision Alignment and Comprehension via Semantic-aware Visual Objects
par: Lu, Junyu, et autres
Publié: (2023)
par: Lu, Junyu, et autres
Publié: (2023)
BatchWeave: A Consistent Object-Store-Native Data Plane for Large Foundation Model Training
par: Sun, Ting, et autres
Publié: (2026)
par: Sun, Ting, et autres
Publié: (2026)
PVI: Plug-in Visual Injection for Vision-Language-Action Models
par: Zhang, Zezhou, et autres
Publié: (2026)
par: Zhang, Zezhou, et autres
Publié: (2026)
Learning to Trust Your Feelings: Leveraging Self-awareness in LLMs for Hallucination Mitigation
par: Liang, Yuxin, et autres
Publié: (2024)
par: Liang, Yuxin, et autres
Publié: (2024)
ICE-GRT: Instruction Context Enhancement by Generative Reinforcement based Transformers
par: Zheng, Chen, et autres
Publié: (2024)
par: Zheng, Chen, et autres
Publié: (2024)
Taiyi-Diffusion-XL: Advancing Bilingual Text-to-Image Generation with Large Vision-Language Model Support
par: Wu, Xiaojun, et autres
Publié: (2024)
par: Wu, Xiaojun, et autres
Publié: (2024)
A Survey on Evaluation of Multimodal Large Language Models
par: Huang, Jiaxing, et autres
Publié: (2024)
par: Huang, Jiaxing, et autres
Publié: (2024)
Open-Vocabulary Object Detection via Language Hierarchy
par: Huang, Jiaxing, et autres
Publié: (2024)
par: Huang, Jiaxing, et autres
Publié: (2024)
Fine-tuning can Help Detect Pretraining Data from Large Language Models
par: Zhang, Hengxiang, et autres
Publié: (2024)
par: Zhang, Hengxiang, et autres
Publié: (2024)
FP8-RL: A Practical and Stable Low-Precision Stack for LLM Reinforcement Learning
par: Qiu, Zhaopeng, et autres
Publié: (2026)
par: Qiu, Zhaopeng, et autres
Publié: (2026)
Historical Test-time Prompt Tuning for Vision Foundation Models
par: Zhang, Jingyi, et autres
Publié: (2024)
par: Zhang, Jingyi, et autres
Publié: (2024)
Exploring Learning Complexity for Efficient Downstream Dataset Pruning
par: Jiang, Wenyu, et autres
Publié: (2024)
par: Jiang, Wenyu, et autres
Publié: (2024)
Unraveling Text Generation in LLMs: A Stochastic Differential Equation Approach
par: Zhang, Yukun
Publié: (2024)
par: Zhang, Yukun
Publié: (2024)
Never Lost in the Middle: Mastering Long-Context Question Answering with Position-Agnostic Decompositional Training
par: He, Junqing, et autres
Publié: (2023)
par: He, Junqing, et autres
Publié: (2023)
ML-Agent: Reinforcing LLM Agents for Autonomous Machine Learning Engineering
par: Liu, Zexi, et autres
Publié: (2025)
par: Liu, Zexi, et autres
Publié: (2025)
MetaGen: Self-Evolving Roles and Topologies for Multi-Agent LLM Reasoning
par: Wang, Yimeng, et autres
Publié: (2026)
par: Wang, Yimeng, et autres
Publié: (2026)
Cochain: Balancing Insufficient and Excessive Collaboration in LLM Agent Workflows
par: Zhao, Jiaxing, et autres
Publié: (2025)
par: Zhao, Jiaxing, et autres
Publié: (2025)
A Simple "Motivation" Can Enhance Reinforcement Finetuning of Large Reasoning Models
par: Zhang, Junjie, et autres
Publié: (2025)
par: Zhang, Junjie, et autres
Publié: (2025)
Securing Computer-Use Agents: A Unified Architecture-Lifecycle Framework for Deployment-Grounded Reliability
par: Chen, Zejian, et autres
Publié: (2026)
par: Chen, Zejian, et autres
Publié: (2026)
Ziya2: Data-centric Learning is All LLMs Need
par: Gan, Ruyi, et autres
Publié: (2023)
par: Gan, Ruyi, et autres
Publié: (2023)
R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization
par: Zhang, Jingyi, et autres
Publié: (2025)
par: Zhang, Jingyi, et autres
Publié: (2025)
DVAO: Dynamic Variance-adaptive Advantage Optimization for Multi-reward Reinforcement Learning
par: Jiang, Guochao, et autres
Publié: (2026)
par: Jiang, Guochao, et autres
Publié: (2026)
Improving Retrieval-Augmented Generation through Multi-Agent Reinforcement Learning
par: Chen, Yiqun, et autres
Publié: (2025)
par: Chen, Yiqun, et autres
Publié: (2025)
Solving Math Word Problems via Cooperative Reasoning induced Language Models
par: Zhu, Xinyu, et autres
Publié: (2022)
par: Zhu, Xinyu, et autres
Publié: (2022)
AAAR-1.0: Assessing AI's Potential to Assist Research
par: Lou, Renze, et autres
Publié: (2024)
par: Lou, Renze, et autres
Publié: (2024)
LiteWebAgent: The Open-Source Suite for VLM-Based Web-Agent Applications
par: Zhang, Danqing, et autres
Publié: (2025)
par: Zhang, Danqing, et autres
Publié: (2025)
Reinforcement Learning for LLM-based Multi-Agent Systems through Orchestration Traces
par: Zhang, Chenchen
Publié: (2026)
par: Zhang, Chenchen
Publié: (2026)
Demystifying Reinforcement Learning for Long-Horizon Tool-Using Agents: A Comprehensive Recipe
par: Wu, Xixi, et autres
Publié: (2026)
par: Wu, Xixi, et autres
Publié: (2026)
DeepRefine: Agent-Compiled Knowledge Refinement via Reinforcement Learning
par: Huang, Haoyu, et autres
Publié: (2026)
par: Huang, Haoyu, et autres
Publié: (2026)
Spatial Semantic Recurrent Mining for Referring Image Segmentation
par: Yang, Jiaxing, et autres
Publié: (2024)
par: Yang, Jiaxing, et autres
Publié: (2024)
MSCoRe: A Benchmark for Multi-Stage Collaborative Reasoning in LLM Agents
par: Lei, Yuzhen, et autres
Publié: (2025)
par: Lei, Yuzhen, et autres
Publié: (2025)
ChiMed-GPT: A Chinese Medical Large Language Model with Full Training Regime and Better Alignment to Human Preferences
par: Tian, Yuanhe, et autres
Publié: (2023)
par: Tian, Yuanhe, et autres
Publié: (2023)
Learning to Generate Structured Output with Schema Reinforcement Learning
par: Lu, Yaxi, et autres
Publié: (2025)
par: Lu, Yaxi, et autres
Publié: (2025)
MADial-Bench: Towards Real-world Evaluation of Memory-Augmented Dialogue Generation
par: He, Junqing, et autres
Publié: (2024)
par: He, Junqing, et autres
Publié: (2024)
ParetoRAG: Leveraging Sentence-Context Attention for Robust and Efficient Retrieval-Augmented Generation
par: Yao, Ruobing, et autres
Publié: (2025)
par: Yao, Ruobing, et autres
Publié: (2025)
Mixture-of-Minds: Multi-Agent Reinforcement Learning for Table Understanding
par: Zhou, Yuhang, et autres
Publié: (2025)
par: Zhou, Yuhang, et autres
Publié: (2025)
R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?
par: Zhang, Jingyi, et autres
Publié: (2026)
par: Zhang, Jingyi, et autres
Publié: (2026)
WebGen-Agent: Enhancing Interactive Website Generation with Multi-Level Feedback and Step-Level Reinforcement Learning
par: Lu, Zimu, et autres
Publié: (2025)
par: Lu, Zimu, et autres
Publié: (2025)
Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale
par: Zhang, Liujie, et autres
Publié: (2026)
par: Zhang, Liujie, et autres
Publié: (2026)
Documents similaires
-
Orcust: Stepwise-Feedback Reinforcement Learning for GUI Agent
par: Lu, Junyu, et autres
Publié: (2025) -
Lyrics: Boosting Fine-grained Language-Vision Alignment and Comprehension via Semantic-aware Visual Objects
par: Lu, Junyu, et autres
Publié: (2023) -
BatchWeave: A Consistent Object-Store-Native Data Plane for Large Foundation Model Training
par: Sun, Ting, et autres
Publié: (2026) -
PVI: Plug-in Visual Injection for Vision-Language-Action Models
par: Zhang, Zezhou, et autres
Publié: (2026) -
Learning to Trust Your Feelings: Leveraging Self-awareness in LLMs for Hallucination Mitigation
par: Liang, Yuxin, et autres
Publié: (2024)