OpenClaw-RL: Train Any Agent Simply by Talking
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Yinjie, Chen, Xuyang, Jin, Xiaolong, Wang, Mengdi, Yang, Ling |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
RLAnything: Forge Environment, Policy, and Reward Model in Completely Dynamic RL System
par: Wang, Yinjie, et autres
Publié: (2026)
par: Wang, Yinjie, et autres
Publié: (2026)
AnomalyClaw: A Universal Visual Anomaly Detection Agent via Tool-Grounded Refutation
par: Jiang, Xi, et autres
Publié: (2026)
par: Jiang, Xi, et autres
Publié: (2026)
Vero: An Open RL Recipe for General Visual Reasoning
par: Sarch, Gabriel, et autres
Publié: (2026)
par: Sarch, Gabriel, et autres
Publié: (2026)
ClawGUI: A Unified Framework for Training, Evaluating, and Deploying GUI Agents
par: Tang, Fei, et autres
Publié: (2026)
par: Tang, Fei, et autres
Publié: (2026)
QuantClaw: Precision Where It Matters for OpenClaw
par: Zhang, Manyi, et autres
Publié: (2026)
par: Zhang, Manyi, et autres
Publié: (2026)
Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL
par: Wang, Sudong, et autres
Publié: (2026)
par: Wang, Sudong, et autres
Publié: (2026)
NExT-OMNI: Towards Any-to-Any Omnimodal Foundation Models with Discrete Flow Matching
par: Luo, Run, et autres
Publié: (2025)
par: Luo, Run, et autres
Publié: (2025)
OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents
par: Yang, Rui, et autres
Publié: (2026)
par: Yang, Rui, et autres
Publié: (2026)
Talking to DINO: Bridging Self-Supervised Vision Backbones with Language for Open-Vocabulary Segmentation
par: Barsellotti, Luca, et autres
Publié: (2024)
par: Barsellotti, Luca, et autres
Publié: (2024)
Agent S: An Open Agentic Framework that Uses Computers Like a Human
par: Agashe, Saaket, et autres
Publié: (2024)
par: Agashe, Saaket, et autres
Publié: (2024)
Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution
par: Wang, Peng, et autres
Publié: (2024)
par: Wang, Peng, et autres
Publié: (2024)
Grasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMs
par: Wang, Haochen, et autres
Publié: (2025)
par: Wang, Haochen, et autres
Publié: (2025)
Training-free Dense-Aligned Diffusion Guidance for Modular Conditional Image Synthesis
par: Wang, Zixuan, et autres
Publié: (2025)
par: Wang, Zixuan, et autres
Publié: (2025)
Your Agent, Their Asset: A Real-World Safety Analysis of OpenClaw
par: Wang, Zijun, et autres
Publié: (2026)
par: Wang, Zijun, et autres
Publié: (2026)
SkillWeaver: Web Agents can Self-Improve by Discovering and Honing Skills
par: Zheng, Boyuan, et autres
Publié: (2025)
par: Zheng, Boyuan, et autres
Publié: (2025)
InfiniteWeb: Scalable Web Environment Synthesis for GUI Agent Training
par: Zhang, Ziyun, et autres
Publié: (2026)
par: Zhang, Ziyun, et autres
Publié: (2026)
PointLLM: Empowering Large Language Models to Understand Point Clouds
par: Xu, Runsen, et autres
Publié: (2023)
par: Xu, Runsen, et autres
Publié: (2023)
VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning
par: Wang, Qiuchen, et autres
Publié: (2025)
par: Wang, Qiuchen, et autres
Publié: (2025)
Scaling RL to Long Videos
par: Chen, Yukang, et autres
Publié: (2025)
par: Chen, Yukang, et autres
Publié: (2025)
MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
par: Xia, Peng, et autres
Publié: (2025)
par: Xia, Peng, et autres
Publié: (2025)
First SFT, Second RL, Third UPT: Continual Improving Multi-Modal LLM Reasoning via Unsupervised Post-Training
par: Wei, Lai, et autres
Publié: (2025)
par: Wei, Lai, et autres
Publié: (2025)
Navigation with VLM framework: Towards Going to Any Language
par: Yin, Zecheng, et autres
Publié: (2024)
par: Yin, Zecheng, et autres
Publié: (2024)
Web World Models
par: Feng, Jichen, et autres
Publié: (2025)
par: Feng, Jichen, et autres
Publié: (2025)
ADAM: An Embodied Causal Agent in Open-World Environments
par: Yu, Shu, et autres
Publié: (2024)
par: Yu, Shu, et autres
Publié: (2024)
GUI-G1: Understanding R1-Zero-Like Training for Visual Grounding in GUI Agents
par: Zhou, Yuqi, et autres
Publié: (2025)
par: Zhou, Yuqi, et autres
Publié: (2025)
MM-WebAgent: A Hierarchical Multimodal Web Agent for Webpage Generation
par: Li, Yan, et autres
Publié: (2026)
par: Li, Yan, et autres
Publié: (2026)
CapRL: Stimulating Dense Image Caption Capabilities via Reinforcement Learning
par: Xing, Long, et autres
Publié: (2025)
par: Xing, Long, et autres
Publié: (2025)
Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding
par: Wang, Ye, et autres
Publié: (2025)
par: Wang, Ye, et autres
Publié: (2025)
Shifting AI Efficiency From Model-Centric to Data-Centric Compression
par: Liu, Xuyang, et autres
Publié: (2025)
par: Liu, Xuyang, et autres
Publié: (2025)
EndoCogniAgent: Closed-Loop Agentic Reasoning with Self-Consistency Validation for Endoscopic Diagnosis
par: Tang, Yi, et autres
Publié: (2025)
par: Tang, Yi, et autres
Publié: (2025)
Towards Understanding Camera Motions in Any Video
par: Lin, Zhiqiu, et autres
Publié: (2025)
par: Lin, Zhiqiu, et autres
Publié: (2025)
Making Avatars Interact: Towards Text-Driven Human-Object Interaction for Controllable Talking Avatars
par: Zhang, Youliang, et autres
Publié: (2026)
par: Zhang, Youliang, et autres
Publié: (2026)
BitStack: Any-Size Compression of Large Language Models in Variable Memory Environments
par: Wang, Xinghao, et autres
Publié: (2024)
par: Wang, Xinghao, et autres
Publié: (2024)
What Is That Talk About? A Video-to-Text Summarization Dataset for Scientific Presentations
par: Liu, Dongqi, et autres
Publié: (2025)
par: Liu, Dongqi, et autres
Publié: (2025)
Unaligning Everything: Or Aligning Any Text to Any Image in Multimodal Models
par: Salman, Shaeke, et autres
Publié: (2024)
par: Salman, Shaeke, et autres
Publié: (2024)
Towards Predicting Any Human Trajectory In Context
par: Fujii, Ryo, et autres
Publié: (2025)
par: Fujii, Ryo, et autres
Publié: (2025)
OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
par: Jia, Mengdi, et autres
Publié: (2025)
par: Jia, Mengdi, et autres
Publié: (2025)
Recent Advances in Multi-modal 3D Intelligence: A Comprehensive Survey and Evaluation
par: Lei, Yinjie, et autres
Publié: (2023)
par: Lei, Yinjie, et autres
Publié: (2023)
AniTalker: Animate Vivid and Diverse Talking Faces through Identity-Decoupled Facial Motion Encoding
par: Liu, Tao, et autres
Publié: (2024)
par: Liu, Tao, et autres
Publié: (2024)
MCU: An Evaluation Framework for Open-Ended Game Agents
par: Zheng, Xinyue, et autres
Publié: (2023)
par: Zheng, Xinyue, et autres
Publié: (2023)
Documents similaires
-
RLAnything: Forge Environment, Policy, and Reward Model in Completely Dynamic RL System
par: Wang, Yinjie, et autres
Publié: (2026) -
AnomalyClaw: A Universal Visual Anomaly Detection Agent via Tool-Grounded Refutation
par: Jiang, Xi, et autres
Publié: (2026) -
Vero: An Open RL Recipe for General Visual Reasoning
par: Sarch, Gabriel, et autres
Publié: (2026) -
ClawGUI: A Unified Framework for Training, Evaluating, and Deploying GUI Agents
par: Tang, Fei, et autres
Publié: (2026) -
QuantClaw: Precision Where It Matters for OpenClaw
par: Zhang, Manyi, et autres
Publié: (2026)