RLAnything: Forge Environment, Policy, and Reward Model in Completely Dynamic RL System
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Yinjie, Xie, Tianbao, Shen, Ke, Wang, Mengdi, Yang, Ling |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
OpenClaw-RL: Train Any Agent Simply by Talking
por: Wang, Yinjie, et al.
Publicado: (2026)
por: Wang, Yinjie, et al.
Publicado: (2026)
Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL
por: Wang, Sudong, et al.
Publicado: (2026)
por: Wang, Sudong, et al.
Publicado: (2026)
CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation
por: Cui, Guofeng, et al.
Publicado: (2025)
por: Cui, Guofeng, et al.
Publicado: (2025)
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
por: Ding, Meidan, et al.
Publicado: (2025)
por: Ding, Meidan, et al.
Publicado: (2025)
DocReward: A Document Reward Model for Structuring and Stylizing
por: Liu, Junpeng, et al.
Publicado: (2025)
por: Liu, Junpeng, et al.
Publicado: (2025)
PyVision-RL: Forging Open Agentic Vision Models via RL
por: Zhao, Shitian, et al.
Publicado: (2026)
por: Zhao, Shitian, et al.
Publicado: (2026)
SAIL-RL: Guiding MLLMs in When and How to Think via Dual-Reward RL Tuning
por: Shu, Fangxun, et al.
Publicado: (2025)
por: Shu, Fangxun, et al.
Publicado: (2025)
Web World Models
por: Feng, Jichen, et al.
Publicado: (2025)
por: Feng, Jichen, et al.
Publicado: (2025)
ChronoForge-RL: Chronological Forging through Reinforcement Learning for Enhanced Video Understanding
por: Chen, Kehua
Publicado: (2025)
por: Chen, Kehua
Publicado: (2025)
Auto MC-Reward: Automated Dense Reward Design with Large Language Models for Minecraft
por: Li, Hao, et al.
Publicado: (2023)
por: Li, Hao, et al.
Publicado: (2023)
Learning What Matters: Dynamic Dimension Selection and Aggregation for Interpretable Vision-Language Reward Modeling
por: Chen, Qiyuan, et al.
Publicado: (2026)
por: Chen, Qiyuan, et al.
Publicado: (2026)
URPO: A Unified Reward & Policy Optimization Framework for Large Language Models
por: Lu, Songshuo, et al.
Publicado: (2025)
por: Lu, Songshuo, et al.
Publicado: (2025)
VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning
por: Wang, Qiuchen, et al.
Publicado: (2025)
por: Wang, Qiuchen, et al.
Publicado: (2025)
Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences
por: Jin, Zhuoran, et al.
Publicado: (2025)
por: Jin, Zhuoran, et al.
Publicado: (2025)
EditReward: A Human-Aligned Reward Model for Instruction-Guided Image Editing
por: Wu, Keming, et al.
Publicado: (2025)
por: Wu, Keming, et al.
Publicado: (2025)
HAZARD Challenge: Embodied Decision Making in Dynamically Changing Environments
por: Zhou, Qinhong, et al.
Publicado: (2024)
por: Zhou, Qinhong, et al.
Publicado: (2024)
Vero: An Open RL Recipe for General Visual Reasoning
por: Sarch, Gabriel, et al.
Publicado: (2026)
por: Sarch, Gabriel, et al.
Publicado: (2026)
OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
por: Jia, Mengdi, et al.
Publicado: (2025)
por: Jia, Mengdi, et al.
Publicado: (2025)
SUDER: Self-Improving Unified Large Multimodal Models for Understanding and Generation with Dual Self-Rewards
por: Hong, Jixiang, et al.
Publicado: (2025)
por: Hong, Jixiang, et al.
Publicado: (2025)
VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models
por: Li, Lei, et al.
Publicado: (2024)
por: Li, Lei, et al.
Publicado: (2024)
Reward Design for Physical Reasoning in Vision-Language Models
por: Lilienthal, Derek, et al.
Publicado: (2026)
por: Lilienthal, Derek, et al.
Publicado: (2026)
ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?
por: Zhang, Leixin, et al.
Publicado: (2024)
por: Zhang, Leixin, et al.
Publicado: (2024)
Scaling RL to Long Videos
por: Chen, Yukang, et al.
Publicado: (2025)
por: Chen, Yukang, et al.
Publicado: (2025)
Router-Suggest: Dynamic Routing for Multimodal Auto-Completion in Visually-Grounded Dialogs
por: Mishra, Sandeep, et al.
Publicado: (2026)
por: Mishra, Sandeep, et al.
Publicado: (2026)
RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction
por: Wang, Yuchi, et al.
Publicado: (2025)
por: Wang, Yuchi, et al.
Publicado: (2025)
Preacher: Paper-to-Video Agentic System
por: Liu, Jingwei, et al.
Publicado: (2025)
por: Liu, Jingwei, et al.
Publicado: (2025)
Multimodal LLMs as Customized Reward Models for Text-to-Image Generation
por: Zhou, Shijie, et al.
Publicado: (2025)
por: Zhou, Shijie, et al.
Publicado: (2025)
CapRL: Stimulating Dense Image Caption Capabilities via Reinforcement Learning
por: Xing, Long, et al.
Publicado: (2025)
por: Xing, Long, et al.
Publicado: (2025)
Beyond Monolithic Rewards: A Hybrid and Multi-Aspect Reward Optimization for MLLM Alignment
por: Gulhane, Radha, et al.
Publicado: (2025)
por: Gulhane, Radha, et al.
Publicado: (2025)
Zoom in, Click out: Unlocking and Evaluating the Potential of Zooming for GUI Grounding
por: Jiang, Zhiyuan, et al.
Publicado: (2025)
por: Jiang, Zhiyuan, et al.
Publicado: (2025)
On Data Synthesis and Post-training for Visual Abstract Reasoning
por: Zhu, Ke, et al.
Publicado: (2025)
por: Zhu, Ke, et al.
Publicado: (2025)
Deep Delta Learning
por: Zhang, Yifan, et al.
Publicado: (2026)
por: Zhang, Yifan, et al.
Publicado: (2026)
TaxonRL: Reinforcement Learning with Intermediate Rewards for Interpretable Fine-Grained Visual Reasoning
por: von Klinski, Maximilian, et al.
Publicado: (2026)
por: von Klinski, Maximilian, et al.
Publicado: (2026)
InstructNav: Zero-shot System for Generic Instruction Navigation in Unexplored Environment
por: Long, Yuxing, et al.
Publicado: (2024)
por: Long, Yuxing, et al.
Publicado: (2024)
Generative Digital Twins: Vision-Language Simulation Models for Executable Industrial Systems
por: Hsu, YuChe, et al.
Publicado: (2025)
por: Hsu, YuChe, et al.
Publicado: (2025)
VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning
por: Lu, Xingyu, et al.
Publicado: (2026)
por: Lu, Xingyu, et al.
Publicado: (2026)
From Forecasting to Planning: Policy World Model for Collaborative State-Action Prediction
por: Zhao, Zhida, et al.
Publicado: (2025)
por: Zhao, Zhida, et al.
Publicado: (2025)
Stable and Efficient Single-Rollout RL for Multimodal Reasoning
por: Liu, Rui, et al.
Publicado: (2025)
por: Liu, Rui, et al.
Publicado: (2025)
Athena: Enhancing Multimodal Reasoning with Data-efficient Process Reward Models
por: Wang, Shuai, et al.
Publicado: (2025)
por: Wang, Shuai, et al.
Publicado: (2025)
GUI-G$^2$: Gaussian Reward Modeling for GUI Grounding
por: Tang, Fei, et al.
Publicado: (2025)
por: Tang, Fei, et al.
Publicado: (2025)
Ejemplares similares
-
OpenClaw-RL: Train Any Agent Simply by Talking
por: Wang, Yinjie, et al.
Publicado: (2026) -
Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL
por: Wang, Sudong, et al.
Publicado: (2026) -
CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation
por: Cui, Guofeng, et al.
Publicado: (2025) -
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
por: Ding, Meidan, et al.
Publicado: (2025) -
DocReward: A Document Reward Model for Structuring and Stylizing
por: Liu, Junpeng, et al.
Publicado: (2025)