Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tan, Reuben, Peng, Baolin, Yang, Zhengyuan, Cheng, Hao, Mees, Oier, Zhao, Theodore, Tupini, Andrea, Meijier, Isar, Wu, Qianhui, Yang, Yuncong, Liden, Lars, Gu, Yu, Zhang, Sheng, Liu, Xiaodong, Wang, Lijuan, Pollefeys, Marc, Lee, Yong Jae, Gao, Jianfeng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AsgardBench -- Evaluating Visually Grounded Interactive Planning Under Minimal Feedback
par: Tupini, Andrea, et autres
Publié: (2026)
par: Tupini, Andrea, et autres
Publié: (2026)
Magma: A Foundation Model for Multimodal AI Agents
par: Yang, Jianwei, et autres
Publié: (2025)
par: Yang, Jianwei, et autres
Publié: (2025)
Multimodal Spatial Language Maps for Robot Navigation and Manipulation
par: Huang, Chenguang, et autres
Publié: (2025)
par: Huang, Chenguang, et autres
Publié: (2025)
Vision-Language Models Provide Promptable Representations for Reinforcement Learning
par: Chen, William, et autres
Publié: (2024)
par: Chen, William, et autres
Publié: (2024)
AutoSurfer -- Teaching Web Agents through Comprehensive Surfing, Learning, and Modeling
par: Faisal, Fazle Elahi, et autres
Publié: (2026)
par: Faisal, Fazle Elahi, et autres
Publié: (2026)
GUI-Libra: Training Native GUI Agents to Reason and Act with Action-aware Supervision and Partially Verifiable RL
par: Yang, Rui, et autres
Publié: (2026)
par: Yang, Rui, et autres
Publié: (2026)
GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents
par: Wu, Qianhui, et autres
Publié: (2025)
par: Wu, Qianhui, et autres
Publié: (2025)
SITE: towards Spatial Intelligence Thorough Evaluation
par: Wang, Wenqi, et autres
Publié: (2025)
par: Wang, Wenqi, et autres
Publié: (2025)
Steering Your Generalists: Improving Robotic Foundation Models via Value Guidance
par: Nakamoto, Mitsuhiko, et autres
Publié: (2024)
par: Nakamoto, Mitsuhiko, et autres
Publié: (2024)
MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities
par: Yu, Weihao, et autres
Publié: (2023)
par: Yu, Weihao, et autres
Publié: (2023)
Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
par: Ni, Minheng, et autres
Publié: (2025)
par: Ni, Minheng, et autres
Publié: (2025)
LiVOS: Light Video Object Segmentation with Gated Linear Matching
par: Liu, Qin, et autres
Publié: (2024)
par: Liu, Qin, et autres
Publié: (2024)
Elevating Visual Perception in Multimodal LLMs with Visual Embedding Distillation
par: Jain, Jitesh, et autres
Publié: (2024)
par: Jain, Jitesh, et autres
Publié: (2024)
List Items One by One: A New Data Source and Learning Paradigm for Multimodal LLMs
par: Yan, An, et autres
Publié: (2024)
par: Yan, An, et autres
Publié: (2024)
OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents
par: Yang, Rui, et autres
Publié: (2026)
par: Yang, Rui, et autres
Publié: (2026)
Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark
par: Hao, Yunzhuo, et autres
Publié: (2025)
par: Hao, Yunzhuo, et autres
Publié: (2025)
Scaling Cross-Embodied Learning: One Policy for Manipulation, Navigation, Locomotion and Aviation
par: Doshi, Ria, et autres
Publié: (2024)
par: Doshi, Ria, et autres
Publié: (2024)
Beyond Words: Advancing Long-Text Image Generation via Multimodal Autoregressive Models
par: Wang, Alex Jinpeng, et autres
Publié: (2025)
par: Wang, Alex Jinpeng, et autres
Publié: (2025)
Bring Metric Functions into Diffusion Models
par: An, Jie, et autres
Publié: (2024)
par: An, Jie, et autres
Publié: (2024)
Policy Adaptation via Language Optimization: Decomposing Tasks for Few-Shot Imitation
par: Myers, Vivek, et autres
Publié: (2024)
par: Myers, Vivek, et autres
Publié: (2024)
The Ingredients for Robotic Diffusion Transformers
par: Dasari, Sudeep, et autres
Publié: (2024)
par: Dasari, Sudeep, et autres
Publié: (2024)
ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs
par: Wang, Xiyao, et autres
Publié: (2025)
par: Wang, Xiyao, et autres
Publié: (2025)
Latent Action Pretraining from Videos
par: Ye, Seonghyeon, et autres
Publié: (2024)
par: Ye, Seonghyeon, et autres
Publié: (2024)
Matryoshka Multimodal Models
par: Cai, Mu, et autres
Publié: (2024)
par: Cai, Mu, et autres
Publié: (2024)
Beyond Sight: Finetuning Generalist Robot Policies with Heterogeneous Sensors via Language Grounding
par: Jones, Joshua, et autres
Publié: (2025)
par: Jones, Joshua, et autres
Publié: (2025)
mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs
par: Pai, Jonas, et autres
Publié: (2025)
par: Pai, Jonas, et autres
Publié: (2025)
Robotic Control via Embodied Chain-of-Thought Reasoning
par: Zawalski, Michał, et autres
Publié: (2024)
par: Zawalski, Michał, et autres
Publié: (2024)
LeLaN: Learning A Language-Conditioned Navigation Policy from In-the-Wild Videos
par: Hirose, Noriaki, et autres
Publié: (2024)
par: Hirose, Noriaki, et autres
Publié: (2024)
Autonomous Improvement of Instruction Following Skills via Foundation Models
par: Zhou, Zhiyuan, et autres
Publié: (2024)
par: Zhou, Zhiyuan, et autres
Publié: (2024)
Trabajo forestal en régimen de subcontratación en Suecia
par: Ewa Lidén (Author)
Publié: (1997)
par: Ewa Lidén (Author)
Publié: (1997)
Le travail en sous-traitance dans la foresterie en Suède
par: Ewa Lidén (Author)
Publié: (1997)
par: Ewa Lidén (Author)
Publié: (1997)
Contract labour in forestry in Sweden
par: Ewa Lidén (Author)
Publié: (1997)
par: Ewa Lidén (Author)
Publié: (1997)
MM-Vet v2: A Challenging Benchmark to Evaluate Large Multimodal Models for Integrated Capabilities
par: Yu, Weihao, et autres
Publié: (2024)
par: Yu, Weihao, et autres
Publié: (2024)
Idea2Img: Iterative Self-Refinement with GPT-4V(ision) for Automatic Image Design and Generation
par: Yang, Zhengyuan, et autres
Publié: (2023)
par: Yang, Zhengyuan, et autres
Publié: (2023)
The Tool Illusion: Rethinking Tool Use in Web Agents
par: Lou, Renze, et autres
Publié: (2026)
par: Lou, Renze, et autres
Publié: (2026)
Reasoning over Object Descriptions Improves Coreference Resolution in Task-Based Dialogue Systems
par: Ijurco, Oier, et autres
Publié: (2026)
par: Ijurco, Oier, et autres
Publié: (2026)
La nueva masculinidad de siempre. Capitalismo, deseo y falofobias, Antonio J. Rodríguez, Anagrama, 2020, 240 páginas.
par: QUINCOCES, Oier
Publié: (2022)
par: QUINCOCES, Oier
Publié: (2022)
Modelo científico de la nutrición vegetal: análisis epistemológico y propuesta de progresión de aprendizaje
par: Oier Pedrera
Publié: (2023)
par: Oier Pedrera
Publié: (2023)
Chapter 9 Mopping Up, Keeping Down, and Propping Up
par: Lidén, Kristoffer, et autres
Publié: (2024)
par: Lidén, Kristoffer, et autres
Publié: (2024)
MindJourney: Test-Time Scaling with World Models for Spatial Reasoning
par: Yang, Yuncong, et autres
Publié: (2025)
par: Yang, Yuncong, et autres
Publié: (2025)
Documents similaires
-
AsgardBench -- Evaluating Visually Grounded Interactive Planning Under Minimal Feedback
par: Tupini, Andrea, et autres
Publié: (2026) -
Magma: A Foundation Model for Multimodal AI Agents
par: Yang, Jianwei, et autres
Publié: (2025) -
Multimodal Spatial Language Maps for Robot Navigation and Manipulation
par: Huang, Chenguang, et autres
Publié: (2025) -
Vision-Language Models Provide Promptable Representations for Reinforcement Learning
par: Chen, William, et autres
Publié: (2024) -
AutoSurfer -- Teaching Web Agents through Comprehensive Surfing, Learning, and Modeling
par: Faisal, Fazle Elahi, et autres
Publié: (2026)