ManipLVM-R1: Reinforcement Learning for Reasoning in Embodied Manipulation with Large Vision-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Song, Zirui, Ouyang, Guangxian, Li, Mingzhe, Ji, Yuheng, Wang, Chenxi, Xu, Zixiang, Zhang, Zeyu, Zhang, Xiaoqing, Jiang, Qian, Chen, Zhenhao, Li, Zhongzhi, Yan, Rui, Chen, Xiuying |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models
par: Song, Zirui, et autres
Publié: (2025)
par: Song, Zirui, et autres
Publié: (2025)
Under the Shadow of Babel: How Language Shapes Reasoning in LLMs
par: Wang, Chenxi, et autres
Publié: (2025)
par: Wang, Chenxi, et autres
Publié: (2025)
Hazards in Daily Life? Enabling Robots to Proactively Detect and Resolve Anomalies
par: Song, Zirui, et autres
Publié: (2024)
par: Song, Zirui, et autres
Publié: (2024)
HeteroGenManip: Generalizable Manipulation For Heterogeneous Object Interactions
par: Shen, Zhenhao, et autres
Publié: (2026)
par: Shen, Zhenhao, et autres
Publié: (2026)
ManipBench: Benchmarking Vision-Language Models for Low-Level Robot Manipulation
par: Zhao, Enyu, et autres
Publié: (2025)
par: Zhao, Enyu, et autres
Publié: (2025)
MoManipVLA: Transferring Vision-language-action Models for General Mobile Manipulation
par: Wu, Zhenyu, et autres
Publié: (2025)
par: Wu, Zhenyu, et autres
Publié: (2025)
Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation
par: Yuan, Yifu, et autres
Publié: (2025)
par: Yuan, Yifu, et autres
Publié: (2025)
Continuous Four‐Year Biogas Slurry Application Regulates the Soil Fertility, Microbial Communities, and Nitrogen Cycling Functions in a Farmland Ecosystem
par: Binbin Yu, et autres
Publié: (2025)
par: Binbin Yu, et autres
Publié: (2025)
ServImage: An Image Generation and Editing Benchmark from Real-world Commercial Imaging Services
par: Ji, Fengxian, et autres
Publié: (2026)
par: Ji, Fengxian, et autres
Publié: (2026)
ManipGPT: Is Affordance Segmentation by Large Vision Models Enough for Articulated Object Manipulation?
par: Kim, Taewhan, et autres
Publié: (2024)
par: Kim, Taewhan, et autres
Publié: (2024)
The Stepwise Deception: Simulating the Evolution from True News to Fake News with LLM Agents
par: Liu, Yuhan, et autres
Publié: (2024)
par: Liu, Yuhan, et autres
Publié: (2024)
When Personalization Tricks Detectors: The Feature-Inversion Trap in Machine-Generated Text Detection
par: Gao, Lang, et autres
Publié: (2025)
par: Gao, Lang, et autres
Publié: (2025)
ManipArena: Comprehensive Real-world Evaluation of Reasoning-Oriented Generalist Robot Manipulation
par: Sun, Yu, et autres
Publié: (2026)
par: Sun, Yu, et autres
Publié: (2026)
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
par: Tan, Huajie, et autres
Publié: (2025)
par: Tan, Huajie, et autres
Publié: (2025)
DyFlow: Dynamic Workflow Framework for Agentic Reasoning
par: Wang, Yanbo, et autres
Publié: (2025)
par: Wang, Yanbo, et autres
Publié: (2025)
UniManip: General-Purpose Zero-Shot Robotic Manipulation with Agentic Operational Graph
par: Liu, Haichao, et autres
Publié: (2026)
par: Liu, Haichao, et autres
Publié: (2026)
GSR: Learning Structured Reasoning for Embodied Manipulation
par: Hu, Kewei, et autres
Publié: (2026)
par: Hu, Kewei, et autres
Publié: (2026)
Survey of Vision-Language-Action Models for Embodied Manipulation
par: Li, Haoran, et autres
Publié: (2025)
par: Li, Haoran, et autres
Publié: (2025)
GeoManip: Geometric Constraints as General Interfaces for Robot Manipulation
par: Tang, Weiliang, et autres
Publié: (2025)
par: Tang, Weiliang, et autres
Publié: (2025)
AdaManip: Adaptive Articulated Object Manipulation Environments and Policy Learning
par: Wang, Yuanfei, et autres
Publié: (2025)
par: Wang, Yuanfei, et autres
Publié: (2025)
ManipTrans: Efficient Dexterous Bimanual Manipulation Transfer via Residual Learning
par: Li, Kailin, et autres
Publié: (2025)
par: Li, Kailin, et autres
Publié: (2025)
Flipping Knowledge Distillation: Leveraging Small Models' Expertise to Enhance LLMs in Text Matching
par: Li, Mingzhe, et autres
Publié: (2025)
par: Li, Mingzhe, et autres
Publié: (2025)
GAPartManip: A Large-scale Part-centric Dataset for Material-Agnostic Articulated Object Manipulation
par: Cui, Wenbo, et autres
Publié: (2024)
par: Cui, Wenbo, et autres
Publié: (2024)
UniDoorManip: Learning Universal Door Manipulation Policy Over Large-scale and Diverse Door Manipulation Environments
par: Li, Yu, et autres
Publié: (2024)
par: Li, Yu, et autres
Publié: (2024)
MMAC-Copilot: Multi-modal Agent Collaboration Operating Copilot
par: Song, Zirui, et autres
Publié: (2024)
par: Song, Zirui, et autres
Publié: (2024)
ManipDreamer: Boosting Robotic Manipulation World Model with Action Tree and Visual Guidance
par: Li, Ying, et autres
Publié: (2025)
par: Li, Ying, et autres
Publié: (2025)
Injecting Domain-Specific Knowledge into Large Language Models: A Comprehensive Survey
par: Song, Zirui, et autres
Publié: (2025)
par: Song, Zirui, et autres
Publié: (2025)
Evaluate Bias without Manual Test Sets: A Concept Representation Perspective for LLMs
par: Gao, Lang, et autres
Publié: (2025)
par: Gao, Lang, et autres
Publié: (2025)
Do LLMs "Feel"? Emotion Circuits Discovery and Control
par: Wang, Chenxi, et autres
Publié: (2025)
par: Wang, Chenxi, et autres
Publié: (2025)
SocialMaze: A Benchmark for Evaluating Social Reasoning in Large Language Models
par: Xu, Zixiang, et autres
Publié: (2025)
par: Xu, Zixiang, et autres
Publié: (2025)
iManip: Skill-Incremental Learning for Robotic Manipulation
par: Zheng, Zexin, et autres
Publié: (2025)
par: Zheng, Zexin, et autres
Publié: (2025)
Word Form Matters: LLMs' Semantic Reconstruction under Typoglycemia
par: Wang, Chenxi, et autres
Publié: (2025)
par: Wang, Chenxi, et autres
Publié: (2025)
Embodied Robot Manipulation in the Era of Foundation Models: Planning and Learning Perspectives
par: Bai, Shuanghao, et autres
Publié: (2025)
par: Bai, Shuanghao, et autres
Publié: (2025)
From Skepticism to Acceptance: Simulating the Attitude Dynamics Toward Fake News
par: Liu, Yuhan, et autres
Publié: (2024)
par: Liu, Yuhan, et autres
Publié: (2024)
Geolocation with Real Human Gameplay Data: A Large-Scale Dataset and Human-Like Reasoning Framework
par: Song, Zirui, et autres
Publié: (2025)
par: Song, Zirui, et autres
Publié: (2025)
pFedLVM: A Large Vision Model (LVM)-Driven and Latent Feature-Based Personalized Federated Learning Framework in Autonomous Driving
par: Kou, Wei-Bin, et autres
Publié: (2024)
par: Kou, Wei-Bin, et autres
Publié: (2024)
Beyond Survival: Evaluating LLMs in Social Deduction Games with Human-Aligned Strategies
par: Song, Zirui, et autres
Publié: (2025)
par: Song, Zirui, et autres
Publié: (2025)
ManipShield: A Unified Framework for Image Manipulation Detection, Localization and Explanation
par: Xu, Zitong, et autres
Publié: (2025)
par: Xu, Zitong, et autres
Publié: (2025)
Recurrent Reasoning with Vision-Language Models for Estimating Long-Horizon Embodied Task Progress
par: Zhang, Yuelin, et autres
Publié: (2026)
par: Zhang, Yuelin, et autres
Publié: (2026)
Write Summary Step-by-Step: A Pilot Study of Stepwise Summarization
par: Chen, Xiuying, et autres
Publié: (2024)
par: Chen, Xiuying, et autres
Publié: (2024)
Documents similaires
-
Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models
par: Song, Zirui, et autres
Publié: (2025) -
Under the Shadow of Babel: How Language Shapes Reasoning in LLMs
par: Wang, Chenxi, et autres
Publié: (2025) -
Hazards in Daily Life? Enabling Robots to Proactively Detect and Resolve Anomalies
par: Song, Zirui, et autres
Publié: (2024) -
HeteroGenManip: Generalizable Manipulation For Heterogeneous Object Interactions
par: Shen, Zhenhao, et autres
Publié: (2026) -
ManipBench: Benchmarking Vision-Language Models for Low-Level Robot Manipulation
par: Zhao, Enyu, et autres
Publié: (2025)