HOID-R1: Reinforcement Learning for Open-World Human-Object Interaction Detection Reasoning with Multimodal Large Language Model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Zhenhao, Wang, Hanqing, Zeng, Xiangyu, Cheng, Ziyu, Liu, Jiaxin, Yan, Haoyu, Liu, Zhirui, Ji, Kaiyang, Gui, Tianxiang, Hu, Ke, Chen, Kangyi, Fan, Yahao, Pan, Mokai |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DAG: Unleash the Potential of Diffusion Model for Open-Vocabulary 3D Affordance Grounding
par: Wang, Hanqing, et autres
Publié: (2025)
par: Wang, Hanqing, et autres
Publié: (2025)
Commanding Humanoid by Free-form Language: A Large Language Action Model with Unified Motion Vocabulary
par: Liu, Zhirui, et autres
Publié: (2025)
par: Liu, Zhirui, et autres
Publié: (2025)
DreamPolicy: A Unified World-model Policy for Scalable Humanoid Locomotion
par: Fan, Yahao, et autres
Publié: (2025)
par: Fan, Yahao, et autres
Publié: (2025)
OpenHOI: Open-World Hand-Object Interaction Synthesis with Multimodal Large Language Model
par: Zhang, Zhenhao, et autres
Publié: (2025)
par: Zhang, Zhenhao, et autres
Publié: (2025)
SDEval: Safety Dynamic Evaluation for Multimodal Large Language Models
par: Wang, Hanqing, et autres
Publié: (2025)
par: Wang, Hanqing, et autres
Publié: (2025)
Towards Immersive Human-X Interaction: A Real-Time Framework for Physically Plausible Motion Synthesis
par: Ji, Kaiyang, et autres
Publié: (2025)
par: Ji, Kaiyang, et autres
Publié: (2025)
DiscoForcing: A Unified Framework for Real-Time Audio-Driven Character Control with Diffusion Forcing
par: Ji, Kaiyang, et autres
Publié: (2026)
par: Ji, Kaiyang, et autres
Publié: (2026)
Beyond Open Vocabulary: Multimodal Prompting for Object Detection in Remote Sensing Images
par: Yang, Shuai, et autres
Publié: (2026)
par: Yang, Shuai, et autres
Publié: (2026)
Adaptive Mobile Manipulation for Articulated Objects In the Open World
par: Xiong, Haoyu, et autres
Publié: (2024)
par: Xiong, Haoyu, et autres
Publié: (2024)
C2F-Thinker: Coarse-to-Fine Reasoning with Hint-Guided Reinforcement Learning for Multimodal Sentiment Analysis
par: Luo, Miaosen, et autres
Publié: (2026)
par: Luo, Miaosen, et autres
Publié: (2026)
Open-World Human-Object Interaction Detection via Multi-modal Prompts
par: Yang, Jie, et autres
Publié: (2024)
par: Yang, Jie, et autres
Publié: (2024)
Human-Object Interaction via Automatically Designed VLM-Guided Motion Policy
par: Deng, Zekai, et autres
Publié: (2025)
par: Deng, Zekai, et autres
Publié: (2025)
Distributional Reinforcement Learning with Diffusion Bridge Critics
par: Ding, Shutong, et autres
Publié: (2026)
par: Ding, Shutong, et autres
Publié: (2026)
OVExp: Open Vocabulary Exploration for Object-Oriented Navigation
par: Wei, Meng, et autres
Publié: (2024)
par: Wei, Meng, et autres
Publié: (2024)
Relational Semantic Reasoning on 3D Scene Graphs for Open World Interactive Object Search
par: Mahdi, Imen, et autres
Publié: (2026)
par: Mahdi, Imen, et autres
Publié: (2026)
ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning
par: Ding, Shengyuan, et autres
Publié: (2025)
par: Ding, Shengyuan, et autres
Publié: (2025)
A Novel Deep Reinforcement Learning Approach for Dynamic Proportional‐Integral Control in Scanning Probe Microscopy
par: Ziwei Wei, et autres
Publié: (2025)
par: Ziwei Wei, et autres
Publié: (2025)
Contextual Object Detection with Multimodal Large Language Models
par: Zang, Yuhang, et autres
Publié: (2023)
par: Zang, Yuhang, et autres
Publié: (2023)
PICTS: A Novel Deep Reinforcement Learning Approach for Dynamic P-I Control in Scanning Probe Microscopy
par: Wei, Ziwei, et autres
Publié: (2025)
par: Wei, Ziwei, et autres
Publié: (2025)
RIVER: A Real-Time Interaction Benchmark for Video LLMs
par: Shi, Yansong, et autres
Publié: (2026)
par: Shi, Yansong, et autres
Publié: (2026)
Towards 3D Objectness Learning in an Open World
par: Liu, Taichi, et autres
Publié: (2025)
par: Liu, Taichi, et autres
Publié: (2025)
Hand-Object Interaction Controller (HOIC): Deep Reinforcement Learning for Reconstructing Interactions with Physics
par: Hu, Haoyu, et autres
Publié: (2024)
par: Hu, Haoyu, et autres
Publié: (2024)
UniHM: Unified Dexterous Hand Manipulation with Vision Language Model
par: Zhang, Zhenhao, et autres
Publié: (2026)
par: Zhang, Zhenhao, et autres
Publié: (2026)
Affordance-R1: Reinforcement Learning for Generalizable Affordance Reasoning in Multimodal Large Language Model
par: Wang, Hanqing, et autres
Publié: (2025)
par: Wang, Hanqing, et autres
Publié: (2025)
Approximate Subgraph Matching with Neural Graph Representations and Reinforcement Learning
par: Li, Kaiyang, et autres
Publié: (2026)
par: Li, Kaiyang, et autres
Publié: (2026)
Domain-Hierarchy Adaptation via Chain of Iterative Reasoning for Few-shot Hierarchical Text Classification
par: Ji, Ke, et autres
Publié: (2024)
par: Ji, Ke, et autres
Publié: (2024)
R-C2: Cycle-Consistent Reinforcement Learning Improves Multimodal Reasoning
par: Zhang, Zirui, et autres
Publié: (2026)
par: Zhang, Zirui, et autres
Publié: (2026)
ClickAIXR: On-Device Multimodal Vision-Language Interaction with Real-World Objects in Extended Reality
par: Khan, Dawar, et autres
Publié: (2026)
par: Khan, Dawar, et autres
Publié: (2026)
AffectGPT-R1: Leveraging Reinforcement Learning for Open-Vocabulary Multimodal Emotion Recognition
par: Lian, Zheng, et autres
Publié: (2025)
par: Lian, Zheng, et autres
Publié: (2025)
MineWorld: a Real-Time and Open-Source Interactive World Model on Minecraft
par: Guo, Junliang, et autres
Publié: (2025)
par: Guo, Junliang, et autres
Publié: (2025)
Learning Interactive World Model for Object-Centric Reinforcement Learning
par: Feng, Fan, et autres
Publié: (2025)
par: Feng, Fan, et autres
Publié: (2025)
Recall, Retrieve and Reason: Towards Better In-Context Relation Extraction
par: Li, Guozheng, et autres
Publié: (2024)
par: Li, Guozheng, et autres
Publié: (2024)
Visionary-R1: Mitigating Shortcuts in Visual Reasoning with Reinforcement Learning
par: Xia, Jiaer, et autres
Publié: (2025)
par: Xia, Jiaer, et autres
Publié: (2025)
Enhancing Event-based Object Detection with Monocular Normal Maps
par: Liu, Mingjie, et autres
Publié: (2025)
par: Liu, Mingjie, et autres
Publié: (2025)
GeoArena: Evaluating Open-World Geographic Reasoning in Large Vision-Language Models
par: Jia, Pengyue, et autres
Publié: (2025)
par: Jia, Pengyue, et autres
Publié: (2025)
Deterministic Single Exponential Time Algorithms for Co-Path Packing and Co-Path Set Parameterized by Treewidth
par: Liu, Yuxi, et autres
Publié: (2026)
par: Liu, Yuxi, et autres
Publié: (2026)
Transfer Learning Analysis of the Cox Mixture Model
par: Kangyi Liu, et autres
Publié: (2026)
par: Kangyi Liu, et autres
Publié: (2026)
Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model
par: Hu, Jingcheng, et autres
Publié: (2025)
par: Hu, Jingcheng, et autres
Publié: (2025)
VideoAfford: Grounding 3D Affordance from Human-Object-Interaction Videos via Multimodal Large Language Model
par: Wang, Hanqing, et autres
Publié: (2026)
par: Wang, Hanqing, et autres
Publié: (2026)
Reinforcing Multimodal Reasoning Against Visual Degradation
par: Liu, Rui, et autres
Publié: (2026)
par: Liu, Rui, et autres
Publié: (2026)
Documents similaires
-
DAG: Unleash the Potential of Diffusion Model for Open-Vocabulary 3D Affordance Grounding
par: Wang, Hanqing, et autres
Publié: (2025) -
Commanding Humanoid by Free-form Language: A Large Language Action Model with Unified Motion Vocabulary
par: Liu, Zhirui, et autres
Publié: (2025) -
DreamPolicy: A Unified World-model Policy for Scalable Humanoid Locomotion
par: Fan, Yahao, et autres
Publié: (2025) -
OpenHOI: Open-World Hand-Object Interaction Synthesis with Multimodal Large Language Model
par: Zhang, Zhenhao, et autres
Publié: (2025) -
SDEval: Safety Dynamic Evaluation for Multimodal Large Language Models
par: Wang, Hanqing, et autres
Publié: (2025)