HOI-R1: Exploring the Potential of Multimodal Large Language Models for Human-Object Interaction Detection
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Junwen, Xiong, Peilin, Yanai, Keiji |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PosBridge: Multi-View Positional Embedding Transplant for Identity-Aware Image Editing
par: Xiong, Peilin, et autres
Publié: (2025)
par: Xiong, Peilin, et autres
Publié: (2025)
BRIDGE: Background Routing and Isolated Discrete Gating for Coarse-Mask Local Editing
par: Xiong, Peilin, et autres
Publié: (2026)
par: Xiong, Peilin, et autres
Publié: (2026)
VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis
par: Kang, Donggoo, et autres
Publié: (2024)
par: Kang, Donggoo, et autres
Publié: (2024)
GenHOI: Generalizing Text-driven 4D Human-Object Interaction Synthesis for Unseen Objects
par: Li, Shujia, et autres
Publié: (2025)
par: Li, Shujia, et autres
Publié: (2025)
OnlineHOI: Towards Online Human-Object Interaction Generation and Perception
par: Ji, Yihong, et autres
Publié: (2025)
par: Ji, Yihong, et autres
Publié: (2025)
UniHOI: Unified Human-Object Interaction Understanding via Unified Token Space
par: Yang, Panqi, et autres
Publié: (2025)
par: Yang, Panqi, et autres
Publié: (2025)
Focusing on what to decode and what to train: SOV Decoding with Specific Target Guided DeNoising and Vision Language Advisor
par: Chen, Junwen, et autres
Publié: (2023)
par: Chen, Junwen, et autres
Publié: (2023)
PhyGenHOI: Physically-Aware 4D Generation of Dynamic Human-Object Interactions
par: Benishu, Omer, et autres
Publié: (2026)
par: Benishu, Omer, et autres
Publié: (2026)
Contextual Object Detection with Multimodal Large Language Models
par: Zang, Yuhang, et autres
Publié: (2023)
par: Zang, Yuhang, et autres
Publié: (2023)
DynaHOI: Benchmarking Hand-Object Interaction for Dynamic Target
par: Hu, BoCheng, et autres
Publié: (2026)
par: Hu, BoCheng, et autres
Publié: (2026)
FlowHOI: Flow-based Semantics-Grounded Generation of Hand-Object Interactions for Dexterous Robot Manipulation
par: Zeng, Huajian, et autres
Publié: (2026)
par: Zeng, Huajian, et autres
Publié: (2026)
Can Multimodal Large Language Models Truly Understand Small Objects?
par: Han, Fujun, et autres
Publié: (2026)
par: Han, Fujun, et autres
Publié: (2026)
Large Language Model Guided Progressive Feature Alignment for Multimodal UAV Object Detection
par: Wu, Wentao, et autres
Publié: (2025)
par: Wu, Wentao, et autres
Publié: (2025)
Object Detection with Multimodal Large Vision-Language Models: An In-depth Review
par: Sapkota, Ranjan, et autres
Publié: (2025)
par: Sapkota, Ranjan, et autres
Publié: (2025)
A Review of Human-Object Interaction Detection
par: Wang, Yuxiao, et autres
Publié: (2024)
par: Wang, Yuxiao, et autres
Publié: (2024)
2AFC Prompting of Large Multimodal Models for Image Quality Assessment
par: Zhu, Hanwei, et autres
Publié: (2024)
par: Zhu, Hanwei, et autres
Publié: (2024)
Mitigating Long-Tail Bias in HOI Detection via Adaptive Diversity Cache
par: Jiang, Yuqiu, et autres
Publié: (2025)
par: Jiang, Yuqiu, et autres
Publié: (2025)
OpenHOI: Open-World Hand-Object Interaction Synthesis with Multimodal Large Language Model
par: Zhang, Zhenhao, et autres
Publié: (2025)
par: Zhang, Zhenhao, et autres
Publié: (2025)
Exploring the Potential of Large Foundation Models for Open-Vocabulary HOI Detection
par: Lei, Ting, et autres
Publié: (2024)
par: Lei, Ting, et autres
Publié: (2024)
IMPACT-HOI: Supervisory Control for Onset-Anchored Partial HOI Event Construction
par: Zhang, Haoshen, et autres
Publié: (2026)
par: Zhang, Haoshen, et autres
Publié: (2026)
Self-Introspective Decoding: Alleviating Hallucinations for Large Vision-Language Models
par: Huo, Fushuo, et autres
Publié: (2024)
par: Huo, Fushuo, et autres
Publié: (2024)
MammothModa: Multi-Modal Large Language Model
par: She, Qi, et autres
Publié: (2024)
par: She, Qi, et autres
Publié: (2024)
Zero-Shot Human-Object Interaction Synthesis with Multimodal Priors
par: Lou, Yuke, et autres
Publié: (2025)
par: Lou, Yuke, et autres
Publié: (2025)
MQuant: Unleashing the Inference Potential of Multimodal Large Language Models via Full Static Quantization
par: Yu, JiangYong, et autres
Publié: (2025)
par: Yu, JiangYong, et autres
Publié: (2025)
COMO: Cross-Mamba Interaction and Offset-Guided Fusion for Multimodal Object Detection
par: Liu, Chang, et autres
Publié: (2024)
par: Liu, Chang, et autres
Publié: (2024)
COUNTS: Benchmarking Object Detectors and Multimodal Large Language Models under Distribution Shifts
par: Li, Jiansheng, et autres
Publié: (2025)
par: Li, Jiansheng, et autres
Publié: (2025)
InterDreamer: Zero-Shot Text to 3D Dynamic Human-Object Interaction
par: Xu, Sirui, et autres
Publié: (2024)
par: Xu, Sirui, et autres
Publié: (2024)
Efficient Spatial-Temporal Focal Adapter with SSM for Temporal Action Detection
par: Qiu, Yicheng, et autres
Publié: (2026)
par: Qiu, Yicheng, et autres
Publié: (2026)
SHOE: Semantic HOI Open-Vocabulary Evaluation Metric
par: Noack, Maja, et autres
Publié: (2026)
par: Noack, Maja, et autres
Publié: (2026)
ContextHOI: Spatial Context Learning for Human-Object Interaction Detection
par: Jia, Mingda, et autres
Publié: (2024)
par: Jia, Mingda, et autres
Publié: (2024)
CL-HOI: Cross-Level Human-Object Interaction Distillation from Vision Large Language Models
par: Gao, Jianjun, et autres
Publié: (2024)
par: Gao, Jianjun, et autres
Publié: (2024)
A Study of Failure Modes in Two-Stage Human-Object Interaction Detection
par: Wang, Lemeng, et autres
Publié: (2026)
par: Wang, Lemeng, et autres
Publié: (2026)
Rethinking Video Human-Object Interaction: Set Prediction over Time for Unified Detection and Anticipation
par: Luo, Yuanhao, et autres
Publié: (2026)
par: Luo, Yuanhao, et autres
Publié: (2026)
TextHawk: Exploring Efficient Fine-Grained Perception of Multimodal Large Language Models
par: Yu, Ya-Qi, et autres
Publié: (2024)
par: Yu, Ya-Qi, et autres
Publié: (2024)
Advancing Object Detection in Transportation with Multimodal Large Language Models (MLLMs): A Comprehensive Review and Empirical Testing
par: Ashqar, Huthaifa I., et autres
Publié: (2024)
par: Ashqar, Huthaifa I., et autres
Publié: (2024)
Human-Object Interaction from Human-Level Instructions
par: Wu, Zhen, et autres
Publié: (2024)
par: Wu, Zhen, et autres
Publié: (2024)
EventVL: Understand Event Streams via Multimodal Large Language Model
par: Li, Pengteng, et autres
Publié: (2025)
par: Li, Pengteng, et autres
Publié: (2025)
MMR-AD: A Large-Scale Multimodal Dataset for Benchmarking General Anomaly Detection with Multimodal Large Language Models
par: Yao, Xincheng, et autres
Publié: (2026)
par: Yao, Xincheng, et autres
Publié: (2026)
Mining Instance-Centric Vision-Language Contexts for Human-Object Interaction Detection
par: Seo, Soo Won, et autres
Publié: (2026)
par: Seo, Soo Won, et autres
Publié: (2026)
Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning
par: Hao, Pengfei, et autres
Publié: (2025)
par: Hao, Pengfei, et autres
Publié: (2025)
Documents similaires
-
PosBridge: Multi-View Positional Embedding Transplant for Identity-Aware Image Editing
par: Xiong, Peilin, et autres
Publié: (2025) -
BRIDGE: Background Routing and Isolated Discrete Gating for Coarse-Mask Local Editing
par: Xiong, Peilin, et autres
Publié: (2026) -
VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis
par: Kang, Donggoo, et autres
Publié: (2024) -
GenHOI: Generalizing Text-driven 4D Human-Object Interaction Synthesis for Unseen Objects
par: Li, Shujia, et autres
Publié: (2025) -
OnlineHOI: Towards Online Human-Object Interaction Generation and Perception
par: Ji, Yihong, et autres
Publié: (2025)