Interaction-Consistent Object Removal via MLLM-Based Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huang, Ching-Kai, Lin, Wen-Chieh, Lee, Yan-Cen |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Mask Consistency Regularization in Object Removal
par: Yuan, Hua, et autres
Publié: (2025)
par: Yuan, Hua, et autres
Publié: (2025)
Aerial View River Landform Video segmentation: A Weakly Supervised Context-aware Temporal Consistency Distillation Approach
par: Chen, Chi-Han, et autres
Publié: (2025)
par: Chen, Chi-Han, et autres
Publié: (2025)
EraseLoRA: MLLM-Driven Foreground Exclusion and Background Subtype Aggregation for Dataset-Free Object Removal
par: Jo, Sanghyun, et autres
Publié: (2025)
par: Jo, Sanghyun, et autres
Publié: (2025)
Elysium: Exploring Object-level Perception in Videos via MLLM
par: Wang, Han, et autres
Publié: (2024)
par: Wang, Han, et autres
Publié: (2024)
POEM: Precise Object-level Editing via MLLM control
par: Schouten, Marco, et autres
Publié: (2025)
par: Schouten, Marco, et autres
Publié: (2025)
ClickRemoval: An Interactive Open-Source Tool for Object Removal in Diffusion Models
par: Zhang, Ledun, et autres
Publié: (2026)
par: Zhang, Ledun, et autres
Publié: (2026)
Object Remover Performance Evaluation Methods using Class-wise Object Removal Images
par: Oh, Changsuk, et autres
Publié: (2024)
par: Oh, Changsuk, et autres
Publié: (2024)
Boosting MLLM Reasoning with Text-Debiased Hint-GRPO
par: Huang, Qihan, et autres
Publié: (2025)
par: Huang, Qihan, et autres
Publié: (2025)
CodeDance: A Dynamic Tool-integrated MLLM for Executable Visual Reasoning
par: Song, Qi, et autres
Publié: (2025)
par: Song, Qi, et autres
Publié: (2025)
Multi-modal Motion Prediction using Temporal Ensembling with Learning-based Aggregation
par: Hong, Kai-Yin, et autres
Publié: (2024)
par: Hong, Kai-Yin, et autres
Publié: (2024)
Simultaneous Detection and Interaction Reasoning for Object-Centric Action Recognition
par: Li, Xunsong, et autres
Publié: (2024)
par: Li, Xunsong, et autres
Publié: (2024)
CAD-MLLM: Unifying Multimodality-Conditioned CAD Generation With MLLM
par: Xu, Jingwei, et autres
Publié: (2024)
par: Xu, Jingwei, et autres
Publié: (2024)
GScream: Learning 3D Geometry and Feature Consistent Gaussian Splatting for Object Removal
par: Wang, Yuxin, et autres
Publié: (2024)
par: Wang, Yuxin, et autres
Publié: (2024)
Creation-MMBench: Assessing Context-Aware Creative Intelligence in MLLM
par: Fang, Xinyu, et autres
Publié: (2025)
par: Fang, Xinyu, et autres
Publié: (2025)
DRIFT: Transferring Reasoning Priors for Efficient MLLM Fine-Tuning
par: Huang, Chao, et autres
Publié: (2025)
par: Huang, Chao, et autres
Publié: (2025)
GenHOI: Towards Object-Consistent Hand-Object Interaction with Temporally Balanced and Spatially Selective Object Injection
par: Huang, Xuan, et autres
Publié: (2026)
par: Huang, Xuan, et autres
Publié: (2026)
Grounded Visual Factualization: Factual Anchor-Based Finetuning for Enhancing MLLM Factual Consistency
par: Morbiato, Filippo, et autres
Publié: (2025)
par: Morbiato, Filippo, et autres
Publié: (2025)
Syn-GRPO: Self-Evolving Data Synthesis for MLLM Perception Reasoning
par: Huang, Qihan, et autres
Publié: (2025)
par: Huang, Qihan, et autres
Publié: (2025)
Exploring Hierarchical Consistency and Unbiased Objectness for Open-Vocabulary Object Detection
par: Lee, Sanghoon, et autres
Publié: (2026)
par: Lee, Sanghoon, et autres
Publié: (2026)
Reasoning Guided Embeddings: Leveraging MLLM Reasoning for Improved Multimodal Retrieval
par: Liu, Chunxu, et autres
Publié: (2025)
par: Liu, Chunxu, et autres
Publié: (2025)
Shadow Removal Refinement via Material-Consistent Shadow Edges
par: Hu, Shilin, et autres
Publié: (2024)
par: Hu, Shilin, et autres
Publié: (2024)
CoInteract: Physically-Consistent Human-Object Interaction Video Synthesis via Spatially-Structured Co-Generation
par: Luo, Xiangyang, et autres
Publié: (2026)
par: Luo, Xiangyang, et autres
Publié: (2026)
Recovering Partially Corrupted Objects via Sketch-Guided Bidirectional Feature Interaction
par: Zhang, Yongle, et autres
Publié: (2025)
par: Zhang, Yongle, et autres
Publié: (2025)
Bootstrapping MLLM for Weakly-Supervised Class-Agnostic Object Counting
par: Zhang, Xiaowen, et autres
Publié: (2026)
par: Zhang, Xiaowen, et autres
Publié: (2026)
ReasonX: MLLM-Guided Intrinsic Image Decomposition
par: Dirik, Alara, et autres
Publié: (2025)
par: Dirik, Alara, et autres
Publié: (2025)
Traffic-MLLM: Curiosity-Regularized Supervised Learning for Traffic Scenario Case-Based Reasoning
par: Xiu, Waikit, et autres
Publié: (2025)
par: Xiu, Waikit, et autres
Publié: (2025)
MASRA: MLLM-Assisted Semantic-Relational Consistent Alignment for Video Temporal Grounding
par: Ran, Ran, et autres
Publié: (2026)
par: Ran, Ran, et autres
Publié: (2026)
Confronting Ambiguity in 6D Object Pose Estimation via Score-Based Diffusion on SE(3)
par: Hsiao, Tsu-Ching, et autres
Publié: (2023)
par: Hsiao, Tsu-Ching, et autres
Publié: (2023)
HOMER: Homography-Based Efficient Multi-view 3D Object Removal
par: Ni, Jingcheng, et autres
Publié: (2025)
par: Ni, Jingcheng, et autres
Publié: (2025)
Occlusion-Aware Temporally Consistent Amodal Completion for 3D Human-Object Interaction Reconstruction
par: Doh, Hyungjun, et autres
Publié: (2025)
par: Doh, Hyungjun, et autres
Publié: (2025)
Completing Visual Objects via Bridging Generation and Segmentation
par: Li, Xiang, et autres
Publié: (2023)
par: Li, Xiang, et autres
Publié: (2023)
RTV-Bench: Benchmarking MLLM Continuous Perception, Understanding and Reasoning through Real-Time Video
par: Xun, Shuhang, et autres
Publié: (2025)
par: Xun, Shuhang, et autres
Publié: (2025)
SCORP: Scene-Consistent Object Refinement via Proxy Generation and Tuning
par: Chen, Ziwei, et autres
Publié: (2025)
par: Chen, Ziwei, et autres
Publié: (2025)
Survey on AI-Generated Media Detection: From Non-MLLM to MLLM
par: Zou, Yueying, et autres
Publié: (2025)
par: Zou, Yueying, et autres
Publié: (2025)
MIRAGE: Assessing Hallucination in Multimodal Reasoning Chains of MLLM
par: Dong, Bowen, et autres
Publié: (2025)
par: Dong, Bowen, et autres
Publié: (2025)
GeoRemover: Removing Objects and Their Causal Visual Artifacts
par: Zhu, Zixin, et autres
Publié: (2025)
par: Zhu, Zixin, et autres
Publié: (2025)
Generate, Analyze, and Refine: Training-Free Sound Source Localization via MLLM Meta-Reasoning
par: Park, Subin, et autres
Publié: (2026)
par: Park, Subin, et autres
Publié: (2026)
AbductiveMLLM: Boosting Visual Abductive Reasoning Within MLLMs
par: Chang, Boyu, et autres
Publié: (2026)
par: Chang, Boyu, et autres
Publié: (2026)
Static-Dynamic Class-level Perception Consistency in Video Semantic Segmentation
par: Cen, Zhigang, et autres
Publié: (2024)
par: Cen, Zhigang, et autres
Publié: (2024)
Place-it-R1: Unlocking Environment-aware Reasoning Potential of MLLM for Video Object Insertion
par: Gu, Bohai, et autres
Publié: (2026)
par: Gu, Bohai, et autres
Publié: (2026)
Documents similaires
-
Mask Consistency Regularization in Object Removal
par: Yuan, Hua, et autres
Publié: (2025) -
Aerial View River Landform Video segmentation: A Weakly Supervised Context-aware Temporal Consistency Distillation Approach
par: Chen, Chi-Han, et autres
Publié: (2025) -
EraseLoRA: MLLM-Driven Foreground Exclusion and Background Subtype Aggregation for Dataset-Free Object Removal
par: Jo, Sanghyun, et autres
Publié: (2025) -
Elysium: Exploring Object-level Perception in Videos via MLLM
par: Wang, Han, et autres
Publié: (2024) -
POEM: Precise Object-level Editing via MLLM control
par: Schouten, Marco, et autres
Publié: (2025)