RePlan: Reasoning-guided Region Planning for Complex Instruction-based Image Editing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Qu, Tianyuan, Ke, Lei, Zhan, Xiaohang, Tang, Longxiang, Liu, Yuqi, Peng, Bohao, Yu, Bei, Yu, Dong, Jia, Jiaya |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Does Your Vision-Language Model Get Lost in the Long Video Sampling Dilemma?
par: Qu, Tianyuan, et autres
Publié: (2025)
par: Qu, Tianyuan, et autres
Publié: (2025)
VisionReasoner: Unified Reasoning-Integrated Visual Perception via Reinforcement Learning
par: Liu, Yuqi, et autres
Publié: (2025)
par: Liu, Yuqi, et autres
Publié: (2025)
DreamVE: Unified Instruction-based Image and Video Editing
par: Xia, Bin, et autres
Publié: (2025)
par: Xia, Bin, et autres
Publié: (2025)
LISA++: An Improved Baseline for Reasoning Segmentation with Large Language Model
par: Yang, Senqiao, et autres
Publié: (2023)
par: Yang, Senqiao, et autres
Publié: (2023)
RTime-QA: A Benchmark for Atomic Temporal Event Understanding in Large Multi-modal Models
par: Liu, Yuqi, et autres
Publié: (2025)
par: Liu, Yuqi, et autres
Publié: (2025)
DreamOmni2: Multimodal Instruction-based Editing and Generation
par: Xia, Bin, et autres
Publié: (2025)
par: Xia, Bin, et autres
Publié: (2025)
DreamOmni3: Scribble-based Editing and Generation
par: Xia, Bin, et autres
Publié: (2025)
par: Xia, Bin, et autres
Publié: (2025)
MGM-Omni: Scaling Omni LLMs to Personalized Long-Horizon Speech
par: Wang, Chengyao, et autres
Publié: (2025)
par: Wang, Chengyao, et autres
Publié: (2025)
Instruction-based Image Editing with Planning, Reasoning, and Generation
par: Ji, Liya, et autres
Publié: (2026)
par: Ji, Liya, et autres
Publié: (2026)
From Noisy Traces to Stable Gradients: Bias-Variance Optimized Preference Optimization for Aligning Large Reasoning Models
par: Zhu, Mingkang, et autres
Publié: (2025)
par: Zhu, Mingkang, et autres
Publié: (2025)
CompBench: Benchmarking Complex Instruction-guided Image Editing
par: Jia, Bohan, et autres
Publié: (2025)
par: Jia, Bohan, et autres
Publié: (2025)
DreamOmni: Unified Image Generation and Editing
par: Xia, Bin, et autres
Publié: (2024)
par: Xia, Bin, et autres
Publié: (2024)
Scalable Language Model with Generalized Continual Learning
par: Peng, Bohao, et autres
Publié: (2024)
par: Peng, Bohao, et autres
Publié: (2024)
Prompt Highlighter: Interactive Control for Multi-Modal LLMs
par: Zhang, Yuechen, et autres
Publié: (2023)
par: Zhang, Yuechen, et autres
Publié: (2023)
ViSurf: Visual Supervised-and-Reinforcement Fine-Tuning for Large Vision-and-Language Models
par: Liu, Yuqi, et autres
Publié: (2025)
par: Liu, Yuqi, et autres
Publié: (2025)
EZBlender: Efficient 3D Editing with Plan-and-ReAct Agent
par: Wang, Hao, et autres
Publié: (2026)
par: Wang, Hao, et autres
Publié: (2026)
Lyra: An Efficient and Speech-Centric Framework for Omni-Cognition
par: Zhong, Zhisheng, et autres
Publié: (2024)
par: Zhong, Zhisheng, et autres
Publié: (2024)
N3D-VLM: Native 3D Grounding Enables Accurate Spatial Reasoning in Vision-Language Models
par: Wang, Yuxin, et autres
Publié: (2025)
par: Wang, Yuxin, et autres
Publié: (2025)
Stratified GRPO: Handling Structural Heterogeneity in Reinforcement Learning of LLM Search Agents
par: Zhu, Mingkang, et autres
Publié: (2025)
par: Zhu, Mingkang, et autres
Publié: (2025)
Re-Align: Structured Reasoning-guided Alignment for In-Context Image Generation and Editing
par: He, Runze, et autres
Publié: (2026)
par: He, Runze, et autres
Publié: (2026)
Text‐to‐3D City: Plan‐then‐Execute Urban Generation With LLM Planners and Procedural Synthesis
par: Xiaohang Dong, et autres
Publié: (2026)
par: Xiaohang Dong, et autres
Publié: (2026)
Optimal Planning for Multi-Robot Simultaneous Area and Line Coverage Using Hierarchical Cyclic Merging Regulation
par: Zheng, Tianyuan, et autres
Publié: (2025)
par: Zheng, Tianyuan, et autres
Publié: (2025)
Reason-Plan-ReAct: A Reasoner-Planner Supervising a ReAct Executor for Complex Enterprise Tasks
par: Molinari, Gianni, et autres
Publié: (2025)
par: Molinari, Gianni, et autres
Publié: (2025)
ControlNeXt: Powerful and Efficient Control for Image and Video Generation
par: Peng, Bohao, et autres
Publié: (2024)
par: Peng, Bohao, et autres
Publié: (2024)
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
par: Yang, Senqiao, et autres
Publié: (2025)
par: Yang, Senqiao, et autres
Publié: (2025)
TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization
par: Zhu, Mingkang, et autres
Publié: (2025)
par: Zhu, Mingkang, et autres
Publié: (2025)
Enhancing LLM Knowledge Learning through Generalization
par: Zhu, Mingkang, et autres
Publié: (2025)
par: Zhu, Mingkang, et autres
Publié: (2025)
Modular Customization of Diffusion Models via Blockwise-Parameterized Low-Rank Adaptation
par: Zhu, Mingkang, et autres
Publié: (2025)
par: Zhu, Mingkang, et autres
Publié: (2025)
VP-VLA: Visual Prompting as an Interface for Vision-Language-Action Models
par: Wang, Zixuan, et autres
Publié: (2026)
par: Wang, Zixuan, et autres
Publié: (2026)
MagicMirror: ID-Preserved Video Generation in Video Diffusion Transformers
par: Zhang, Yuechen, et autres
Publié: (2025)
par: Zhang, Yuechen, et autres
Publié: (2025)
OA-CNNs: Omni-Adaptive Sparse CNNs for 3D Semantic Segmentation
par: Peng, Bohao, et autres
Publié: (2024)
par: Peng, Bohao, et autres
Publié: (2024)
GroupContrast: Semantic-aware Self-supervised Representation Learning for 3D Understanding
par: Wang, Chengyao, et autres
Publié: (2024)
par: Wang, Chengyao, et autres
Publié: (2024)
On the Empirical Complexity of Reasoning and Planning in LLMs
par: Kang, Liwei, et autres
Publié: (2024)
par: Kang, Liwei, et autres
Publié: (2024)
Mind the Interference: Retaining Pre-trained Knowledge in Parameter Efficient Continual Learning of Vision-Language Models
par: Tang, Longxiang, et autres
Publié: (2024)
par: Tang, Longxiang, et autres
Publié: (2024)
MotionEdit: Benchmarking and Learning Motion-Centric Image Editing
par: Wan, Yixin, et autres
Publié: (2025)
par: Wan, Yixin, et autres
Publié: (2025)
Penguin-VL: Exploring the Efficiency Limits of VLM with LLM-based Vision Encoders
par: Zhang, Boqiang, et autres
Publié: (2026)
par: Zhang, Boqiang, et autres
Publié: (2026)
PlanGEN: A Multi-Agent Framework for Generating Planning and Reasoning Trajectories for Complex Problem Solving
par: Parmar, Mihir, et autres
Publié: (2025)
par: Parmar, Mihir, et autres
Publié: (2025)
LAP: A Language-Aware Planning Model For Procedure Planning In Instructional Videos
par: Shi, Lei, et autres
Publié: (2026)
par: Shi, Lei, et autres
Publié: (2026)
VisionZip: Longer is Better but Not Necessary in Vision Language Models
par: Yang, Senqiao, et autres
Publié: (2024)
par: Yang, Senqiao, et autres
Publié: (2024)
Matrix as Plan: Structured Logical Reasoning with Feedback-Driven Replanning
par: Chen, Ke, et autres
Publié: (2026)
par: Chen, Ke, et autres
Publié: (2026)
Documents similaires
-
Does Your Vision-Language Model Get Lost in the Long Video Sampling Dilemma?
par: Qu, Tianyuan, et autres
Publié: (2025) -
VisionReasoner: Unified Reasoning-Integrated Visual Perception via Reinforcement Learning
par: Liu, Yuqi, et autres
Publié: (2025) -
DreamVE: Unified Instruction-based Image and Video Editing
par: Xia, Bin, et autres
Publié: (2025) -
LISA++: An Improved Baseline for Reasoning Segmentation with Large Language Model
par: Yang, Senqiao, et autres
Publié: (2023) -
RTime-QA: A Benchmark for Atomic Temporal Event Understanding in Large Multi-modal Models
par: Liu, Yuqi, et autres
Publié: (2025)