RePlan: Reasoning-guided Region Planning for Complex Instruction-based Image Editing
Fuente:
arXiv
Salvato in:
| Autori principali: | Qu, Tianyuan, Ke, Lei, Zhan, Xiaohang, Tang, Longxiang, Liu, Yuqi, Peng, Bohao, Yu, Bei, Yu, Dong, Jia, Jiaya |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Does Your Vision-Language Model Get Lost in the Long Video Sampling Dilemma?
di: Qu, Tianyuan, et al.
Pubblicazione: (2025)
di: Qu, Tianyuan, et al.
Pubblicazione: (2025)
VisionReasoner: Unified Reasoning-Integrated Visual Perception via Reinforcement Learning
di: Liu, Yuqi, et al.
Pubblicazione: (2025)
di: Liu, Yuqi, et al.
Pubblicazione: (2025)
DreamVE: Unified Instruction-based Image and Video Editing
di: Xia, Bin, et al.
Pubblicazione: (2025)
di: Xia, Bin, et al.
Pubblicazione: (2025)
LISA++: An Improved Baseline for Reasoning Segmentation with Large Language Model
di: Yang, Senqiao, et al.
Pubblicazione: (2023)
di: Yang, Senqiao, et al.
Pubblicazione: (2023)
RTime-QA: A Benchmark for Atomic Temporal Event Understanding in Large Multi-modal Models
di: Liu, Yuqi, et al.
Pubblicazione: (2025)
di: Liu, Yuqi, et al.
Pubblicazione: (2025)
DreamOmni2: Multimodal Instruction-based Editing and Generation
di: Xia, Bin, et al.
Pubblicazione: (2025)
di: Xia, Bin, et al.
Pubblicazione: (2025)
DreamOmni3: Scribble-based Editing and Generation
di: Xia, Bin, et al.
Pubblicazione: (2025)
di: Xia, Bin, et al.
Pubblicazione: (2025)
MGM-Omni: Scaling Omni LLMs to Personalized Long-Horizon Speech
di: Wang, Chengyao, et al.
Pubblicazione: (2025)
di: Wang, Chengyao, et al.
Pubblicazione: (2025)
Instruction-based Image Editing with Planning, Reasoning, and Generation
di: Ji, Liya, et al.
Pubblicazione: (2026)
di: Ji, Liya, et al.
Pubblicazione: (2026)
From Noisy Traces to Stable Gradients: Bias-Variance Optimized Preference Optimization for Aligning Large Reasoning Models
di: Zhu, Mingkang, et al.
Pubblicazione: (2025)
di: Zhu, Mingkang, et al.
Pubblicazione: (2025)
CompBench: Benchmarking Complex Instruction-guided Image Editing
di: Jia, Bohan, et al.
Pubblicazione: (2025)
di: Jia, Bohan, et al.
Pubblicazione: (2025)
DreamOmni: Unified Image Generation and Editing
di: Xia, Bin, et al.
Pubblicazione: (2024)
di: Xia, Bin, et al.
Pubblicazione: (2024)
Scalable Language Model with Generalized Continual Learning
di: Peng, Bohao, et al.
Pubblicazione: (2024)
di: Peng, Bohao, et al.
Pubblicazione: (2024)
Prompt Highlighter: Interactive Control for Multi-Modal LLMs
di: Zhang, Yuechen, et al.
Pubblicazione: (2023)
di: Zhang, Yuechen, et al.
Pubblicazione: (2023)
ViSurf: Visual Supervised-and-Reinforcement Fine-Tuning for Large Vision-and-Language Models
di: Liu, Yuqi, et al.
Pubblicazione: (2025)
di: Liu, Yuqi, et al.
Pubblicazione: (2025)
EZBlender: Efficient 3D Editing with Plan-and-ReAct Agent
di: Wang, Hao, et al.
Pubblicazione: (2026)
di: Wang, Hao, et al.
Pubblicazione: (2026)
Lyra: An Efficient and Speech-Centric Framework for Omni-Cognition
di: Zhong, Zhisheng, et al.
Pubblicazione: (2024)
di: Zhong, Zhisheng, et al.
Pubblicazione: (2024)
N3D-VLM: Native 3D Grounding Enables Accurate Spatial Reasoning in Vision-Language Models
di: Wang, Yuxin, et al.
Pubblicazione: (2025)
di: Wang, Yuxin, et al.
Pubblicazione: (2025)
Stratified GRPO: Handling Structural Heterogeneity in Reinforcement Learning of LLM Search Agents
di: Zhu, Mingkang, et al.
Pubblicazione: (2025)
di: Zhu, Mingkang, et al.
Pubblicazione: (2025)
Re-Align: Structured Reasoning-guided Alignment for In-Context Image Generation and Editing
di: He, Runze, et al.
Pubblicazione: (2026)
di: He, Runze, et al.
Pubblicazione: (2026)
Text‐to‐3D City: Plan‐then‐Execute Urban Generation With LLM Planners and Procedural Synthesis
di: Xiaohang Dong, et al.
Pubblicazione: (2026)
di: Xiaohang Dong, et al.
Pubblicazione: (2026)
Optimal Planning for Multi-Robot Simultaneous Area and Line Coverage Using Hierarchical Cyclic Merging Regulation
di: Zheng, Tianyuan, et al.
Pubblicazione: (2025)
di: Zheng, Tianyuan, et al.
Pubblicazione: (2025)
Reason-Plan-ReAct: A Reasoner-Planner Supervising a ReAct Executor for Complex Enterprise Tasks
di: Molinari, Gianni, et al.
Pubblicazione: (2025)
di: Molinari, Gianni, et al.
Pubblicazione: (2025)
ControlNeXt: Powerful and Efficient Control for Image and Video Generation
di: Peng, Bohao, et al.
Pubblicazione: (2024)
di: Peng, Bohao, et al.
Pubblicazione: (2024)
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
di: Yang, Senqiao, et al.
Pubblicazione: (2025)
di: Yang, Senqiao, et al.
Pubblicazione: (2025)
TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization
di: Zhu, Mingkang, et al.
Pubblicazione: (2025)
di: Zhu, Mingkang, et al.
Pubblicazione: (2025)
Enhancing LLM Knowledge Learning through Generalization
di: Zhu, Mingkang, et al.
Pubblicazione: (2025)
di: Zhu, Mingkang, et al.
Pubblicazione: (2025)
Modular Customization of Diffusion Models via Blockwise-Parameterized Low-Rank Adaptation
di: Zhu, Mingkang, et al.
Pubblicazione: (2025)
di: Zhu, Mingkang, et al.
Pubblicazione: (2025)
VP-VLA: Visual Prompting as an Interface for Vision-Language-Action Models
di: Wang, Zixuan, et al.
Pubblicazione: (2026)
di: Wang, Zixuan, et al.
Pubblicazione: (2026)
MagicMirror: ID-Preserved Video Generation in Video Diffusion Transformers
di: Zhang, Yuechen, et al.
Pubblicazione: (2025)
di: Zhang, Yuechen, et al.
Pubblicazione: (2025)
OA-CNNs: Omni-Adaptive Sparse CNNs for 3D Semantic Segmentation
di: Peng, Bohao, et al.
Pubblicazione: (2024)
di: Peng, Bohao, et al.
Pubblicazione: (2024)
GroupContrast: Semantic-aware Self-supervised Representation Learning for 3D Understanding
di: Wang, Chengyao, et al.
Pubblicazione: (2024)
di: Wang, Chengyao, et al.
Pubblicazione: (2024)
On the Empirical Complexity of Reasoning and Planning in LLMs
di: Kang, Liwei, et al.
Pubblicazione: (2024)
di: Kang, Liwei, et al.
Pubblicazione: (2024)
Mind the Interference: Retaining Pre-trained Knowledge in Parameter Efficient Continual Learning of Vision-Language Models
di: Tang, Longxiang, et al.
Pubblicazione: (2024)
di: Tang, Longxiang, et al.
Pubblicazione: (2024)
MotionEdit: Benchmarking and Learning Motion-Centric Image Editing
di: Wan, Yixin, et al.
Pubblicazione: (2025)
di: Wan, Yixin, et al.
Pubblicazione: (2025)
Penguin-VL: Exploring the Efficiency Limits of VLM with LLM-based Vision Encoders
di: Zhang, Boqiang, et al.
Pubblicazione: (2026)
di: Zhang, Boqiang, et al.
Pubblicazione: (2026)
PlanGEN: A Multi-Agent Framework for Generating Planning and Reasoning Trajectories for Complex Problem Solving
di: Parmar, Mihir, et al.
Pubblicazione: (2025)
di: Parmar, Mihir, et al.
Pubblicazione: (2025)
LAP: A Language-Aware Planning Model For Procedure Planning In Instructional Videos
di: Shi, Lei, et al.
Pubblicazione: (2026)
di: Shi, Lei, et al.
Pubblicazione: (2026)
VisionZip: Longer is Better but Not Necessary in Vision Language Models
di: Yang, Senqiao, et al.
Pubblicazione: (2024)
di: Yang, Senqiao, et al.
Pubblicazione: (2024)
Matrix as Plan: Structured Logical Reasoning with Feedback-Driven Replanning
di: Chen, Ke, et al.
Pubblicazione: (2026)
di: Chen, Ke, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Does Your Vision-Language Model Get Lost in the Long Video Sampling Dilemma?
di: Qu, Tianyuan, et al.
Pubblicazione: (2025) -
VisionReasoner: Unified Reasoning-Integrated Visual Perception via Reinforcement Learning
di: Liu, Yuqi, et al.
Pubblicazione: (2025) -
DreamVE: Unified Instruction-based Image and Video Editing
di: Xia, Bin, et al.
Pubblicazione: (2025) -
LISA++: An Improved Baseline for Reasoning Segmentation with Large Language Model
di: Yang, Senqiao, et al.
Pubblicazione: (2023) -
RTime-QA: A Benchmark for Atomic Temporal Event Understanding in Large Multi-modal Models
di: Liu, Yuqi, et al.
Pubblicazione: (2025)