Understanding the Implicit User Intention via Reasoning with Large Language Model for Image Editing
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Yijia, Shen, Yiqing, Chen, Weiming, He, Zhihai |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Runge-Kutta Approximation and Decoupled Attention for Rectified Flow Inversion and Semantic Editing
by: Chen, Weiming, et al.
Published: (2025)
by: Chen, Weiming, et al.
Published: (2025)
Generative Semantic Coding for Ultra-Low Bitrate Visual Communication and Analysis
by: Chen, Weiming, et al.
Published: (2025)
by: Chen, Weiming, et al.
Published: (2025)
LatentEdit: Adaptive Latent Control for Consistent Semantic Editing
by: Liu, Siyi, et al.
Published: (2025)
by: Liu, Siyi, et al.
Published: (2025)
Text-Driven Reasoning Video Editing via Reinforcement Learning on Digital Twin Representations
by: Shen, Yiqing, et al.
Published: (2025)
by: Shen, Yiqing, et al.
Published: (2025)
Latent Bias Alignment for High-Fidelity Diffusion Inversion in Real-World Image Reconstruction and Manipulation
by: Chen, Weiming, et al.
Published: (2026)
by: Chen, Weiming, et al.
Published: (2026)
Reasoning Text-to-Video Retrieval via Digital Twin Video Representations and Large Language Models
by: Shen, Yiqing, et al.
Published: (2025)
by: Shen, Yiqing, et al.
Published: (2025)
Fast Reasoning Segmentation for Images and Videos
by: Shen, Yiqing, et al.
Published: (2025)
by: Shen, Yiqing, et al.
Published: (2025)
Localize, Understand, Collaborate: Semantic-Aware Dragging via Intention Reasoner
by: Cui, Xing, et al.
Published: (2024)
by: Cui, Xing, et al.
Published: (2024)
Constructing and Interpreting Digital Twin Representations for Visual Reasoning via Reinforcement Learning
by: Shen, Yiqing, et al.
Published: (2025)
by: Shen, Yiqing, et al.
Published: (2025)
Multi-turn Consistent Image Editing
by: Zhou, Zijun, et al.
Published: (2025)
by: Zhou, Zijun, et al.
Published: (2025)
Edit Spillover as a Probe: Do Image Editing Models Implicitly Understand World Relations?
by: Li, Guandong, et al.
Published: (2026)
by: Li, Guandong, et al.
Published: (2026)
Multimodal Self-Instruct: Synthetic Abstract Image and Visual Reasoning Instruction Using Language Model
by: Zhang, Wenqi, et al.
Published: (2024)
by: Zhang, Wenqi, et al.
Published: (2024)
Guiding Instruction-based Image Editing via Multimodal Large Language Models
by: Fu, Tsu-Jui, et al.
Published: (2023)
by: Fu, Tsu-Jui, et al.
Published: (2023)
Implicit Multi-Spectral Transformer: An Lightweight and Effective Visible to Infrared Image Translation Model
by: Chen, Yijia, et al.
Published: (2024)
by: Chen, Yijia, et al.
Published: (2024)
Edit2Perceive: Image Editing Diffusion Models Are Strong Dense Perceivers
by: Shi, Yiqing, et al.
Published: (2025)
by: Shi, Yiqing, et al.
Published: (2025)
Vidi: Large Multimodal Models for Video Understanding and Editing
by: Vidi Team, et al.
Published: (2025)
by: Vidi Team, et al.
Published: (2025)
Reasoning to Align: Implicit Reasoning in Diffusion Transformers for Video Editing
by: Li, Yan, et al.
Published: (2026)
by: Li, Yan, et al.
Published: (2026)
ReasonEdit: Towards Reasoning-Enhanced Image Editing Models
by: Yin, Fukun, et al.
Published: (2025)
by: Yin, Fukun, et al.
Published: (2025)
Reasoning to Edit: Hypothetical Instruction-Based Image Editing with Visual Reasoning
by: He, Qingdong, et al.
Published: (2025)
by: He, Qingdong, et al.
Published: (2025)
SSCR: Iterative Language-Based Image Editing via Self-Supervised Counterfactual Reasoning
by: Fu, Tsu-Jui, et al.
Published: (2020)
by: Fu, Tsu-Jui, et al.
Published: (2020)
DiffuseReg: Denoising Diffusion Model for Obtaining Deformation Fields in Unsupervised Deformable Image Registration
by: Zhuo, Yongtai, et al.
Published: (2024)
by: Zhuo, Yongtai, et al.
Published: (2024)
Implicit Priors Editing in Stable Diffusion via Targeted Token Adjustment
by: He, Feng, et al.
Published: (2024)
by: He, Feng, et al.
Published: (2024)
Deeply-Conditioned Image Compression via Self-Generated Priors
by: Zhao, Zhineng, et al.
Published: (2025)
by: Zhao, Zhineng, et al.
Published: (2025)
Beyond Raw Videos: Understanding Edited Videos with Large Multimodal Model
by: Xu, Lu, et al.
Published: (2024)
by: Xu, Lu, et al.
Published: (2024)
Conceptual Codebook Learning for Vision-Language Models
by: Zhang, Yi, et al.
Published: (2024)
by: Zhang, Yi, et al.
Published: (2024)
PUMGPT: A Large Vision-Language Model for Product Understanding
by: Xue, Wei, et al.
Published: (2023)
by: Xue, Wei, et al.
Published: (2023)
UniEdit-I: Training-free Image Editing for Unified VLM via Iterative Understanding, Editing and Verifying
by: Bai, Chengyu, et al.
Published: (2025)
by: Bai, Chengyu, et al.
Published: (2025)
GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing
by: Fang, Rongyao, et al.
Published: (2025)
by: Fang, Rongyao, et al.
Published: (2025)
Reasoning Segmentation for Images and Videos: A Survey
by: Shen, Yiqing, et al.
Published: (2025)
by: Shen, Yiqing, et al.
Published: (2025)
Decoupling the Image Perception and Multimodal Reasoning for Reasoning Segmentation with Digital Twin Representations
by: Li, Yizhen, et al.
Published: (2025)
by: Li, Yizhen, et al.
Published: (2025)
Hyperspectral Image Recovery Constrained by Multi-Granularity Non-Local Self-Similarity Priors
by: Peng, Zhuoran, et al.
Published: (2025)
by: Peng, Zhuoran, et al.
Published: (2025)
InternVL-U: Democratizing Unified Multimodal Models for Understanding, Reasoning, Generation and Editing
by: Tian, Changyao, et al.
Published: (2026)
by: Tian, Changyao, et al.
Published: (2026)
VarAD: Lightweight High-Resolution Image Anomaly Detection via Visual Autoregressive Modeling
by: Cao, Yunkang, et al.
Published: (2024)
by: Cao, Yunkang, et al.
Published: (2024)
WMVLM: Evaluating Diffusion Model Image Watermarking via Vision-Language Models
by: Yang, Zijin, et al.
Published: (2026)
by: Yang, Zijin, et al.
Published: (2026)
ChronoEdit: Towards Temporal Reasoning for Image Editing and World Simulation
by: Wu, Jay Zhangjie, et al.
Published: (2025)
by: Wu, Jay Zhangjie, et al.
Published: (2025)
Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions
by: Ma, Chenrui, et al.
Published: (2025)
by: Ma, Chenrui, et al.
Published: (2025)
ReasonCD: A Multimodal Reasoning Large Model for Implicit Change-of-Interest Semantic Mining
by: Huang, Zhenyang, et al.
Published: (2025)
by: Huang, Zhenyang, et al.
Published: (2025)
ReasonEdit: Towards Interpretable Image Editing Evaluation via Reinforcement Learning
by: Chen, Honghua, et al.
Published: (2026)
by: Chen, Honghua, et al.
Published: (2026)
Anchor Token Matching: Implicit Structure Locking for Training-free AR Image Editing
by: Hu, Taihang, et al.
Published: (2025)
by: Hu, Taihang, et al.
Published: (2025)
Boosting Medical Visual Understanding From Multi-Granular Language Learning
by: Li, Zihan, et al.
Published: (2025)
by: Li, Zihan, et al.
Published: (2025)
Similar Items
-
Runge-Kutta Approximation and Decoupled Attention for Rectified Flow Inversion and Semantic Editing
by: Chen, Weiming, et al.
Published: (2025) -
Generative Semantic Coding for Ultra-Low Bitrate Visual Communication and Analysis
by: Chen, Weiming, et al.
Published: (2025) -
LatentEdit: Adaptive Latent Control for Consistent Semantic Editing
by: Liu, Siyi, et al.
Published: (2025) -
Text-Driven Reasoning Video Editing via Reinforcement Learning on Digital Twin Representations
by: Shen, Yiqing, et al.
Published: (2025) -
Latent Bias Alignment for High-Fidelity Diffusion Inversion in Real-World Image Reconstruction and Manipulation
by: Chen, Weiming, et al.
Published: (2026)