Instruction-based Image Editing with Planning, Reasoning, and Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ji, Liya, Qi, Chenyang, Chen, Qifeng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SIFThinker: Spatially-Aware Image Focus for Visual Reasoning
par: Chen, Zhangquan, et autres
Publié: (2025)
par: Chen, Zhangquan, et autres
Publié: (2025)
CLIP Embeddings for AI-Generated Image Detection: A Few-Shot Study with Lightweight Classifier
par: Ou, Ziyang
Publié: (2025)
par: Ou, Ziyang
Publié: (2025)
OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention
par: Chen, Zhangquan, et autres
Publié: (2026)
par: Chen, Zhangquan, et autres
Publié: (2026)
Think with 3D: Geometric Imagination Grounded Spatial Reasoning from Limited Views
par: Chen, Zhangquan, et autres
Publié: (2025)
par: Chen, Zhangquan, et autres
Publié: (2025)
Supervised Contrastive Learning for Few-Shot AI-Generated Image Detection and Attribution
par: Urueña, Jaime Álvarez, et autres
Publié: (2025)
par: Urueña, Jaime Álvarez, et autres
Publié: (2025)
NumeriKontrol: Adding Numeric Control to Diffusion Transformers for Instruction-based Image Editing
par: Xu, Zhenyu, et autres
Publié: (2025)
par: Xu, Zhenyu, et autres
Publié: (2025)
MPCC: A Novel Benchmark for Multimodal Planning with Complex Constraints in Multimodal Large Language Models
par: Ji, Yiyan, et autres
Publié: (2025)
par: Ji, Yiyan, et autres
Publié: (2025)
Image Segmentation and Classification of E-waste for Training Robots for Waste Segregation
par: Tripathi, Prakriti
Publié: (2025)
par: Tripathi, Prakriti
Publié: (2025)
CoMViT: An Efficient Vision Backbone for Supervised Classification in Medical Imaging
par: Safdar, Aon, et autres
Publié: (2025)
par: Safdar, Aon, et autres
Publié: (2025)
From Prompt to Production:Automating Brand-Safe Marketing Imagery with Text-to-Image Models
par: Atighehchian, Parmida, et autres
Publié: (2026)
par: Atighehchian, Parmida, et autres
Publié: (2026)
Sora as a World Model? A Complete Survey on Text-to-Video Generation
par: Puspitasari, Fachrina Dewi, et autres
Publié: (2024)
par: Puspitasari, Fachrina Dewi, et autres
Publié: (2024)
Next-Generation License Plate Detection and Recognition System using YOLOv8
par: Amin, Arslan, et autres
Publié: (2025)
par: Amin, Arslan, et autres
Publié: (2025)
Appearance-based gaze estimation enhanced with synthetic images using deep neural networks
par: Herashchenko, Dmytro, et autres
Publié: (2023)
par: Herashchenko, Dmytro, et autres
Publié: (2023)
Disrupting Diffusion: Token-Level Attention Erasure Attack against Diffusion-based Customization
par: Liu, Yisu, et autres
Publié: (2024)
par: Liu, Yisu, et autres
Publié: (2024)
Locate-Then-Examine: Grounded Region Reasoning Improves Detection of AI-Generated Images
par: Ji, Yikun, et autres
Publié: (2025)
par: Ji, Yikun, et autres
Publié: (2025)
Learning to Seek Evidence: A Verifiable Reasoning Agent with Causal Faithfulness Analysis
par: Huang, Yuhang, et autres
Publié: (2025)
par: Huang, Yuhang, et autres
Publié: (2025)
CoT4AD: A Vision-Language-Action Model with Explicit Chain-of-Thought Reasoning for Autonomous Driving
par: Wang, Zhaohui, et autres
Publié: (2025)
par: Wang, Zhaohui, et autres
Publié: (2025)
3DCity-LLM: Empowering Multi-modality Large Language Models for 3D City-scale Perception and Understanding
par: Chen, Yiping, et autres
Publié: (2026)
par: Chen, Yiping, et autres
Publié: (2026)
Invariant Representation via Decoupling Style and Spurious Features from Images
par: Li, Ruimeng, et autres
Publié: (2023)
par: Li, Ruimeng, et autres
Publié: (2023)
FrescoDiffusion: 4K Image-to-Video with Prior-Regularized Tiled Diffusion
par: Caselles-Dupré, Hugo, et autres
Publié: (2026)
par: Caselles-Dupré, Hugo, et autres
Publié: (2026)
Fruit Fly Classification (Diptera: Tephritidae) in Images, Applying Transfer Learning
par: Flores, Erick Andrew Bustamante, et autres
Publié: (2025)
par: Flores, Erick Andrew Bustamante, et autres
Publié: (2025)
Vectra: A New Metric, Dataset, and Model for Visual Quality Assessment in E-Commerce In-Image Machine Translation
par: Wu, Qingyu, et autres
Publié: (2026)
par: Wu, Qingyu, et autres
Publié: (2026)
Perceptual Flow Network for Visually Grounded Reasoning
par: Li, Yangfu, et autres
Publié: (2026)
par: Li, Yangfu, et autres
Publié: (2026)
Story Generation from Visual Inputs: Techniques, Related Tasks, and Challenges
par: Oliveira, Daniel A. P., et autres
Publié: (2024)
par: Oliveira, Daniel A. P., et autres
Publié: (2024)
MAP: End-to-End Autonomous Driving with Map-Assisted Planning
par: Yin, Huilin, et autres
Publié: (2025)
par: Yin, Huilin, et autres
Publié: (2025)
Demo-Pose: Depth-Monocular Modality Fusion For Object Pose Estimation
par: Agarwal, Rachit, et autres
Publié: (2026)
par: Agarwal, Rachit, et autres
Publié: (2026)
SITUATE -- Synthetic Object Counting Dataset for VLM training
par: Peinl, René, et autres
Publié: (2026)
par: Peinl, René, et autres
Publié: (2026)
Fre-Res: Frequency-Residual Video Token Compression for Efficient Video MLLMs
par: Feng, Yigui, et autres
Publié: (2026)
par: Feng, Yigui, et autres
Publié: (2026)
ProtoFlow: Interpretable and Robust Surgical Workflow Modeling with Learned Dynamic Scene Graph Prototypes
par: Holm, Felix, et autres
Publié: (2025)
par: Holm, Felix, et autres
Publié: (2025)
Siamese Networks for Cat Re-Identification: Exploring Neural Models for Cat Instance Recognition
par: Trein, Tobias, et autres
Publié: (2025)
par: Trein, Tobias, et autres
Publié: (2025)
Evaluation of Environmental Conditions on Object Detection using Oriented Bounding Boxes for AR Applications
par: Li, Vladislav, et autres
Publié: (2023)
par: Li, Vladislav, et autres
Publié: (2023)
MFTF: Mask-free Training-free Object Level Layout Control Diffusion Model
par: Yang, Shan
Publié: (2024)
par: Yang, Shan
Publié: (2024)
Attentive VQ-VAE
par: Hoyos, Angello, et autres
Publié: (2023)
par: Hoyos, Angello, et autres
Publié: (2023)
TexTailor: Customized Text-aligned Texturing via Effective Resampling
par: Lee, Suin, et autres
Publié: (2025)
par: Lee, Suin, et autres
Publié: (2025)
Rethinking Multimodal Point Cloud Completion: A Completion-by-Correction Perspective
par: Luo, Wang, et autres
Publié: (2025)
par: Luo, Wang, et autres
Publié: (2025)
VSI: Visual Subtitle Integration for Keyframe Selection to enhance Long Video Understanding
par: He, Jianxiang, et autres
Publié: (2025)
par: He, Jianxiang, et autres
Publié: (2025)
Robust Visual Question Answering: Datasets, Methods, and Future Challenges
par: Ma, Jie, et autres
Publié: (2023)
par: Ma, Jie, et autres
Publié: (2023)
Unified Auto-Encoding with Masked Diffusion
par: Hansen-Estruch, Philippe, et autres
Publié: (2024)
par: Hansen-Estruch, Philippe, et autres
Publié: (2024)
ESCAPE: Energy-based Selective Adaptive Correction for Out-of-distribution 3D Human Pose Estimation
par: Bidulka, Luke, et autres
Publié: (2024)
par: Bidulka, Luke, et autres
Publié: (2024)
EvoPrune: Early-Stage Visual Token Pruning for Efficient MLLMs
par: Chen, Yuhao, et autres
Publié: (2026)
par: Chen, Yuhao, et autres
Publié: (2026)
Documents similaires
-
SIFThinker: Spatially-Aware Image Focus for Visual Reasoning
par: Chen, Zhangquan, et autres
Publié: (2025) -
CLIP Embeddings for AI-Generated Image Detection: A Few-Shot Study with Lightweight Classifier
par: Ou, Ziyang
Publié: (2025) -
OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention
par: Chen, Zhangquan, et autres
Publié: (2026) -
Think with 3D: Geometric Imagination Grounded Spatial Reasoning from Limited Views
par: Chen, Zhangquan, et autres
Publié: (2025) -
Supervised Contrastive Learning for Few-Shot AI-Generated Image Detection and Attribution
par: Urueña, Jaime Álvarez, et autres
Publié: (2025)