Reasoning to Edit: Hypothetical Instruction-Based Image Editing with Visual Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | He, Qingdong, Chen, Xueqin, Wang, Chaoyi, Pan, Yanjie, Hu, Xiaobin, Gan, Zhenye, Wang, Yabiao, Wang, Chengjie, Li, Xiangtai, Zhang, Jiangning |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
The devil is in the details: Enhancing Video Virtual Try-On via Keyframe-Driven Details Injection
di: He, Qingdong, et al.
Pubblicazione: (2025)
di: He, Qingdong, et al.
Pubblicazione: (2025)
PointRWKV: Efficient RWKV-Like Model for Hierarchical Point Cloud Learning
di: He, Qingdong, et al.
Pubblicazione: (2024)
di: He, Qingdong, et al.
Pubblicazione: (2024)
A Comprehensive Library for Benchmarking Multi-class Visual Anomaly Detection
di: Zhang, Jiangning, et al.
Pubblicazione: (2024)
di: Zhang, Jiangning, et al.
Pubblicazione: (2024)
MobileMamba: Lightweight Multi-Receptive Visual Mamba Network
di: He, Haoyang, et al.
Pubblicazione: (2024)
di: He, Haoyang, et al.
Pubblicazione: (2024)
DynamicControl: Adaptive Condition Selection for Improved Text-to-Image Generation
di: He, Qingdong, et al.
Pubblicazione: (2024)
di: He, Qingdong, et al.
Pubblicazione: (2024)
HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding
di: Cai, Yuxuan, et al.
Pubblicazione: (2025)
di: Cai, Yuxuan, et al.
Pubblicazione: (2025)
PixelPonder: Dynamic Patch Adaptation for Enhanced Multi-Conditional Text-to-Image Generation
di: Pan, Yanjie, et al.
Pubblicazione: (2025)
di: Pan, Yanjie, et al.
Pubblicazione: (2025)
IVEBench: Modern Benchmark Suite for Instruction-Guided Video Editing Assessment
di: Chen, Yinan, et al.
Pubblicazione: (2025)
di: Chen, Yinan, et al.
Pubblicazione: (2025)
Transform Trained Transformer: Accelerating Naive 4K Video Generation Over 10$\times$
di: Zhang, Jiangning, et al.
Pubblicazione: (2025)
di: Zhang, Jiangning, et al.
Pubblicazione: (2025)
MambaAD: Exploring State Space Models for Multi-class Unsupervised Anomaly Detection
di: He, Haoyang, et al.
Pubblicazione: (2024)
di: He, Haoyang, et al.
Pubblicazione: (2024)
Open-Vocabulary SAM3D: Towards Training-free Open-Vocabulary 3D Scene Understanding
di: Tai, Hanchen, et al.
Pubblicazione: (2024)
di: Tai, Hanchen, et al.
Pubblicazione: (2024)
Unveil Inversion and Invariance in Flow Transformer for Versatile Image Editing
di: Xu, Pengcheng, et al.
Pubblicazione: (2024)
di: Xu, Pengcheng, et al.
Pubblicazione: (2024)
UniCombine: Unified Multi-Conditional Combination with Diffusion Transformer
di: Wang, Haoxuan, et al.
Pubblicazione: (2025)
di: Wang, Haoxuan, et al.
Pubblicazione: (2025)
LLaVA-VSD: Large Language-and-Vision Assistant for Visual Spatial Description
di: Jin, Yizhang, et al.
Pubblicazione: (2024)
di: Jin, Yizhang, et al.
Pubblicazione: (2024)
EATFormer: Improving Vision Transformer Inspired by Evolutionary Algorithm
di: Zhang, Jiangning, et al.
Pubblicazione: (2022)
di: Zhang, Jiangning, et al.
Pubblicazione: (2022)
EMOv2: Pushing 5M Vision Model Frontier
di: Zhang, Jiangning, et al.
Pubblicazione: (2024)
di: Zhang, Jiangning, et al.
Pubblicazione: (2024)
ReasonEdit: Towards Reasoning-Enhanced Image Editing Models
di: Yin, Fukun, et al.
Pubblicazione: (2025)
di: Yin, Fukun, et al.
Pubblicazione: (2025)
MARRS: Masked Autoregressive Unit-based Reaction Synthesis
di: Wang, Yabiao, et al.
Pubblicazione: (2025)
di: Wang, Yabiao, et al.
Pubblicazione: (2025)
CLEAR: Context-Aware Learning with End-to-End Mask-Free Inference for Adaptive Video Subtitle Removal
di: He, Qingdong, et al.
Pubblicazione: (2026)
di: He, Qingdong, et al.
Pubblicazione: (2026)
Boosting Reasoning in Large Multimodal Models via Activation Replay
di: Xing, Yun, et al.
Pubblicazione: (2025)
di: Xing, Yun, et al.
Pubblicazione: (2025)
Towards Generalized Multi-Image Editing for Unified Multimodal Models
di: Xu, Pengcheng, et al.
Pubblicazione: (2026)
di: Xu, Pengcheng, et al.
Pubblicazione: (2026)
DMAD: Dual Memory Bank for Real-World Anomaly Detection
di: Hu, Jianlong, et al.
Pubblicazione: (2024)
di: Hu, Jianlong, et al.
Pubblicazione: (2024)
Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation
di: Chen, Yuheng, et al.
Pubblicazione: (2026)
di: Chen, Yuheng, et al.
Pubblicazione: (2026)
Rethinking Where to Edit: Task-Aware Localization for Instruction-Based Image Editing
di: He, Jingxuan, et al.
Pubblicazione: (2026)
di: He, Jingxuan, et al.
Pubblicazione: (2026)
Reference Twice: A Simple and Unified Baseline for Few-Shot Instance Segmentation
di: Han, Yue, et al.
Pubblicazione: (2023)
di: Han, Yue, et al.
Pubblicazione: (2023)
Exploring Plain ViT Reconstruction for Multi-class Unsupervised Anomaly Detection
di: Zhang, Jiangning, et al.
Pubblicazione: (2023)
di: Zhang, Jiangning, et al.
Pubblicazione: (2023)
ReasonPix2Pix: Instruction Reasoning Dataset for Advanced Image Editing
di: Jin, Ying, et al.
Pubblicazione: (2024)
di: Jin, Ying, et al.
Pubblicazione: (2024)
PointSeg: A Training-Free Paradigm for 3D Scene Segmentation via Foundation Models
di: He, Qingdong, et al.
Pubblicazione: (2024)
di: He, Qingdong, et al.
Pubblicazione: (2024)
InsightEdit: Towards Better Instruction Following for Image Editing
di: Xu, Yingjing, et al.
Pubblicazione: (2024)
di: Xu, Yingjing, et al.
Pubblicazione: (2024)
UniM-OV3D: Uni-Modality Open-Vocabulary 3D Scene Understanding with Fine-Grained Feature Representation
di: He, Qingdong, et al.
Pubblicazione: (2024)
di: He, Qingdong, et al.
Pubblicazione: (2024)
AnomalyDiffusion: Few-Shot Anomaly Image Generation with Diffusion Model
di: Hu, Teng, et al.
Pubblicazione: (2023)
di: Hu, Teng, et al.
Pubblicazione: (2023)
AdapNet: Adaptive Noise-Based Network for Low-Quality Image Retrieval
di: Zhang, Sihe, et al.
Pubblicazione: (2024)
di: Zhang, Sihe, et al.
Pubblicazione: (2024)
UltraVideo: High-Quality UHD Video Dataset with Comprehensive Captions
di: Xue, Zhucun, et al.
Pubblicazione: (2025)
di: Xue, Zhucun, et al.
Pubblicazione: (2025)
ChronoEdit: Towards Temporal Reasoning for Image Editing and World Simulation
di: Wu, Jay Zhangjie, et al.
Pubblicazione: (2025)
di: Wu, Jay Zhangjie, et al.
Pubblicazione: (2025)
Collaborative Face Experts Fusion in Video Generation: Boosting Identity Consistency Across Large Face Poses
di: Wang, Yuji, et al.
Pubblicazione: (2025)
di: Wang, Yuji, et al.
Pubblicazione: (2025)
Identity-Preserving Text-to-Video Generation Guided by Simple yet Effective Spatial-Temporal Decoupled Representations
di: Wang, Yuji, et al.
Pubblicazione: (2025)
di: Wang, Yuji, et al.
Pubblicazione: (2025)
Semantic Frame Interpolation
di: Hong, Yijia, et al.
Pubblicazione: (2025)
di: Hong, Yijia, et al.
Pubblicazione: (2025)
Human-MME: A Holistic Evaluation Benchmark for Human-Centric Multimodal Large Language Models
di: Liu, Yuansen, et al.
Pubblicazione: (2025)
di: Liu, Yuansen, et al.
Pubblicazione: (2025)
HumanEdit: A High-Quality Human-Rewarded Dataset for Instruction-based Image Editing
di: Bai, Jinbin, et al.
Pubblicazione: (2024)
di: Bai, Jinbin, et al.
Pubblicazione: (2024)
FitDiT: Advancing the Authentic Garment Details for High-fidelity Virtual Try-on
di: Jiang, Boyuan, et al.
Pubblicazione: (2024)
di: Jiang, Boyuan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
The devil is in the details: Enhancing Video Virtual Try-On via Keyframe-Driven Details Injection
di: He, Qingdong, et al.
Pubblicazione: (2025) -
PointRWKV: Efficient RWKV-Like Model for Hierarchical Point Cloud Learning
di: He, Qingdong, et al.
Pubblicazione: (2024) -
A Comprehensive Library for Benchmarking Multi-class Visual Anomaly Detection
di: Zhang, Jiangning, et al.
Pubblicazione: (2024) -
MobileMamba: Lightweight Multi-Receptive Visual Mamba Network
di: He, Haoyang, et al.
Pubblicazione: (2024) -
DynamicControl: Adaptive Condition Selection for Improved Text-to-Image Generation
di: He, Qingdong, et al.
Pubblicazione: (2024)