EditThinker: Unlocking Iterative Reasoning for Any Image Editor
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Hongyu, Zhang, Manyuan, Zheng, Dian, Guo, Ziyu, Jia, Yimeng, Feng, Kaituo, Yu, Hao, Liu, Yexin, Feng, Yan, Pei, Peng, Cai, Xunliang, Huang, Linjiang, Li, Hongsheng, Liu, Si |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Uni-Edit: Intelligent Editing Is A General Task For Unified Model Tuning
di: Zheng, Dian, et al.
Pubblicazione: (2026)
di: Zheng, Dian, et al.
Pubblicazione: (2026)
OneThinker: All-in-one Reasoning Model for Image and Video
di: Feng, Kaituo, et al.
Pubblicazione: (2025)
di: Feng, Kaituo, et al.
Pubblicazione: (2025)
AIA: Rethinking Architecture Decoupling Strategy In Unified Multimodal Model
di: Zheng, Dian, et al.
Pubblicazione: (2025)
di: Zheng, Dian, et al.
Pubblicazione: (2025)
OpenSubject: Leveraging Video-Derived Identity and Diversity Priors for Subject-driven Image Generation and Manipulation
di: Liu, Yexin, et al.
Pubblicazione: (2025)
di: Liu, Yexin, et al.
Pubblicazione: (2025)
Exploring Reasoning Reward Model for Agents
di: Fan, Kaixuan, et al.
Pubblicazione: (2026)
di: Fan, Kaixuan, et al.
Pubblicazione: (2026)
CodePlot-CoT: Mathematical Visual Reasoning by Thinking with Code-Driven Images
di: Duan, Chengqi, et al.
Pubblicazione: (2025)
di: Duan, Chengqi, et al.
Pubblicazione: (2025)
Gen-Searcher: Reinforcing Agentic Search for Image Generation
di: Feng, Kaituo, et al.
Pubblicazione: (2026)
di: Feng, Kaituo, et al.
Pubblicazione: (2026)
Thinking-while-Generating: Interleaving Textual Reasoning throughout Visual Generation
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark
di: Fang, Rongyao, et al.
Pubblicazione: (2025)
di: Fang, Rongyao, et al.
Pubblicazione: (2025)
GaussianPainter: Painting Point Cloud into 3D Gaussians with Normal Guidance
di: Zhou, Jingqiu, et al.
Pubblicazione: (2024)
di: Zhou, Jingqiu, et al.
Pubblicazione: (2024)
Think with 3D: Geometric Imagination Grounded Spatial Reasoning from Limited Views
di: Chen, Zhangquan, et al.
Pubblicazione: (2025)
di: Chen, Zhangquan, et al.
Pubblicazione: (2025)
AnyExperts: On-Demand Expert Allocation for Multimodal Language Models with Mixture of Expert
di: Gao, Yuting, et al.
Pubblicazione: (2025)
di: Gao, Yuting, et al.
Pubblicazione: (2025)
FouriScale: A Frequency Perspective on Training-Free High-Resolution Image Synthesis
di: Huang, Linjiang, et al.
Pubblicazione: (2024)
di: Huang, Linjiang, et al.
Pubblicazione: (2024)
FlexDrive: Toward Trajectory Flexibility in Driving Scene Reconstruction and Rendering
di: Zhou, Jingqiu, et al.
Pubblicazione: (2025)
di: Zhou, Jingqiu, et al.
Pubblicazione: (2025)
AnyEdit: Edit Any Knowledge Encoded in Language Models
di: Jiang, Houcheng, et al.
Pubblicazione: (2025)
di: Jiang, Houcheng, et al.
Pubblicazione: (2025)
Visual Para-Thinker: Divide-and-Conquer Reasoning for Visual Comprehension
di: Xu, Haoran, et al.
Pubblicazione: (2026)
di: Xu, Haoran, et al.
Pubblicazione: (2026)
Are Video Models Ready as Zero-Shot Reasoners? An Empirical Study with the MME-CoF Benchmark
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
MosaicThinker: On-Device Visual Spatial Reasoning for Embodied AI via Iterative Construction of Space Representation
di: Wang, Haoming, et al.
Pubblicazione: (2026)
di: Wang, Haoming, et al.
Pubblicazione: (2026)
GoT-R1: Unleashing Reasoning Capability of MLLM for Visual Generation with Reinforcement Learning
di: Duan, Chengqi, et al.
Pubblicazione: (2025)
di: Duan, Chengqi, et al.
Pubblicazione: (2025)
SpiralThinker: Latent Reasoning through an Iterative Process with Text-Latent Interleaving
di: Piao, Shengmin, et al.
Pubblicazione: (2025)
di: Piao, Shengmin, et al.
Pubblicazione: (2025)
VideoThinker: Building Agentic VideoLLMs with LLM-Guided Tool Reasoning
di: Li, Chenglin, et al.
Pubblicazione: (2026)
di: Li, Chenglin, et al.
Pubblicazione: (2026)
FreeEdit: Mask-free Reference-based Image Editing with Multi-modal Instruction
di: He, Runze, et al.
Pubblicazione: (2024)
di: He, Runze, et al.
Pubblicazione: (2024)
GraphThinker: Reinforcing Temporally Grounded Video Reasoning with Event Graph Thinking
di: Cheng, Zixu, et al.
Pubblicazione: (2026)
di: Cheng, Zixu, et al.
Pubblicazione: (2026)
ReThinker: Scientific Reasoning by Rethinking with Guided Reflection and Confidence Control
di: Tang, Zhentao, et al.
Pubblicazione: (2026)
di: Tang, Zhentao, et al.
Pubblicazione: (2026)
BudgetThinker: Empowering Budget-aware LLM Reasoning with Control Tokens
di: Wen, Hao, et al.
Pubblicazione: (2025)
di: Wen, Hao, et al.
Pubblicazione: (2025)
AnyEdit: Mastering Unified High-Quality Image Editing for Any Idea
di: Yu, Qifan, et al.
Pubblicazione: (2024)
di: Yu, Qifan, et al.
Pubblicazione: (2024)
Edit360: 2D Image Edits to 3D Assets from Any Angle
di: Huang, Junchao, et al.
Pubblicazione: (2025)
di: Huang, Junchao, et al.
Pubblicazione: (2025)
SophiaVL-R1: Reinforcing MLLMs Reasoning with Thinking Reward
di: Fan, Kaixuan, et al.
Pubblicazione: (2025)
di: Fan, Kaixuan, et al.
Pubblicazione: (2025)
MoTE: Mixture of Ternary Experts for Memory-efficient Large Multimodal Models
di: Wang, Hongyu, et al.
Pubblicazione: (2025)
di: Wang, Hongyu, et al.
Pubblicazione: (2025)
EmotionThinker: Prosody-Aware Reinforcement Learning for Explainable Speech Emotion Reasoning
di: Wang, Dingdong, et al.
Pubblicazione: (2026)
di: Wang, Dingdong, et al.
Pubblicazione: (2026)
EgoThinker: Unveiling Egocentric Reasoning with Spatio-Temporal CoT
di: Pei, Baoqi, et al.
Pubblicazione: (2025)
di: Pei, Baoqi, et al.
Pubblicazione: (2025)
Highly Efficient Test-Time Scaling for T2I Diffusion Models with Text Embedding Perturbation
di: Xu, Hang, et al.
Pubblicazione: (2025)
di: Xu, Hang, et al.
Pubblicazione: (2025)
FR-TTS: Test-Time Scaling for NTP-based Image Generation with Effective Filling-based Reward Signal
di: Xu, Hang, et al.
Pubblicazione: (2025)
di: Xu, Hang, et al.
Pubblicazione: (2025)
Fractal dimensions for Iterated Graph Systems
di: Li, Nero Ziyu
Pubblicazione: (2022)
di: Li, Nero Ziyu
Pubblicazione: (2022)
MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning
di: Shi, Weikang, et al.
Pubblicazione: (2025)
di: Shi, Weikang, et al.
Pubblicazione: (2025)
CAE: Repurposing the Critic as an Explorer in Deep Reinforcement Learning
di: Li, Yexin
Pubblicazione: (2025)
di: Li, Yexin
Pubblicazione: (2025)
SMI-Editor: Edit-based SMILES Language Model with Fragment-level Supervision
di: Zheng, Kangjie, et al.
Pubblicazione: (2024)
di: Zheng, Kangjie, et al.
Pubblicazione: (2024)
Unlocking Implicit Experience: Synthesizing Tool-Use Trajectories from Text
di: Xu, Zhihao, et al.
Pubblicazione: (2026)
di: Xu, Zhihao, et al.
Pubblicazione: (2026)
Resolving UnderEdit & OverEdit with Iterative & Neighbor-Assisted Model Editing
di: Baghel, Bhiman Kumar, et al.
Pubblicazione: (2025)
di: Baghel, Bhiman Kumar, et al.
Pubblicazione: (2025)
ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning
di: Ding, Shengyuan, et al.
Pubblicazione: (2025)
di: Ding, Shengyuan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Uni-Edit: Intelligent Editing Is A General Task For Unified Model Tuning
di: Zheng, Dian, et al.
Pubblicazione: (2026) -
OneThinker: All-in-one Reasoning Model for Image and Video
di: Feng, Kaituo, et al.
Pubblicazione: (2025) -
AIA: Rethinking Architecture Decoupling Strategy In Unified Multimodal Model
di: Zheng, Dian, et al.
Pubblicazione: (2025) -
OpenSubject: Leveraging Video-Derived Identity and Diversity Priors for Subject-driven Image Generation and Manipulation
di: Liu, Yexin, et al.
Pubblicazione: (2025) -
Exploring Reasoning Reward Model for Agents
di: Fan, Kaixuan, et al.
Pubblicazione: (2026)