Generative Visual Chain-of-Thought for Image Editing
Fuente:
arXiv
Guardado en:
| Autores principales: | Yin, Zijin, Hang, Tiankai, Cheng, Yiji, Zhang, Shiyi, He, Runze, Xu, Yu, Wang, Chunyu, Li, Bing, Chang, Zheng, Liang, Kongming, Lu, Qinglin, Ma, Zhanyu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Meta-CoT: Enhancing Granularity and Generalization in Image Editing
por: Zhang, Shiyi, et al.
Publicado: (2026)
por: Zhang, Shiyi, et al.
Publicado: (2026)
Re-Align: Structured Reasoning-guided Alignment for In-Context Image Generation and Editing
por: He, Runze, et al.
Publicado: (2026)
por: He, Runze, et al.
Publicado: (2026)
Benchmarking Segmentation Models with Mask-Preserved Attribute Editing
por: Yin, Zijin, et al.
Publicado: (2024)
por: Yin, Zijin, et al.
Publicado: (2024)
Benchmarking Semantic Segmentation Models via Appearance and Geometry Attribute Editing
por: Yin, Zijin, et al.
Publicado: (2026)
por: Yin, Zijin, et al.
Publicado: (2026)
TAG-MoE: Task-Aware Gating for Unified Generative Mixture-of-Experts
por: Xu, Yu, et al.
Publicado: (2026)
por: Xu, Yu, et al.
Publicado: (2026)
PGP-SAM: Prototype-Guided Prompt Learning for Efficient Few-Shot Medical Image Segmentation
por: Yan, Zhonghao, et al.
Publicado: (2025)
por: Yan, Zhonghao, et al.
Publicado: (2025)
PromptEnhancer: A Simple Approach to Enhance Text-to-Image Models via Chain-of-Thought Prompt Rewriting
por: Wang, Linqing, et al.
Publicado: (2025)
por: Wang, Linqing, et al.
Publicado: (2025)
Hierarchical SVG Tokenization: Learning Compact Visual Programs for Scalable Vector Graphics Modeling
por: Xing, Ximing, et al.
Publicado: (2026)
por: Xing, Ximing, et al.
Publicado: (2026)
Polyp-E: Benchmarking the Robustness of Deep Segmentation Models via Polyp Editing
por: Wei, Runpu, et al.
Publicado: (2024)
por: Wei, Runpu, et al.
Publicado: (2024)
Harnessing Caption Detailness for Data-Efficient Text-to-Image Generation
por: Wang, Xinran, et al.
Publicado: (2025)
por: Wang, Xinran, et al.
Publicado: (2025)
FairHuman: Boosting Hand and Face Quality in Human Image Generation with Minimum Potential Delay Fairness in Diffusion Models
por: Wang, Yuxuan, et al.
Publicado: (2025)
por: Wang, Yuxuan, et al.
Publicado: (2025)
ConMo: Controllable Motion Disentanglement and Recomposition for Zero-Shot Motion Transfer
por: Gao, Jiayi, et al.
Publicado: (2025)
por: Gao, Jiayi, et al.
Publicado: (2025)
OmniEraser: Remove Objects and Their Effects in Images with Paired Video-Frame Data
por: Wei, Runpu, et al.
Publicado: (2025)
por: Wei, Runpu, et al.
Publicado: (2025)
Geometric Image Editing via Effects-Sensitive In-Context Inpainting with Diffusion Transformers
por: Zhang, Shuo, et al.
Publicado: (2026)
por: Zhang, Shuo, et al.
Publicado: (2026)
Unified Multimodal Chain-of-Thought Reward Model through Reinforcement Fine-Tuning
por: Wang, Yibin, et al.
Publicado: (2025)
por: Wang, Yibin, et al.
Publicado: (2025)
FireEdit: Fine-grained Instruction-based Image Editing via Region-aware Vision Language Model
por: Zhou, Jun, et al.
Publicado: (2025)
por: Zhou, Jun, et al.
Publicado: (2025)
Reversing the Flow: Generation-to-Understanding Synergy in Large Multimodal Models
por: Tong, Yujun, et al.
Publicado: (2026)
por: Tong, Yujun, et al.
Publicado: (2026)
From Simple to Professional: A Combinatorial Controllable Image Captioning Agent
por: Wang, Xinran, et al.
Publicado: (2024)
por: Wang, Xinran, et al.
Publicado: (2024)
ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding
por: Fu, Xingyu, et al.
Publicado: (2025)
por: Fu, Xingyu, et al.
Publicado: (2025)
CCA: Collaborative Competitive Agents for Image Editing
por: Hang, Tiankai, et al.
Publicado: (2024)
por: Hang, Tiankai, et al.
Publicado: (2024)
Curriculum Group Policy Optimization: Adaptive Sampling for Unleashing the Potential of Text-to-Image Generation
por: Li, Baoteng, et al.
Publicado: (2026)
por: Li, Baoteng, et al.
Publicado: (2026)
Evaluating Attribute Comprehension in Large Vision-Language Models
por: Zhang, Haiwen, et al.
Publicado: (2024)
por: Zhang, Haiwen, et al.
Publicado: (2024)
SRLCG: Self-Rectified Large-Scale Code Generation with Multidimensional Chain-of-Thought and Dynamic Backtracking
por: Ma, Hongru, et al.
Publicado: (2025)
por: Ma, Hongru, et al.
Publicado: (2025)
MedReasoner: Reinforcement Learning Drives Reasoning Grounding from Clinical Thought to Pixel-Level Precision
por: Yan, Zhonghao, et al.
Publicado: (2025)
por: Yan, Zhonghao, et al.
Publicado: (2025)
Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
por: Wang, Yifan, et al.
Publicado: (2026)
por: Wang, Yifan, et al.
Publicado: (2026)
AutoRed: A Free-form Adversarial Prompt Generation Framework for Automated Red Teaming
por: Diao, Muxi, et al.
Publicado: (2025)
por: Diao, Muxi, et al.
Publicado: (2025)
Synthesizing File-Level Data for Unit Test Generation with Chain-of-Thoughts via Self-Debugging
por: Hua, Ziyue, et al.
Publicado: (2026)
por: Hua, Ziyue, et al.
Publicado: (2026)
DriveRX: A Vision-Language Reasoning Model for Cross-Task Autonomous Driving
por: Diao, Muxi, et al.
Publicado: (2025)
por: Diao, Muxi, et al.
Publicado: (2025)
Toward Generalizable Forgery Detection and Reasoning
por: Gao, Yueying, et al.
Publicado: (2025)
por: Gao, Yueying, et al.
Publicado: (2025)
ChatUMM: Robust Context Tracking for Conversational Interleaved Generation
por: Dai, Wenxun, et al.
Publicado: (2026)
por: Dai, Wenxun, et al.
Publicado: (2026)
Latent Chain-of-Thought for Visual Reasoning
por: Sun, Guohao, et al.
Publicado: (2025)
por: Sun, Guohao, et al.
Publicado: (2025)
Chain-of-Cooking:Cooking Process Visualization via Bidirectional Chain-of-Thought Guidance
por: Xu, Mengling, et al.
Publicado: (2025)
por: Xu, Mengling, et al.
Publicado: (2025)
Detailed Object Description with Controllable Dimensions
por: Wang, Xinran, et al.
Publicado: (2024)
por: Wang, Xinran, et al.
Publicado: (2024)
Knowledge Editing through Chain-of-Thought
por: Wang, Changyue, et al.
Publicado: (2024)
por: Wang, Changyue, et al.
Publicado: (2024)
Efficient Face Super-Resolution via Wavelet-based Feature Enhancement Network
por: Li, Wenjie, et al.
Publicado: (2024)
por: Li, Wenjie, et al.
Publicado: (2024)
Shape of Thought: Progressive Object Assembly via Visual Chain-of-Thought
por: Huo, Yu, et al.
Publicado: (2026)
por: Huo, Yu, et al.
Publicado: (2026)
Hepato-LLaVA: An Expert MLLM with Sparse Topo-Pack Attention for Hepatocellular Pathology Analysis on Whole Slide Images
por: Yang, Yuxuan, et al.
Publicado: (2026)
por: Yang, Yuxuan, et al.
Publicado: (2026)
Improving Chain-of-Thought Efficiency for Autoregressive Image Generation
por: Gu, Zeqi, et al.
Publicado: (2025)
por: Gu, Zeqi, et al.
Publicado: (2025)
Unlocking the Potential of Disulfidptosis‐Related LncRNAs in Lung Adenocarcinoma: A Promising Prognostic LncRNA Model for Survival and Immunotherapy Prediction
por: Xin Nie, et al.
Publicado: (2024)
por: Xin Nie, et al.
Publicado: (2024)
CineTechBench: A Benchmark for Cinematographic Technique Understanding and Generation
por: Wang, Xinran, et al.
Publicado: (2025)
por: Wang, Xinran, et al.
Publicado: (2025)
Ejemplares similares
-
Meta-CoT: Enhancing Granularity and Generalization in Image Editing
por: Zhang, Shiyi, et al.
Publicado: (2026) -
Re-Align: Structured Reasoning-guided Alignment for In-Context Image Generation and Editing
por: He, Runze, et al.
Publicado: (2026) -
Benchmarking Segmentation Models with Mask-Preserved Attribute Editing
por: Yin, Zijin, et al.
Publicado: (2024) -
Benchmarking Semantic Segmentation Models via Appearance and Geometry Attribute Editing
por: Yin, Zijin, et al.
Publicado: (2026) -
TAG-MoE: Task-Aware Gating for Unified Generative Mixture-of-Experts
por: Xu, Yu, et al.
Publicado: (2026)