ControlThinker: Unveiling Latent Semantics for Controllable Image Generation through Visual Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Han, Feng, Jiao, Yang, Chen, Shaoxiang, Xu, Junhao, Chen, Jingjing, Jiang, Yu-Gang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
EAGLE: Towards Efficient Arbitrary Referring Visual Prompts Comprehension for Multimodal Large Language Models
por: Zhang, Jiacheng, et al.
Publicado: (2024)
por: Zhang, Jiacheng, et al.
Publicado: (2024)
SpatialImaginer: Towards Adaptive Visual Imagination for Spatial Reasoning
por: Li, Yian, et al.
Publicado: (2026)
por: Li, Yian, et al.
Publicado: (2026)
UniToken: Harmonizing Multimodal Understanding and Generation through Unified Visual Encoding
por: Jiao, Yang, et al.
Publicado: (2025)
por: Jiao, Yang, et al.
Publicado: (2025)
Lumen: Unleashing Versatile Vision-Centric Capabilities of Large Multimodal Models
por: Jiao, Yang, et al.
Publicado: (2024)
por: Jiao, Yang, et al.
Publicado: (2024)
VCE: Safe Autoregressive Image Generation via Visual Contrast Exploitation
por: Han, Feng, et al.
Publicado: (2025)
por: Han, Feng, et al.
Publicado: (2025)
OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks
por: Wang, Jiayu, et al.
Publicado: (2025)
por: Wang, Jiayu, et al.
Publicado: (2025)
EgoThinker: Unveiling Egocentric Reasoning with Spatio-Temporal CoT
por: Pei, Baoqi, et al.
Publicado: (2025)
por: Pei, Baoqi, et al.
Publicado: (2025)
Semantic-Enriched Latent Visual Reasoning
por: Xu, Tianrun, et al.
Publicado: (2026)
por: Xu, Tianrun, et al.
Publicado: (2026)
Unlocking Textual and Visual Wisdom: Open-Vocabulary 3D Object Detection Enhanced by Comprehensive Guidance from Text and Image
por: Jiao, Pengkun, et al.
Publicado: (2024)
por: Jiao, Pengkun, et al.
Publicado: (2024)
OneThinker: All-in-one Reasoning Model for Image and Video
por: Feng, Kaituo, et al.
Publicado: (2025)
por: Feng, Kaituo, et al.
Publicado: (2025)
Visual Para-Thinker: Divide-and-Conquer Reasoning for Visual Comprehension
por: Xu, Haoran, et al.
Publicado: (2026)
por: Xu, Haoran, et al.
Publicado: (2026)
NuScenes-QA: A Multi-modal Visual Question Answering Benchmark for Autonomous Driving Scenario
por: Qian, Tianwen, et al.
Publicado: (2023)
por: Qian, Tianwen, et al.
Publicado: (2023)
VIGIL: Part-Grounded Structured Reasoning for Generalizable Deepfake Detection
por: Li, Xinghan, et al.
Publicado: (2026)
por: Li, Xinghan, et al.
Publicado: (2026)
VR-Thinker: Boosting Video Reward Models through Thinking-with-Image Reasoning
por: Wang, Qunzhong, et al.
Publicado: (2025)
por: Wang, Qunzhong, et al.
Publicado: (2025)
Unified Thinker: A General Reasoning Modular Core for Image Generation
por: Zhou, Sashuai, et al.
Publicado: (2026)
por: Zhou, Sashuai, et al.
Publicado: (2026)
EditThinker: Unlocking Iterative Reasoning for Any Image Editor
por: Li, Hongyu, et al.
Publicado: (2025)
por: Li, Hongyu, et al.
Publicado: (2025)
Rex-Thinker: Grounded Object Referring via Chain-of-Thought Reasoning
por: Jiang, Qing, et al.
Publicado: (2025)
por: Jiang, Qing, et al.
Publicado: (2025)
Latent Action Control for Reasoning-Guided Unified Image Generation
por: Zhai, Fuxiang, et al.
Publicado: (2026)
por: Zhai, Fuxiang, et al.
Publicado: (2026)
ProxyThinker: Test-Time Guidance through Small Visual Reasoners
por: Xiao, Zilin, et al.
Publicado: (2025)
por: Xiao, Zilin, et al.
Publicado: (2025)
Domain Expansion and Boundary Growth for Open-Set Single-Source Domain Generalization
por: Jiao, Pengkun, et al.
Publicado: (2024)
por: Jiao, Pengkun, et al.
Publicado: (2024)
V-Thinker: Interactive Thinking with Images
por: Qiao, Runqi, et al.
Publicado: (2025)
por: Qiao, Runqi, et al.
Publicado: (2025)
VLA-Thinker: Boosting Vision-Language-Action Models through Thinking-with-Image Reasoning
por: Wang, Chaoyang, et al.
Publicado: (2026)
por: Wang, Chaoyang, et al.
Publicado: (2026)
Latent Visual Reasoning
por: Li, Bangzheng, et al.
Publicado: (2025)
por: Li, Bangzheng, et al.
Publicado: (2025)
From Canteen Food to Daily Meals: Generalizing Food Recognition to More Practical Scenarios
por: Liu, Guoshan, et al.
Publicado: (2024)
por: Liu, Guoshan, et al.
Publicado: (2024)
Pix2Key: Controllable Open-Vocabulary Retrieval with Semantic Decomposition and Self-Supervised Visual Dictionary Learning
por: Wei, Guoyizhe, et al.
Publicado: (2026)
por: Wei, Guoyizhe, et al.
Publicado: (2026)
DiffThinker: Towards Generative Multimodal Reasoning with Diffusion Models
por: He, Zefeng, et al.
Publicado: (2025)
por: He, Zefeng, et al.
Publicado: (2025)
From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning
por: Jiao, Pengkun, et al.
Publicado: (2024)
por: Jiao, Pengkun, et al.
Publicado: (2024)
MultiRef: Controllable Image Generation with Multiple Visual References
por: Chen, Ruoxi, et al.
Publicado: (2025)
por: Chen, Ruoxi, et al.
Publicado: (2025)
Don't Deceive Me: Mitigating Gaslighting through Attention Reallocation in LMMs
por: Jiao, Pengkun, et al.
Publicado: (2025)
por: Jiao, Pengkun, et al.
Publicado: (2025)
Control-oriented Clustering of Visual Latent Representation
por: Qi, Han, et al.
Publicado: (2024)
por: Qi, Han, et al.
Publicado: (2024)
Controlling the Latent Diffusion Model for Generative Image Shadow Removal via Residual Generation
por: Li, Xinjie, et al.
Publicado: (2024)
por: Li, Xinjie, et al.
Publicado: (2024)
ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning
por: Ding, Shengyuan, et al.
Publicado: (2025)
por: Ding, Shengyuan, et al.
Publicado: (2025)
MotiMotion: Motion-Controlled Video Generation with Visual Reasoning
por: Hsin-Ying, Lee, et al.
Publicado: (2026)
por: Hsin-Ying, Lee, et al.
Publicado: (2026)
EventHallusion: Diagnosing Event Hallucinations in Video LLMs
por: Zhang, Jiacheng, et al.
Publicado: (2024)
por: Zhang, Jiacheng, et al.
Publicado: (2024)
Leveraging Latent Visual Reasoning in Silence
por: Zhu, Dongyao, et al.
Publicado: (2026)
por: Zhu, Dongyao, et al.
Publicado: (2026)
Benchmarking Gaslighting Negation Attacks Against Reasoning Models
por: Zhu, Bin, et al.
Publicado: (2025)
por: Zhu, Bin, et al.
Publicado: (2025)
VideoThinker: Building Agentic VideoLLMs with LLM-Guided Tool Reasoning
por: Li, Chenglin, et al.
Publicado: (2026)
por: Li, Chenglin, et al.
Publicado: (2026)
TextFusion: Unveiling the Power of Textual Semantics for Controllable Image Fusion
por: Cheng, Chunyang, et al.
Publicado: (2023)
por: Cheng, Chunyang, et al.
Publicado: (2023)
LatentEdit: Adaptive Latent Control for Consistent Semantic Editing
por: Liu, Siyi, et al.
Publicado: (2025)
por: Liu, Siyi, et al.
Publicado: (2025)
Visually-Guided Controllable Medical Image Generation via Fine-Grained Semantic Disentanglement
por: Huang, Xin, et al.
Publicado: (2026)
por: Huang, Xin, et al.
Publicado: (2026)
Ejemplares similares
-
EAGLE: Towards Efficient Arbitrary Referring Visual Prompts Comprehension for Multimodal Large Language Models
por: Zhang, Jiacheng, et al.
Publicado: (2024) -
SpatialImaginer: Towards Adaptive Visual Imagination for Spatial Reasoning
por: Li, Yian, et al.
Publicado: (2026) -
UniToken: Harmonizing Multimodal Understanding and Generation through Unified Visual Encoding
por: Jiao, Yang, et al.
Publicado: (2025) -
Lumen: Unleashing Versatile Vision-Centric Capabilities of Large Multimodal Models
por: Jiao, Yang, et al.
Publicado: (2024) -
VCE: Safe Autoregressive Image Generation via Visual Contrast Exploitation
por: Han, Feng, et al.
Publicado: (2025)