Mind-Brush: Integrating Agentic Cognitive Search and Reasoning into Image Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | He, Jun, Ye, Junyan, Huang, Zilong, Jiang, Dongzhi, Zhang, Chenjue, Zhu, Leqi, Zhang, Renrui, Zhang, Xiang, Li, Weijia |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
GenClaw: Code-Driven Agentic Image Generation
por: Ye, Junyan, et al.
Publicado: (2026)
por: Ye, Junyan, et al.
Publicado: (2026)
OmniAID: Decoupling Semantic and Artifacts for Universal AI-Generated Image Detection in the Wild
por: Guo, Yuncheng, et al.
Publicado: (2025)
por: Guo, Yuncheng, et al.
Publicado: (2025)
Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation
por: Ye, Junyan, et al.
Publicado: (2025)
por: Ye, Junyan, et al.
Publicado: (2025)
RealGen: Photorealistic Text-to-Image Generation via Detector-Guided Rewards
por: Ye, Junyan, et al.
Publicado: (2025)
por: Ye, Junyan, et al.
Publicado: (2025)
BLINK-Twice: You see, but do you observe? A Reasoning Benchmark on Visual Perception
por: Ye, Junyan, et al.
Publicado: (2025)
por: Ye, Junyan, et al.
Publicado: (2025)
DraCo: Draft as CoT for Text-to-Image Preview and Rare Concept Generation
por: Jiang, Dongzhi, et al.
Publicado: (2025)
por: Jiang, Dongzhi, et al.
Publicado: (2025)
FakeVLM-R1: Internalizing Physical Laws via CoT for Synthetic Image Detection
por: Zhu, Leqi, et al.
Publicado: (2026)
por: Zhu, Leqi, et al.
Publicado: (2026)
Scene4U: Hierarchical Layered 3D Scene Reconstruction from Single Panoramic Image for Your Immerse Exploration
por: Huang, Zilong, et al.
Publicado: (2025)
por: Huang, Zilong, et al.
Publicado: (2025)
UrbanFeel: A Comprehensive Benchmark for Temporal and Perceptual Understanding of City Scenes through Human Perspective
por: He, Jun, et al.
Publicado: (2025)
por: He, Jun, et al.
Publicado: (2025)
GPT-ImgEval: A Comprehensive Benchmark for Diagnosing GPT4o in Image Generation
por: Yan, Zhiyuan, et al.
Publicado: (2025)
por: Yan, Zhiyuan, et al.
Publicado: (2025)
MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning
por: Chen, Xinyan, et al.
Publicado: (2025)
por: Chen, Xinyan, et al.
Publicado: (2025)
MajutsuCity: Language-driven Aesthetic-adaptive City Generation with Controllable 3D Assets and Layouts
por: Huang, Zilong, et al.
Publicado: (2025)
por: Huang, Zilong, et al.
Publicado: (2025)
CrossViewDiff: A Cross-View Diffusion Model for Satellite-to-Street View Synthesis
por: Li, Weijia, et al.
Publicado: (2024)
por: Li, Weijia, et al.
Publicado: (2024)
SatSAM2: Motion-Constrained Video Object Tracking in Satellite Imagery using Promptable SAM2 and Kalman Priors
por: Fan, Ruijie, et al.
Publicado: (2025)
por: Fan, Ruijie, et al.
Publicado: (2025)
CoMat: Aligning Text-to-Image Diffusion Model with Image-to-Text Concept Matching
por: Jiang, Dongzhi, et al.
Publicado: (2024)
por: Jiang, Dongzhi, et al.
Publicado: (2024)
Leveraging BEV Paradigm for Ground-to-Aerial Image Synthesis
por: Ye, Junyan, et al.
Publicado: (2024)
por: Ye, Junyan, et al.
Publicado: (2024)
Are Video Models Ready as Zero-Shot Reasoners? An Empirical Study with the MME-CoF Benchmark
por: Guo, Ziyu, et al.
Publicado: (2025)
por: Guo, Ziyu, et al.
Publicado: (2025)
T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT
por: Jiang, Dongzhi, et al.
Publicado: (2025)
por: Jiang, Dongzhi, et al.
Publicado: (2025)
Gen-Searcher: Reinforcing Agentic Search for Image Generation
por: Feng, Kaituo, et al.
Publicado: (2026)
por: Feng, Kaituo, et al.
Publicado: (2026)
Unveiling the Cognitive Compass: Theory-of-Mind-Guided Multimodal Emotion Reasoning
por: Luo, Meng, et al.
Publicado: (2026)
por: Luo, Meng, et al.
Publicado: (2026)
GenAgent: Scaling Text-to-Image Generation via Agentic Multimodal Reasoning
por: Jiang, Kaixun, et al.
Publicado: (2026)
por: Jiang, Kaixun, et al.
Publicado: (2026)
Generative Universal Verifier as Multimodal Meta-Reasoner
por: Zhang, Xinchen, et al.
Publicado: (2025)
por: Zhang, Xinchen, et al.
Publicado: (2025)
Beyond Isolated Words: Diffusion Brush for Handwritten Text-Line Generation
por: Dai, Gang, et al.
Publicado: (2025)
por: Dai, Gang, et al.
Publicado: (2025)
LOKI: A Comprehensive Synthetic Data Detection Benchmark using Large Multimodal Models
por: Ye, Junyan, et al.
Publicado: (2024)
por: Ye, Junyan, et al.
Publicado: (2024)
EgoMind: Activating Spatial Cognition through Linguistic Reasoning in MLLMs
por: Chen, Zhenghao, et al.
Publicado: (2026)
por: Chen, Zhenghao, et al.
Publicado: (2026)
LEGION: Learning to Ground and Explain for Synthetic Image Detection
por: Kang, Hengrui, et al.
Publicado: (2025)
por: Kang, Hengrui, et al.
Publicado: (2025)
Uni-Synergy: Bridging Understanding and Generation for Personalized Reasoning via Co-operative Reinforcement Learning
por: Shen, Zijun, et al.
Publicado: (2026)
por: Shen, Zijun, et al.
Publicado: (2026)
PiSA: A Self-Augmented Data Engine and Training Strategy for 3D Understanding with Large Models
por: Guo, Zilu, et al.
Publicado: (2025)
por: Guo, Zilu, et al.
Publicado: (2025)
Spot the Fake: Large Multimodal Model-Based Synthetic Image Detection with Artifact Explanation
por: Wen, Siwei, et al.
Publicado: (2025)
por: Wen, Siwei, et al.
Publicado: (2025)
MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency
por: Jiang, Dongzhi, et al.
Publicado: (2025)
por: Jiang, Dongzhi, et al.
Publicado: (2025)
BrushEdit: All-In-One Image Inpainting and Editing
por: Li, Yaowei, et al.
Publicado: (2024)
por: Li, Yaowei, et al.
Publicado: (2024)
Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step
por: Guo, Ziyu, et al.
Publicado: (2025)
por: Guo, Ziyu, et al.
Publicado: (2025)
Where am I? Cross-View Geo-localization with Natural Language Descriptions
por: Ye, Junyan, et al.
Publicado: (2024)
por: Ye, Junyan, et al.
Publicado: (2024)
TIR-Bench: A Comprehensive Benchmark for Agentic Thinking-with-Images Reasoning
por: Li, Ming, et al.
Publicado: (2025)
por: Li, Ming, et al.
Publicado: (2025)
MMSearch: Benchmarking the Potential of Large Models as Multi-modal Search Engines
por: Jiang, Dongzhi, et al.
Publicado: (2024)
por: Jiang, Dongzhi, et al.
Publicado: (2024)
PathAgent: Toward Interpretable Analysis of Whole-slide Pathology Images via Large Language Model-based Agentic Reasoning
por: Chen, Jingyun, et al.
Publicado: (2025)
por: Chen, Jingyun, et al.
Publicado: (2025)
Echo-α: Large Agentic Multimodal Reasoning Model for Ultrasound Interpretation
por: Zhang, Jing, et al.
Publicado: (2026)
por: Zhang, Jing, et al.
Publicado: (2026)
Thinking-while-Generating: Interleaving Textual Reasoning throughout Visual Generation
por: Guo, Ziyu, et al.
Publicado: (2025)
por: Guo, Ziyu, et al.
Publicado: (2025)
SG-BEV: Satellite-Guided BEV Fusion for Cross-View Semantic Segmentation
por: Ye, Junyan, et al.
Publicado: (2024)
por: Ye, Junyan, et al.
Publicado: (2024)
Cross-view image geo-localization with Panorama-BEV Co-Retrieval Network
por: Ye, Junyan, et al.
Publicado: (2024)
por: Ye, Junyan, et al.
Publicado: (2024)
Ejemplares similares
-
GenClaw: Code-Driven Agentic Image Generation
por: Ye, Junyan, et al.
Publicado: (2026) -
OmniAID: Decoupling Semantic and Artifacts for Universal AI-Generated Image Detection in the Wild
por: Guo, Yuncheng, et al.
Publicado: (2025) -
Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation
por: Ye, Junyan, et al.
Publicado: (2025) -
RealGen: Photorealistic Text-to-Image Generation via Detector-Guided Rewards
por: Ye, Junyan, et al.
Publicado: (2025) -
BLINK-Twice: You see, but do you observe? A Reasoning Benchmark on Visual Perception
por: Ye, Junyan, et al.
Publicado: (2025)