Unified Thinker: A General Reasoning Modular Core for Image Generation
Fuente:
arXiv
Saved in:
| Main Authors: | Zhou, Sashuai, Zhou, Qiang, Hu, Jijin, Yang, Hanqing, Cao, Yue, Ma, Junpeng, Ma, Yinchao, Song, Jun, Ge, Tiezheng, Yu, Cheng, Zheng, Bo, Zhao, Zhou |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
DDA-Thinker: Decoupled Dual-Atomic Reinforcement Learning for Reasoning-Driven Image Editing
by: Yang, Hanqing, et al.
Published: (2026)
by: Yang, Hanqing, et al.
Published: (2026)
SpatialReward: Verifiable Spatial Reward Modeling for Fine-Grained Spatial Consistency in Text-to-Image Generation
by: Zhou, Sashuai, et al.
Published: (2026)
by: Zhou, Sashuai, et al.
Published: (2026)
Contribution-aware Token Compression for Efficient Video Understanding via Reinforcement Learning
by: Ma, Yinchao, et al.
Published: (2026)
by: Ma, Yinchao, et al.
Published: (2026)
Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations
by: Huang, Hai, et al.
Published: (2025)
by: Huang, Hai, et al.
Published: (2025)
ReWatch-R1: Boosting Complex Video Reasoning in Large Vision-Language Models through Agentic Data Synthesis
by: Zhang, Congzhi, et al.
Published: (2025)
by: Zhang, Congzhi, et al.
Published: (2025)
GAN-based Domain Adaptation for Image-aware Layout Generation in Advertising Poster Design
by: Xu, Chenchen, et al.
Published: (2026)
by: Xu, Chenchen, et al.
Published: (2026)
GIFT: Global Irreplaceability Frame Targeting for Efficient Video Understanding
by: Ma, Junpeng, et al.
Published: (2026)
by: Ma, Junpeng, et al.
Published: (2026)
AndroidLens: Long-latency Evaluation with Nested Sub-targets for Android GUI Agents
by: Cao, Yue, et al.
Published: (2025)
by: Cao, Yue, et al.
Published: (2025)
Rethinking Scribble-Guided Image Editing: Generalization, Instruction Adherence, and Multi-Tasking
by: Xu, Mingyi, et al.
Published: (2026)
by: Xu, Mingyi, et al.
Published: (2026)
Accelerating Image Generation with Sub-path Linear Approximation Model
by: Xu, Chen, et al.
Published: (2024)
by: Xu, Chen, et al.
Published: (2024)
Identity-Preserving Image-to-Video Generation via Reward-Guided Optimization
by: Shen, Liao, et al.
Published: (2025)
by: Shen, Liao, et al.
Published: (2025)
RHanDS: Refining Malformed Hands for Generated Images with Decoupled Structure and Style Guidance
by: Wang, Chengrui, et al.
Published: (2024)
by: Wang, Chengrui, et al.
Published: (2024)
Open-set Cross Modal Generalization via Multimodal Unified Representation
by: Huang, Hai, et al.
Published: (2025)
by: Huang, Hai, et al.
Published: (2025)
Enhancing Multimodal Unified Representations for Cross Modal Generalization
by: Huang, Hai, et al.
Published: (2024)
by: Huang, Hai, et al.
Published: (2024)
FlowDCN: Exploring DCN-like Architectures for Fast Image Generation with Arbitrary Resolution
by: Wang, Shuai, et al.
Published: (2024)
by: Wang, Shuai, et al.
Published: (2024)
PosterMaker: Towards High-Quality Product Poster Generation with Accurate Text Rendering
by: Gao, Yifan, et al.
Published: (2025)
by: Gao, Yifan, et al.
Published: (2025)
DMM: Building a Versatile Image Generation Model via Distillation-Based Model Merging
by: Song, Tianhui, et al.
Published: (2025)
by: Song, Tianhui, et al.
Published: (2025)
UniSOT: A Unified Framework for Multi-Modality Single Object Tracking
by: Ma, Yinchao, et al.
Published: (2025)
by: Ma, Yinchao, et al.
Published: (2025)
KAG-Thinker: Interactive Thinking and Deep Reasoning in LLMs via Knowledge-Augmented Generation
by: Zhang, Dalong, et al.
Published: (2025)
by: Zhang, Dalong, et al.
Published: (2025)
AtomoVideo: High Fidelity Image-to-Video Generation
by: Gong, Litong, et al.
Published: (2024)
by: Gong, Litong, et al.
Published: (2024)
SketchThinker-R1: Towards Efficient Sketch-Style Reasoning in Large Multimodal Models
by: Zhang, Ruiyang, et al.
Published: (2026)
by: Zhang, Ruiyang, et al.
Published: (2026)
PreferThinker: Reasoning-based Personalized Image Preference Assessment
by: Xu, Shengqi, et al.
Published: (2025)
by: Xu, Shengqi, et al.
Published: (2025)
DiffThinker: Towards Generative Multimodal Reasoning with Diffusion Models
by: He, Zefeng, et al.
Published: (2025)
by: He, Zefeng, et al.
Published: (2025)
Enhancing Multi-modal Models with Heterogeneous MoE Adapters for Fine-tuning
by: Zhou, Sashuai, et al.
Published: (2025)
by: Zhou, Sashuai, et al.
Published: (2025)
Tuning-Free Noise Rectification for High Fidelity Image-to-Video Generation
by: Li, Weijie, et al.
Published: (2024)
by: Li, Weijie, et al.
Published: (2024)
M2-Reasoning: Empowering MLLMs with Unified General and Spatial Reasoning
by: AI, Inclusion, et al.
Published: (2025)
by: AI, Inclusion, et al.
Published: (2025)
CF-Font: Content Fusion for Few-shot Font Generation
by: Wang, Chi, et al.
Published: (2023)
by: Wang, Chi, et al.
Published: (2023)
OneThinker: All-in-one Reasoning Model for Image and Video
by: Feng, Kaituo, et al.
Published: (2025)
by: Feng, Kaituo, et al.
Published: (2025)
VC4VG: Optimizing Video Captions for Text-to-Video Generation
by: Du, Yang, et al.
Published: (2025)
by: Du, Yang, et al.
Published: (2025)
Bridging the Gap between Chemical Reaction Pretraining and Conditional Molecule Generation with a Unified Model
by: Qiang, Bo, et al.
Published: (2023)
by: Qiang, Bo, et al.
Published: (2023)
HLGFA: High-Low Resolution Guided Feature Alignment for Unsupervised Anomaly Detection
by: Zhou, Han, et al.
Published: (2026)
by: Zhou, Han, et al.
Published: (2026)
MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs
by: Ma, Junpeng, et al.
Published: (2025)
by: Ma, Junpeng, et al.
Published: (2025)
Edit-GRPO: A Locality-Preserving Policy Optimization Framework for Image Editing
by: Xu, Shaodong, et al.
Published: (2026)
by: Xu, Shaodong, et al.
Published: (2026)
ControlThinker: Unveiling Latent Semantics for Controllable Image Generation through Visual Reasoning
by: Han, Feng, et al.
Published: (2025)
by: Han, Feng, et al.
Published: (2025)
T-Stars-Poster: A Framework for Product-Centric Advertising Image Design
by: Chen, Hongyu, et al.
Published: (2025)
by: Chen, Hongyu, et al.
Published: (2025)
Memorizing Long-tail Data Can Help Generalization Through Composition
by: Zhou, Mo, et al.
Published: (2025)
by: Zhou, Mo, et al.
Published: (2025)
Integrated Sensing, Computing, and Semantic Communication with Fluid Antenna for Metaverse
by: Yang, Yinchao, et al.
Published: (2025)
by: Yang, Yinchao, et al.
Published: (2025)
VR-Thinker: Boosting Video Reward Models through Thinking-with-Image Reasoning
by: Wang, Qunzhong, et al.
Published: (2025)
by: Wang, Qunzhong, et al.
Published: (2025)
Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation
by: Pan, Jiadong, et al.
Published: (2025)
by: Pan, Jiadong, et al.
Published: (2025)
"When He Feels Cold, He Goes to the Seahorse"-Blending Generative AI into Multimaterial Storymaking for Family Expressive Arts Therapy
by: Liu, Di, et al.
Published: (2024)
by: Liu, Di, et al.
Published: (2024)
Similar Items
-
DDA-Thinker: Decoupled Dual-Atomic Reinforcement Learning for Reasoning-Driven Image Editing
by: Yang, Hanqing, et al.
Published: (2026) -
SpatialReward: Verifiable Spatial Reward Modeling for Fine-Grained Spatial Consistency in Text-to-Image Generation
by: Zhou, Sashuai, et al.
Published: (2026) -
Contribution-aware Token Compression for Efficient Video Understanding via Reinforcement Learning
by: Ma, Yinchao, et al.
Published: (2026) -
Bridging Domain Generalization to Multimodal Domain Generalization via Unified Representations
by: Huang, Hai, et al.
Published: (2025) -
ReWatch-R1: Boosting Complex Video Reasoning in Large Vision-Language Models through Agentic Data Synthesis
by: Zhang, Congzhi, et al.
Published: (2025)