ImageDoctor: Diagnosing Text-to-Image Generation via Grounded Image Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Guo, Yuxiang, Liu, Jiang, Wang, Ze, Chen, Hao, Sun, Ximeng, Zhao, Yang, Wu, Jialian, Yu, Xiaodong, Liu, Zicheng, Barsoum, Emad |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Instella-T2I: Pushing the Limits of 1D Discrete Latent Space Image Generation
par: Wang, Ze, et autres
Publié: (2025)
par: Wang, Ze, et autres
Publié: (2025)
Latent Visual Reasoning
par: Li, Bangzheng, et autres
Publié: (2025)
par: Li, Bangzheng, et autres
Publié: (2025)
MOVi: Training-free Text-conditioned Multi-Object Video Generation
par: Rahman, Aimon, et autres
Publié: (2025)
par: Rahman, Aimon, et autres
Publié: (2025)
DRIFT: Transferring Reasoning Priors for Efficient MLLM Fine-Tuning
par: Huang, Chao, et autres
Publié: (2025)
par: Huang, Chao, et autres
Publié: (2025)
TTT-Bench: A Benchmark for Evaluating Reasoning Ability with Simple and Novel Tic-Tac-Toe-style Games
par: Mishra, Prakamya, et autres
Publié: (2025)
par: Mishra, Prakamya, et autres
Publié: (2025)
VideoSeek: Long-Horizon Video Agent with Tool-Guided Seeking
par: Lin, Jingyang, et autres
Publié: (2026)
par: Lin, Jingyang, et autres
Publié: (2026)
Learning from Online Videos at Inference Time for Computer-Use Agents
par: Liu, Yujian, et autres
Publié: (2025)
par: Liu, Yujian, et autres
Publié: (2025)
CD4LM: Consistency Distillation and aDaptive Decoding for Diffusion Language Models
par: Liang, Yihao, et autres
Publié: (2026)
par: Liang, Yihao, et autres
Publié: (2026)
Agent Laboratory: Using LLM Agents as Research Assistants
par: Schmidgall, Samuel, et autres
Publié: (2025)
par: Schmidgall, Samuel, et autres
Publié: (2025)
XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models
par: Wang, Xingrui, et autres
Publié: (2025)
par: Wang, Xingrui, et autres
Publié: (2025)
Self-Taught Agentic Long Context Understanding
par: Zhuang, Yufan, et autres
Publié: (2025)
par: Zhuang, Yufan, et autres
Publié: (2025)
KeyVID: Keyframe-Aware Video Diffusion for Audio-Synchronized Visual Animation
par: Wang, Xingrui, et autres
Publié: (2025)
par: Wang, Xingrui, et autres
Publié: (2025)
Unleashing Hour-Scale Video Training for Long Video-Language Understanding
par: Lin, Jingyang, et autres
Publié: (2025)
par: Lin, Jingyang, et autres
Publié: (2025)
Reliable Use of Lemmas via Eligibility Reasoning and Section$-$Aware Reinforcement Learning
par: Xu, Zhikun, et autres
Publié: (2026)
par: Xu, Zhikun, et autres
Publié: (2026)
Stabilizing Efficient Reasoning with Step-Level Advantage Selection
par: Wang, Han, et autres
Publié: (2026)
par: Wang, Han, et autres
Publié: (2026)
CaptionQA: Is Your Caption as Useful as the Image Itself?
par: Yang, Shijia, et autres
Publié: (2025)
par: Yang, Shijia, et autres
Publié: (2025)
Instella: Fully Open Language Models with Stellar Performance
par: Liu, Jiang, et autres
Publié: (2025)
par: Liu, Jiang, et autres
Publié: (2025)
APRIL: Active Partial Rollouts in Reinforcement Learning to Tame Long-tail Generation
par: Zhou, Yuzhen, et autres
Publié: (2025)
par: Zhou, Yuzhen, et autres
Publié: (2025)
SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer
par: Chen, Hao, et autres
Publié: (2024)
par: Chen, Hao, et autres
Publié: (2024)
Conditional Text-to-Image Generation with Reference Guidance
par: Kim, Taewook, et autres
Publié: (2024)
par: Kim, Taewook, et autres
Publié: (2024)
Pause and Think: A Dataset and Benchmark for Video-Grounded Assistive Action Suggestion
par: Singh, Shivam, et autres
Publié: (2026)
par: Singh, Shivam, et autres
Publié: (2026)
TermiGen: High-Fidelity Environment and Robust Trajectory Synthesis for Terminal Agents
par: Zhu, Kaijie, et autres
Publié: (2026)
par: Zhu, Kaijie, et autres
Publié: (2026)
DiffDoctor: Diagnosing Image Diffusion Models Before Treating
par: Wang, Yiyang, et autres
Publié: (2025)
par: Wang, Yiyang, et autres
Publié: (2025)
Layout-Conditioned Autoregressive Text-to-Image Generation via Structured Masking
par: Zheng, Zirui, et autres
Publié: (2025)
par: Zheng, Zirui, et autres
Publié: (2025)
AdaptEvolve: Improving Efficiency of Evolutionary AI Agents through Adaptive Model Selection
par: Ray, Pretam, et autres
Publié: (2026)
par: Ray, Pretam, et autres
Publié: (2026)
TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering
par: Joshi, Vinay, et autres
Publié: (2025)
par: Joshi, Vinay, et autres
Publié: (2025)
Taming Diffusion Prior for Image Super-Resolution with Domain Shift SDEs
par: Cui, Qinpeng, et autres
Publié: (2024)
par: Cui, Qinpeng, et autres
Publié: (2024)
SAND-Math: Using LLMs to Generate Novel, Difficult and Useful Mathematics Questions and Answers
par: Manem, Chaitanya, et autres
Publié: (2025)
par: Manem, Chaitanya, et autres
Publié: (2025)
E-MMDiT: Revisiting Multimodal Diffusion Transformer Design for Fast Image Synthesis under Limited Resources
par: Shen, Tong, et autres
Publié: (2025)
par: Shen, Tong, et autres
Publié: (2025)
RePrompt: Reasoning-Augmented Reprompting for Text-to-Image Generation via Reinforcement Learning
par: Wu, Mingrui, et autres
Publié: (2025)
par: Wu, Mingrui, et autres
Publié: (2025)
Edit as You See: Image-guided Video Editing via Masked Motion Modeling
par: Huang, Zhi-Lin, et autres
Publié: (2025)
par: Huang, Zhi-Lin, et autres
Publié: (2025)
PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning
par: Dong, Daize, et autres
Publié: (2026)
par: Dong, Daize, et autres
Publié: (2026)
T2I-ReasonBench: Benchmarking Reasoning-Informed Text-to-Image Generation
par: Sun, Kaiyue, et autres
Publié: (2025)
par: Sun, Kaiyue, et autres
Publié: (2025)
G-Refine: A General Quality Refiner for Text-to-Image Generation
par: Li, Chunyi, et autres
Publié: (2024)
par: Li, Chunyi, et autres
Publié: (2024)
World-To-Image: Grounding Text-to-Image Generation with Agent-Driven World Knowledge
par: Son, Moo Hyun, et autres
Publié: (2025)
par: Son, Moo Hyun, et autres
Publié: (2025)
Scaling Down Text Encoders of Text-to-Image Diffusion Models
par: Wang, Lifu, et autres
Publié: (2025)
par: Wang, Lifu, et autres
Publié: (2025)
Evaluating Image Caption via Cycle-consistent Text-to-Image Generation
par: Cui, Tianyu, et autres
Publié: (2025)
par: Cui, Tianyu, et autres
Publié: (2025)
TextDoctor: Unified Document Image Inpainting via Patch Pyramid Diffusion Models
par: Lu, Wanglong, et autres
Publié: (2025)
par: Lu, Wanglong, et autres
Publié: (2025)
GenAgent: Scaling Text-to-Image Generation via Agentic Multimodal Reasoning
par: Jiang, Kaixun, et autres
Publié: (2026)
par: Jiang, Kaixun, et autres
Publié: (2026)
RAPHAEL: Text-to-Image Generation via Large Mixture of Diffusion Paths
par: Xue, Zeyue, et autres
Publié: (2023)
par: Xue, Zeyue, et autres
Publié: (2023)
Documents similaires
-
Instella-T2I: Pushing the Limits of 1D Discrete Latent Space Image Generation
par: Wang, Ze, et autres
Publié: (2025) -
Latent Visual Reasoning
par: Li, Bangzheng, et autres
Publié: (2025) -
MOVi: Training-free Text-conditioned Multi-Object Video Generation
par: Rahman, Aimon, et autres
Publié: (2025) -
DRIFT: Transferring Reasoning Priors for Efficient MLLM Fine-Tuning
par: Huang, Chao, et autres
Publié: (2025) -
TTT-Bench: A Benchmark for Evaluating Reasoning Ability with Simple and Novel Tic-Tac-Toe-style Games
par: Mishra, Prakamya, et autres
Publié: (2025)