Self-Reflective Reinforcement Learning for Diffusion-based Image Reasoning Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Pan, Jiadong, Ma, Zhiyuan, Zhang, Kaiyan, Ding, Ning, Zhou, Bowen |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
RL-RIG: A Generative Spatial Reasoner via Intrinsic Reflection
por: Wang, Tianyu, et al.
Publicado: (2026)
por: Wang, Tianyu, et al.
Publicado: (2026)
Emotion-Director: Bridging Affective Shortcut in Emotion-Oriented Image Generation
por: Jia, Guoli, et al.
Publicado: (2025)
por: Jia, Guoli, et al.
Publicado: (2025)
Safe-SD: Safe and Traceable Stable Diffusion with Text Prompt Trigger for Invisible Generative Watermarking
por: Ma, Zhiyuan, et al.
Publicado: (2024)
por: Ma, Zhiyuan, et al.
Publicado: (2024)
CMAL: A Novel Cross-Modal Associative Learning Framework for Vision-Language Pre-Training
por: Ma, Zhiyuan, et al.
Publicado: (2024)
por: Ma, Zhiyuan, et al.
Publicado: (2024)
AdapEdit: Spatio-Temporal Guided Adaptive Editing Algorithm for Text-Based Continuity-Sensitive Image Editing
por: Ma, Zhiyuan, et al.
Publicado: (2023)
por: Ma, Zhiyuan, et al.
Publicado: (2023)
Neural Residual Diffusion Models for Deep Scalable Vision Generation
por: Ma, Zhiyuan, et al.
Publicado: (2024)
por: Ma, Zhiyuan, et al.
Publicado: (2024)
ReflectanceFusion: Diffusion-based text to SVBRDF Generation
por: Xue, Bowen, et al.
Publicado: (2024)
por: Xue, Bowen, et al.
Publicado: (2024)
Retrieval-Augmented Visual Question Answering via Built-in Autoregressive Search Engines
por: Long, Xinwei, et al.
Publicado: (2025)
por: Long, Xinwei, et al.
Publicado: (2025)
Reasoning Physical Video Generation with Diffusion Timestep Tokens via Reinforcement Learning
por: Lin, Wang, et al.
Publicado: (2025)
por: Lin, Wang, et al.
Publicado: (2025)
Efficient Diffusion Models: A Comprehensive Survey from Principles to Practices
por: Ma, Zhiyuan, et al.
Publicado: (2024)
por: Ma, Zhiyuan, et al.
Publicado: (2024)
Towards Reason-Informed Video Editing in Unified Models with Self-Reflective Learning
por: Liu, Xinyu, et al.
Publicado: (2025)
por: Liu, Xinyu, et al.
Publicado: (2025)
Context-Aware Autoregressive Models for Multi-Conditional Image Generation
por: Chen, Yixiao, et al.
Publicado: (2025)
por: Chen, Yixiao, et al.
Publicado: (2025)
SR-CIS: Self-Reflective Incremental System with Decoupled Memory and Reasoning
por: Qi, Biqing, et al.
Publicado: (2024)
por: Qi, Biqing, et al.
Publicado: (2024)
Boosting the Generalization and Reasoning of Vision Language Models with Curriculum Reinforcement Learning
por: Deng, Huilin, et al.
Publicado: (2025)
por: Deng, Huilin, et al.
Publicado: (2025)
Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning
por: Zhang, Haoji, et al.
Publicado: (2025)
por: Zhang, Haoji, et al.
Publicado: (2025)
MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding
por: Zuo, Yuxin, et al.
Publicado: (2025)
por: Zuo, Yuxin, et al.
Publicado: (2025)
Reflection Generation for Composite Image Using Diffusion Model
por: Zhao, Haonan, et al.
Publicado: (2026)
por: Zhao, Haonan, et al.
Publicado: (2026)
MIRG-RL: Multi-Image Reasoning and Grounding with Reinforcement Learning
por: Zheng, Lihao, et al.
Publicado: (2025)
por: Zheng, Lihao, et al.
Publicado: (2025)
Think-Then-Generate: Reasoning-Aware Text-to-Image Diffusion with LLM Encoders
por: Kou, Siqi, et al.
Publicado: (2026)
por: Kou, Siqi, et al.
Publicado: (2026)
Flow Diverse and Efficient: Learning Momentum Flow Matching via Stochastic Velocity Field Sampling
por: Ma, Zhiyuan, et al.
Publicado: (2025)
por: Ma, Zhiyuan, et al.
Publicado: (2025)
PromptRR: Diffusion Models as Prompt Generators for Single Image Reflection Removal
por: Wang, Tao, et al.
Publicado: (2024)
por: Wang, Tao, et al.
Publicado: (2024)
Harnessing Text-to-Image Diffusion Models for Point Cloud Self-Supervised Learning
por: Chen, Yiyang, et al.
Publicado: (2025)
por: Chen, Yiyang, et al.
Publicado: (2025)
Reasoning as Representation: Rethinking Visual Reinforcement Learning in Image Quality Assessment
por: Zhao, Shijie, et al.
Publicado: (2025)
por: Zhao, Shijie, et al.
Publicado: (2025)
StoryDiffusion: Consistent Self-Attention for Long-Range Image and Video Generation
por: Zhou, Yupeng, et al.
Publicado: (2024)
por: Zhou, Yupeng, et al.
Publicado: (2024)
Faster and Better: Reinforced Collaborative Distillation and Self-Learning for Infrared-Visible Image Fusion
por: Wang, Yuhao, et al.
Publicado: (2025)
por: Wang, Yuhao, et al.
Publicado: (2025)
SGEdit: Bridging LLM with Text2Image Generative Model for Scene Graph-based Image Editing
por: Zhang, Zhiyuan, et al.
Publicado: (2024)
por: Zhang, Zhiyuan, et al.
Publicado: (2024)
HiCoGen: Hierarchical Compositional Text-to-Image Generation in Diffusion Models via Reinforcement Learning
por: Yang, Hongji, et al.
Publicado: (2025)
por: Yang, Hongji, et al.
Publicado: (2025)
Reliable Reasoning in SVG-LLMs via Multi-Task Multi-Reward Reinforcement Learning
por: Wang, Haomin, et al.
Publicado: (2026)
por: Wang, Haomin, et al.
Publicado: (2026)
VisualQuality-R1: Reasoning-Induced Image Quality Assessment via Reinforcement Learning to Rank
por: Wu, Tianhe, et al.
Publicado: (2025)
por: Wu, Tianhe, et al.
Publicado: (2025)
Learning Only with Images: Visual Reinforcement Learning with Reasoning, Rendering, and Visual Feedback
por: Chen, Yang, et al.
Publicado: (2025)
por: Chen, Yang, et al.
Publicado: (2025)
Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement Learning
por: Zhang, Bob, et al.
Publicado: (2025)
por: Zhang, Bob, et al.
Publicado: (2025)
Reason-SVG: Enhancing Structured Reasoning for Vector Graphics Generation with Reinforcement Learning
por: Xing, Ximing, et al.
Publicado: (2025)
por: Xing, Ximing, et al.
Publicado: (2025)
WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning
por: Yang, Jie, et al.
Publicado: (2025)
por: Yang, Jie, et al.
Publicado: (2025)
Benchmarking and Evolving Reason-Reflect-Rectify for Reflective Visual Generation
por: Wang, Junjie, et al.
Publicado: (2026)
por: Wang, Junjie, et al.
Publicado: (2026)
Diffusion Time-step Curriculum for One Image to 3D Generation
por: Yi, Xuanyu, et al.
Publicado: (2024)
por: Yi, Xuanyu, et al.
Publicado: (2024)
SurgPETL: Parameter-Efficient Image-to-Surgical-Video Transfer Learning for Surgical Phase Recognition
por: Yang, Shu, et al.
Publicado: (2024)
por: Yang, Shu, et al.
Publicado: (2024)
LAKE-RED: Camouflaged Images Generation by Latent Background Knowledge Retrieval-Augmented Diffusion
por: Zhao, Pancheng, et al.
Publicado: (2024)
por: Zhao, Pancheng, et al.
Publicado: (2024)
PaCo-RL: Advancing Reinforcement Learning for Consistent Image Generation with Pairwise Reward Modeling
por: Ping, Bowen, et al.
Publicado: (2025)
por: Ping, Bowen, et al.
Publicado: (2025)
PROMPTMINER: Black-Box Prompt Stealing against Text-to-Image Generative Models via Reinforcement Learning and Fuzz Optimization
por: Li, Mingzhe, et al.
Publicado: (2025)
por: Li, Mingzhe, et al.
Publicado: (2025)
Perceptual-Evidence Anchored Reinforced Learning for Multimodal Reasoning
por: Zhang, Chi, et al.
Publicado: (2025)
por: Zhang, Chi, et al.
Publicado: (2025)
Ejemplares similares
-
RL-RIG: A Generative Spatial Reasoner via Intrinsic Reflection
por: Wang, Tianyu, et al.
Publicado: (2026) -
Emotion-Director: Bridging Affective Shortcut in Emotion-Oriented Image Generation
por: Jia, Guoli, et al.
Publicado: (2025) -
Safe-SD: Safe and Traceable Stable Diffusion with Text Prompt Trigger for Invisible Generative Watermarking
por: Ma, Zhiyuan, et al.
Publicado: (2024) -
CMAL: A Novel Cross-Modal Associative Learning Framework for Vision-Language Pre-Training
por: Ma, Zhiyuan, et al.
Publicado: (2024) -
AdapEdit: Spatio-Temporal Guided Adaptive Editing Algorithm for Text-Based Continuity-Sensitive Image Editing
por: Ma, Zhiyuan, et al.
Publicado: (2023)