Visual-CoG: Stage-Aware Reinforcement Learning with Chain of Guidance for Text-to-Image Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Yaqi, Chen, Peng, Han, Mingyang, Bu, Pi, Shi, Haoxiang, Zhao, Runzhou, Yao, Yang, Zhang, Xuan, Song, Jun, Zheng, Bo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Principle of Architecture, Protocol, and Algorithms for CoG-MIN
di: Li, Hui, et al.
Pubblicazione: (2025)
di: Li, Hui, et al.
Pubblicazione: (2025)
CoG: Controllable Graph Reasoning via Relational Blueprints and Failure-Aware Refinement over Knowledge Graphs
di: Liu, Yuanxiang, et al.
Pubblicazione: (2026)
di: Liu, Yuanxiang, et al.
Pubblicazione: (2026)
HiCoGen: Hierarchical Compositional Text-to-Image Generation in Diffusion Models via Reinforcement Learning
di: Yang, Hongji, et al.
Pubblicazione: (2025)
di: Yang, Hongji, et al.
Pubblicazione: (2025)
Can VLMs Play Action Role-Playing Games? Take Black Myth Wukong as a Study Case
di: Chen, Peng, et al.
Pubblicazione: (2024)
di: Chen, Peng, et al.
Pubblicazione: (2024)
Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning
di: Li, Zejun, et al.
Pubblicazione: (2025)
di: Li, Zejun, et al.
Pubblicazione: (2025)
Text-IF: Leveraging Semantic Text Guidance for Degradation-Aware and Interactive Image Fusion
di: Yi, Xunpeng, et al.
Pubblicazione: (2024)
di: Yi, Xunpeng, et al.
Pubblicazione: (2024)
Diffusion Model Based Visual Compensation Guidance and Visual Difference Analysis for No-Reference Image Quality Assessment
di: Wang, Zhaoyang, et al.
Pubblicazione: (2024)
di: Wang, Zhaoyang, et al.
Pubblicazione: (2024)
Token Preference Optimization with Self-Calibrated Visual-Anchored Rewards for Hallucination Mitigation
di: Gu, Jihao, et al.
Pubblicazione: (2024)
di: Gu, Jihao, et al.
Pubblicazione: (2024)
Genetic Structure and Phylogeographic Divergence of Thymallus brevicephalus in the Ob‐Irtysh River Headwaters
di: Wenjie Peng, et al.
Pubblicazione: (2024)
di: Wenjie Peng, et al.
Pubblicazione: (2024)
MAMBO-G: Magnitude-Aware Mitigation for Boosted Guidance
di: Zhu, Shangwen, et al.
Pubblicazione: (2025)
di: Zhu, Shangwen, et al.
Pubblicazione: (2025)
Group Relative Attention Guidance for Image Editing
di: Zhang, Xuanpu, et al.
Pubblicazione: (2025)
di: Zhang, Xuanpu, et al.
Pubblicazione: (2025)
OneLatent: Single-Token Compression for Visual Latent Reasoning
di: Lv, Bo, et al.
Pubblicazione: (2026)
di: Lv, Bo, et al.
Pubblicazione: (2026)
FastCuRL: Curriculum Reinforcement Learning with Stage-wise Context Scaling for Efficient Training R1-like Reasoning Models
di: Song, Mingyang, et al.
Pubblicazione: (2025)
di: Song, Mingyang, et al.
Pubblicazione: (2025)
Restore Text First, Enhance Image Later: Two-Stage Scene Text Image Super-Resolution with Glyph Structure Guidance
di: Luo, Minxing, et al.
Pubblicazione: (2025)
di: Luo, Minxing, et al.
Pubblicazione: (2025)
Tuning-Free Image Customization with Image and Text Guidance
di: Li, Pengzhi, et al.
Pubblicazione: (2024)
di: Li, Pengzhi, et al.
Pubblicazione: (2024)
Doc-CoB: Enhancing Document Understanding with Visual Chain-of-Boxes Reasoning
di: Mo, Ye, et al.
Pubblicazione: (2025)
di: Mo, Ye, et al.
Pubblicazione: (2025)
TAT-R1: Terminology-Aware Translation with Reinforcement Learning and Word Alignment
di: Li, Zheng, et al.
Pubblicazione: (2025)
di: Li, Zheng, et al.
Pubblicazione: (2025)
Learning Only with Images: Visual Reinforcement Learning with Reasoning, Rendering, and Visual Feedback
di: Chen, Yang, et al.
Pubblicazione: (2025)
di: Chen, Yang, et al.
Pubblicazione: (2025)
OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning
di: Su, Zhaochen, et al.
Pubblicazione: (2025)
di: Su, Zhaochen, et al.
Pubblicazione: (2025)
Chain-of-Cooking:Cooking Process Visualization via Bidirectional Chain-of-Thought Guidance
di: Xu, Mengling, et al.
Pubblicazione: (2025)
di: Xu, Mengling, et al.
Pubblicazione: (2025)
Time-Layer Adaptive Alignment for Speaker Similarity in Flow-Matching Based Zero-Shot TTS
di: Li, Haoyu, et al.
Pubblicazione: (2025)
di: Li, Haoyu, et al.
Pubblicazione: (2025)
NavG: Risk-Aware Navigation in Crowded Environments Based on Reinforcement Learning with Guidance Points
di: Zhang, Qianyi, et al.
Pubblicazione: (2025)
di: Zhang, Qianyi, et al.
Pubblicazione: (2025)
REVEALER: Reinforcement-Guided Visual Reasoning for Element-Level Text-Image Alignment Evaluation
di: Shi, Fulin, et al.
Pubblicazione: (2025)
di: Shi, Fulin, et al.
Pubblicazione: (2025)
Training-Free Safe Text Embedding Guidance for Text-to-Image Diffusion Models
di: Na, Byeonghu, et al.
Pubblicazione: (2025)
di: Na, Byeonghu, et al.
Pubblicazione: (2025)
Guidance Matters: Rethinking the Evaluation Pitfall for Text-to-Image Generation
di: Xie, Dian, et al.
Pubblicazione: (2026)
di: Xie, Dian, et al.
Pubblicazione: (2026)
Dual-Agent Multiple-Model Reinforcement Learning for Event-Triggered Human-Robot Co-Adaptation in Decoupled Task Spaces
di: Li, Yaqi, et al.
Pubblicazione: (2026)
di: Li, Yaqi, et al.
Pubblicazione: (2026)
InstaHide's Sample Complexity When Mixing Two Private Images
di: Huang, Baihe, et al.
Pubblicazione: (2020)
di: Huang, Baihe, et al.
Pubblicazione: (2020)
VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation
di: Liao, Xinyao, et al.
Pubblicazione: (2026)
di: Liao, Xinyao, et al.
Pubblicazione: (2026)
Reinforced Visual Perception with Tools
di: Zhou, Zetong, et al.
Pubblicazione: (2025)
di: Zhou, Zetong, et al.
Pubblicazione: (2025)
ImageGen-CoT: Enhancing Text-to-Image In-context Learning with Chain-of-Thought Reasoning
di: Liao, Jiaqi, et al.
Pubblicazione: (2025)
di: Liao, Jiaqi, et al.
Pubblicazione: (2025)
Advanced Image‐Guidance and Surgical‐Navigation Techniques for Real‐Time Visualized Surgery
di: Xiaoxiao Fan, et al.
Pubblicazione: (2025)
di: Xiaoxiao Fan, et al.
Pubblicazione: (2025)
Missing Value Chain in Generative AI Governance China as an example
di: Pi, Yulu
Pubblicazione: (2024)
di: Pi, Yulu
Pubblicazione: (2024)
A Two‐Stage Block Screening Framework for Ultra‐High Dimensional Tensor Feature
di: Pengfei Pi
Pubblicazione: (2025)
di: Pengfei Pi
Pubblicazione: (2025)
DTVI: Dual-Stage Textual and Visual Intervention for Safe Text-to-Image Generation
di: Tan, Binhong, et al.
Pubblicazione: (2026)
di: Tan, Binhong, et al.
Pubblicazione: (2026)
Training-free Subject-Enhanced Attention Guidance for Compositional Text-to-image Generation
di: Liu, Shengyuan, et al.
Pubblicazione: (2024)
di: Liu, Shengyuan, et al.
Pubblicazione: (2024)
Context-KG: Context-Aware Knowledge Graph Visualization with User Preferences and Ontological Guidance
di: Perera, Rumali, et al.
Pubblicazione: (2026)
di: Perera, Rumali, et al.
Pubblicazione: (2026)
Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning
di: Song, Mingyang, et al.
Pubblicazione: (2025)
di: Song, Mingyang, et al.
Pubblicazione: (2025)
When Safety Collides: Resolving Multi-Category Harmful Conflicts in Text-to-Image Diffusion via Adaptive Safety Guidance
di: Xiang, Yongli, et al.
Pubblicazione: (2026)
di: Xiang, Yongli, et al.
Pubblicazione: (2026)
CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models
di: Zhao, Qingqing, et al.
Pubblicazione: (2025)
di: Zhao, Qingqing, et al.
Pubblicazione: (2025)
Stage-wise Dynamics of Classifier-Free Guidance in Diffusion Models
di: Jin, Cheng, et al.
Pubblicazione: (2025)
di: Jin, Cheng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Principle of Architecture, Protocol, and Algorithms for CoG-MIN
di: Li, Hui, et al.
Pubblicazione: (2025) -
CoG: Controllable Graph Reasoning via Relational Blueprints and Failure-Aware Refinement over Knowledge Graphs
di: Liu, Yuanxiang, et al.
Pubblicazione: (2026) -
HiCoGen: Hierarchical Compositional Text-to-Image Generation in Diffusion Models via Reinforcement Learning
di: Yang, Hongji, et al.
Pubblicazione: (2025) -
Can VLMs Play Action Role-Playing Games? Take Black Myth Wukong as a Study Case
di: Chen, Peng, et al.
Pubblicazione: (2024) -
Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning
di: Li, Zejun, et al.
Pubblicazione: (2025)