Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Luo, Siqi, Shen, Jianghan, Xin, Yi, Zheng, Huayu, Chen, Haoxing, Tai, Yan, Li, Yue, He, Junjun, Liu, Yihao, Zhai, Guangtao, Cao, Yuewen, Liu, Xiaohong |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
dMLLM-TTS: Self-Verified and Efficient Test-Time Scaling for Diffusion Multi-Modal Large Language Models
by: Xin, Yi, et al.
Published: (2025)
by: Xin, Yi, et al.
Published: (2025)
Lumina-DiMOO: An Omni Diffusion Large Language Model for Multi-Modal Generation and Understanding
by: Xin, Yi, et al.
Published: (2025)
by: Xin, Yi, et al.
Published: (2025)
Consolidating Diffusion-Generated Video Detection with Unified Multimodal Forgery Learning
by: Liu, Xiaohong, et al.
Published: (2025)
by: Liu, Xiaohong, et al.
Published: (2025)
A$^2$-Edit: Precise Reference-Guided Image Editing of Arbitrary Objects and Ambiguous Masks
by: Zheng, Huayu, et al.
Published: (2026)
by: Zheng, Huayu, et al.
Published: (2026)
Enhancing Test Time Adaptation with Few-shot Guidance
by: Luo, Siqi, et al.
Published: (2024)
by: Luo, Siqi, et al.
Published: (2024)
Towards Effective User Attribution for Latent Diffusion Models via Watermark-Informed Blending
by: Pan, Yongyang, et al.
Published: (2024)
by: Pan, Yongyang, et al.
Published: (2024)
TR-PTS: Task-Relevant Parameter and Token Selection for Efficient Tuning
by: Luo, Siqi, et al.
Published: (2025)
by: Luo, Siqi, et al.
Published: (2025)
Resurrect Mask AutoRegressive Modeling for Efficient and Scalable Image Generation
by: Xin, Yi, et al.
Published: (2025)
by: Xin, Yi, et al.
Published: (2025)
FUMO: Prior-Modulated Diffusion for Single Image Reflection Removal
by: Xu, Telang, et al.
Published: (2026)
by: Xu, Telang, et al.
Published: (2026)
LayerT2V: A Unified Multi-Layer Video Generation Framework
by: Li, Guangzhao, et al.
Published: (2025)
by: Li, Guangzhao, et al.
Published: (2025)
On Learning Multi-Modal Forgery Representation for Diffusion Generated Video Detection
by: Song, Xiufeng, et al.
Published: (2024)
by: Song, Xiufeng, et al.
Published: (2024)
CuSearch: Curriculum Rollout Sampling via Search Depth for Agentic RAG
by: Shen, Jianghan, et al.
Published: (2026)
by: Shen, Jianghan, et al.
Published: (2026)
Quasinormal Modes of pp-Wave Spacetimes and Zero Temperature Dissipation
by: Dai, Huayu, et al.
Published: (2026)
by: Dai, Huayu, et al.
Published: (2026)
Quality Assessment in the Era of Large Models: A Survey
by: Zhang, Zicheng, et al.
Published: (2024)
by: Zhang, Zicheng, et al.
Published: (2024)
REF-VLM: Triplet-Based Referring Paradigm for Unified Visual Decoding
by: Tai, Yan, et al.
Published: (2025)
by: Tai, Yan, et al.
Published: (2025)
IllusionBench+: A Large-scale and Comprehensive Benchmark for Visual Illusion Understanding in Vision-Language Models
by: Zhang, Yiming, et al.
Published: (2025)
by: Zhang, Yiming, et al.
Published: (2025)
Resolution-Agnostic Neural Compression for High-Fidelity Portrait Video Conferencing via Implicit Radiance Fields
by: Li, Yifei, et al.
Published: (2024)
by: Li, Yifei, et al.
Published: (2024)
Face2QR: A Unified Framework for Aesthetic, Face-Preserving, and Scannable QR Code Generation
by: Cui, Xuehao, et al.
Published: (2024)
by: Cui, Xuehao, et al.
Published: (2024)
Text2QR: Harmonizing Aesthetic Customization and Scanning Robustness for Text-Guided QR Code Generation
by: Wu, Guangyang, et al.
Published: (2024)
by: Wu, Guangyang, et al.
Published: (2024)
DiffStega: Towards Universal Training-Free Coverless Image Steganography with Diffusion Models
by: Yang, Yiwei, et al.
Published: (2024)
by: Yang, Yiwei, et al.
Published: (2024)
MedQ-Deg: A Multidimensional Benchmark for Evaluating MLLMs Across Medical Image Quality Degradations
by: Liu, Jiyao, et al.
Published: (2026)
by: Liu, Jiyao, et al.
Published: (2026)
Sketch & Paint: Stroke-by-Stroke Evolution of Visual Artworks
by: Prudviraj, Jeripothula, et al.
Published: (2025)
by: Prudviraj, Jeripothula, et al.
Published: (2025)
Counting Permutations in $S_{2n}$ and $S_{2n+1}$
by: Luo, Yuewen
Published: (2024)
by: Luo, Yuewen
Published: (2024)
Compression-Realized Deep Structural Network for Video Quality Enhancement
by: Sun, Hanchi, et al.
Published: (2024)
by: Sun, Hanchi, et al.
Published: (2024)
Q-Agent: Quality-Driven Chain-of-Thought Image Restoration Agent through Robust Multimodal Large Language Model
by: Zhou, Yingjie, et al.
Published: (2025)
by: Zhou, Yingjie, et al.
Published: (2025)
Efficient One-Step Diffusion Restoration Model with Compact Token Compression and Linear Attention
by: Qiao, Bingtian, et al.
Published: (2026)
by: Qiao, Bingtian, et al.
Published: (2026)
GeoX-Bench: Benchmarking Cross-View Geo-Localization and Pose Estimation Capabilities of Large Multimodal Models
by: Zheng, Yushuo, et al.
Published: (2025)
by: Zheng, Yushuo, et al.
Published: (2025)
MEMO-Bench: A Multiple Benchmark for Text-to-Image and Multimodal Large Language Models on Human Emotion Analysis
by: Zhou, Yingjie, et al.
Published: (2024)
by: Zhou, Yingjie, et al.
Published: (2024)
Samba+: General and Accurate Salient Object Detection via A More Unified Mamba-based Framework
by: Zhao, Wenzhuo, et al.
Published: (2026)
by: Zhao, Wenzhuo, et al.
Published: (2026)
Charting the Path Forward: CT Image Quality Assessment -- An In-Depth Review
by: Xun, Siyi, et al.
Published: (2024)
by: Xun, Siyi, et al.
Published: (2024)
Low-Light Image Enhancement via Generative Perceptual Priors
by: Zhou, Han, et al.
Published: (2024)
by: Zhou, Han, et al.
Published: (2024)
DehazeDCT: Towards Effective Non-Homogeneous Dehazing via Deformable Convolutional Transformer
by: Dong, Wei, et al.
Published: (2024)
by: Dong, Wei, et al.
Published: (2024)
MoGen: A Unified Collaborative Framework for Controllable Multi-Object Image Generation
by: Li, Yanfeng, et al.
Published: (2026)
by: Li, Yanfeng, et al.
Published: (2026)
Parameter-Efficient Fine-Tuning for Pre-Trained Vision Models: A Survey and Benchmark
by: Xin, Yi, et al.
Published: (2024)
by: Xin, Yi, et al.
Published: (2024)
GLARE: Low Light Image Enhancement via Generative Latent Feature based Codebook Retrieval
by: Zhou, Han, et al.
Published: (2024)
by: Zhou, Han, et al.
Published: (2024)
Learning Hazing to Dehazing: Towards Realistic Haze Generation for Real-World Image Dehazing
by: Wang, Ruiyi, et al.
Published: (2025)
by: Wang, Ruiyi, et al.
Published: (2025)
F-Bench: Rethinking Human Preference Evaluation Metrics for Benchmarking Face Generation, Customization, and Restoration
by: Liu, Lu, et al.
Published: (2024)
by: Liu, Lu, et al.
Published: (2024)
Lumina-mGPT 2.0: Stand-Alone AutoRegressive Image Modeling
by: Xin, Yi, et al.
Published: (2025)
by: Xin, Yi, et al.
Published: (2025)
Pushing the Limits of Inverse Lithography with Generative Reinforcement Learning
by: Yang, Haoyu, et al.
Published: (2026)
by: Yang, Haoyu, et al.
Published: (2026)
Painting Peptides With Antimicrobial Potency Through Deep Reinforcement Learning
by: Ruihan Dong, et al.
Published: (2025)
by: Ruihan Dong, et al.
Published: (2025)
Similar Items
-
dMLLM-TTS: Self-Verified and Efficient Test-Time Scaling for Diffusion Multi-Modal Large Language Models
by: Xin, Yi, et al.
Published: (2025) -
Lumina-DiMOO: An Omni Diffusion Large Language Model for Multi-Modal Generation and Understanding
by: Xin, Yi, et al.
Published: (2025) -
Consolidating Diffusion-Generated Video Detection with Unified Multimodal Forgery Learning
by: Liu, Xiaohong, et al.
Published: (2025) -
A$^2$-Edit: Precise Reference-Guided Image Editing of Arbitrary Objects and Ambiguous Masks
by: Zheng, Huayu, et al.
Published: (2026) -
Enhancing Test Time Adaptation with Few-shot Guidance
by: Luo, Siqi, et al.
Published: (2024)