Accelerating Inference of Masked Image Generators via Reinforcement Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Subbaraman, Pranav, Li, Shufan, Zhao, Siyan, Grover, Aditya |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PopAlign: Population-Level Alignment for Fair Text-to-Image Generation
di: Li, Shufan, et al.
Pubblicazione: (2024)
di: Li, Shufan, et al.
Pubblicazione: (2024)
InstructAny2Pix: Flexible Visual Editing via Multimodal Instruction Following
di: Li, Shufan, et al.
Pubblicazione: (2023)
di: Li, Shufan, et al.
Pubblicazione: (2023)
Mamba-ND: Selective State Space Modeling for Multi-Dimensional Data
di: Li, Shufan, et al.
Pubblicazione: (2024)
di: Li, Shufan, et al.
Pubblicazione: (2024)
MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants
di: Bansal, Hritik, et al.
Pubblicazione: (2024)
di: Bansal, Hritik, et al.
Pubblicazione: (2024)
Reflect-DiT: Inference-Time Scaling for Text-to-Image Diffusion Transformers via In-Context Reflection
di: Li, Shufan, et al.
Pubblicazione: (2025)
di: Li, Shufan, et al.
Pubblicazione: (2025)
Lavida-O: Elastic Large Masked Diffusion Models for Unified Multimodal Understanding and Generation
di: Li, Shufan, et al.
Pubblicazione: (2025)
di: Li, Shufan, et al.
Pubblicazione: (2025)
SNCE: Geometry-Aware Supervision for Scalable Discrete Image Generation
di: Li, Shufan, et al.
Pubblicazione: (2026)
di: Li, Shufan, et al.
Pubblicazione: (2026)
Guidance Contrastive Token Credit Assignment for Discrete Policy Optimization
di: Li, Shufan, et al.
Pubblicazione: (2026)
di: Li, Shufan, et al.
Pubblicazione: (2026)
Accelerating Masked Image Generation by Learning Latent Controlled Dynamics
di: Zhu, Kaiwen, et al.
Pubblicazione: (2026)
di: Zhu, Kaiwen, et al.
Pubblicazione: (2026)
Reinforcement Learning Meets Masked Generative Models: Mask-GRPO for Text-to-Image Generation
di: Luo, Yifu, et al.
Pubblicazione: (2025)
di: Luo, Yifu, et al.
Pubblicazione: (2025)
Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models
di: Li, Shufan, et al.
Pubblicazione: (2025)
di: Li, Shufan, et al.
Pubblicazione: (2025)
Accelerating Conditional Prompt Learning via Masked Image Modeling for Vision-Language Models
di: Bui, Phuoc-Nguyen, et al.
Pubblicazione: (2025)
di: Bui, Phuoc-Nguyen, et al.
Pubblicazione: (2025)
EpiMask: Leveraging Epipolar Distance Based Masks in Cross-Attention for Satellite Image Matching
di: Deshmukh, Rahul, et al.
Pubblicazione: (2026)
di: Deshmukh, Rahul, et al.
Pubblicazione: (2026)
LaViDa-R1: Advancing Reasoning for Unified Multimodal Diffusion Language Models
di: Li, Shufan, et al.
Pubblicazione: (2026)
di: Li, Shufan, et al.
Pubblicazione: (2026)
OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows
di: Li, Shufan, et al.
Pubblicazione: (2024)
di: Li, Shufan, et al.
Pubblicazione: (2024)
CoSimGen: Controllable Diffusion Model for Simultaneous Image and Mask Generation
di: Bose, Rupak, et al.
Pubblicazione: (2025)
di: Bose, Rupak, et al.
Pubblicazione: (2025)
Generation then Reconstruction: Accelerating Masked Autoregressive Models via Two-Stage Sampling
di: Yan, Feihong, et al.
Pubblicazione: (2025)
di: Yan, Feihong, et al.
Pubblicazione: (2025)
DogWeave: High-Fidelity 3D Canine Reconstruction from a Single Image via Normal Fusion and Conditional Inpainting
di: Sun, Shufan, et al.
Pubblicazione: (2026)
di: Sun, Shufan, et al.
Pubblicazione: (2026)
SimGen: A Diffusion-Based Framework for Simultaneous Surgical Image and Segmentation Mask Generation
di: Bhat, Aditya, et al.
Pubblicazione: (2025)
di: Bhat, Aditya, et al.
Pubblicazione: (2025)
LlamaSeg: Image Segmentation via Autoregressive Mask Generation
di: Deng, Jiru, et al.
Pubblicazione: (2025)
di: Deng, Jiru, et al.
Pubblicazione: (2025)
Conditional Panoramic Image Generation via Masked Autoregressive Modeling
di: Wang, Chaoyang, et al.
Pubblicazione: (2025)
di: Wang, Chaoyang, et al.
Pubblicazione: (2025)
Powerful and Flexible: Personalized Text-to-Image Generation via Reinforcement Learning
di: Wei, Fanyue, et al.
Pubblicazione: (2024)
di: Wei, Fanyue, et al.
Pubblicazione: (2024)
Accelerating Text-to-Image Editing via Cache-Enabled Sparse Diffusion Inference
di: Yu, Zihao, et al.
Pubblicazione: (2023)
di: Yu, Zihao, et al.
Pubblicazione: (2023)
Few-shot Image Generation via Masked Discrimination
di: Zhu, Jingyuan, et al.
Pubblicazione: (2022)
di: Zhu, Jingyuan, et al.
Pubblicazione: (2022)
MaskFocus: Focusing Policy Optimization on Critical Steps for Masked Image Generation
di: Zhang, Guohui, et al.
Pubblicazione: (2025)
di: Zhang, Guohui, et al.
Pubblicazione: (2025)
LaViDa: A Large Diffusion Language Model for Multimodal Understanding
di: Li, Shufan, et al.
Pubblicazione: (2025)
di: Li, Shufan, et al.
Pubblicazione: (2025)
LazyMAR: Accelerating Masked Autoregressive Models via Feature Caching
di: Yan, Feihong, et al.
Pubblicazione: (2025)
di: Yan, Feihong, et al.
Pubblicazione: (2025)
Mask2IV: Interaction-Centric Video Generation via Mask Trajectories
di: Li, Gen, et al.
Pubblicazione: (2025)
di: Li, Gen, et al.
Pubblicazione: (2025)
RedVTP: Training-Free Acceleration of Diffusion Vision-Language Models Inference via Masked Token-Guided Visual Token Pruning
di: Xu, Jingqi, et al.
Pubblicazione: (2025)
di: Xu, Jingqi, et al.
Pubblicazione: (2025)
Q-Insight: Understanding Image Quality via Visual Reinforcement Learning
di: Li, Weiqi, et al.
Pubblicazione: (2025)
di: Li, Weiqi, et al.
Pubblicazione: (2025)
Mask Image Watermarking
di: Hu, Runyi, et al.
Pubblicazione: (2025)
di: Hu, Runyi, et al.
Pubblicazione: (2025)
Mask-ControlNet: Higher-Quality Image Generation with An Additional Mask Prompt
di: Huang, Zhiqi, et al.
Pubblicazione: (2024)
di: Huang, Zhiqi, et al.
Pubblicazione: (2024)
Masked Gamma-SSL: Learning Uncertainty Estimation via Masked Image Modeling
di: Williams, David S. W., et al.
Pubblicazione: (2024)
di: Williams, David S. W., et al.
Pubblicazione: (2024)
Membership Inference Attack Against Masked Image Modeling
di: Li, Zheng, et al.
Pubblicazione: (2024)
di: Li, Zheng, et al.
Pubblicazione: (2024)
InterMask: 3D Human Interaction Generation via Collaborative Masked Modeling
di: Javed, Muhammad Gohar, et al.
Pubblicazione: (2024)
di: Javed, Muhammad Gohar, et al.
Pubblicazione: (2024)
Layout-Conditioned Autoregressive Text-to-Image Generation via Structured Masking
di: Zheng, Zirui, et al.
Pubblicazione: (2025)
di: Zheng, Zirui, et al.
Pubblicazione: (2025)
Learning Mask Invariant Mutual Information for Masked Image Modeling
di: Huang, Tao, et al.
Pubblicazione: (2025)
di: Huang, Tao, et al.
Pubblicazione: (2025)
Augmented Efficiency: Reducing Memory Footprint and Accelerating Inference for 3D Semantic Segmentation through Hybrid Vision
di: Krishnan, Aditya, et al.
Pubblicazione: (2024)
di: Krishnan, Aditya, et al.
Pubblicazione: (2024)
OneReward: Unified Mask-Guided Image Generation via Multi-Task Human Preference Learning
di: Gong, Yuan, et al.
Pubblicazione: (2025)
di: Gong, Yuan, et al.
Pubblicazione: (2025)
Beyond Night Visibility: Adaptive Multi-Scale Fusion of Infrared and Visible Images
di: Pei, Shufan, et al.
Pubblicazione: (2024)
di: Pei, Shufan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
PopAlign: Population-Level Alignment for Fair Text-to-Image Generation
di: Li, Shufan, et al.
Pubblicazione: (2024) -
InstructAny2Pix: Flexible Visual Editing via Multimodal Instruction Following
di: Li, Shufan, et al.
Pubblicazione: (2023) -
Mamba-ND: Selective State Space Modeling for Multi-Dimensional Data
di: Li, Shufan, et al.
Pubblicazione: (2024) -
MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants
di: Bansal, Hritik, et al.
Pubblicazione: (2024) -
Reflect-DiT: Inference-Time Scaling for Text-to-Image Diffusion Transformers via In-Context Reflection
di: Li, Shufan, et al.
Pubblicazione: (2025)