Accelerating Masked Image Generation by Learning Latent Controlled Dynamics
Fuente:
arXiv
Saved in:
| Main Authors: | Zhu, Kaiwen, Zeng, Quansheng, Pu, Yuandong, Cao, Shuo, Li, Xiaohui, Xin, Yi, Qin, Qi, Li, Jiayang, Qiao, Yu, Gu, Jinjin, Liu, Yihao |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
UniPercept: Towards Unified Perceptual-Level Image Understanding across Aesthetics, Quality, Structure, and Texture
by: Cao, Shuo, et al.
Published: (2025)
by: Cao, Shuo, et al.
Published: (2025)
StableI2I: Spotting Unintended Changes in Image-to-Image Transition
by: Li, Jiayang, et al.
Published: (2026)
by: Li, Jiayang, et al.
Published: (2026)
LinearSR: Unlocking Linear Attention for Stable and Efficient Image Super-Resolution
by: Li, Xiaohui, et al.
Published: (2025)
by: Li, Xiaohui, et al.
Published: (2025)
Exploring Scalable Unified Modeling for General Low-Level Vision
by: Chen, Xiangyu, et al.
Published: (2025)
by: Chen, Xiangyu, et al.
Published: (2025)
Toward Generalizable Deblurring: Leveraging Massive Blur Priors with Linear Attention for Real-World Scenarios
by: Gao, Yuanting, et al.
Published: (2026)
by: Gao, Yuanting, et al.
Published: (2026)
ArtiMuse: Fine-Grained Image Aesthetics Assessment with Joint Scoring and Expert-Level Understanding
by: Cao, Shuo, et al.
Published: (2025)
by: Cao, Shuo, et al.
Published: (2025)
PICABench: How Far Are We from Physically Realistic Image Editing?
by: Pu, Yuandong, et al.
Published: (2025)
by: Pu, Yuandong, et al.
Published: (2025)
An Intelligent Agentic System for Complex Image Restoration Problems
by: Zhu, Kaiwen, et al.
Published: (2024)
by: Zhu, Kaiwen, et al.
Published: (2024)
A Comparative Study of Image Restoration Networks for General Backbone Network Design
by: Chen, Xiangyu, et al.
Published: (2023)
by: Chen, Xiangyu, et al.
Published: (2023)
Enhancing Descriptive Image Quality Assessment with A Large-scale Multi-modal Dataset
by: You, Zhiyuan, et al.
Published: (2024)
by: You, Zhiyuan, et al.
Published: (2024)
FocusDiT: Masking Queries in Diffusion Transformers for Fine-grained Image Generation
by: Fang, Xueji, et al.
Published: (2026)
by: Fang, Xueji, et al.
Published: (2026)
Lumina-OmniLV: A Unified Multimodal Framework for General Low-Level Vision
by: Pu, Yuandong, et al.
Published: (2025)
by: Pu, Yuandong, et al.
Published: (2025)
A Preliminary Exploration Towards General Image Restoration
by: Kong, Xiangtao, et al.
Published: (2024)
by: Kong, Xiangtao, et al.
Published: (2024)
GRIDS: Grouped Multiple-Degradation Restoration with Image Degradation Similarity
by: Cao, Shuo, et al.
Published: (2024)
by: Cao, Shuo, et al.
Published: (2024)
Revisiting the Generalization Problem of Low-level Vision Models Through the Lens of Image Deraining
by: Hu, Jinfan, et al.
Published: (2025)
by: Hu, Jinfan, et al.
Published: (2025)
Position: Agentic Systems Constitute a Key Component of Next-Generation Intelligent Image Processing
by: Gu, Jinjin
Published: (2025)
by: Gu, Jinjin
Published: (2025)
Learning A Low-Level Vision Generalist via Visual Task Prompt
by: Chen, Xiangyu, et al.
Published: (2024)
by: Chen, Xiangyu, et al.
Published: (2024)
DiffVSR: Revealing an Effective Recipe for Taming Robust Video Super-Resolution Against Complex Degradations
by: Li, Xiaohui, et al.
Published: (2025)
by: Li, Xiaohui, et al.
Published: (2025)
DualX-VSR: Dual Axial Spatial$\times$Temporal Transformer for Real-World Video Super-Resolution without Motion Compensation
by: Cao, Shuo, et al.
Published: (2025)
by: Cao, Shuo, et al.
Published: (2025)
Resurrect Mask AutoRegressive Modeling for Efficient and Scalable Image Generation
by: Xin, Yi, et al.
Published: (2025)
by: Xin, Yi, et al.
Published: (2025)
Restore Anything with Masks: Leveraging Mask Image Modeling for Blind All-in-One Image Restoration
by: Qin, Chu-Jie, et al.
Published: (2024)
by: Qin, Chu-Jie, et al.
Published: (2024)
OT-ALD: Aligning Latent Distributions with Optimal Transport for Accelerated Image-to-Image Translation
by: Wang, Zhanpeng, et al.
Published: (2025)
by: Wang, Zhanpeng, et al.
Published: (2025)
Provable Scaling Laws of Feature Emergence from Learning Dynamics of Grokking
by: Tian, Yuandong
Published: (2025)
by: Tian, Yuandong
Published: (2025)
MaskControl: Spatio-Temporal Control for Masked Motion Synthesis
by: Pinyoanuntapong, Ekkasit, et al.
Published: (2024)
by: Pinyoanuntapong, Ekkasit, et al.
Published: (2024)
MaeFuse: Transferring Omni Features with Pretrained Masked Autoencoders for Infrared and Visible Image Fusion via Guided Training
by: Li, Jiayang, et al.
Published: (2024)
by: Li, Jiayang, et al.
Published: (2024)
RestoreAgent: Autonomous Image Restoration Agent via Multimodal Large Language Models
by: Chen, Haoyu, et al.
Published: (2024)
by: Chen, Haoyu, et al.
Published: (2024)
Event‐Triggered Iterative Learning Control of Regular Time‐Varying Multi‐Agent Systems Under Switching Topology
by: Wei Cao, et al.
Published: (2025)
by: Wei Cao, et al.
Published: (2025)
Squid: Long Context as a New Modality for Energy-Efficient On-Device Language Models
by: Chen, Wei, et al.
Published: (2024)
by: Chen, Wei, et al.
Published: (2024)
Factuality Matters: When Image Generation and Editing Meet Structured Visuals
by: Zhuo, Le, et al.
Published: (2025)
by: Zhuo, Le, et al.
Published: (2025)
Accelerating Inference of Masked Image Generators via Reinforcement Learning
by: Subbaraman, Pranav, et al.
Published: (2025)
by: Subbaraman, Pranav, et al.
Published: (2025)
MCANet: Medical Image Segmentation with Multi-Scale Cross-Axis Attention
by: Shao, Hao, et al.
Published: (2023)
by: Shao, Hao, et al.
Published: (2023)
dMLLM-TTS: Self-Verified and Efficient Test-Time Scaling for Diffusion Multi-Modal Large Language Models
by: Xin, Yi, et al.
Published: (2025)
by: Xin, Yi, et al.
Published: (2025)
Satellite Image Survey of Landslides Triggered by the 2024 Wushi Earthquake, Xinjiang, China
by: Tao Li, et al.
Published: (2025)
by: Tao Li, et al.
Published: (2025)
Technical Report: Masked Skeleton Sequence Modeling for Learning Larval Zebrafish Behavior Latent Embeddings
by: Xu, Lanxin, et al.
Published: (2024)
by: Xu, Lanxin, et al.
Published: (2024)
Limiting Interfacial Free Water and Proton Concentration by Hydrogel Electrolytes for Stable MoO3 Anode in a Proton Battery
by: Zili Qin, et al.
Published: (2024)
by: Zili Qin, et al.
Published: (2024)
Masked Latent Transformer with the Random Masking Ratio to Advance the Diagnosis of Dental Fluorosis
by: Wu, Yun, et al.
Published: (2024)
by: Wu, Yun, et al.
Published: (2024)
Clinical Evaluation of a Multi‐Component Facial Mask for Moisturizing, Repairing, and Anti‐Aging Effects
by: Fan Yang, et al.
Published: (2025)
by: Fan Yang, et al.
Published: (2025)
Latent Action Control for Reasoning-Guided Unified Image Generation
by: Zhai, Fuxiang, et al.
Published: (2026)
by: Zhai, Fuxiang, et al.
Published: (2026)
Topological Superconductivity in Monolayer T$_{\textrm{d}}$-MoTe$_2$
by: Li, Xin-Zhi, et al.
Published: (2024)
by: Li, Xin-Zhi, et al.
Published: (2024)
BadReward: Clean-Label Poisoning of Reward Models in Text-to-Image RLHF
by: Duan, Kaiwen, et al.
Published: (2025)
by: Duan, Kaiwen, et al.
Published: (2025)
Similar Items
-
UniPercept: Towards Unified Perceptual-Level Image Understanding across Aesthetics, Quality, Structure, and Texture
by: Cao, Shuo, et al.
Published: (2025) -
StableI2I: Spotting Unintended Changes in Image-to-Image Transition
by: Li, Jiayang, et al.
Published: (2026) -
LinearSR: Unlocking Linear Attention for Stable and Efficient Image Super-Resolution
by: Li, Xiaohui, et al.
Published: (2025) -
Exploring Scalable Unified Modeling for General Low-Level Vision
by: Chen, Xiangyu, et al.
Published: (2025) -
Toward Generalizable Deblurring: Leveraging Massive Blur Priors with Linear Attention for Real-World Scenarios
by: Gao, Yuanting, et al.
Published: (2026)