ZipAR: Parallel Auto-regressive Image Generation through Spatial Locality
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | He, Yefei, Chen, Feng, He, Yuanyu, He, Shaoxuan, Zhou, Hong, Zhang, Kaipeng, Zhuang, Bohan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Neighboring Autoregressive Modeling for Efficient Visual Generation
par: He, Yefei, et autres
Publié: (2025)
par: He, Yefei, et autres
Publié: (2025)
ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification
par: He, Yefei, et autres
Publié: (2024)
par: He, Yefei, et autres
Publié: (2024)
FlashAR: Efficient Post-Training Acceleration for Autoregressive Image Generation
par: Zhou, Junkang, et autres
Publié: (2026)
par: Zhou, Junkang, et autres
Publié: (2026)
OmniSparse: Training-Aware Fine-Grained Sparse Attention for Long-Video MLLMs
par: Chen, Feng, et autres
Publié: (2025)
par: Chen, Feng, et autres
Publié: (2025)
EfficientDM: Efficient Quantization-Aware Fine-Tuning of Low-Bit Diffusion Models
par: He, Yefei, et autres
Publié: (2023)
par: He, Yefei, et autres
Publié: (2023)
Less Detail, Better Answers: Degradation-Driven Prompting for VQA
par: Han, Haoxuan, et autres
Publié: (2026)
par: Han, Haoxuan, et autres
Publié: (2026)
BlockVid: Block Diffusion for High-Quality and Consistent Minute-Long Video Generation
par: Zhang, Zeyu, et autres
Publié: (2025)
par: Zhang, Zeyu, et autres
Publié: (2025)
AR-Diffusion: Asynchronous Video Generation with Auto-Regressive Diffusion
par: Sun, Mingzhen, et autres
Publié: (2025)
par: Sun, Mingzhen, et autres
Publié: (2025)
World-R1: Reinforcing 3D Constraints for Text-to-Video Generation
par: Wang, Weijie, et autres
Publié: (2026)
par: Wang, Weijie, et autres
Publié: (2026)
Where Am I and What Will I See: An Auto-Regressive Model for Spatial Localization and View Prediction
par: Chen, Junyi, et autres
Publié: (2024)
par: Chen, Junyi, et autres
Publié: (2024)
Paragraph-to-Image Generation with Information-Enriched Diffusion Model
par: Wu, Weijia, et autres
Publié: (2023)
par: Wu, Weijia, et autres
Publié: (2023)
FlowAR: Scale-wise Autoregressive Image Generation Meets Flow Matching
par: Ren, Sucheng, et autres
Publié: (2024)
par: Ren, Sucheng, et autres
Publié: (2024)
Webly-Supervised Image Manipulation Localization via Category-Aware Auto-Annotation
par: Qu, Chenfan, et autres
Publié: (2025)
par: Qu, Chenfan, et autres
Publié: (2025)
Many-to-many Image Generation with Auto-regressive Diffusion Models
par: Shen, Ying, et autres
Publié: (2024)
par: Shen, Ying, et autres
Publié: (2024)
Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation
par: Xu, Zhiyang, et autres
Publié: (2025)
par: Xu, Zhiyang, et autres
Publié: (2025)
Improving Autoregressive Image Generation through Coarse-to-Fine Token Prediction
par: Guo, Ziyao, et autres
Publié: (2025)
par: Guo, Ziyao, et autres
Publié: (2025)
Multimodal Self-Instruct: Synthetic Abstract Image and Visual Reasoning Instruction Using Language Model
par: Zhang, Wenqi, et autres
Publié: (2024)
par: Zhang, Wenqi, et autres
Publié: (2024)
Deterministic Image-to-Image Translation via Denoising Brownian Bridge Models with Dual Approximators
par: Xiao, Bohan, et autres
Publié: (2025)
par: Xiao, Bohan, et autres
Publié: (2025)
Geometrically-Constrained Agent for Spatial Reasoning
par: Chen, Zeren, et autres
Publié: (2025)
par: Chen, Zeren, et autres
Publié: (2025)
Spectral-Spatial Mamba for Hyperspectral Image Classification
par: Huang, Lingbo, et autres
Publié: (2024)
par: Huang, Lingbo, et autres
Publié: (2024)
DCoAR: Deep Concept Injection into Unified Autoregressive Models for Personalized Text-to-Image Generation
par: Wu, Fangtai, et autres
Publié: (2025)
par: Wu, Fangtai, et autres
Publié: (2025)
EdgeRunner: Auto-regressive Auto-encoder for Artistic Mesh Generation
par: Tang, Jiaxiang, et autres
Publié: (2024)
par: Tang, Jiaxiang, et autres
Publié: (2024)
Dynamic Execution Commitment of Vision-Language-Action Models
par: Chen, Feng, et autres
Publié: (2026)
par: Chen, Feng, et autres
Publié: (2026)
StgcDiff: Spatial-Temporal Graph Condition Diffusion for Sign Language Transition Generation
par: He, Jiashu, et autres
Publié: (2025)
par: He, Jiashu, et autres
Publié: (2025)
LongVLM: Efficient Long Video Understanding via Large Language Models
par: Weng, Yuetian, et autres
Publié: (2024)
par: Weng, Yuetian, et autres
Publié: (2024)
OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models
par: Tao, Keda, et autres
Publié: (2025)
par: Tao, Keda, et autres
Publié: (2025)
LiveWorld: Simulating Out-of-Sight Dynamics in Generative Video World Models
par: Duan, Zicheng, et autres
Publié: (2026)
par: Duan, Zicheng, et autres
Publié: (2026)
Accelerating Auto-regressive Text-to-Image Generation with Training-free Speculative Jacobi Decoding
par: Teng, Yao, et autres
Publié: (2024)
par: Teng, Yao, et autres
Publié: (2024)
Inferix: A Block-Diffusion based Next-Generation Inference Engine for World Simulation
par: Inferix Team, et autres
Publié: (2025)
par: Inferix Team, et autres
Publié: (2025)
OpenING: A Comprehensive Benchmark for Judging Open-ended Interleaved Image-Text Generation
par: Zhou, Pengfei, et autres
Publié: (2024)
par: Zhou, Pengfei, et autres
Publié: (2024)
FPSAttention: Training-Aware FP8 and Sparsity Co-Design for Fast Video Diffusion
par: Liu, Akide, et autres
Publié: (2025)
par: Liu, Akide, et autres
Publié: (2025)
AR4D: Autoregressive 4D Generation from Monocular Videos
par: Zhu, Hanxin, et autres
Publié: (2025)
par: Zhu, Hanxin, et autres
Publié: (2025)
AR-CoPO: Align Autoregressive Video Generation with Contrastive Policy Optimization
par: He, Dailan, et autres
Publié: (2026)
par: He, Dailan, et autres
Publié: (2026)
Gimbal360: Differentiable Auto-Leveling for Canonicalized $360^\circ$ Panoramic Image Completion
par: Lu, Yuqin, et autres
Publié: (2026)
par: Lu, Yuqin, et autres
Publié: (2026)
SAM-Med3D-MoE: Towards a Non-Forgetting Segment Anything Model via Mixture of Experts for 3D Medical Image Segmentation
par: Wang, Guoan, et autres
Publié: (2024)
par: Wang, Guoan, et autres
Publié: (2024)
ZipIR: Latent Pyramid Diffusion Transformer for High-Resolution Image Restoration
par: Yu, Yongsheng, et autres
Publié: (2025)
par: Yu, Yongsheng, et autres
Publié: (2025)
Resurrect Mask AutoRegressive Modeling for Efficient and Scalable Image Generation
par: Xin, Yi, et autres
Publié: (2025)
par: Xin, Yi, et autres
Publié: (2025)
Human-Aware 3D Scene Generation with Spatially-constrained Diffusion Models
par: Hong, Xiaolin, et autres
Publié: (2024)
par: Hong, Xiaolin, et autres
Publié: (2024)
Streaming Video Diffusion: Online Video Editing with Diffusion Models
par: Chen, Feng, et autres
Publié: (2024)
par: Chen, Feng, et autres
Publié: (2024)
IPDreamer: Appearance-Controllable 3D Object Generation with Complex Image Prompts
par: Zeng, Bohan, et autres
Publié: (2023)
par: Zeng, Bohan, et autres
Publié: (2023)
Documents similaires
-
Neighboring Autoregressive Modeling for Efficient Visual Generation
par: He, Yefei, et autres
Publié: (2025) -
ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification
par: He, Yefei, et autres
Publié: (2024) -
FlashAR: Efficient Post-Training Acceleration for Autoregressive Image Generation
par: Zhou, Junkang, et autres
Publié: (2026) -
OmniSparse: Training-Aware Fine-Grained Sparse Attention for Long-Video MLLMs
par: Chen, Feng, et autres
Publié: (2025) -
EfficientDM: Efficient Quantization-Aware Fine-Tuning of Low-Bit Diffusion Models
par: He, Yefei, et autres
Publié: (2023)