MaskBit: Embedding-free Image Generation via Bit Tokens
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Weber, Mark, Yu, Lijun, Yu, Qihang, Deng, Xueqing, Shen, Xiaohui, Cremers, Daniel, Chen, Liang-Chieh |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
An Image is Worth 32 Tokens for Reconstruction and Generation
par: Yu, Qihang, et autres
Publié: (2024)
par: Yu, Qihang, et autres
Publié: (2024)
Autoregressive Image Generation with Masked Bit Modeling
par: Yu, Qihang, et autres
Publié: (2026)
par: Yu, Qihang, et autres
Publié: (2026)
Randomized Autoregressive Visual Generation
par: Yu, Qihang, et autres
Publié: (2024)
par: Yu, Qihang, et autres
Publié: (2024)
Democratizing Text-to-Image Masked Generative Models with Compact Text-Aware One-Dimensional Tokens
par: Kim, Dongwon, et autres
Publié: (2025)
par: Kim, Dongwon, et autres
Publié: (2025)
COCONut: Modernizing COCO Segmentation
par: Deng, Xueqing, et autres
Publié: (2024)
par: Deng, Xueqing, et autres
Publié: (2024)
Beyond Next-Token: Next-X Prediction for Autoregressive Visual Generation
par: Ren, Sucheng, et autres
Publié: (2025)
par: Ren, Sucheng, et autres
Publié: (2025)
A Simple Video Segmenter by Tracking Objects Along Axial Trajectories
par: He, Ju, et autres
Publié: (2023)
par: He, Ju, et autres
Publié: (2023)
COCONut-PanCap: Joint Panoptic Segmentation and Grounded Captions for Fine-Grained Understanding and Generation
par: Deng, Xueqing, et autres
Publié: (2025)
par: Deng, Xueqing, et autres
Publié: (2025)
Alleviating Distortion in Image Generation via Multi-Resolution Diffusion Models and Time-Dependent Layer Normalization
par: Liu, Qihao, et autres
Publié: (2024)
par: Liu, Qihao, et autres
Publié: (2024)
Frequency-Aware Flow Matching for High-Quality Image Generation
par: Ren, Sucheng, et autres
Publié: (2026)
par: Ren, Sucheng, et autres
Publié: (2026)
FlowTok: Flowing Seamlessly Across Text and Image Tokens
par: He, Ju, et autres
Publié: (2025)
par: He, Ju, et autres
Publié: (2025)
FlowAR: Scale-wise Autoregressive Image Generation Meets Flow Matching
par: Ren, Sucheng, et autres
Publié: (2024)
par: Ren, Sucheng, et autres
Publié: (2024)
ViTamin: Designing Scalable Vision Models in the Vision-Language Era
par: Chen, Jieneng, et autres
Publié: (2024)
par: Chen, Jieneng, et autres
Publié: (2024)
A Frame is Worth One Token: Efficient Generative World Modeling with Delta Tokens
par: Kerssies, Tommie, et autres
Publié: (2026)
par: Kerssies, Tommie, et autres
Publié: (2026)
BitDance: Scaling Autoregressive Generative Models with Binary Tokens
par: Ai, Yuang, et autres
Publié: (2026)
par: Ai, Yuang, et autres
Publié: (2026)
BitC-3DGS: High-Capacity 3D Gaussian Splatting Watermarking via Bit Compression
par: Bi, Yuquan, et autres
Publié: (2026)
par: Bi, Yuquan, et autres
Publié: (2026)
Enhancing Temporal Consistency in Video Editing by Reconstructing Videos with 3D Gaussian Splatting
par: Shin, Inkyu, et autres
Publié: (2024)
par: Shin, Inkyu, et autres
Publié: (2024)
MICDrop: Masking Image and Depth Features via Complementary Dropout for Domain-Adaptive Semantic Segmentation
par: Yang, Linyan, et autres
Publié: (2024)
par: Yang, Linyan, et autres
Publié: (2024)
ViCaS: A Dataset for Combining Holistic and Pixel-level Video Understanding using Captions with Grounded Segmentation
par: Athar, Ali, et autres
Publié: (2024)
par: Athar, Ali, et autres
Publié: (2024)
LOTA: Bit-Planes Guided AI-Generated Image Detection
par: Wang, Hongsong, et autres
Publié: (2025)
par: Wang, Hongsong, et autres
Publié: (2025)
BitMark: Watermarking Bitwise Autoregressive Image Generative Models
par: Kerner, Louis, et autres
Publié: (2025)
par: Kerner, Louis, et autres
Publié: (2025)
Improved Masked Image Generation with Knowledge-Augmented Token Representations
par: Liang, Guotao, et autres
Publié: (2025)
par: Liang, Guotao, et autres
Publié: (2025)
Towards Agnostic and Holistic Universal Image Segmentation with Bit Diffusion
par: Christensen, Jakob Lønborg, et autres
Publié: (2026)
par: Christensen, Jakob Lønborg, et autres
Publié: (2026)
RAWIC: Bit-Depth Adaptive Lossless Raw Image Compression
par: Zheng, Chunhang, et autres
Publié: (2026)
par: Zheng, Chunhang, et autres
Publié: (2026)
LDP-Slicing: Local Differential Privacy for Images via Randomized Bit-Plane Slicing
par: Cao, Yuanming, et autres
Publié: (2026)
par: Cao, Yuanming, et autres
Publié: (2026)
SatSynth: Augmenting Image-Mask Pairs through Diffusion Models for Aerial Semantic Segmentation
par: Toker, Aysim, et autres
Publié: (2024)
par: Toker, Aysim, et autres
Publié: (2024)
PerCoV2: Improved Ultra-Low Bit-Rate Perceptual Image Compression with Implicit Hierarchical Masked Image Modeling
par: Körber, Nikolai, et autres
Publié: (2025)
par: Körber, Nikolai, et autres
Publié: (2025)
FlowFeat: Pixel-Dense Embedding of Motion Profiles
par: Araslanov, Nikita, et autres
Publié: (2025)
par: Araslanov, Nikita, et autres
Publié: (2025)
Dissecting Bit-Level Scaling Laws in Quantizing Vision Generative Models
par: Ding, Xin, et autres
Publié: (2025)
par: Ding, Xin, et autres
Publié: (2025)
Grouping First, Attending Smartly: Training-Free Acceleration for Diffusion Transformers
par: Ren, Sucheng, et autres
Publié: (2025)
par: Ren, Sucheng, et autres
Publié: (2025)
ReVision: Refining Video Diffusion with Explicit 3D Motion Modeling
par: Liu, Qihao, et autres
Publié: (2025)
par: Liu, Qihao, et autres
Publié: (2025)
1.58-bit FLUX
par: Yang, Chenglin, et autres
Publié: (2024)
par: Yang, Chenglin, et autres
Publié: (2024)
Towards Lossless Implicit Neural Representation via Bit Plane Decomposition
par: Han, Woo Kyoung, et autres
Publié: (2025)
par: Han, Woo Kyoung, et autres
Publié: (2025)
CoE: Deep Coupled Embedding for Non-Rigid Point Cloud Correspondences
par: Zeng, Huajian, et autres
Publié: (2024)
par: Zeng, Huajian, et autres
Publié: (2024)
On the Robustness of Diffusion-Based Image Compression to Bit-Flip Errors
par: Vaisman, Amit, et autres
Publié: (2026)
par: Vaisman, Amit, et autres
Publié: (2026)
ROI-based Deep Image Compression with Implicit Bit Allocation
par: Hu, Kai, et autres
Publié: (2025)
par: Hu, Kai, et autres
Publié: (2025)
Token Painter: Training-Free Text-Guided Image Inpainting via Mask Autoregressive Models
par: Jiang, Longtao, et autres
Publié: (2025)
par: Jiang, Longtao, et autres
Publié: (2025)
Power Variable Projection for Initialization-Free Large-Scale Bundle Adjustment
par: Weber, Simon, et autres
Publié: (2024)
par: Weber, Simon, et autres
Publié: (2024)
MotionBits: Video Segmentation through Motion-Level Analysis of Rigid Bodies
par: Qian, Howard H., et autres
Publié: (2026)
par: Qian, Howard H., et autres
Publié: (2026)
Gone With the Bits: Revealing Racial Bias in Low-Rate Neural Compression for Facial Images
par: Qiu, Tian, et autres
Publié: (2025)
par: Qiu, Tian, et autres
Publié: (2025)
Documents similaires
-
An Image is Worth 32 Tokens for Reconstruction and Generation
par: Yu, Qihang, et autres
Publié: (2024) -
Autoregressive Image Generation with Masked Bit Modeling
par: Yu, Qihang, et autres
Publié: (2026) -
Randomized Autoregressive Visual Generation
par: Yu, Qihang, et autres
Publié: (2024) -
Democratizing Text-to-Image Masked Generative Models with Compact Text-Aware One-Dimensional Tokens
par: Kim, Dongwon, et autres
Publié: (2025) -
COCONut: Modernizing COCO Segmentation
par: Deng, Xueqing, et autres
Publié: (2024)