Scalable Training for Vector-Quantized Networks with 100% Codebook Utilization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chang, Yifan, Qin, Jie, Qiao, Limeng, Wang, Xiaofeng, Zhu, Zheng, Ma, Lin, Wang, Xingang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Beyond Stationarity: Rethinking Codebook Collapse in Vector Quantization
par: Lu, Hao, et autres
Publié: (2026)
par: Lu, Hao, et autres
Publié: (2026)
LooC: Effective Low-Dimensional Codebook for Compositional Vector Quantization
par: Li, Jie, et autres
Publié: (2026)
par: Li, Jie, et autres
Publié: (2026)
Group-Wise Optimization for Self-Extensible Codebooks in Vector Quantized Models
par: Zheng, Hong-Kai, et autres
Publié: (2025)
par: Zheng, Hong-Kai, et autres
Publié: (2025)
STAR: STacked AutoRegressive Scheme for Unified Multimodal Learning
par: Qin, Jie, et autres
Publié: (2025)
par: Qin, Jie, et autres
Publié: (2025)
Codebook Transfer with Part-of-Speech for Vector-Quantized Image Modeling
par: Zhang, Baoquan, et autres
Publié: (2024)
par: Zhang, Baoquan, et autres
Publié: (2024)
Scaling the Codebook Size of VQGAN to 100,000 with a Utilization Rate of 99%
par: Zhu, Lei, et autres
Publié: (2024)
par: Zhu, Lei, et autres
Publié: (2024)
VITRIX-CLIPIN: Enhancing Fine-Grained Visual Understanding in CLIP via Instruction Editing Data and Long Captions
par: Wang, Ziteng, et autres
Publié: (2025)
par: Wang, Ziteng, et autres
Publié: (2025)
Training-Free Vector Quantization via Gaussian VAEs
par: Xu, Tongda, et autres
Publié: (2025)
par: Xu, Tongda, et autres
Publié: (2025)
UniViTAR: Unified Vision Transformer with Native Resolution
par: Qiao, Limeng, et autres
Publié: (2025)
par: Qiao, Limeng, et autres
Publié: (2025)
ReconDreamer++: Harmonizing Generative and Reconstructive Models for Driving Scene Representation
par: Zhao, Guosheng, et autres
Publié: (2025)
par: Zhao, Guosheng, et autres
Publié: (2025)
Switchable Token-Specific Codebook Quantization For Face Image Compression
par: Wang, Yongbo, et autres
Publié: (2025)
par: Wang, Yongbo, et autres
Publié: (2025)
All-in-One Medical Image Restoration with Latent Diffusion-Enhanced Vector-Quantized Codebook Prior
par: Chen, Haowei, et autres
Publié: (2025)
par: Chen, Haowei, et autres
Publié: (2025)
Rethinking Lanes and Points in Complex Scenarios for Monocular 3D Lane Detection
par: Chang, Yifan, et autres
Publié: (2025)
par: Chang, Yifan, et autres
Publié: (2025)
TLC-Plan: A Two-Level Codebook Based Network for End-to-End Vector Floorplan Generation
par: Xiong, Biao, et autres
Publié: (2026)
par: Xiong, Biao, et autres
Publié: (2026)
DC-PCN: Point Cloud Completion Network with Dual-Codebook Guided Quantization
par: Wu, Qiuxia, et autres
Publié: (2025)
par: Wu, Qiuxia, et autres
Publié: (2025)
Video Diffusion Models are Training-free Motion Interpreter and Controller
par: Xiao, Zeqi, et autres
Publié: (2024)
par: Xiao, Zeqi, et autres
Publié: (2024)
DriveDreamer-2: LLM-Enhanced World Models for Diverse Driving Video Generation
par: Zhao, Guosheng, et autres
Publié: (2024)
par: Zhao, Guosheng, et autres
Publié: (2024)
UniComp: Rethinking Video Compression Through Informational Uniqueness
par: Yuan, Chao, et autres
Publié: (2025)
par: Yuan, Chao, et autres
Publié: (2025)
ReconPhys: Reconstruct Appearance and Physical Attributes from Single Video
par: Wang, Boyuan, et autres
Publié: (2026)
par: Wang, Boyuan, et autres
Publié: (2026)
R3-Avatar: Record and Retrieve Temporal Codebook for Reconstructing Photorealistic Human Avatars
par: Zhan, Yifan, et autres
Publié: (2025)
par: Zhan, Yifan, et autres
Publié: (2025)
Patch-aware Vector Quantized Codebook Learning for Unsupervised Visual Defect Detection
par: Cheng, Qisen, et autres
Publié: (2025)
par: Cheng, Qisen, et autres
Publié: (2025)
RIV: Recursive Introspection Mask Diffusion Vision Language Model
par: Li, YuQian, et autres
Publié: (2025)
par: Li, YuQian, et autres
Publié: (2025)
ViM-VQ: Efficient Post-Training Vector Quantization for Visual Mamba
par: Deng, Juncan, et autres
Publié: (2025)
par: Deng, Juncan, et autres
Publié: (2025)
PCA-VAE: Differentiable Subspace Quantization without Codebook Collapse
par: Lu, Hao, et autres
Publié: (2026)
par: Lu, Hao, et autres
Publié: (2026)
X-SAM: From Segment Anything to Any Segmentation
par: Wang, Hao, et autres
Publié: (2025)
par: Wang, Hao, et autres
Publié: (2025)
Rate-Adaptive Quantization: A Multi-Rate Codebook Adaptation for Vector Quantization-based Generative Models
par: Seo, Jiwan, et autres
Publié: (2024)
par: Seo, Jiwan, et autres
Publié: (2024)
DynImg: Key Frames with Visual Prompts are Good Representation for Multi-Modal Video Understanding
par: Bao, Xiaoyi, et autres
Publié: (2025)
par: Bao, Xiaoyi, et autres
Publié: (2025)
EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation
par: Wang, Xiaofeng, et autres
Publié: (2024)
par: Wang, Xiaofeng, et autres
Publié: (2024)
PLUG: Revisiting Amodal Segmentation with Foundation Model and Hierarchical Focus
par: Liu, Zhaochen, et autres
Publié: (2024)
par: Liu, Zhaochen, et autres
Publié: (2024)
Preventing Local Pitfalls in Vector Quantization via Optimal Transport
par: Zhang, Borui, et autres
Publié: (2024)
par: Zhang, Borui, et autres
Publié: (2024)
Beyond the Visible: Benchmarking Occlusion Perception in Multimodal Large Language Models
par: Liu, Zhaochen, et autres
Publié: (2025)
par: Liu, Zhaochen, et autres
Publié: (2025)
QuantSR+: Pushing the Limit of Quantized Image Super-Resolution Networks
par: Qin, Haotong, et autres
Publié: (2026)
par: Qin, Haotong, et autres
Publié: (2026)
Sensitivity-Aware Post-Training Quantization for Deep Neural Networks
par: Zheng, Zekang, et autres
Publié: (2025)
par: Zheng, Zekang, et autres
Publié: (2025)
Motion-R1: Enhancing Motion Generation with Decomposed Chain-of-Thought and RL Binding
par: Ouyang, Runqi, et autres
Publié: (2025)
par: Ouyang, Runqi, et autres
Publié: (2025)
EmbodieDreamer: Advancing Real2Sim2Real Transfer for Policy Training via Embodied World Modeling
par: Wang, Boyuan, et autres
Publié: (2025)
par: Wang, Boyuan, et autres
Publié: (2025)
X2SAM: Any Segmentation in Images and Videos
par: Wang, Hao, et autres
Publié: (2026)
par: Wang, Hao, et autres
Publié: (2026)
Decomposed Vector-Quantized Variational Autoencoder for Human Grasp Generation
par: Zhao, Zhe, et autres
Publié: (2024)
par: Zhao, Zhe, et autres
Publié: (2024)
Channel-wise Vector Quantization
par: Song, Wei, et autres
Publié: (2026)
par: Song, Wei, et autres
Publié: (2026)
Autoregressive Video Generation without Vector Quantization
par: Deng, Haoge, et autres
Publié: (2024)
par: Deng, Haoge, et autres
Publié: (2024)
GigaVideo-1: Advancing Video Generation via Automatic Feedback with 4 GPU-Hours Fine-Tuning
par: Bao, Xiaoyi, et autres
Publié: (2025)
par: Bao, Xiaoyi, et autres
Publié: (2025)
Documents similaires
-
Beyond Stationarity: Rethinking Codebook Collapse in Vector Quantization
par: Lu, Hao, et autres
Publié: (2026) -
LooC: Effective Low-Dimensional Codebook for Compositional Vector Quantization
par: Li, Jie, et autres
Publié: (2026) -
Group-Wise Optimization for Self-Extensible Codebooks in Vector Quantized Models
par: Zheng, Hong-Kai, et autres
Publié: (2025) -
STAR: STacked AutoRegressive Scheme for Unified Multimodal Learning
par: Qin, Jie, et autres
Publié: (2025) -
Codebook Transfer with Part-of-Speech for Vector-Quantized Image Modeling
par: Zhang, Baoquan, et autres
Publié: (2024)