VAEVQ: Enhancing Discrete Visual Tokenization through Variational Modeling
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Sicheng, Hu, Xing, Wu, Qiang, Yang, Dawei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VQ-Seg: Vector-Quantized Token Perturbation for Semi-Supervised Medical Image Segmentation
di: Yang, Sicheng, et al.
Pubblicazione: (2026)
di: Yang, Sicheng, et al.
Pubblicazione: (2026)
Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning
di: Wang, Bohan, et al.
Pubblicazione: (2025)
di: Wang, Bohan, et al.
Pubblicazione: (2025)
A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models
di: Li, Duo, et al.
Pubblicazione: (2025)
di: Li, Duo, et al.
Pubblicazione: (2025)
Unified Language-Vision Pretraining in LLM with Dynamic Discrete Visual Tokenization
di: Jin, Yang, et al.
Pubblicazione: (2023)
di: Jin, Yang, et al.
Pubblicazione: (2023)
MergeTok: Unified Continuous and Discrete Visual Tokenization via Token Merging
di: Zhang, Luyuan, et al.
Pubblicazione: (2026)
di: Zhang, Luyuan, et al.
Pubblicazione: (2026)
Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens
di: Wang, Yuqing, et al.
Pubblicazione: (2026)
di: Wang, Yuqing, et al.
Pubblicazione: (2026)
Bridging Continuous and Discrete Tokens for Autoregressive Visual Generation
di: Wang, Yuqing, et al.
Pubblicazione: (2025)
di: Wang, Yuqing, et al.
Pubblicazione: (2025)
ST$^3$: Accelerating Multimodal Large Language Model by Spatial-Temporal Visual Token Trimming
di: Zhuang, Jiedong, et al.
Pubblicazione: (2024)
di: Zhuang, Jiedong, et al.
Pubblicazione: (2024)
Variational Autoencoding Discrete Diffusion with Enhanced Dimensional Correlations Modeling
di: Xie, Tianyu, et al.
Pubblicazione: (2025)
di: Xie, Tianyu, et al.
Pubblicazione: (2025)
Customizing Visual Emotion Evaluation for MLLMs: An Open-vocabulary, Multifaceted, and Scalable Approach
di: Wu, Daiqing, et al.
Pubblicazione: (2025)
di: Wu, Daiqing, et al.
Pubblicazione: (2025)
WeTok: Powerful Discrete Tokenization for High-Fidelity Visual Reconstruction
di: Zhuang, Shaobin, et al.
Pubblicazione: (2025)
di: Zhuang, Shaobin, et al.
Pubblicazione: (2025)
LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs
di: Lou, Haoran, et al.
Pubblicazione: (2025)
di: Lou, Haoran, et al.
Pubblicazione: (2025)
K-Stain: Keypoint-Driven Correspondence for H&E-to-IHC Virtual Staining
di: Yang, Sicheng, et al.
Pubblicazione: (2025)
di: Yang, Sicheng, et al.
Pubblicazione: (2025)
On the Role of Discrete Tokenization in Visual Representation Learning
di: Du, Tianqi, et al.
Pubblicazione: (2024)
di: Du, Tianqi, et al.
Pubblicazione: (2024)
When Token Pruning is Worse than Random: Understanding Visual Token Information in VLLMs
di: Wang, Yahong, et al.
Pubblicazione: (2025)
di: Wang, Yahong, et al.
Pubblicazione: (2025)
Revisiting MLLM Token Technology through the Lens of Classical Visual Coding
di: Liu, Jinming, et al.
Pubblicazione: (2025)
di: Liu, Jinming, et al.
Pubblicazione: (2025)
MUSE: Resolving Manifold Misalignment in Visual Tokenization via Topological Orthogonality
di: Yang, Panqi, et al.
Pubblicazione: (2026)
di: Yang, Panqi, et al.
Pubblicazione: (2026)
TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models
di: Tan, Xudong, et al.
Pubblicazione: (2025)
di: Tan, Xudong, et al.
Pubblicazione: (2025)
Advancing Reliable Test-Time Adaptation of Vision-Language Models under Visual Variations
di: Liang, Yiwen, et al.
Pubblicazione: (2025)
di: Liang, Yiwen, et al.
Pubblicazione: (2025)
EntropyPrune: Matrix Entropy Guided Visual Token Pruning for Multimodal Large Language Models
di: Wang, Yahong, et al.
Pubblicazione: (2026)
di: Wang, Yahong, et al.
Pubblicazione: (2026)
Wave-Particle (Continuous-Discrete) Dualistic Visual Tokenization for Unified Understanding and Generation
di: Chen, Yizhu, et al.
Pubblicazione: (2025)
di: Chen, Yizhu, et al.
Pubblicazione: (2025)
A Survey of Token Compression for Efficient Multimodal Large Language Models
di: Shao, Kele, et al.
Pubblicazione: (2025)
di: Shao, Kele, et al.
Pubblicazione: (2025)
FlowCoMotion: Text-to-Motion Generation via Token-Latent Flow Modeling
di: Guan, Dawei, et al.
Pubblicazione: (2026)
di: Guan, Dawei, et al.
Pubblicazione: (2026)
HAWK: Head Importance-Aware Visual Token Pruning in Multimodal Models
di: Zhu, Qihui, et al.
Pubblicazione: (2026)
di: Zhu, Qihui, et al.
Pubblicazione: (2026)
Bridging Semantic and Kinematic Conditions with Diffusion-based Discrete Motion Tokenizer
di: Gu, Chenyang, et al.
Pubblicazione: (2026)
di: Gu, Chenyang, et al.
Pubblicazione: (2026)
Information Entropy Guided Height-aware Histogram for Quantization-friendly Pillar Feature Encoder
di: Zhou, Sifan, et al.
Pubblicazione: (2024)
di: Zhou, Sifan, et al.
Pubblicazione: (2024)
TokenPure: Watermark Removal through Tokenized Appearance and Structural Guidance
di: Yang, Pei, et al.
Pubblicazione: (2025)
di: Yang, Pei, et al.
Pubblicazione: (2025)
CoordSpeaker: Exploiting Gesture Captioning for Coordinated Caption-Empowered Co-Speech Gesture Generation
di: Fang, Fengyi, et al.
Pubblicazione: (2025)
di: Fang, Fengyi, et al.
Pubblicazione: (2025)
ToDRE: Effective Visual Token Pruning via Token Diversity and Task Relevance
di: Li, Duo, et al.
Pubblicazione: (2025)
di: Li, Duo, et al.
Pubblicazione: (2025)
Discrete JEPA: Learning Discrete Token Representations without Reconstruction
di: Baek, Junyeob, et al.
Pubblicazione: (2025)
di: Baek, Junyeob, et al.
Pubblicazione: (2025)
SegDINO: An Efficient Design for Medical and Natural Image Segmentation with DINO-V3
di: Yang, Sicheng, et al.
Pubblicazione: (2025)
di: Yang, Sicheng, et al.
Pubblicazione: (2025)
TokenFLEX: Unified VLM Training for Flexible Visual Tokens Inference
di: Hu, Junshan, et al.
Pubblicazione: (2025)
di: Hu, Junshan, et al.
Pubblicazione: (2025)
MGVQ: Synergizing Multi-dimensional Sensitivity-Aware and Gradient-Hessian Fusion for Vector Quantization
di: Wang, Zhong, et al.
Pubblicazione: (2026)
di: Wang, Zhong, et al.
Pubblicazione: (2026)
TokenSeg: Efficient 3D Medical Image Segmentation via Hierarchical Visual Token Compression
di: Zeng, Sen, et al.
Pubblicazione: (2026)
di: Zeng, Sen, et al.
Pubblicazione: (2026)
Gaussian Variation Field Diffusion for High-fidelity Video-to-4D Synthesis
di: Zhang, Bowen, et al.
Pubblicazione: (2025)
di: Zhang, Bowen, et al.
Pubblicazione: (2025)
Enhancing 3D Transformer Segmentation Model for Medical Image with Token-level Representation Learning
di: Hu, Xinrong, et al.
Pubblicazione: (2024)
di: Hu, Xinrong, et al.
Pubblicazione: (2024)
FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models
di: Cai, Kaitong, et al.
Pubblicazione: (2025)
di: Cai, Kaitong, et al.
Pubblicazione: (2025)
ReDDiT: Rehashing Noise for Discrete Visual Generation
di: Ma, Tianren, et al.
Pubblicazione: (2025)
di: Ma, Tianren, et al.
Pubblicazione: (2025)
Enhancing Visual Document Understanding with Contrastive Learning in Large Visual-Language Models
di: Li, Xin, et al.
Pubblicazione: (2024)
di: Li, Xin, et al.
Pubblicazione: (2024)
LongCat-Next: Lexicalizing Modalities as Discrete Tokens
di: Meituan LongCat Team, et al.
Pubblicazione: (2026)
di: Meituan LongCat Team, et al.
Pubblicazione: (2026)
Documenti analoghi
-
VQ-Seg: Vector-Quantized Token Perturbation for Semi-Supervised Medical Image Segmentation
di: Yang, Sicheng, et al.
Pubblicazione: (2026) -
Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning
di: Wang, Bohan, et al.
Pubblicazione: (2025) -
A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models
di: Li, Duo, et al.
Pubblicazione: (2025) -
Unified Language-Vision Pretraining in LLM with Dynamic Discrete Visual Tokenization
di: Jin, Yang, et al.
Pubblicazione: (2023) -
MergeTok: Unified Continuous and Discrete Visual Tokenization via Token Merging
di: Zhang, Luyuan, et al.
Pubblicazione: (2026)