VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Lin, Huawei, Geng, Tong, Xu, Zhaozhuo, Zhao, Weijie |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DMin: Scalable Training Data Influence Estimation for Diffusion Models
por: Lin, Huawei, et al.
Publicado: (2024)
por: Lin, Huawei, et al.
Publicado: (2024)
SpectralAR: Spectral Autoregressive Visual Generation
por: Huang, Yuanhui, et al.
Publicado: (2025)
por: Huang, Yuanhui, et al.
Publicado: (2025)
HART: Efficient Visual Generation with Hybrid Autoregressive Transformer
por: Tang, Haotian, et al.
Publicado: (2024)
por: Tang, Haotian, et al.
Publicado: (2024)
Spherical Leech Quantization for Visual Tokenization and Generation
por: Zhao, Yue, et al.
Publicado: (2025)
por: Zhao, Yue, et al.
Publicado: (2025)
E-CAR: Efficient Continuous Autoregressive Image Generation via Multistage Modeling
por: Yuan, Zhihang, et al.
Publicado: (2024)
por: Yuan, Zhihang, et al.
Publicado: (2024)
Language-Guided Image Tokenization for Generation
por: Zha, Kaiwen, et al.
Publicado: (2024)
por: Zha, Kaiwen, et al.
Publicado: (2024)
JetFormer: An Autoregressive Generative Model of Raw Images and Text
por: Tschannen, Michael, et al.
Publicado: (2024)
por: Tschannen, Michael, et al.
Publicado: (2024)
Annealed Relaxation of Speculative Decoding for Faster Autoregressive Image Generation
por: Li, Xingyao, et al.
Publicado: (2026)
por: Li, Xingyao, et al.
Publicado: (2026)
Universal Approximation of Visual Autoregressive Transformers
por: Chen, Yifang, et al.
Publicado: (2025)
por: Chen, Yifang, et al.
Publicado: (2025)
Taming the Entropy Cliff: Variable Codebook Size Quantization for Autoregressive Visual Generation
por: Zheng, Bowen, et al.
Publicado: (2026)
por: Zheng, Bowen, et al.
Publicado: (2026)
Autoregressive Adversarial Post-Training for Real-Time Interactive Video Generation
por: Lin, Shanchuan, et al.
Publicado: (2025)
por: Lin, Shanchuan, et al.
Publicado: (2025)
Visual Autoregressive Transformers Must Use $Ω(n^2 d)$ Memory
por: Cao, Yang, et al.
Publicado: (2025)
por: Cao, Yang, et al.
Publicado: (2025)
Watermarking Autoregressive Image Generation
por: Jovanović, Nikola, et al.
Publicado: (2025)
por: Jovanović, Nikola, et al.
Publicado: (2025)
DocSynthv2: A Practical Autoregressive Modeling for Document Generation
por: Biswas, Sanket, et al.
Publicado: (2024)
por: Biswas, Sanket, et al.
Publicado: (2024)
Frequency Autoregressive Image Generation with Continuous Tokens
por: Yu, Hu, et al.
Publicado: (2025)
por: Yu, Hu, et al.
Publicado: (2025)
MASC: Boosting Autoregressive Image Generation with a Manifold-Aligned Semantic Clustering
por: He, Lixuan, et al.
Publicado: (2025)
por: He, Lixuan, et al.
Publicado: (2025)
LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information
por: Wang, Ke, et al.
Publicado: (2024)
por: Wang, Ke, et al.
Publicado: (2024)
Evaluating Text-to-Visual Generation with Image-to-Text Generation
por: Lin, Zhiqiu, et al.
Publicado: (2024)
por: Lin, Zhiqiu, et al.
Publicado: (2024)
Hita: Holistic Tokenizer for Autoregressive Image Generation
por: Zheng, Anlin, et al.
Publicado: (2025)
por: Zheng, Anlin, et al.
Publicado: (2025)
Vision Foundation Models as Effective Visual Tokenizers for Autoregressive Image Generation
por: Zheng, Anlin, et al.
Publicado: (2025)
por: Zheng, Anlin, et al.
Publicado: (2025)
Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens
por: Qin, Yiming, et al.
Publicado: (2025)
por: Qin, Yiming, et al.
Publicado: (2025)
Uncertainty-DTW for Sequences and Visual Tokens
por: Wang, Lei, et al.
Publicado: (2026)
por: Wang, Lei, et al.
Publicado: (2026)
Break the Visual Perception: Adversarial Attacks Targeting Encoded Visual Tokens of Large Vision-Language Models
por: Wang, Yubo, et al.
Publicado: (2024)
por: Wang, Yubo, et al.
Publicado: (2024)
ToDo: Token Downsampling for Efficient Generation of High-Resolution Images
por: Smith, Ethan, et al.
Publicado: (2024)
por: Smith, Ethan, et al.
Publicado: (2024)
GeoToken: Hierarchical Geolocalization of Images via Next Token Prediction
por: Ghasemi, Narges, et al.
Publicado: (2025)
por: Ghasemi, Narges, et al.
Publicado: (2025)
Astra: General Interactive World Model with Autoregressive Denoising
por: Zhu, Yixuan, et al.
Publicado: (2025)
por: Zhu, Yixuan, et al.
Publicado: (2025)
PSA: Pyramid Sparse Attention for Efficient Video Understanding and Generation
por: Li, Xiaolong, et al.
Publicado: (2025)
por: Li, Xiaolong, et al.
Publicado: (2025)
Token Activation Map to Visually Explain Multimodal LLMs
por: Li, Yi, et al.
Publicado: (2025)
por: Li, Yi, et al.
Publicado: (2025)
Mixture of Nested Experts: Adaptive Processing of Visual Tokens
por: Jain, Gagan, et al.
Publicado: (2024)
por: Jain, Gagan, et al.
Publicado: (2024)
Diffusion Autoencoders are Scalable Image Tokenizers
por: Chen, Yinbo, et al.
Publicado: (2025)
por: Chen, Yinbo, et al.
Publicado: (2025)
Fine-Tuning Next-Scale Visual Autoregressive Models with Group Relative Policy Optimization
por: Gallici, Matteo, et al.
Publicado: (2025)
por: Gallici, Matteo, et al.
Publicado: (2025)
Self-Evaluation Unlocks Any-Step Text-to-Image Generation
por: Yu, Xin, et al.
Publicado: (2025)
por: Yu, Xin, et al.
Publicado: (2025)
Perception Tokens Enhance Visual Reasoning in Multimodal Language Models
por: Bigverdi, Mahtab, et al.
Publicado: (2024)
por: Bigverdi, Mahtab, et al.
Publicado: (2024)
Analyzing The Language of Visual Tokens
por: Chan, David M., et al.
Publicado: (2024)
por: Chan, David M., et al.
Publicado: (2024)
PointNSP: Autoregressive 3D Point Cloud Generation with Next-Scale Level-of-Detail Prediction
por: Meng, Ziqiao, et al.
Publicado: (2025)
por: Meng, Ziqiao, et al.
Publicado: (2025)
Communication-Inspired Tokenization for Structured Image Representations
por: Davtyan, Aram, et al.
Publicado: (2026)
por: Davtyan, Aram, et al.
Publicado: (2026)
HOFAR: High-Order Augmentation of Flow Autoregressive Transformers
por: Liang, Yingyu, et al.
Publicado: (2025)
por: Liang, Yingyu, et al.
Publicado: (2025)
SegDAC: Visual Generalization in Reinforcement Learning via Dynamic Object Tokens
por: Brown, Alexandre, et al.
Publicado: (2025)
por: Brown, Alexandre, et al.
Publicado: (2025)
Inference Optimal VLMs Need Fewer Visual Tokens and More Parameters
por: Li, Kevin Y., et al.
Publicado: (2024)
por: Li, Kevin Y., et al.
Publicado: (2024)
TORE: Token Recycling in Vision Transformers for Efficient Active Visual Exploration
por: Olszewski, Jan, et al.
Publicado: (2023)
por: Olszewski, Jan, et al.
Publicado: (2023)
Ejemplares similares
-
DMin: Scalable Training Data Influence Estimation for Diffusion Models
por: Lin, Huawei, et al.
Publicado: (2024) -
SpectralAR: Spectral Autoregressive Visual Generation
por: Huang, Yuanhui, et al.
Publicado: (2025) -
HART: Efficient Visual Generation with Hybrid Autoregressive Transformer
por: Tang, Haotian, et al.
Publicado: (2024) -
Spherical Leech Quantization for Visual Tokenization and Generation
por: Zhao, Yue, et al.
Publicado: (2025) -
E-CAR: Efficient Continuous Autoregressive Image Generation via Multistage Modeling
por: Yuan, Zhihang, et al.
Publicado: (2024)