A Survey on Vision Autoregressive Model
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Jiang, Kai, Huang, Jiaxing |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
A Survey on Evaluation of Multimodal Large Language Models
von: Huang, Jiaxing, et al.
Veröffentlicht: (2024)
von: Huang, Jiaxing, et al.
Veröffentlicht: (2024)
Training-Free Text-Guided Image Editing with Visual Autoregressive Model
von: Wang, Yufei, et al.
Veröffentlicht: (2025)
von: Wang, Yufei, et al.
Veröffentlicht: (2025)
SAM2 for Image and Video Segmentation: A Comprehensive Survey
von: Jiaxing, Zhang, et al.
Veröffentlicht: (2025)
von: Jiaxing, Zhang, et al.
Veröffentlicht: (2025)
Open-Vocabulary Object Detection via Language Hierarchy
von: Huang, Jiaxing, et al.
Veröffentlicht: (2024)
von: Huang, Jiaxing, et al.
Veröffentlicht: (2024)
DEX-AR: A Dynamic Explainability Method for Autoregressive Vision-Language Models
von: Bousselham, Walid, et al.
Veröffentlicht: (2026)
von: Bousselham, Walid, et al.
Veröffentlicht: (2026)
GranViT: A Fine-Grained Vision Model With Autoregressive Perception For MLLMs
von: Zheng, Guanghao, et al.
Veröffentlicht: (2025)
von: Zheng, Guanghao, et al.
Veröffentlicht: (2025)
Historical Test-time Prompt Tuning for Vision Foundation Models
von: Zhang, Jingyi, et al.
Veröffentlicht: (2024)
von: Zhang, Jingyi, et al.
Veröffentlicht: (2024)
Vision Foundation Models as Effective Visual Tokenizers for Autoregressive Image Generation
von: Zheng, Anlin, et al.
Veröffentlicht: (2025)
von: Zheng, Anlin, et al.
Veröffentlicht: (2025)
Separators in Enhancing Autoregressive Pretraining for Vision Mamba
von: Liu, Hanpeng, et al.
Veröffentlicht: (2026)
von: Liu, Hanpeng, et al.
Veröffentlicht: (2026)
Vision Generalist Model: A Survey
von: Wang, Ziyi, et al.
Veröffentlicht: (2025)
von: Wang, Ziyi, et al.
Veröffentlicht: (2025)
ReasonEdit: Editing Vision-Language Models using Human Reasoning
von: Qiu, Jiaxing, et al.
Veröffentlicht: (2026)
von: Qiu, Jiaxing, et al.
Veröffentlicht: (2026)
Generative Pre-trained Autoregressive Diffusion Transformer
von: Zhang, Yuan, et al.
Veröffentlicht: (2025)
von: Zhang, Yuan, et al.
Veröffentlicht: (2025)
ControlVAR: Exploring Controllable Visual Autoregressive Modeling
von: Li, Xiang, et al.
Veröffentlicht: (2024)
von: Li, Xiang, et al.
Veröffentlicht: (2024)
Trustworthy Large Models in Vision: A Survey
von: Guo, Ziyan, et al.
Veröffentlicht: (2023)
von: Guo, Ziyan, et al.
Veröffentlicht: (2023)
Efficient Diffusion Models for Vision: A Survey
von: Ulhaq, Anwaar, et al.
Veröffentlicht: (2022)
von: Ulhaq, Anwaar, et al.
Veröffentlicht: (2022)
A Survey on Vision-Language-Action Models for Autonomous Driving
von: Jiang, Sicong, et al.
Veröffentlicht: (2025)
von: Jiang, Sicong, et al.
Veröffentlicht: (2025)
SenseBench: A Benchmark for Remote Sensing Low-Level Visual Perception and Description in Large Vision-Language Models
von: Zhong, Chen, et al.
Veröffentlicht: (2026)
von: Zhong, Chen, et al.
Veröffentlicht: (2026)
Diffusion Models in Low-Level Vision: A Survey
von: He, Chunming, et al.
Veröffentlicht: (2024)
von: He, Chunming, et al.
Veröffentlicht: (2024)
MENTOR: Efficient Multimodal-Conditioned Tuning for Autoregressive Vision Generation Models
von: Zhao, Haozhe, et al.
Veröffentlicht: (2025)
von: Zhao, Haozhe, et al.
Veröffentlicht: (2025)
A Survey on Agentic Multimodal Large Language Models
von: Yao, Huanjin, et al.
Veröffentlicht: (2025)
von: Yao, Huanjin, et al.
Veröffentlicht: (2025)
Vision Language Models in Autonomous Driving: A Survey and Outlook
von: Zhou, Xingcheng, et al.
Veröffentlicht: (2023)
von: Zhou, Xingcheng, et al.
Veröffentlicht: (2023)
Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction
von: Tian, Keyu, et al.
Veröffentlicht: (2024)
von: Tian, Keyu, et al.
Veröffentlicht: (2024)
Xmodel-VLM: A Simple Baseline for Multimodal Vision Language Model
von: Xu, Wanting, et al.
Veröffentlicht: (2024)
von: Xu, Wanting, et al.
Veröffentlicht: (2024)
BitDance: Scaling Autoregressive Generative Models with Binary Tokens
von: Ai, Yuang, et al.
Veröffentlicht: (2026)
von: Ai, Yuang, et al.
Veröffentlicht: (2026)
Spatial 3D-LLM: Exploring Spatial Awareness in 3D Vision-Language Models
von: Wang, Xiaoyan, et al.
Veröffentlicht: (2025)
von: Wang, Xiaoyan, et al.
Veröffentlicht: (2025)
MAP: Unleashing Hybrid Mamba-Transformer Vision Backbone's Potential with Masked Autoregressive Pretraining
von: Liu, Yunze, et al.
Veröffentlicht: (2024)
von: Liu, Yunze, et al.
Veröffentlicht: (2024)
Adversarial Error Correction for Visual Autoregressive Generation
von: Bi, Ligong, et al.
Veröffentlicht: (2026)
von: Bi, Ligong, et al.
Veröffentlicht: (2026)
Efficient Multimodal Large Language Models: A Survey
von: Jin, Yizhang, et al.
Veröffentlicht: (2024)
von: Jin, Yizhang, et al.
Veröffentlicht: (2024)
Challenges and Trends in Egocentric Vision: A Survey
von: Li, Xiang, et al.
Veröffentlicht: (2025)
von: Li, Xiang, et al.
Veröffentlicht: (2025)
A Survey on Mamba Architecture for Vision Applications
von: Ibrahim, Fady, et al.
Veröffentlicht: (2025)
von: Ibrahim, Fady, et al.
Veröffentlicht: (2025)
Generative Physical AI in Vision: A Survey
von: Liu, Daochang, et al.
Veröffentlicht: (2025)
von: Liu, Daochang, et al.
Veröffentlicht: (2025)
Survey on Vision-Language-Action Models
von: Adilkhanov, Adilzhan, et al.
Veröffentlicht: (2025)
von: Adilkhanov, Adilzhan, et al.
Veröffentlicht: (2025)
Analyzing Diffusion and Autoregressive Vision Language Models in Multimodal Embedding Space
von: Wang, Zihang, et al.
Veröffentlicht: (2026)
von: Wang, Zihang, et al.
Veröffentlicht: (2026)
HiTVideo: Hierarchical Tokenizers for Enhancing Text-to-Video Generation with Autoregressive Large Language Models
von: Zhou, Ziqin, et al.
Veröffentlicht: (2025)
von: Zhou, Ziqin, et al.
Veröffentlicht: (2025)
Fast Autoregressive Video Generation with Diagonal Decoding
von: Ye, Yang, et al.
Veröffentlicht: (2025)
von: Ye, Yang, et al.
Veröffentlicht: (2025)
Frequency Autoregressive Image Generation with Continuous Tokens
von: Yu, Hu, et al.
Veröffentlicht: (2025)
von: Yu, Hu, et al.
Veröffentlicht: (2025)
Fourier Compressor: Frequency-Domain Visual Token Compression for Vision-Language Models
von: Wang, Huanyu, et al.
Veröffentlicht: (2025)
von: Wang, Huanyu, et al.
Veröffentlicht: (2025)
Diffusion Models in Vision: A Survey
von: Croitoru, Florinel-Alin, et al.
Veröffentlicht: (2022)
von: Croitoru, Florinel-Alin, et al.
Veröffentlicht: (2022)
Vision Transformers in Precision Agriculture: A Comprehensive Survey
von: Mehdipour, Saber, et al.
Veröffentlicht: (2025)
von: Mehdipour, Saber, et al.
Veröffentlicht: (2025)
Stabilize the Latent Space for Image Autoregressive Modeling: A Unified Perspective
von: Zhu, Yongxin, et al.
Veröffentlicht: (2024)
von: Zhu, Yongxin, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
A Survey on Evaluation of Multimodal Large Language Models
von: Huang, Jiaxing, et al.
Veröffentlicht: (2024) -
Training-Free Text-Guided Image Editing with Visual Autoregressive Model
von: Wang, Yufei, et al.
Veröffentlicht: (2025) -
SAM2 for Image and Video Segmentation: A Comprehensive Survey
von: Jiaxing, Zhang, et al.
Veröffentlicht: (2025) -
Open-Vocabulary Object Detection via Language Hierarchy
von: Huang, Jiaxing, et al.
Veröffentlicht: (2024) -
DEX-AR: A Dynamic Explainability Method for Autoregressive Vision-Language Models
von: Bousselham, Walid, et al.
Veröffentlicht: (2026)