QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhao, Yue, Xue, Fuzhao, Reed, Scott, Fan, Linxi, Zhu, Yuke, Kautz, Jan, Yu, Zhiding, Krähenbühl, Philipp, Huang, De-An |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Image and Video Tokenization with Binary Spherical Quantization
par: Zhao, Yue, et autres
Publié: (2024)
par: Zhao, Yue, et autres
Publié: (2024)
FRAG: Frame Selection Augmented Generation for Long Video and Long Document Understanding
par: Huang, De-An, et autres
Publié: (2025)
par: Huang, De-An, et autres
Publié: (2025)
AMAGO: Scalable In-Context Reinforcement Learning for Adaptive Agents
par: Grigsby, Jake, et autres
Publié: (2023)
par: Grigsby, Jake, et autres
Publié: (2023)
Spherical Leech Quantization for Visual Tokenization and Generation
par: Zhao, Yue, et autres
Publié: (2025)
par: Zhao, Yue, et autres
Publié: (2025)
LongVILA: Scaling Long-Context Visual Language Models for Long Videos
par: Chen, Yukang, et autres
Publié: (2024)
par: Chen, Yukang, et autres
Publié: (2024)
STORM: Token-Efficient Long Video Understanding for Multimodal LLMs
par: Jiang, Jindong, et autres
Publié: (2025)
par: Jiang, Jindong, et autres
Publié: (2025)
Vision as a Dialect: Unifying Visual Understanding and Generation via Text-Aligned Representations
par: Han, Jiaming, et autres
Publié: (2025)
par: Han, Jiaming, et autres
Publié: (2025)
Unified Autoregressive Visual Generation and Understanding with Continuous Tokens
par: Fan, Lijie, et autres
Publié: (2025)
par: Fan, Lijie, et autres
Publié: (2025)
UM-Text: A Unified Multimodal Model for Image Understanding and Visual Text Editing
par: Ma, Lichen, et autres
Publié: (2026)
par: Ma, Lichen, et autres
Publié: (2026)
Sim-to-Real Reinforcement Learning for Vision-Based Dexterous Manipulation on Humanoids
par: Lin, Toru, et autres
Publié: (2025)
par: Lin, Toru, et autres
Publié: (2025)
InfinityStar: Unified Spacetime AutoRegressive Modeling for Visual Generation
par: Liu, Jinlai, et autres
Publié: (2025)
par: Liu, Jinlai, et autres
Publié: (2025)
STAR: STacked AutoRegressive Scheme for Unified Multimodal Learning
par: Qin, Jie, et autres
Publié: (2025)
par: Qin, Jie, et autres
Publié: (2025)
UniToken: Harmonizing Multimodal Understanding and Generation through Unified Visual Encoding
par: Jiao, Yang, et autres
Publié: (2025)
par: Jiao, Yang, et autres
Publié: (2025)
Compressed Map Priors for 3D Perception
par: Zhou, Brady, et autres
Publié: (2025)
par: Zhou, Brady, et autres
Publié: (2025)
TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation
par: Qu, Liao, et autres
Publié: (2024)
par: Qu, Liao, et autres
Publié: (2024)
Auto-Encoding Morph-Tokens for Multimodal LLM
par: Pan, Kaihang, et autres
Publié: (2024)
par: Pan, Kaihang, et autres
Publié: (2024)
OneCAT: Decoder-Only Auto-Regressive Model for Unified Understanding and Generation
par: Li, Han, et autres
Publié: (2025)
par: Li, Han, et autres
Publié: (2025)
Interactive Post-Training for Vision-Language-Action Models
par: Tan, Shuhan, et autres
Publié: (2025)
par: Tan, Shuhan, et autres
Publié: (2025)
VAR-CLIP: Text-to-Image Generator with Visual Auto-Regressive Modeling
par: Zhang, Qian, et autres
Publié: (2024)
par: Zhang, Qian, et autres
Publié: (2024)
Prismer: A Vision-Language Model with Multi-Task Experts
par: Liu, Shikun, et autres
Publié: (2023)
par: Liu, Shikun, et autres
Publié: (2023)
Unified Multimodal Understanding via Byte-Pair Visual Encoding
par: Zhang, Wanpeng, et autres
Publié: (2025)
par: Zhang, Wanpeng, et autres
Publié: (2025)
QLIP: A Dynamic Quadtree Vision Prior Enhances MLLM Performance Without Retraining
par: Chickering, Kyle R., et autres
Publié: (2025)
par: Chickering, Kyle R., et autres
Publié: (2025)
HAVEN: Hierarchically Aligned Multimodal Benchmark for Unified Video Understanding
par: Shi, Mengqi, et autres
Publié: (2026)
par: Shi, Mengqi, et autres
Publié: (2026)
Steering Visual Generation in Unified Multimodal Models with Understanding Supervision
par: Liu, Zeyu, et autres
Publié: (2026)
par: Liu, Zeyu, et autres
Publié: (2026)
PhyCritic: Multimodal Critic Models for Physical AI
par: Xiong, Tianyi, et autres
Publié: (2026)
par: Xiong, Tianyi, et autres
Publié: (2026)
UniFlow: A Unified Pixel Flow Tokenizer for Visual Understanding and Generation
par: Yue, Zhengrong, et autres
Publié: (2025)
par: Yue, Zhengrong, et autres
Publié: (2025)
FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models
par: Cai, Kaitong, et autres
Publié: (2025)
par: Cai, Kaitong, et autres
Publié: (2025)
Wave-Particle (Continuous-Discrete) Dualistic Visual Tokenization for Unified Understanding and Generation
par: Chen, Yizhu, et autres
Publié: (2025)
par: Chen, Yizhu, et autres
Publié: (2025)
Auto-Regressive Next-Token Predictors are Universal Learners
par: Malach, Eran
Publié: (2023)
par: Malach, Eran
Publié: (2023)
GEOMETRIA ÓSSEA E ATIVIDADE FÍSICA EM CRIANÇAS E ADOLESCENTES: REVISÃO SISTEMÁTICA
par: Tathyane Krahenbühl
Publié: (2018)
par: Tathyane Krahenbühl
Publié: (2018)
The use of the additional field player in handball: analysis of the Rio 2016 Olympic Games
par: Tathyane Krahenbühl
Publié: (2019)
par: Tathyane Krahenbühl
Publié: (2019)
Fatores que influenciam a massa óssea de crianças e adolescentes saudáveis mensurada pelo ultrassom quantitativo de falanges: revisão sistemática
par: Tathyane Krahenbühl
Publié: (2014)
par: Tathyane Krahenbühl
Publié: (2014)
HOVER: Versatile Neural Whole-Body Controller for Humanoid Robots
par: He, Tairan, et autres
Publié: (2024)
par: He, Tairan, et autres
Publié: (2024)
UniTok: A Unified Tokenizer for Visual Generation and Understanding
par: Ma, Chuofan, et autres
Publié: (2025)
par: Ma, Chuofan, et autres
Publié: (2025)
Stateful Token Reduction for Long-Video Hybrid VLMs
par: Jiang, Jindong, et autres
Publié: (2026)
par: Jiang, Jindong, et autres
Publié: (2026)
ARDuP: Active Region Video Diffusion for Universal Policies
par: Huang, Shuaiyi, et autres
Publié: (2024)
par: Huang, Shuaiyi, et autres
Publié: (2024)
Prompt-Aware Adapter: Towards Learning Adaptive Visual Tokens for Multimodal Large Language Models
par: Zhang, Yue, et autres
Publié: (2024)
par: Zhang, Yue, et autres
Publié: (2024)
DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies
par: Song, Wei, et autres
Publié: (2025)
par: Song, Wei, et autres
Publié: (2025)
Domain Adaptation Through Task Distillation
par: Zhou, Brady, et autres
Publié: (2020)
par: Zhou, Brady, et autres
Publié: (2020)
Long-term Traffic Simulation with Interleaved Autoregressive Motion and Scenario Generation
par: Yang, Xiuyu, et autres
Publié: (2025)
par: Yang, Xiuyu, et autres
Publié: (2025)
Documents similaires
-
Image and Video Tokenization with Binary Spherical Quantization
par: Zhao, Yue, et autres
Publié: (2024) -
FRAG: Frame Selection Augmented Generation for Long Video and Long Document Understanding
par: Huang, De-An, et autres
Publié: (2025) -
AMAGO: Scalable In-Context Reinforcement Learning for Adaptive Agents
par: Grigsby, Jake, et autres
Publié: (2023) -
Spherical Leech Quantization for Visual Tokenization and Generation
par: Zhao, Yue, et autres
Publié: (2025) -
LongVILA: Scaling Long-Context Visual Language Models for Long Videos
par: Chen, Yukang, et autres
Publié: (2024)