Unified Pix Token And Word Token Generative Language Model
Fuente:
arXiv
Guardado en:
| Autores principales: | Leung, Haun, Wang, ZiNan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LLM should think and action as a human
por: Leung, Haun, et al.
Publicado: (2025)
por: Leung, Haun, et al.
Publicado: (2025)
UniCompress: Token Compression for Unified Vision-Language Understanding and Generation
por: Wang, Ziyao, et al.
Publicado: (2026)
por: Wang, Ziyao, et al.
Publicado: (2026)
Visual-Word Tokenizer: Beyond Fixed Sets of Tokens in Vision Transformers
por: Gee, Leonidas, et al.
Publicado: (2024)
por: Gee, Leonidas, et al.
Publicado: (2024)
TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation
por: Qu, Liao, et al.
Publicado: (2024)
por: Qu, Liao, et al.
Publicado: (2024)
MergeTok: Unified Continuous and Discrete Visual Tokenization via Token Merging
por: Zhang, Luyuan, et al.
Publicado: (2026)
por: Zhang, Luyuan, et al.
Publicado: (2026)
TokenHSI: Unified Synthesis of Physical Human-Scene Interactions through Task Tokenization
por: Pan, Liang, et al.
Publicado: (2025)
por: Pan, Liang, et al.
Publicado: (2025)
TokenFLEX: Unified VLM Training for Flexible Visual Tokens Inference
por: Hu, Junshan, et al.
Publicado: (2025)
por: Hu, Junshan, et al.
Publicado: (2025)
LLaMo: Scaling Pretrained Language Models for Unified Motion Understanding and Generation with Continuous Autoregressive Tokens
por: Li, Zekun, et al.
Publicado: (2026)
por: Li, Zekun, et al.
Publicado: (2026)
Descriminative-Generative Custom Tokens for Vision-Language Models
por: Perera, Pramuditha, et al.
Publicado: (2025)
por: Perera, Pramuditha, et al.
Publicado: (2025)
UniFlow: A Unified Pixel Flow Tokenizer for Visual Understanding and Generation
por: Yue, Zhengrong, et al.
Publicado: (2025)
por: Yue, Zhengrong, et al.
Publicado: (2025)
Beyond Next-Token Alignment: Distilling Multimodal Large Language Models via Token Interactions
por: Chen, Lin, et al.
Publicado: (2026)
por: Chen, Lin, et al.
Publicado: (2026)
Language-Guided Transformer Tokenizer for Human Motion Generation
por: Yan, Sheng, et al.
Publicado: (2026)
por: Yan, Sheng, et al.
Publicado: (2026)
PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models
por: Yang, Chenyu, et al.
Publicado: (2024)
por: Yang, Chenyu, et al.
Publicado: (2024)
Unified Language-Vision Pretraining in LLM with Dynamic Discrete Visual Tokenization
por: Jin, Yang, et al.
Publicado: (2023)
por: Jin, Yang, et al.
Publicado: (2023)
Wave-Particle (Continuous-Discrete) Dualistic Visual Tokenization for Unified Understanding and Generation
por: Chen, Yizhu, et al.
Publicado: (2025)
por: Chen, Yizhu, et al.
Publicado: (2025)
TokenCom: Vision-Language Model for Multimodal and Multitask Token Communications
por: Jiang, Feibo, et al.
Publicado: (2026)
por: Jiang, Feibo, et al.
Publicado: (2026)
HybridToken-VLM: Hybrid Token Compression for Vision-Language Models
por: Zhang, Jusheng, et al.
Publicado: (2025)
por: Zhang, Jusheng, et al.
Publicado: (2025)
OmniTokenizer: A Joint Image-Video Tokenizer for Visual Generation
por: Wang, Junke, et al.
Publicado: (2024)
por: Wang, Junke, et al.
Publicado: (2024)
Grounding Everything in Tokens for Multimodal Large Language Models
por: Ren, Xiangxuan, et al.
Publicado: (2025)
por: Ren, Xiangxuan, et al.
Publicado: (2025)
TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models
por: Tan, Xudong, et al.
Publicado: (2025)
por: Tan, Xudong, et al.
Publicado: (2025)
Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration
por: Zeng, Fanhu, et al.
Publicado: (2025)
por: Zeng, Fanhu, et al.
Publicado: (2025)
G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models
por: Li, Junxian, et al.
Publicado: (2026)
por: Li, Junxian, et al.
Publicado: (2026)
A Frame is Worth One Token: Efficient Generative World Modeling with Delta Tokens
por: Kerssies, Tommie, et al.
Publicado: (2026)
por: Kerssies, Tommie, et al.
Publicado: (2026)
TokensGen: Harnessing Condensed Tokens for Long Video Generation
por: Ouyang, Wenqi, et al.
Publicado: (2025)
por: Ouyang, Wenqi, et al.
Publicado: (2025)
Factorized Visual Tokenization and Generation
por: Bai, Zechen, et al.
Publicado: (2024)
por: Bai, Zechen, et al.
Publicado: (2024)
DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies
por: Song, Wei, et al.
Publicado: (2025)
por: Song, Wei, et al.
Publicado: (2025)
Ming-UniVision: Joint Image Understanding and Generation with a Unified Continuous Tokenizer
por: Huang, Ziyuan, et al.
Publicado: (2025)
por: Huang, Ziyuan, et al.
Publicado: (2025)
ScribeTokens: Fixed-Vocabulary Tokenization of Digital Ink
por: Wang, Douglass
Publicado: (2026)
por: Wang, Douglass
Publicado: (2026)
Unified Autoregressive Visual Generation and Understanding with Continuous Tokens
por: Fan, Lijie, et al.
Publicado: (2025)
por: Fan, Lijie, et al.
Publicado: (2025)
HYDRA: Unifying Multi-modal Generation and Understanding via Representation-Harmonized Tokenization
por: Qiu, Xuerui, et al.
Publicado: (2026)
por: Qiu, Xuerui, et al.
Publicado: (2026)
UniCTokens: Boosting Personalized Understanding and Generation via Unified Concept Tokens
por: An, Ruichuan, et al.
Publicado: (2025)
por: An, Ruichuan, et al.
Publicado: (2025)
Scenes as Tokens: Multi-Scale Normal Distributions Transform Tokenizer for General 3D Vision-Language Understanding
por: Tang, Yutao, et al.
Publicado: (2025)
por: Tang, Yutao, et al.
Publicado: (2025)
Dynamic Token Reduction during Generation for Vision Language Models
por: Liang, Xiaoyu, et al.
Publicado: (2025)
por: Liang, Xiaoyu, et al.
Publicado: (2025)
Representation Shift: Unifying Token Compression with FlashAttention
por: Choi, Joonmyung, et al.
Publicado: (2025)
por: Choi, Joonmyung, et al.
Publicado: (2025)
VTok: A Unified Video Tokenizer with Decoupled Spatial-Temporal Latents
por: Wang, Feng, et al.
Publicado: (2026)
por: Wang, Feng, et al.
Publicado: (2026)
V2Flow: Unifying Visual Tokenization and Large Language Model Vocabularies for Autoregressive Image Generation
por: Zhang, Guiwei, et al.
Publicado: (2025)
por: Zhang, Guiwei, et al.
Publicado: (2025)
LINA: Linear Autoregressive Image Generative Models with Continuous Tokens
por: Wang, Jiahao, et al.
Publicado: (2026)
por: Wang, Jiahao, et al.
Publicado: (2026)
One Token, Two Fates: A Unified Framework via Vision Token Manipulation Against MLLMs Hallucination
por: Fa, Zhan, et al.
Publicado: (2026)
por: Fa, Zhan, et al.
Publicado: (2026)
TokenCompose: Text-to-Image Diffusion with Token-level Supervision
por: Wang, Zirui, et al.
Publicado: (2023)
por: Wang, Zirui, et al.
Publicado: (2023)
QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation
por: Zhao, Yue, et al.
Publicado: (2025)
por: Zhao, Yue, et al.
Publicado: (2025)
Ejemplares similares
-
LLM should think and action as a human
por: Leung, Haun, et al.
Publicado: (2025) -
UniCompress: Token Compression for Unified Vision-Language Understanding and Generation
por: Wang, Ziyao, et al.
Publicado: (2026) -
Visual-Word Tokenizer: Beyond Fixed Sets of Tokens in Vision Transformers
por: Gee, Leonidas, et al.
Publicado: (2024) -
TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation
por: Qu, Liao, et al.
Publicado: (2024) -
MergeTok: Unified Continuous and Discrete Visual Tokenization via Token Merging
por: Zhang, Luyuan, et al.
Publicado: (2026)