Unified Language-Vision Pretraining in LLM with Dynamic Discrete Visual Tokenization
Fuente:
arXiv
Saved in:
| Main Authors: | Jin, Yang, Xu, Kun, Chen, Liwei, Liao, Chao, Tan, Jianchao, Huang, Quzhe, Chen, Bin, Lei, Chenyi, Liu, An, Song, Chengru, Lei, Xiaoqiang, Zhang, Di, Ou, Wenwu, Gai, Kun, Mu, Yadong |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Video-LaVIT: Unified Video-Language Pre-training with Decoupled Visual-Motional Tokenization
by: Jin, Yang, et al.
Published: (2024)
by: Jin, Yang, et al.
Published: (2024)
RectifID: Personalizing Rectified Flow with Anchored Classifier Guidance
by: Sun, Zhicheng, et al.
Published: (2024)
by: Sun, Zhicheng, et al.
Published: (2024)
Towards Context-aware Reasoning-enhanced Generative Searching in E-commerce
by: Liu, Zhiding, et al.
Published: (2025)
by: Liu, Zhiding, et al.
Published: (2025)
OneVision: An End-to-End Generative Framework for Multi-view E-commerce Vision Search
by: Zheng, Zexin, et al.
Published: (2025)
by: Zheng, Zexin, et al.
Published: (2025)
Probing Multimodal Large Language Models for Global and Local Semantic Representations
by: Tao, Mingxu, et al.
Published: (2024)
by: Tao, Mingxu, et al.
Published: (2024)
Harder Tasks Need More Experts: Dynamic Routing in MoE Models
by: Huang, Quzhe, et al.
Published: (2024)
by: Huang, Quzhe, et al.
Published: (2024)
Pyramidal Flow Matching for Efficient Video Generative Modeling
by: Jin, Yang, et al.
Published: (2024)
by: Jin, Yang, et al.
Published: (2024)
Rethinking Tokenized Graph Transformers for Node Classification
by: Chen, Jinsong, et al.
Published: (2025)
by: Chen, Jinsong, et al.
Published: (2025)
ResTok: Learning Hierarchical Residuals in 1D Visual Tokenizers for Autoregressive Image Generation
by: Zhang, Xu, et al.
Published: (2026)
by: Zhang, Xu, et al.
Published: (2026)
VINO: A Unified Visual Generator with Interleaved OmniModal Context
by: Chen, Junyi, et al.
Published: (2026)
by: Chen, Junyi, et al.
Published: (2026)
UniDGF: A Unified Detection-to-Generation Framework for Hierarchical Object Visual Recognition
by: Nan, Xinyu, et al.
Published: (2025)
by: Nan, Xinyu, et al.
Published: (2025)
Wave-Particle (Continuous-Discrete) Dualistic Visual Tokenization for Unified Understanding and Generation
by: Chen, Yizhu, et al.
Published: (2025)
by: Chen, Yizhu, et al.
Published: (2025)
MergeTok: Unified Continuous and Discrete Visual Tokenization via Token Merging
by: Zhang, Luyuan, et al.
Published: (2026)
by: Zhang, Luyuan, et al.
Published: (2026)
From Vision to Audio and Beyond: A Unified Model for Audio-Visual Representation and Generation
by: Su, Kun, et al.
Published: (2024)
by: Su, Kun, et al.
Published: (2024)
UniCustom: Unified Visual Conditioning for Multi-Reference Image Generation
by: Xu, Yiyan, et al.
Published: (2026)
by: Xu, Yiyan, et al.
Published: (2026)
Mass spectra of charged mesons and the quenching of vector meson condensation via exact phase-space diagonalization
by: Chao, Jingyi, et al.
Published: (2026)
by: Chao, Jingyi, et al.
Published: (2026)
Unified Gas-Kinetic Wave-Particle Method for Multiscale Flow Simulation of Partially Ionized Plasma
by: Pu, Zhigang, et al.
Published: (2024)
by: Pu, Zhigang, et al.
Published: (2024)
From Principles to Applications: A Comprehensive Survey of Discrete Tokenizers in Generation, Comprehension, Recommendation, and Information Retrieval
by: Jia, Jian, et al.
Published: (2025)
by: Jia, Jian, et al.
Published: (2025)
Chromomagnetic condensation and perturbative confinement induced by imaginary rotation in SU(2) Yang-Mills Theory
by: Zhang, Lei, et al.
Published: (2026)
by: Zhang, Lei, et al.
Published: (2026)
DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies
by: Song, Wei, et al.
Published: (2025)
by: Song, Wei, et al.
Published: (2025)
HDMoLE: Mixture of LoRA Experts with Hierarchical Routing and Dynamic Thresholds for Fine-Tuning LLM-based ASR Models
by: Mu, Bingshen, et al.
Published: (2024)
by: Mu, Bingshen, et al.
Published: (2024)
GRADE: Personalized Multi-Task Fusion via Group-relative Reinforcement Learning with Adaptive Dirichlet Exploration
by: Hong, Tingfeng, et al.
Published: (2025)
by: Hong, Tingfeng, et al.
Published: (2025)
Stability of the first-order unified gas-kinetic scheme based on a linear kinetic model
by: Chen, Tuowei, et al.
Published: (2025)
by: Chen, Tuowei, et al.
Published: (2025)
Generating Attribute-Aware Human Motions from Textual Prompt
by: Wang, Xinghan, et al.
Published: (2025)
by: Wang, Xinghan, et al.
Published: (2025)
Learning from Next-Frame Prediction: Autoregressive Video Modeling Encodes Effective Representations
by: Li, Jinghan, et al.
Published: (2025)
by: Li, Jinghan, et al.
Published: (2025)
Correlative and Discriminative Label Grouping for Multi-Label Visual Prompt Tuning
by: Ma, LeiLei, et al.
Published: (2025)
by: Ma, LeiLei, et al.
Published: (2025)
SVFSearch: A Multimodal Knowledge-Intensive Benchmark for Short-Video Frame Search in the Gaming Vertical Domain
by: Mao, Lingtao, et al.
Published: (2026)
by: Mao, Lingtao, et al.
Published: (2026)
KuaiSearch: A Large-Scale E-Commerce Search Dataset for Recall, Ranking, and Relevance
by: Li, Yupeng, et al.
Published: (2026)
by: Li, Yupeng, et al.
Published: (2026)
Abundance and phase-space distribution of subhalos in cosmological N-body simulations: testing numerical convergence and correction methods
by: Xu, Kun
Published: (2025)
by: Xu, Kun
Published: (2025)
Neurovascular Barrier Protection in COVID‐19: Emerging Therapeutic Targets From SARS‐CoV‐2 Pathogenesis
by: Qisen Chen, et al.
Published: (2025)
by: Qisen Chen, et al.
Published: (2025)
Pivotal Role of FBXW4 in Glioma Progression and Prognosis
by: Kun Chen, et al.
Published: (2024)
by: Kun Chen, et al.
Published: (2024)
Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models
by: Dong, Xinpeng, et al.
Published: (2026)
by: Dong, Xinpeng, et al.
Published: (2026)
Separators in Enhancing Autoregressive Pretraining for Vision Mamba
by: Liu, Hanpeng, et al.
Published: (2026)
by: Liu, Hanpeng, et al.
Published: (2026)
Visual-Aware CoT: Achieving High-Fidelity Visual Consistency in Unified Models
by: Ye, Zixuan, et al.
Published: (2025)
by: Ye, Zixuan, et al.
Published: (2025)
DiffusionGS: Generative Search with Query Conditioned Diffusion in Kuaishou
by: Li, Qinyao, et al.
Published: (2025)
by: Li, Qinyao, et al.
Published: (2025)
Utility-Aware Data Pricing: Token-Level Quality and Empirical Training Gain for LLMs
by: Xu, Minghui, et al.
Published: (2026)
by: Xu, Minghui, et al.
Published: (2026)
Mixture of LoRA Experts with Multi-Modal and Multi-Granularity LLM Generative Error Correction for Accented Speech Recognition
by: Mu, Bingshen, et al.
Published: (2025)
by: Mu, Bingshen, et al.
Published: (2025)
Steering Visual Generation in Unified Multimodal Models with Understanding Supervision
by: Liu, Zeyu, et al.
Published: (2026)
by: Liu, Zeyu, et al.
Published: (2026)
AToken: A Unified Tokenizer for Vision
by: Lu, Jiasen, et al.
Published: (2025)
by: Lu, Jiasen, et al.
Published: (2025)
Decoding at the Speed of Thought: Harnessing Parallel Decoding of Lexical Units for LLMs
by: Sun, Chenxi, et al.
Published: (2024)
by: Sun, Chenxi, et al.
Published: (2024)
Similar Items
-
Video-LaVIT: Unified Video-Language Pre-training with Decoupled Visual-Motional Tokenization
by: Jin, Yang, et al.
Published: (2024) -
RectifID: Personalizing Rectified Flow with Anchored Classifier Guidance
by: Sun, Zhicheng, et al.
Published: (2024) -
Towards Context-aware Reasoning-enhanced Generative Searching in E-commerce
by: Liu, Zhiding, et al.
Published: (2025) -
OneVision: An End-to-End Generative Framework for Multi-view E-commerce Vision Search
by: Zheng, Zexin, et al.
Published: (2025) -
Probing Multimodal Large Language Models for Global and Local Semantic Representations
by: Tao, Mingxu, et al.
Published: (2024)