VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Yecheng, Zhang, Zhuoyang, Chen, Junyu, Tang, Haotian, Li, Dacheng, Fang, Yunhao, Zhu, Ligeng, Xie, Enze, Yin, Hongxu, Yi, Li, Han, Song, Lu, Yao |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VILA$^2$: VILA Augmented VILA
par: Fang, Yunhao, et autres
Publié: (2024)
par: Fang, Yunhao, et autres
Publié: (2024)
LongVILA: Scaling Long-Context Visual Language Models for Long Videos
par: Chen, Yukang, et autres
Publié: (2024)
par: Chen, Yukang, et autres
Publié: (2024)
HART: Efficient Visual Generation with Hybrid Autoregressive Transformer
par: Tang, Haotian, et autres
Publié: (2024)
par: Tang, Haotian, et autres
Publié: (2024)
DC-AR: Efficient Masked Autoregressive Image Generation with Deep Compression Hybrid Tokenizer
par: Wu, Yecheng, et autres
Publié: (2025)
par: Wu, Yecheng, et autres
Publié: (2025)
VILA: On Pre-training for Visual Language Models
par: Lin, Ji, et autres
Publié: (2023)
par: Lin, Ji, et autres
Publié: (2023)
SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers
par: Xie, Enze, et autres
Publié: (2024)
par: Xie, Enze, et autres
Publié: (2024)
Deep Compression Autoencoder for Efficient High-Resolution Diffusion Models
par: Chen, Junyu, et autres
Publié: (2024)
par: Chen, Junyu, et autres
Publié: (2024)
X-VILA: Cross-Modality Alignment for Large Language Model
par: Ye, Hanrong, et autres
Publié: (2024)
par: Ye, Hanrong, et autres
Publié: (2024)
EGM: Efficient Visual Grounding Language Models
par: Zhan, Guanqi, et autres
Publié: (2026)
par: Zhan, Guanqi, et autres
Publié: (2026)
FoundationMotion: Auto-Labeling and Reasoning about Spatial Movement in Videos
par: Gan, Yulu, et autres
Publié: (2025)
par: Gan, Yulu, et autres
Publié: (2025)
NVILA: Efficient Frontier Visual Language Models
par: Liu, Zhijian, et autres
Publié: (2024)
par: Liu, Zhijian, et autres
Publié: (2024)
SparseVILA: Decoupling Visual Sparsity for Efficient VLM Inference
par: Khaki, Samir, et autres
Publié: (2025)
par: Khaki, Samir, et autres
Publié: (2025)
JetViT: Efficient High-Resolution Vision Transformer with Post-Training Attention Search
par: Zou, Dongyun, et autres
Publié: (2026)
par: Zou, Dongyun, et autres
Publié: (2026)
WorldModelBench: Judging Video Generation Models As World Models
par: Li, Dacheng, et autres
Publié: (2025)
par: Li, Dacheng, et autres
Publié: (2025)
Orcust: Stepwise-Feedback Reinforcement Learning for GUI Agent
par: Lu, Junyu, et autres
Publié: (2025)
par: Lu, Junyu, et autres
Publié: (2025)
EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos
par: Yang, Ruihan, et autres
Publié: (2025)
par: Yang, Ruihan, et autres
Publié: (2025)
DeepRTL: Bridging Verilog Understanding and Generation with a Unified Representation Model
par: Liu, Yi, et autres
Publié: (2025)
par: Liu, Yi, et autres
Publié: (2025)
DC-Gen: Post-Training Diffusion Acceleration with Deeply Compressed Latent Space
par: He, Wenkun, et autres
Publié: (2025)
par: He, Wenkun, et autres
Publié: (2025)
SANA 1.5: Efficient Scaling of Training-Time and Inference-Time Compute in Linear Diffusion Transformer
par: Xie, Enze, et autres
Publié: (2025)
par: Xie, Enze, et autres
Publié: (2025)
NaVILA: Legged Robot Vision-Language-Action Model for Navigation
par: Cheng, An-Chieh, et autres
Publié: (2024)
par: Cheng, An-Chieh, et autres
Publié: (2024)
VILA-M3: Enhancing Vision-Language Models with Medical Expert Knowledge
par: Nath, Vishwesh, et autres
Publié: (2024)
par: Nath, Vishwesh, et autres
Publié: (2024)
Grounded 3D-Aware Spatial Vision-Language Modeling
par: Cheng, An-Chieh, et autres
Publié: (2026)
par: Cheng, An-Chieh, et autres
Publié: (2026)
Skywork UniPic: Unified Autoregressive Modeling for Visual Understanding and Generation
par: Wang, Peiyu, et autres
Publié: (2025)
par: Wang, Peiyu, et autres
Publié: (2025)
Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding
par: Wu, Chengyue, et autres
Publié: (2025)
par: Wu, Chengyue, et autres
Publié: (2025)
DC-AE 1.5: Accelerating Diffusion Model Convergence with Structured Latent Space
par: Chen, Junyu, et autres
Publié: (2025)
par: Chen, Junyu, et autres
Publié: (2025)
DC-VideoGen: Efficient Video Generation with Deep Compression Video Autoencoder
par: Chen, Junyu, et autres
Publié: (2025)
par: Chen, Junyu, et autres
Publié: (2025)
CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models
par: Zhao, Qingqing, et autres
Publié: (2025)
par: Zhao, Qingqing, et autres
Publié: (2025)
Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation
par: Wu, Yecheng, et autres
Publié: (2026)
par: Wu, Yecheng, et autres
Publié: (2026)
EfficientViT-SAM: Accelerated Segment Anything Model Without Accuracy Loss
par: Zhang, Zhuoyang, et autres
Publié: (2024)
par: Zhang, Zhuoyang, et autres
Publié: (2024)
Astrea: A MOE-based Visual Understanding Model with Progressive Alignment
par: Yang, Xiaoda, et autres
Publié: (2025)
par: Yang, Xiaoda, et autres
Publié: (2025)
Lyrics: Boosting Fine-grained Language-Vision Alignment and Comprehension via Semantic-aware Visual Objects
par: Lu, Junyu, et autres
Publié: (2023)
par: Lu, Junyu, et autres
Publié: (2023)
Hide to Guide: Learning via Semantic Masking
par: Liu, Ruitao, et autres
Publié: (2026)
par: Liu, Ruitao, et autres
Publié: (2026)
DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies
par: Song, Wei, et autres
Publié: (2025)
par: Song, Wei, et autres
Publié: (2025)
Two-color magneto-optical trapping of ytterbium atoms
par: Li, Xiao, et autres
Publié: (2025)
par: Li, Xiao, et autres
Publié: (2025)
VideoTIR: Accurate Understanding for Long Videos with Efficient Tool-Integrated Reasoning
par: Gao, Zhe, et autres
Publié: (2026)
par: Gao, Zhe, et autres
Publié: (2026)
Visualizing the Invisible: Generative Visual Grounding Empowers Universal EEG Understanding in MLLMs
par: Pan, Jun-Yu, et autres
Publié: (2026)
par: Pan, Jun-Yu, et autres
Publié: (2026)
Character-Centric Understanding of Animated Movies
par: Gui, Zhongrui, et autres
Publié: (2025)
par: Gui, Zhongrui, et autres
Publié: (2025)
Sparse Refinement for Efficient High-Resolution Semantic Segmentation
par: Liu, Zhijian, et autres
Publié: (2024)
par: Liu, Zhijian, et autres
Publié: (2024)
SMILE: Zero-Shot Sparse Mixture of Low-Rank Experts Construction From Pre-Trained Foundation Models
par: Tang, Anke, et autres
Publié: (2024)
par: Tang, Anke, et autres
Publié: (2024)
Unified Autoregressive Visual Generation and Understanding with Continuous Tokens
par: Fan, Lijie, et autres
Publié: (2025)
par: Fan, Lijie, et autres
Publié: (2025)
Documents similaires
-
VILA$^2$: VILA Augmented VILA
par: Fang, Yunhao, et autres
Publié: (2024) -
LongVILA: Scaling Long-Context Visual Language Models for Long Videos
par: Chen, Yukang, et autres
Publié: (2024) -
HART: Efficient Visual Generation with Hybrid Autoregressive Transformer
par: Tang, Haotian, et autres
Publié: (2024) -
DC-AR: Efficient Masked Autoregressive Image Generation with Deep Compression Hybrid Tokenizer
par: Wu, Yecheng, et autres
Publié: (2025) -
VILA: On Pre-training for Visual Language Models
par: Lin, Ji, et autres
Publié: (2023)