VILA: On Pre-training for Visual Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Lin, Ji, Yin, Hongxu, Ping, Wei, Lu, Yao, Molchanov, Pavlo, Tao, Andrew, Mao, Huizi, Kautz, Jan, Shoeybi, Mohammad, Han, Song |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
X-VILA: Cross-Modality Alignment for Large Language Model
di: Ye, Hanrong, et al.
Pubblicazione: (2024)
di: Ye, Hanrong, et al.
Pubblicazione: (2024)
VILA$^2$: VILA Augmented VILA
di: Fang, Yunhao, et al.
Pubblicazione: (2024)
di: Fang, Yunhao, et al.
Pubblicazione: (2024)
LongVILA: Scaling Long-Context Visual Language Models for Long Videos
di: Chen, Yukang, et al.
Pubblicazione: (2024)
di: Chen, Yukang, et al.
Pubblicazione: (2024)
RADIOv2.5: Improved Baselines for Agglomerative Vision Foundation Models
di: Heinrich, Greg, et al.
Pubblicazione: (2024)
di: Heinrich, Greg, et al.
Pubblicazione: (2024)
Scaling Vision Pre-Training to 4K Resolution
di: Shi, Baifeng, et al.
Pubblicazione: (2025)
di: Shi, Baifeng, et al.
Pubblicazione: (2025)
FasterViT: Fast Vision Transformers with Hierarchical Attention
di: Hatamizadeh, Ali, et al.
Pubblicazione: (2023)
di: Hatamizadeh, Ali, et al.
Pubblicazione: (2023)
LITA: Language Instructed Temporal-Localization Assistant
di: Huang, De-An, et al.
Pubblicazione: (2024)
di: Huang, De-An, et al.
Pubblicazione: (2024)
Flextron: Many-in-One Flexible Large Language Model
di: Cai, Ruisi, et al.
Pubblicazione: (2024)
di: Cai, Ruisi, et al.
Pubblicazione: (2024)
Nemotron-CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training
di: Diao, Shizhe, et al.
Pubblicazione: (2025)
di: Diao, Shizhe, et al.
Pubblicazione: (2025)
MaskLLM: Learnable Semi-Structured Sparsity for Large Language Models
di: Fang, Gongfan, et al.
Pubblicazione: (2024)
di: Fang, Gongfan, et al.
Pubblicazione: (2024)
Compact Language Models via Pruning and Knowledge Distillation
di: Muralidharan, Saurav, et al.
Pubblicazione: (2024)
di: Muralidharan, Saurav, et al.
Pubblicazione: (2024)
NaVILA: Legged Robot Vision-Language-Action Model for Navigation
di: Cheng, An-Chieh, et al.
Pubblicazione: (2024)
di: Cheng, An-Chieh, et al.
Pubblicazione: (2024)
Step Out and Seek Around: On Warm-Start Training with Incremental Data
di: Shen, Maying, et al.
Pubblicazione: (2024)
di: Shen, Maying, et al.
Pubblicazione: (2024)
Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation
di: Belcak, Peter, et al.
Pubblicazione: (2025)
di: Belcak, Peter, et al.
Pubblicazione: (2025)
AM-RADIO: Agglomerative Vision Foundation Model -- Reduce All Domains Into One
di: Ranzinger, Mike, et al.
Pubblicazione: (2023)
di: Ranzinger, Mike, et al.
Pubblicazione: (2023)
3D Aware Region Prompted Vision Language Model
di: Cheng, An-Chieh, et al.
Pubblicazione: (2025)
di: Cheng, An-Chieh, et al.
Pubblicazione: (2025)
FeatSharp: Your Vision Model Features, Sharper
di: Ranzinger, Mike, et al.
Pubblicazione: (2025)
di: Ranzinger, Mike, et al.
Pubblicazione: (2025)
Adaptive Sharpness-Aware Pruning for Robust Sparse Networks
di: Bair, Anna, et al.
Pubblicazione: (2023)
di: Bair, Anna, et al.
Pubblicazione: (2023)
Advancing Weight and Channel Sparsification with Enhanced Saliency
di: Sun, Xinglong, et al.
Pubblicazione: (2025)
di: Sun, Xinglong, et al.
Pubblicazione: (2025)
Grounded 3D-Aware Spatial Vision-Language Modeling
di: Cheng, An-Chieh, et al.
Pubblicazione: (2026)
di: Cheng, An-Chieh, et al.
Pubblicazione: (2026)
VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation
di: Wu, Yecheng, et al.
Pubblicazione: (2024)
di: Wu, Yecheng, et al.
Pubblicazione: (2024)
VILA-M3: Enhancing Vision-Language Models with Medical Expert Knowledge
di: Nath, Vishwesh, et al.
Pubblicazione: (2024)
di: Nath, Vishwesh, et al.
Pubblicazione: (2024)
Scaling RL to Long Videos
di: Chen, Yukang, et al.
Pubblicazione: (2025)
di: Chen, Yukang, et al.
Pubblicazione: (2025)
C-RADIOv4 (Tech Report)
di: Ranzinger, Mike, et al.
Pubblicazione: (2026)
di: Ranzinger, Mike, et al.
Pubblicazione: (2026)
Universal Deep Research: Bring Your Own Model and Strategy
di: Belcak, Peter, et al.
Pubblicazione: (2025)
di: Belcak, Peter, et al.
Pubblicazione: (2025)
Attend Before Attention: Efficient and Scalable Video Understanding via Autoregressive Gazing
di: Shi, Baifeng, et al.
Pubblicazione: (2026)
di: Shi, Baifeng, et al.
Pubblicazione: (2026)
SparseVILA: Decoupling Visual Sparsity for Efficient VLM Inference
di: Khaki, Samir, et al.
Pubblicazione: (2025)
di: Khaki, Samir, et al.
Pubblicazione: (2025)
COIN: Control-Inpainting Diffusion Prior for Human and Camera Motion Estimation
di: Li, Jiefeng, et al.
Pubblicazione: (2024)
di: Li, Jiefeng, et al.
Pubblicazione: (2024)
Reasoning Visual Language Model for Chest X-Ray Analysis
di: Myronenko, Andriy, et al.
Pubblicazione: (2025)
di: Myronenko, Andriy, et al.
Pubblicazione: (2025)
NVILA: Efficient Frontier Visual Language Models
di: Liu, Zhijian, et al.
Pubblicazione: (2024)
di: Liu, Zhijian, et al.
Pubblicazione: (2024)
A deeper look at depth pruning of LLMs
di: Siddiqui, Shoaib Ahmed, et al.
Pubblicazione: (2024)
di: Siddiqui, Shoaib Ahmed, et al.
Pubblicazione: (2024)
LaCache: Ladder-Shaped KV Caching for Efficient Long-Context Modeling of Large Language Models
di: Shi, Dachuan, et al.
Pubblicazione: (2025)
di: Shi, Dachuan, et al.
Pubblicazione: (2025)
TwinTURBO: Semi-Supervised Fine-Tuning of Foundation Models via Mutual Information Decompositions for Downstream Task and Latent Spaces
di: Quétant, Guillaume, et al.
Pubblicazione: (2025)
di: Quétant, Guillaume, et al.
Pubblicazione: (2025)
Stateful Token Reduction for Long-Video Hybrid VLMs
di: Jiang, Jindong, et al.
Pubblicazione: (2026)
di: Jiang, Jindong, et al.
Pubblicazione: (2026)
DLER: Doing Length pEnalty Right - Incentivizing More Intelligence per Token via Reinforcement Learning
di: Liu, Shih-Yang, et al.
Pubblicazione: (2025)
di: Liu, Shih-Yang, et al.
Pubblicazione: (2025)
ToolOrchestra: Elevating Intelligence via Efficient Model and Tool Orchestration
di: Su, Hongjin, et al.
Pubblicazione: (2025)
di: Su, Hongjin, et al.
Pubblicazione: (2025)
Towards Scalable Pre-training of Visual Tokenizers for Generation
di: Yao, Jingfeng, et al.
Pubblicazione: (2025)
di: Yao, Jingfeng, et al.
Pubblicazione: (2025)
PHI-S: Distribution Balancing for Label-Free Multi-Teacher Distillation
di: Ranzinger, Mike, et al.
Pubblicazione: (2024)
di: Ranzinger, Mike, et al.
Pubblicazione: (2024)
QeRL: Beyond Efficiency -- Quantization-enhanced Reinforcement Learning for LLMs
di: Huang, Wei, et al.
Pubblicazione: (2025)
di: Huang, Wei, et al.
Pubblicazione: (2025)
Efficient-DLM: From Autoregressive to Diffusion Language Models, and Beyond in Speed
di: Fu, Yonggan, et al.
Pubblicazione: (2025)
di: Fu, Yonggan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
X-VILA: Cross-Modality Alignment for Large Language Model
di: Ye, Hanrong, et al.
Pubblicazione: (2024) -
VILA$^2$: VILA Augmented VILA
di: Fang, Yunhao, et al.
Pubblicazione: (2024) -
LongVILA: Scaling Long-Context Visual Language Models for Long Videos
di: Chen, Yukang, et al.
Pubblicazione: (2024) -
RADIOv2.5: Improved Baselines for Agglomerative Vision Foundation Models
di: Heinrich, Greg, et al.
Pubblicazione: (2024) -
Scaling Vision Pre-Training to 4K Resolution
di: Shi, Baifeng, et al.
Pubblicazione: (2025)