Scaling Vision Pre-Training to 4K Resolution
Fuente:
arXiv
Guardado en:
| Autores principales: | Shi, Baifeng, Li, Boyi, Cai, Han, Lu, Yao, Liu, Sifei, Pavone, Marco, Kautz, Jan, Han, Song, Darrell, Trevor, Molchanov, Pavlo, Yin, Hongxu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Scaling RL to Long Videos
por: Chen, Yukang, et al.
Publicado: (2025)
por: Chen, Yukang, et al.
Publicado: (2025)
Attend Before Attention: Efficient and Scalable Video Understanding via Autoregressive Gazing
por: Shi, Baifeng, et al.
Publicado: (2026)
por: Shi, Baifeng, et al.
Publicado: (2026)
FoundationMotion: Auto-Labeling and Reasoning about Spatial Movement in Videos
por: Gan, Yulu, et al.
Publicado: (2025)
por: Gan, Yulu, et al.
Publicado: (2025)
VILA$^2$: VILA Augmented VILA
por: Fang, Yunhao, et al.
Publicado: (2024)
por: Fang, Yunhao, et al.
Publicado: (2024)
VILA: On Pre-training for Visual Language Models
por: Lin, Ji, et al.
Publicado: (2023)
por: Lin, Ji, et al.
Publicado: (2023)
3D Aware Region Prompted Vision Language Model
por: Cheng, An-Chieh, et al.
Publicado: (2025)
por: Cheng, An-Chieh, et al.
Publicado: (2025)
RADIOv2.5: Improved Baselines for Agglomerative Vision Foundation Models
por: Heinrich, Greg, et al.
Publicado: (2024)
por: Heinrich, Greg, et al.
Publicado: (2024)
LLM-grounded Video Diffusion Models
por: Lian, Long, et al.
Publicado: (2023)
por: Lian, Long, et al.
Publicado: (2023)
FasterViT: Fast Vision Transformers with Hierarchical Attention
por: Hatamizadeh, Ali, et al.
Publicado: (2023)
por: Hatamizadeh, Ali, et al.
Publicado: (2023)
Flextron: Many-in-One Flexible Large Language Model
por: Cai, Ruisi, et al.
Publicado: (2024)
por: Cai, Ruisi, et al.
Publicado: (2024)
Grounded 3D-Aware Spatial Vision-Language Modeling
por: Cheng, An-Chieh, et al.
Publicado: (2026)
por: Cheng, An-Chieh, et al.
Publicado: (2026)
AM-RADIO: Agglomerative Vision Foundation Model -- Reduce All Domains Into One
por: Ranzinger, Mike, et al.
Publicado: (2023)
por: Ranzinger, Mike, et al.
Publicado: (2023)
LITA: Language Instructed Temporal-Localization Assistant
por: Huang, De-An, et al.
Publicado: (2024)
por: Huang, De-An, et al.
Publicado: (2024)
X-VILA: Cross-Modality Alignment for Large Language Model
por: Ye, Hanrong, et al.
Publicado: (2024)
por: Ye, Hanrong, et al.
Publicado: (2024)
Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders
por: Jiang, Yitong, et al.
Publicado: (2026)
por: Jiang, Yitong, et al.
Publicado: (2026)
When Do We Not Need Larger Vision Models?
por: Shi, Baifeng, et al.
Publicado: (2024)
por: Shi, Baifeng, et al.
Publicado: (2024)
Step Out and Seek Around: On Warm-Start Training with Incremental Data
por: Shen, Maying, et al.
Publicado: (2024)
por: Shen, Maying, et al.
Publicado: (2024)
JetViT: Efficient High-Resolution Vision Transformer with Post-Training Attention Search
por: Zou, Dongyun, et al.
Publicado: (2026)
por: Zou, Dongyun, et al.
Publicado: (2026)
Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation
por: Belcak, Peter, et al.
Publicado: (2025)
por: Belcak, Peter, et al.
Publicado: (2025)
MaskLLM: Learnable Semi-Structured Sparsity for Large Language Models
por: Fang, Gongfan, et al.
Publicado: (2024)
por: Fang, Gongfan, et al.
Publicado: (2024)
FeatSharp: Your Vision Model Features, Sharper
por: Ranzinger, Mike, et al.
Publicado: (2025)
por: Ranzinger, Mike, et al.
Publicado: (2025)
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
por: Cheng, An-Chieh, et al.
Publicado: (2024)
por: Cheng, An-Chieh, et al.
Publicado: (2024)
Adaptive Sharpness-Aware Pruning for Robust Sparse Networks
por: Bair, Anna, et al.
Publicado: (2023)
por: Bair, Anna, et al.
Publicado: (2023)
Describe Anything: Detailed Localized Image and Video Captioning
por: Lian, Long, et al.
Publicado: (2025)
por: Lian, Long, et al.
Publicado: (2025)
Recursive Visual Programming
por: Ge, Jiaxin, et al.
Publicado: (2023)
por: Ge, Jiaxin, et al.
Publicado: (2023)
GSPN-2: Efficient Parallel Sequence Modeling
por: Wang, Hongjun, et al.
Publicado: (2025)
por: Wang, Hongjun, et al.
Publicado: (2025)
LongVILA: Scaling Long-Context Visual Language Models for Long Videos
por: Chen, Yukang, et al.
Publicado: (2024)
por: Chen, Yukang, et al.
Publicado: (2024)
NaVILA: Legged Robot Vision-Language-Action Model for Navigation
por: Cheng, An-Chieh, et al.
Publicado: (2024)
por: Cheng, An-Chieh, et al.
Publicado: (2024)
LLARVA: Vision-Action Instruction Tuning Enhances Robot Learning
por: Niu, Dantong, et al.
Publicado: (2024)
por: Niu, Dantong, et al.
Publicado: (2024)
Nemotron-CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training
por: Diao, Shizhe, et al.
Publicado: (2025)
por: Diao, Shizhe, et al.
Publicado: (2025)
Advancing Weight and Channel Sparsification with Enhanced Saliency
por: Sun, Xinglong, et al.
Publicado: (2025)
por: Sun, Xinglong, et al.
Publicado: (2025)
Universal Deep Research: Bring Your Own Model and Strategy
por: Belcak, Peter, et al.
Publicado: (2025)
por: Belcak, Peter, et al.
Publicado: (2025)
NVILA: Efficient Frontier Visual Language Models
por: Liu, Zhijian, et al.
Publicado: (2024)
por: Liu, Zhijian, et al.
Publicado: (2024)
LLM-grounded Diffusion: Enhancing Prompt Understanding of Text-to-Image Diffusion Models with Large Language Models
por: Lian, Long, et al.
Publicado: (2023)
por: Lian, Long, et al.
Publicado: (2023)
COIN: Control-Inpainting Diffusion Prior for Human and Camera Motion Estimation
por: Li, Jiefeng, et al.
Publicado: (2024)
por: Li, Jiefeng, et al.
Publicado: (2024)
BroRL: Scaling Reinforcement Learning via Broadened Exploration
por: Hu, Jian, et al.
Publicado: (2025)
por: Hu, Jian, et al.
Publicado: (2025)
A deeper look at depth pruning of LLMs
por: Siddiqui, Shoaib Ahmed, et al.
Publicado: (2024)
por: Siddiqui, Shoaib Ahmed, et al.
Publicado: (2024)
C-RADIOv4 (Tech Report)
por: Ranzinger, Mike, et al.
Publicado: (2026)
por: Ranzinger, Mike, et al.
Publicado: (2026)
TwinTURBO: Semi-Supervised Fine-Tuning of Foundation Models via Mutual Information Decompositions for Downstream Task and Latent Spaces
por: Quétant, Guillaume, et al.
Publicado: (2025)
por: Quétant, Guillaume, et al.
Publicado: (2025)
Humanoid Locomotion as Next Token Prediction
por: Radosavovic, Ilija, et al.
Publicado: (2024)
por: Radosavovic, Ilija, et al.
Publicado: (2024)
Ejemplares similares
-
Scaling RL to Long Videos
por: Chen, Yukang, et al.
Publicado: (2025) -
Attend Before Attention: Efficient and Scalable Video Understanding via Autoregressive Gazing
por: Shi, Baifeng, et al.
Publicado: (2026) -
FoundationMotion: Auto-Labeling and Reasoning about Spatial Movement in Videos
por: Gan, Yulu, et al.
Publicado: (2025) -
VILA$^2$: VILA Augmented VILA
por: Fang, Yunhao, et al.
Publicado: (2024) -
VILA: On Pre-training for Visual Language Models
por: Lin, Ji, et al.
Publicado: (2023)