Gespeichert in:
| Hauptverfasser: | Liu, Zhijian, Zhu, Ligeng, Shi, Baifeng, Zhang, Zhuoyang, Lou, Yuming, Yang, Shang, Xi, Haocheng, Cao, Shiyi, Gu, Yuxian, Li, Dacheng, Li, Xiuyu, Fang, Yunhao, Chen, Yukang, Hsieh, Cheng-Yu, Huang, De-An, Cheng, An-Chieh, Nath, Vishwesh, Hu, Jinyi, Liu, Sifei, Krishna, Ranjay, Xu, Daguang, Wang, Xiaolong, Molchanov, Pavlo, Kautz, Jan, Yin, Hongxu, Han, Song, Lu, Yao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | https://arxiv.org/abs/2412.04468 |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Scaling RL to Long Videos
von: Chen, Yukang, et al.
Veröffentlicht: (2025)
von: Chen, Yukang, et al.
Veröffentlicht: (2025)
3D Aware Region Prompted Vision Language Model
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2025)
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2025)
LongVILA: Scaling Long-Context Visual Language Models for Long Videos
von: Chen, Yukang, et al.
Veröffentlicht: (2024)
von: Chen, Yukang, et al.
Veröffentlicht: (2024)
Grounded 3D-Aware Spatial Vision-Language Modeling
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2026)
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2026)
Scaling Vision Pre-Training to 4K Resolution
von: Shi, Baifeng, et al.
Veröffentlicht: (2025)
von: Shi, Baifeng, et al.
Veröffentlicht: (2025)
VILA$^2$: VILA Augmented VILA
von: Fang, Yunhao, et al.
Veröffentlicht: (2024)
von: Fang, Yunhao, et al.
Veröffentlicht: (2024)
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2024)
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2024)
LITA: Language Instructed Temporal-Localization Assistant
von: Huang, De-An, et al.
Veröffentlicht: (2024)
von: Huang, De-An, et al.
Veröffentlicht: (2024)
Flextron: Many-in-One Flexible Large Language Model
von: Cai, Ruisi, et al.
Veröffentlicht: (2024)
von: Cai, Ruisi, et al.
Veröffentlicht: (2024)
Minifinetuning: Low-Data Generation Domain Adaptation through Corrective Self-Distillation
von: Belcak, Peter, et al.
Veröffentlicht: (2025)
von: Belcak, Peter, et al.
Veröffentlicht: (2025)
AM-RADIO: Agglomerative Vision Foundation Model -- Reduce All Domains Into One
von: Ranzinger, Mike, et al.
Veröffentlicht: (2023)
von: Ranzinger, Mike, et al.
Veröffentlicht: (2023)
OmniVinci: Enhancing Architecture and Data for Omni-Modal Understanding LLM
von: Ye, Hanrong, et al.
Veröffentlicht: (2025)
von: Ye, Hanrong, et al.
Veröffentlicht: (2025)
FasterViT: Fast Vision Transformers with Hierarchical Attention
von: Hatamizadeh, Ali, et al.
Veröffentlicht: (2023)
von: Hatamizadeh, Ali, et al.
Veröffentlicht: (2023)
VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation
von: Wu, Yecheng, et al.
Veröffentlicht: (2024)
von: Wu, Yecheng, et al.
Veröffentlicht: (2024)
RADIOv2.5: Improved Baselines for Agglomerative Vision Foundation Models
von: Heinrich, Greg, et al.
Veröffentlicht: (2024)
von: Heinrich, Greg, et al.
Veröffentlicht: (2024)
MaskLLM: Learnable Semi-Structured Sparsity for Large Language Models
von: Fang, Gongfan, et al.
Veröffentlicht: (2024)
von: Fang, Gongfan, et al.
Veröffentlicht: (2024)
Adaptive Sharpness-Aware Pruning for Robust Sparse Networks
von: Bair, Anna, et al.
Veröffentlicht: (2023)
von: Bair, Anna, et al.
Veröffentlicht: (2023)
Attend Before Attention: Efficient and Scalable Video Understanding via Autoregressive Gazing
von: Shi, Baifeng, et al.
Veröffentlicht: (2026)
von: Shi, Baifeng, et al.
Veröffentlicht: (2026)
NaVILA: Legged Robot Vision-Language-Action Model for Navigation
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2024)
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2024)
Step Out and Seek Around: On Warm-Start Training with Incremental Data
von: Shen, Maying, et al.
Veröffentlicht: (2024)
von: Shen, Maying, et al.
Veröffentlicht: (2024)
Universal Deep Research: Bring Your Own Model and Strategy
von: Belcak, Peter, et al.
Veröffentlicht: (2025)
von: Belcak, Peter, et al.
Veröffentlicht: (2025)
VILA: On Pre-training for Visual Language Models
von: Lin, Ji, et al.
Veröffentlicht: (2023)
von: Lin, Ji, et al.
Veröffentlicht: (2023)
Advancing Weight and Channel Sparsification with Enhanced Saliency
von: Sun, Xinglong, et al.
Veröffentlicht: (2025)
von: Sun, Xinglong, et al.
Veröffentlicht: (2025)
FeatSharp: Your Vision Model Features, Sharper
von: Ranzinger, Mike, et al.
Veröffentlicht: (2025)
von: Ranzinger, Mike, et al.
Veröffentlicht: (2025)
GSPN-2: Efficient Parallel Sequence Modeling
von: Wang, Hongjun, et al.
Veröffentlicht: (2025)
von: Wang, Hongjun, et al.
Veröffentlicht: (2025)
WorldModelBench: Judging Video Generation Models As World Models
von: Li, Dacheng, et al.
Veröffentlicht: (2025)
von: Li, Dacheng, et al.
Veröffentlicht: (2025)
VILA-M3: Enhancing Vision-Language Models with Medical Expert Knowledge
von: Nath, Vishwesh, et al.
Veröffentlicht: (2024)
von: Nath, Vishwesh, et al.
Veröffentlicht: (2024)
X-VILA: Cross-Modality Alignment for Large Language Model
von: Ye, Hanrong, et al.
Veröffentlicht: (2024)
von: Ye, Hanrong, et al.
Veröffentlicht: (2024)
Fast-dVLM: Efficient Block-Diffusion VLM via Direct Conversion from Autoregressive VLM
von: Wu, Chengyue, et al.
Veröffentlicht: (2026)
von: Wu, Chengyue, et al.
Veröffentlicht: (2026)
TwinTURBO: Semi-Supervised Fine-Tuning of Foundation Models via Mutual Information Decompositions for Downstream Task and Latent Spaces
von: Quétant, Guillaume, et al.
Veröffentlicht: (2025)
von: Quétant, Guillaume, et al.
Veröffentlicht: (2025)
Reasoning Visual Language Model for Chest X-Ray Analysis
von: Myronenko, Andriy, et al.
Veröffentlicht: (2025)
von: Myronenko, Andriy, et al.
Veröffentlicht: (2025)
DoRA: Weight-Decomposed Low-Rank Adaptation
von: Liu, Shih-Yang, et al.
Veröffentlicht: (2024)
von: Liu, Shih-Yang, et al.
Veröffentlicht: (2024)
FoundationMotion: Auto-Labeling and Reasoning about Spatial Movement in Videos
von: Gan, Yulu, et al.
Veröffentlicht: (2025)
von: Gan, Yulu, et al.
Veröffentlicht: (2025)
DLER: Doing Length pEnalty Right - Incentivizing More Intelligence per Token via Reinforcement Learning
von: Liu, Shih-Yang, et al.
Veröffentlicht: (2025)
von: Liu, Shih-Yang, et al.
Veröffentlicht: (2025)
A deeper look at depth pruning of LLMs
von: Siddiqui, Shoaib Ahmed, et al.
Veröffentlicht: (2024)
von: Siddiqui, Shoaib Ahmed, et al.
Veröffentlicht: (2024)
C-RADIOv4 (Tech Report)
von: Ranzinger, Mike, et al.
Veröffentlicht: (2026)
von: Ranzinger, Mike, et al.
Veröffentlicht: (2026)
EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos
von: Yang, Ruihan, et al.
Veröffentlicht: (2025)
von: Yang, Ruihan, et al.
Veröffentlicht: (2025)
Long-Horizon Manipulation via Trace-Conditioned VLA Planning
von: Liu, Isabella, et al.
Veröffentlicht: (2026)
von: Liu, Isabella, et al.
Veröffentlicht: (2026)
A Short Review and Evaluation of SAM2's Performance in 3D CT Image Segmentation
von: He, Yufan, et al.
Veröffentlicht: (2024)
von: He, Yufan, et al.
Veröffentlicht: (2024)
COIN: Control-Inpainting Diffusion Prior for Human and Camera Motion Estimation
von: Li, Jiefeng, et al.
Veröffentlicht: (2024)
von: Li, Jiefeng, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Scaling RL to Long Videos
von: Chen, Yukang, et al.
Veröffentlicht: (2025) -
3D Aware Region Prompted Vision Language Model
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2025) -
LongVILA: Scaling Long-Context Visual Language Models for Long Videos
von: Chen, Yukang, et al.
Veröffentlicht: (2024) -
Grounded 3D-Aware Spatial Vision-Language Modeling
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2026) -
Scaling Vision Pre-Training to 4K Resolution
von: Shi, Baifeng, et al.
Veröffentlicht: (2025)