AM-RADIO: Agglomerative Vision Foundation Model -- Reduce All Domains Into One
Fuente:
arXiv
Guardado en:
| Autores principales: | Ranzinger, Mike, Heinrich, Greg, Kautz, Jan, Molchanov, Pavlo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
RADIOv2.5: Improved Baselines for Agglomerative Vision Foundation Models
por: Heinrich, Greg, et al.
Publicado: (2024)
por: Heinrich, Greg, et al.
Publicado: (2024)
FeatSharp: Your Vision Model Features, Sharper
por: Ranzinger, Mike, et al.
Publicado: (2025)
por: Ranzinger, Mike, et al.
Publicado: (2025)
C-RADIOv4 (Tech Report)
por: Ranzinger, Mike, et al.
Publicado: (2026)
por: Ranzinger, Mike, et al.
Publicado: (2026)
PHI-S: Distribution Balancing for Label-Free Multi-Teacher Distillation
por: Ranzinger, Mike, et al.
Publicado: (2024)
por: Ranzinger, Mike, et al.
Publicado: (2024)
FasterViT: Fast Vision Transformers with Hierarchical Attention
por: Hatamizadeh, Ali, et al.
Publicado: (2023)
por: Hatamizadeh, Ali, et al.
Publicado: (2023)
TwinTURBO: Semi-Supervised Fine-Tuning of Foundation Models via Mutual Information Decompositions for Downstream Task and Latent Spaces
por: Quétant, Guillaume, et al.
Publicado: (2025)
por: Quétant, Guillaume, et al.
Publicado: (2025)
Scaling Vision Pre-Training to 4K Resolution
por: Shi, Baifeng, et al.
Publicado: (2025)
por: Shi, Baifeng, et al.
Publicado: (2025)
3D Aware Region Prompted Vision Language Model
por: Cheng, An-Chieh, et al.
Publicado: (2025)
por: Cheng, An-Chieh, et al.
Publicado: (2025)
One for All: Toward Unified Foundation Models for Earth Vision
por: Xiong, Zhitong, et al.
Publicado: (2024)
por: Xiong, Zhitong, et al.
Publicado: (2024)
All-in-One: Transferring Vision Foundation Models into Stereo Matching
por: Zhou, Jingyi, et al.
Publicado: (2024)
por: Zhou, Jingyi, et al.
Publicado: (2024)
ViR: Towards Efficient Vision Retention Backbones
por: Hatamizadeh, Ali, et al.
Publicado: (2023)
por: Hatamizadeh, Ali, et al.
Publicado: (2023)
LITA: Language Instructed Temporal-Localization Assistant
por: Huang, De-An, et al.
Publicado: (2024)
por: Huang, De-An, et al.
Publicado: (2024)
VILA: On Pre-training for Visual Language Models
por: Lin, Ji, et al.
Publicado: (2023)
por: Lin, Ji, et al.
Publicado: (2023)
Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders
por: Jiang, Yitong, et al.
Publicado: (2026)
por: Jiang, Yitong, et al.
Publicado: (2026)
MambaVision: A Hybrid Mamba-Transformer Vision Backbone
por: Hatamizadeh, Ali, et al.
Publicado: (2024)
por: Hatamizadeh, Ali, et al.
Publicado: (2024)
Grounded 3D-Aware Spatial Vision-Language Modeling
por: Cheng, An-Chieh, et al.
Publicado: (2026)
por: Cheng, An-Chieh, et al.
Publicado: (2026)
COIN: Control-Inpainting Diffusion Prior for Human and Camera Motion Estimation
por: Li, Jiefeng, et al.
Publicado: (2024)
por: Li, Jiefeng, et al.
Publicado: (2024)
Rank-Aware Agglomeration of Foundation Models for Immunohistochemistry Image Cell Counting
por: Huang, Zuqi, et al.
Publicado: (2025)
por: Huang, Zuqi, et al.
Publicado: (2025)
VILA$^2$: VILA Augmented VILA
por: Fang, Yunhao, et al.
Publicado: (2024)
por: Fang, Yunhao, et al.
Publicado: (2024)
Step Out and Seek Around: On Warm-Start Training with Incremental Data
por: Shen, Maying, et al.
Publicado: (2024)
por: Shen, Maying, et al.
Publicado: (2024)
FlexGS: Train Once, Deploy Everywhere with Many-in-One Flexible 3D Gaussian Splatting
por: Liu, Hengyu, et al.
Publicado: (2025)
por: Liu, Hengyu, et al.
Publicado: (2025)
MAD: Makeup All-in-One with Cross-Domain Diffusion Model
por: Ruan, Bo-Kai, et al.
Publicado: (2025)
por: Ruan, Bo-Kai, et al.
Publicado: (2025)
X-VILA: Cross-Modality Alignment for Large Language Model
por: Ye, Hanrong, et al.
Publicado: (2024)
por: Ye, Hanrong, et al.
Publicado: (2024)
Bootstrapping SparseFormers from Vision Foundation Models
por: Gao, Ziteng, et al.
Publicado: (2023)
por: Gao, Ziteng, et al.
Publicado: (2023)
SigLino: Efficient Multi-Teacher Distillation for Agglomerative Vision Foundation Models
por: Chaybouti, Sofian, et al.
Publicado: (2025)
por: Chaybouti, Sofian, et al.
Publicado: (2025)
Stateful Token Reduction for Long-Video Hybrid VLMs
por: Jiang, Jindong, et al.
Publicado: (2026)
por: Jiang, Jindong, et al.
Publicado: (2026)
Agglomerative Token Clustering
por: Haurum, Joakim Bruslund, et al.
Publicado: (2024)
por: Haurum, Joakim Bruslund, et al.
Publicado: (2024)
Exploring the Benefits of Vision Foundation Models for Unsupervised Domain Adaptation
por: Englert, Brunó B., et al.
Publicado: (2024)
por: Englert, Brunó B., et al.
Publicado: (2024)
Adaptive Sharpness-Aware Pruning for Robust Sparse Networks
por: Bair, Anna, et al.
Publicado: (2023)
por: Bair, Anna, et al.
Publicado: (2023)
Attend Before Attention: Efficient and Scalable Video Understanding via Autoregressive Gazing
por: Shi, Baifeng, et al.
Publicado: (2026)
por: Shi, Baifeng, et al.
Publicado: (2026)
VILA-M3: Enhancing Vision-Language Models with Medical Expert Knowledge
por: Nath, Vishwesh, et al.
Publicado: (2024)
por: Nath, Vishwesh, et al.
Publicado: (2024)
Benchmarking Vision Foundation Models for Domain-Generalizable Face Anti-Spoofing
por: Feng, Mika, et al.
Publicado: (2026)
por: Feng, Mika, et al.
Publicado: (2026)
One Language-Free Foundation Model Is Enough for Universal Vision Anomaly Detection
por: Gao, Bin-Bin, et al.
Publicado: (2026)
por: Gao, Bin-Bin, et al.
Publicado: (2026)
Efficient Domain-Adaptive Multi-Task Dense Prediction with Vision Foundation Models
por: Kang, Beomseok, et al.
Publicado: (2025)
por: Kang, Beomseok, et al.
Publicado: (2025)
Agglomerating Large Vision Encoders via Distillation for VFSS Segmentation
por: Zeng, Chengxi, et al.
Publicado: (2025)
por: Zeng, Chengxi, et al.
Publicado: (2025)
Learning Domain-Aware Task Prompt Representations for Multi-Domain All-in-One Image Restoration
por: Dong, Guanglu, et al.
Publicado: (2026)
por: Dong, Guanglu, et al.
Publicado: (2026)
Mamba as a Bridge: Where Vision Foundation Models Meet Vision Language Models for Domain-Generalized Semantic Segmentation
por: Zhang, Xin, et al.
Publicado: (2025)
por: Zhang, Xin, et al.
Publicado: (2025)
Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation
por: Lee, Junha, et al.
Publicado: (2025)
por: Lee, Junha, et al.
Publicado: (2025)
Stronger, Fewer, & Superior: Harnessing Vision Foundation Models for Domain Generalized Semantic Segmentation
por: Wei, Zhixiang, et al.
Publicado: (2023)
por: Wei, Zhixiang, et al.
Publicado: (2023)
nvTorchCam: An Open-source Library for Camera-Agnostic Differentiable Geometric Vision
por: Lichy, Daniel, et al.
Publicado: (2024)
por: Lichy, Daniel, et al.
Publicado: (2024)
Ejemplares similares
-
RADIOv2.5: Improved Baselines for Agglomerative Vision Foundation Models
por: Heinrich, Greg, et al.
Publicado: (2024) -
FeatSharp: Your Vision Model Features, Sharper
por: Ranzinger, Mike, et al.
Publicado: (2025) -
C-RADIOv4 (Tech Report)
por: Ranzinger, Mike, et al.
Publicado: (2026) -
PHI-S: Distribution Balancing for Label-Free Multi-Teacher Distillation
por: Ranzinger, Mike, et al.
Publicado: (2024) -
FasterViT: Fast Vision Transformers with Hierarchical Attention
por: Hatamizadeh, Ali, et al.
Publicado: (2023)