CanViT: Toward Active-Vision Foundation Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Berreby, Yohaï-Eliel, Du, Sabrina, Durand, Audrey, Krishna, B. Suresh |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Random Initialization of Gated Sparse Adapters
por: Retault, Vi, et al.
Publicado: (2025)
por: Retault, Vi, et al.
Publicado: (2025)
ViLReF: An Expert Knowledge Enabled Vision-Language Retinal Foundation Model
por: Yang, Shengzhu, et al.
Publicado: (2024)
por: Yang, Shengzhu, et al.
Publicado: (2024)
ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads
por: Li, Yifan, et al.
Publicado: (2025)
por: Li, Yifan, et al.
Publicado: (2025)
IML-ViT: Benchmarking Image Manipulation Localization by Vision Transformer
por: Ma, Xiaochen, et al.
Publicado: (2023)
por: Ma, Xiaochen, et al.
Publicado: (2023)
ViThinker: Active Vision-Language Reasoning via Dynamic Perceptual Querying
por: You, Weihang, et al.
Publicado: (2026)
por: You, Weihang, et al.
Publicado: (2026)
FairViT: Fair Vision Transformer via Adaptive Masking
por: Tian, Bowei, et al.
Publicado: (2024)
por: Tian, Bowei, et al.
Publicado: (2024)
ViTamin: Designing Scalable Vision Models in the Vision-Language Era
por: Chen, Jieneng, et al.
Publicado: (2024)
por: Chen, Jieneng, et al.
Publicado: (2024)
ViPOcc: Leveraging Visual Priors from Vision Foundation Models for Single-View 3D Occupancy Prediction
por: Feng, Yi, et al.
Publicado: (2024)
por: Feng, Yi, et al.
Publicado: (2024)
Towards Vision-Language Geo-Foundation Model: A Survey
por: Zhou, Yue, et al.
Publicado: (2024)
por: Zhou, Yue, et al.
Publicado: (2024)
One for All: Toward Unified Foundation Models for Earth Vision
por: Xiong, Zhitong, et al.
Publicado: (2024)
por: Xiong, Zhitong, et al.
Publicado: (2024)
Towards a Unified Copernicus Foundation Model for Earth Vision
por: Wang, Yi, et al.
Publicado: (2025)
por: Wang, Yi, et al.
Publicado: (2025)
ConsiStyle: Style Diversity in Training-Free Consistent T2I Generation
por: Mazuz, Yohai, et al.
Publicado: (2025)
por: Mazuz, Yohai, et al.
Publicado: (2025)
F-ViTA: Foundation Model Guided Visible to Thermal Translation
por: Paranjape, Jay N., et al.
Publicado: (2025)
por: Paranjape, Jay N., et al.
Publicado: (2025)
Where to Look: Can Foundation Models Reach a Target Viewpoint Through Active Exploration?
por: Li, Liyang, et al.
Publicado: (2026)
por: Li, Liyang, et al.
Publicado: (2026)
Revisiting Active Learning in the Era of Vision Foundation Models
por: Gupte, Sanket Rajan, et al.
Publicado: (2024)
por: Gupte, Sanket Rajan, et al.
Publicado: (2024)
Towards Training-free Anomaly Detection with Vision and Language Foundation Models
por: Zhang, Jinjin, et al.
Publicado: (2025)
por: Zhang, Jinjin, et al.
Publicado: (2025)
Towards Foundation Models for 3D Vision: How Close Are We?
por: Zuo, Yiming, et al.
Publicado: (2024)
por: Zuo, Yiming, et al.
Publicado: (2024)
ViTime: Foundation Model for Time Series Forecasting Powered by Vision Intelligence
por: Yang, Luoxiao, et al.
Publicado: (2024)
por: Yang, Luoxiao, et al.
Publicado: (2024)
ViT-5: Vision Transformers for The Mid-2020s
por: Wang, Feng, et al.
Publicado: (2026)
por: Wang, Feng, et al.
Publicado: (2026)
FTerViT: Fully Ternary Vision Transformer
por: Ruciński, Szymon, et al.
Publicado: (2026)
por: Ruciński, Szymon, et al.
Publicado: (2026)
LocalViT: Analyzing Locality in Vision Transformers
por: Li, Yawei, et al.
Publicado: (2021)
por: Li, Yawei, et al.
Publicado: (2021)
ViTAR: Vision Transformer with Any Resolution
por: Fan, Qihang, et al.
Publicado: (2024)
por: Fan, Qihang, et al.
Publicado: (2024)
ViSpec: Accelerating Vision-Language Models with Vision-Aware Speculative Decoding
por: Kang, Jialiang, et al.
Publicado: (2025)
por: Kang, Jialiang, et al.
Publicado: (2025)
Towards Unbiased Source-Free Object Detection via Vision Foundation Models
por: Cai, Zhi, et al.
Publicado: (2026)
por: Cai, Zhi, et al.
Publicado: (2026)
Towards Depth Foundation Model: Recent Trends in Vision-Based Depth Estimation
por: Xu, Zhen, et al.
Publicado: (2025)
por: Xu, Zhen, et al.
Publicado: (2025)
Towards Generalist Intelligence in Dentistry: Vision Foundation Models for Oral and Maxillofacial Radiology
por: Huang, Xinrui, et al.
Publicado: (2025)
por: Huang, Xinrui, et al.
Publicado: (2025)
DopQ-ViT: Towards Distribution-Friendly and Outlier-Aware Post-Training Quantization for Vision Transformers
por: Yang, Lianwei, et al.
Publicado: (2024)
por: Yang, Lianwei, et al.
Publicado: (2024)
ViCLIP-OT: The First Foundation Vision-Language Model for Vietnamese Image-Text Retrieval with Optimal Transport
por: Tran, Quoc-Khang, et al.
Publicado: (2026)
por: Tran, Quoc-Khang, et al.
Publicado: (2026)
LeMeViT: Efficient Vision Transformer with Learnable Meta Tokens for Remote Sensing Image Interpretation
por: Jiang, Wentao, et al.
Publicado: (2024)
por: Jiang, Wentao, et al.
Publicado: (2024)
Articulate-Anything: Automatic Modeling of Articulated Objects via a Vision-Language Foundation Model
por: Le, Long, et al.
Publicado: (2024)
por: Le, Long, et al.
Publicado: (2024)
ViM-UNet: Vision Mamba for Biomedical Segmentation
por: Archit, Anwai, et al.
Publicado: (2024)
por: Archit, Anwai, et al.
Publicado: (2024)
ViGEO: an Assessment of Vision GNNs in Earth Observation
por: Colomba, Luca, et al.
Publicado: (2024)
por: Colomba, Luca, et al.
Publicado: (2024)
ViT$^3$: Unlocking Test-Time Training in Vision
por: Han, Dongchen, et al.
Publicado: (2025)
por: Han, Dongchen, et al.
Publicado: (2025)
ViDAS: Vision-based Danger Assessment and Scoring
por: Gupta, Pranav, et al.
Publicado: (2024)
por: Gupta, Pranav, et al.
Publicado: (2024)
ViTOC: Vision Transformer and Object-aware Captioner
por: Huang, Feiyang
Publicado: (2024)
por: Huang, Feiyang
Publicado: (2024)
ACC-ViT : Atrous Convolution's Comeback in Vision Transformers
por: Ibtehaz, Nabil, et al.
Publicado: (2024)
por: Ibtehaz, Nabil, et al.
Publicado: (2024)
EA-ViT: Efficient Adaptation for Elastic Vision Transformer
por: Zhu, Chen, et al.
Publicado: (2025)
por: Zhu, Chen, et al.
Publicado: (2025)
ViTCN: Vision Transformer Contrastive Network For Reasoning
por: Song, Bo, et al.
Publicado: (2024)
por: Song, Bo, et al.
Publicado: (2024)
Can Foundation Models Predict Fitness for Duty?
por: Tapia, Juan E., et al.
Publicado: (2025)
por: Tapia, Juan E., et al.
Publicado: (2025)
Castling-ViT: Compressing Self-Attention via Switching Towards Linear-Angular Attention at Vision Transformer Inference
por: You, Haoran, et al.
Publicado: (2022)
por: You, Haoran, et al.
Publicado: (2022)
Ejemplares similares
-
Random Initialization of Gated Sparse Adapters
por: Retault, Vi, et al.
Publicado: (2025) -
ViLReF: An Expert Knowledge Enabled Vision-Language Retinal Foundation Model
por: Yang, Shengzhu, et al.
Publicado: (2024) -
ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads
por: Li, Yifan, et al.
Publicado: (2025) -
IML-ViT: Benchmarking Image Manipulation Localization by Vision Transformer
por: Ma, Xiaochen, et al.
Publicado: (2023) -
ViThinker: Active Vision-Language Reasoning via Dynamic Perceptual Querying
por: You, Weihang, et al.
Publicado: (2026)