FeatSharp: Your Vision Model Features, Sharper
Fuente:
arXiv
Saved in:
| Main Authors: | Ranzinger, Mike, Heinrich, Greg, Molchanov, Pavlo, Kautz, Jan, Catanzaro, Bryan, Tao, Andrew |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
AM-RADIO: Agglomerative Vision Foundation Model -- Reduce All Domains Into One
by: Ranzinger, Mike, et al.
Published: (2023)
by: Ranzinger, Mike, et al.
Published: (2023)
RADIOv2.5: Improved Baselines for Agglomerative Vision Foundation Models
by: Heinrich, Greg, et al.
Published: (2024)
by: Heinrich, Greg, et al.
Published: (2024)
C-RADIOv4 (Tech Report)
by: Ranzinger, Mike, et al.
Published: (2026)
by: Ranzinger, Mike, et al.
Published: (2026)
PHI-S: Distribution Balancing for Label-Free Multi-Teacher Distillation
by: Ranzinger, Mike, et al.
Published: (2024)
by: Ranzinger, Mike, et al.
Published: (2024)
FasterViT: Fast Vision Transformers with Hierarchical Attention
by: Hatamizadeh, Ali, et al.
Published: (2023)
by: Hatamizadeh, Ali, et al.
Published: (2023)
VILA: On Pre-training for Visual Language Models
by: Lin, Ji, et al.
Published: (2023)
by: Lin, Ji, et al.
Published: (2023)
Adaptive Sharpness-Aware Pruning for Robust Sparse Networks
by: Bair, Anna, et al.
Published: (2023)
by: Bair, Anna, et al.
Published: (2023)
Scaling Vision Pre-Training to 4K Resolution
by: Shi, Baifeng, et al.
Published: (2025)
by: Shi, Baifeng, et al.
Published: (2025)
3D Aware Region Prompted Vision Language Model
by: Cheng, An-Chieh, et al.
Published: (2025)
by: Cheng, An-Chieh, et al.
Published: (2025)
ViR: Towards Efficient Vision Retention Backbones
by: Hatamizadeh, Ali, et al.
Published: (2023)
by: Hatamizadeh, Ali, et al.
Published: (2023)
LITA: Language Instructed Temporal-Localization Assistant
by: Huang, De-An, et al.
Published: (2024)
by: Huang, De-An, et al.
Published: (2024)
MambaVision: A Hybrid Mamba-Transformer Vision Backbone
by: Hatamizadeh, Ali, et al.
Published: (2024)
by: Hatamizadeh, Ali, et al.
Published: (2024)
X-VILA: Cross-Modality Alignment for Large Language Model
by: Ye, Hanrong, et al.
Published: (2024)
by: Ye, Hanrong, et al.
Published: (2024)
Grounded 3D-Aware Spatial Vision-Language Modeling
by: Cheng, An-Chieh, et al.
Published: (2026)
by: Cheng, An-Chieh, et al.
Published: (2026)
AquaFeat: A Features-Based Image Enhancement Model for Underwater Object Detection
by: Silva, Emanuel C., et al.
Published: (2025)
by: Silva, Emanuel C., et al.
Published: (2025)
Stateful Token Reduction for Long-Video Hybrid VLMs
by: Jiang, Jindong, et al.
Published: (2026)
by: Jiang, Jindong, et al.
Published: (2026)
COIN: Control-Inpainting Diffusion Prior for Human and Camera Motion Estimation
by: Li, Jiefeng, et al.
Published: (2024)
by: Li, Jiefeng, et al.
Published: (2024)
TwinTURBO: Semi-Supervised Fine-Tuning of Foundation Models via Mutual Information Decompositions for Downstream Task and Latent Spaces
by: Quétant, Guillaume, et al.
Published: (2025)
by: Quétant, Guillaume, et al.
Published: (2025)
VILA$^2$: VILA Augmented VILA
by: Fang, Yunhao, et al.
Published: (2024)
by: Fang, Yunhao, et al.
Published: (2024)
LiftFeat: 3D Geometry-Aware Local Feature Matching
by: Liu, Yepeng, et al.
Published: (2025)
by: Liu, Yepeng, et al.
Published: (2025)
D-Feat Occlusions: Diffusion Features for Robustness to Partial Visual Occlusions in Object Recognition
by: Mallick, Rupayan, et al.
Published: (2025)
by: Mallick, Rupayan, et al.
Published: (2025)
NeRF-Feat: 6D Object Pose Estimation using Feature Rendering
by: Vutukur, Shishir Reddy, et al.
Published: (2024)
by: Vutukur, Shishir Reddy, et al.
Published: (2024)
MeshFeat: Multi-Resolution Features for Neural Fields on Meshes
by: Mahajan, Mihir, et al.
Published: (2024)
by: Mahajan, Mihir, et al.
Published: (2024)
AquaFeat+: an Underwater Vision Learning-based Enhancement Method for Object Detection, Classification, and Tracking
by: Silva, Emanuel da Costa, et al.
Published: (2026)
by: Silva, Emanuel da Costa, et al.
Published: (2026)
Step Out and Seek Around: On Warm-Start Training with Incremental Data
by: Shen, Maying, et al.
Published: (2024)
by: Shen, Maying, et al.
Published: (2024)
Eagle 2.5: Boosting Long-Context Post-Training for Frontier Vision-Language Models
by: Chen, Guo, et al.
Published: (2025)
by: Chen, Guo, et al.
Published: (2025)
Feat2GS: Probing Visual Foundation Models with Gaussian Splatting
by: Chen, Yue, et al.
Published: (2024)
by: Chen, Yue, et al.
Published: (2024)
Preserve Your Own Correlation: A Noise Prior for Video Diffusion Models
by: Ge, Songwei, et al.
Published: (2023)
by: Ge, Songwei, et al.
Published: (2023)
OMCAT: Omni Context Aware Transformer
by: Goel, Arushi, et al.
Published: (2024)
by: Goel, Arushi, et al.
Published: (2024)
FlowFeat: Pixel-Dense Embedding of Motion Profiles
by: Araslanov, Nikita, et al.
Published: (2025)
by: Araslanov, Nikita, et al.
Published: (2025)
OccFeat: Self-supervised Occupancy Feature Prediction for Pretraining BEV Segmentation Networks
by: Sirko-Galouchenko, Sophia, et al.
Published: (2024)
by: Sirko-Galouchenko, Sophia, et al.
Published: (2024)
Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders
by: Jiang, Yitong, et al.
Published: (2026)
by: Jiang, Yitong, et al.
Published: (2026)
Attend Before Attention: Efficient and Scalable Video Understanding via Autoregressive Gazing
by: Shi, Baifeng, et al.
Published: (2026)
by: Shi, Baifeng, et al.
Published: (2026)
VILA-M3: Enhancing Vision-Language Models with Medical Expert Knowledge
by: Nath, Vishwesh, et al.
Published: (2024)
by: Nath, Vishwesh, et al.
Published: (2024)
FedFeat+: A Robust Federated Learning Framework Through Federated Aggregation and Differentially Private Feature-Based Classifier Retraining
by: Gain, Mrityunjoy, et al.
Published: (2025)
by: Gain, Mrityunjoy, et al.
Published: (2025)
FeatUp: A Model-Agnostic Framework for Features at Any Resolution
by: Fu, Stephanie, et al.
Published: (2024)
by: Fu, Stephanie, et al.
Published: (2024)
RankFeat&RankWeight: Rank-1 Feature/Weight Removal for Out-of-distribution Detection
by: Song, Yue, et al.
Published: (2023)
by: Song, Yue, et al.
Published: (2023)
FeatDistill: A Feature Distillation Enhanced Multi-Expert Ensemble Framework for Robust AI-generated Image Detection
by: Tu, Zhilin, et al.
Published: (2026)
by: Tu, Zhilin, et al.
Published: (2026)
nvTorchCam: An Open-source Library for Camera-Agnostic Differentiable Geometric Vision
by: Lichy, Daniel, et al.
Published: (2024)
by: Lichy, Daniel, et al.
Published: (2024)
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
by: Cheng, An-Chieh, et al.
Published: (2024)
by: Cheng, An-Chieh, et al.
Published: (2024)
Similar Items
-
AM-RADIO: Agglomerative Vision Foundation Model -- Reduce All Domains Into One
by: Ranzinger, Mike, et al.
Published: (2023) -
RADIOv2.5: Improved Baselines for Agglomerative Vision Foundation Models
by: Heinrich, Greg, et al.
Published: (2024) -
C-RADIOv4 (Tech Report)
by: Ranzinger, Mike, et al.
Published: (2026) -
PHI-S: Distribution Balancing for Label-Free Multi-Teacher Distillation
by: Ranzinger, Mike, et al.
Published: (2024) -
FasterViT: Fast Vision Transformers with Hierarchical Attention
by: Hatamizadeh, Ali, et al.
Published: (2023)