Rethinking Noise-Robust Training for Frozen Vision Foundation Models: A Cross-Dataset Benchmark with a Case Study of Small-Loss Failure
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Zitong, Wang, Haoyu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
HalluCXR: Benchmarking and Mitigating Hallucinations in Medical Vision-Language Models for Chest Radiograph Interpretation
por: Wang, Haoyu, et al.
Publicado: (2026)
por: Wang, Haoyu, et al.
Publicado: (2026)
Chain-of-Models Pre-Training: Rethinking Training Acceleration of Vision Foundation Models
por: Fan, Jiawei, et al.
Publicado: (2026)
por: Fan, Jiawei, et al.
Publicado: (2026)
Frozen Vision Transformers for Dense Prediction on Small Datasets: A Case Study in Arrow Localization
por: Shepherd, Maxwell
Publicado: (2026)
por: Shepherd, Maxwell
Publicado: (2026)
FrozenSeg: Harmonizing Frozen Foundation Models for Open-Vocabulary Segmentation
por: Chen, Xi, et al.
Publicado: (2024)
por: Chen, Xi, et al.
Publicado: (2024)
Benchmarking Deep Learning and Vision Foundation Models for Atypical vs. Normal Mitosis Classification with Cross-Dataset Evaluation
por: Banerjee, Sweta, et al.
Publicado: (2025)
por: Banerjee, Sweta, et al.
Publicado: (2025)
Beyond the Failures: Rethinking Foundation Models in Pathology
por: Tizhoosh, Hamid R.
Publicado: (2025)
por: Tizhoosh, Hamid R.
Publicado: (2025)
Frozen-DETR: Enhancing DETR with Image Understanding from Frozen Foundation Models
por: Fu, Shenghao, et al.
Publicado: (2024)
por: Fu, Shenghao, et al.
Publicado: (2024)
Depth-Wise Convolutions in Vision Transformers for Efficient Training on Small Datasets
por: Zhang, Tianxiao, et al.
Publicado: (2024)
por: Zhang, Tianxiao, et al.
Publicado: (2024)
Lens: Rethinking Training Efficiency for Foundational Text-to-Image Models
por: Chen, Dong, et al.
Publicado: (2026)
por: Chen, Dong, et al.
Publicado: (2026)
Continual Alignment for SAM: Rethinking Foundation Models for Medical Image Segmentation in Continual Learning
por: Wang, Jiayi, et al.
Publicado: (2025)
por: Wang, Jiayi, et al.
Publicado: (2025)
Vision Large Language Models Are Good Noise Handlers in Engagement Analysis
por: Vedernikov, Alexander, et al.
Publicado: (2025)
por: Vedernikov, Alexander, et al.
Publicado: (2025)
MedFM-Robust: Benchmarking Robustness of Medical Foundation Models
por: Cui, Xiangxiang, et al.
Publicado: (2026)
por: Cui, Xiangxiang, et al.
Publicado: (2026)
Asymmetric Masked Distillation for Pre-Training Small Foundation Models
por: Zhao, Zhiyu, et al.
Publicado: (2023)
por: Zhao, Zhiyu, et al.
Publicado: (2023)
Rethinking Generalizable Infrared Small Target Detection: A Real-scene Benchmark and Cross-view Representation Learning
por: Lu, Yahao, et al.
Publicado: (2025)
por: Lu, Yahao, et al.
Publicado: (2025)
Source-Free Domain Adaptation with Frozen Multimodal Foundation Model
por: Tang, Song, et al.
Publicado: (2023)
por: Tang, Song, et al.
Publicado: (2023)
Towards Small Object Editing: A Benchmark Dataset and A Training-Free Approach
por: Pan, Qihe, et al.
Publicado: (2024)
por: Pan, Qihe, et al.
Publicado: (2024)
GuiDINO: Rethinking Vision Foundation Model in Medical Image Segmentation
por: Liang, Zhuonan, et al.
Publicado: (2026)
por: Liang, Zhuonan, et al.
Publicado: (2026)
Rethinking Infrared Small Target Detection: A Foundation-Driven Efficient Paradigm
por: Yu, Chuang, et al.
Publicado: (2025)
por: Yu, Chuang, et al.
Publicado: (2025)
In-context Prompt Learning for Test-time Vision Recognition with Frozen Vision-language Model
por: Yin, Junhui, et al.
Publicado: (2024)
por: Yin, Junhui, et al.
Publicado: (2024)
REOBench: Benchmarking Robustness of Earth Observation Foundation Models
por: Li, Xiang, et al.
Publicado: (2025)
por: Li, Xiang, et al.
Publicado: (2025)
Robust Prompt Tuning for Vision-Language Models with Mild Semantic Noise
por: Gao, Yansheng, et al.
Publicado: (2025)
por: Gao, Yansheng, et al.
Publicado: (2025)
SOCO: Benchmarking Semantic Object Correspondence in Vision Foundation Models
por: Dünkel, Olaf, et al.
Publicado: (2026)
por: Dünkel, Olaf, et al.
Publicado: (2026)
Rethinking Facial Expression Recognition in the Era of Multimodal Large Language Models: Benchmark, Datasets, and Beyond
por: Zhang, Fan, et al.
Publicado: (2025)
por: Zhang, Fan, et al.
Publicado: (2025)
Failure Cases Are Better Learned But Boundary Says Sorry: Facilitating Smooth Perception Change for Accuracy-Robustness Trade-Off in Adversarial Training
por: Wang, Yanyun, et al.
Publicado: (2025)
por: Wang, Yanyun, et al.
Publicado: (2025)
Cracks in the Foundation: A Civil Infrastructure Dataset to Challenge Vision Foundation Models
por: Farronato, Nicola, et al.
Publicado: (2026)
por: Farronato, Nicola, et al.
Publicado: (2026)
Insect-Foundation: A Foundation Model and Large Multimodal Dataset for Vision-Language Insect Understanding
por: Truong, Thanh-Dat, et al.
Publicado: (2025)
por: Truong, Thanh-Dat, et al.
Publicado: (2025)
Benchmarking Vision Language Model Unlearning via Fictitious Facial Identity Dataset
por: Ma, Yingzi, et al.
Publicado: (2024)
por: Ma, Yingzi, et al.
Publicado: (2024)
Ivan-ISTD: Rethinking Cross-domain Heteroscedastic Noise Perturbations in Infrared Small Target Detection
por: Li, Yuehui, et al.
Publicado: (2025)
por: Li, Yuehui, et al.
Publicado: (2025)
Dimensional Coactivation for Representational Consistency in Frozen Vision Foundation Models
por: Saddik, Izaldein Al-Zyoud Abdulmotaleb El
Publicado: (2026)
por: Saddik, Izaldein Al-Zyoud Abdulmotaleb El
Publicado: (2026)
Towards Training-free Anomaly Detection with Vision and Language Foundation Models
por: Zhang, Jinjin, et al.
Publicado: (2025)
por: Zhang, Jinjin, et al.
Publicado: (2025)
Knowledge Transfer from Vision Foundation Models for Efficient Training of Small Task-specific Models
por: Vemulapalli, Raviteja, et al.
Publicado: (2023)
por: Vemulapalli, Raviteja, et al.
Publicado: (2023)
Towards Data-Efficient Video Pre-training with Frozen Image Foundation Models
por: Orlova, Svetlana, et al.
Publicado: (2026)
por: Orlova, Svetlana, et al.
Publicado: (2026)
Adapting Vision Foundation Models for Robust Cloud Segmentation in Remote Sensing Images
por: Zou, Xuechao, et al.
Publicado: (2024)
por: Zou, Xuechao, et al.
Publicado: (2024)
Benchmarking Vision Foundation Models for Input Monitoring in Autonomous Driving
por: Keser, Mert, et al.
Publicado: (2025)
por: Keser, Mert, et al.
Publicado: (2025)
Rethinking JEPA: Compute-Efficient Video SSL with Frozen Teachers
por: Li, Xianhang, et al.
Publicado: (2025)
por: Li, Xianhang, et al.
Publicado: (2025)
Seeing is Believing: Robust Vision-Guided Cross-Modal Prompt Learning under Label Noise
por: Geng, Zibin, et al.
Publicado: (2026)
por: Geng, Zibin, et al.
Publicado: (2026)
Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation
por: Wang, Xintong, et al.
Publicado: (2025)
por: Wang, Xintong, et al.
Publicado: (2025)
All-in-One: Transferring Vision Foundation Models into Stereo Matching
por: Zhou, Jingyi, et al.
Publicado: (2024)
por: Zhou, Jingyi, et al.
Publicado: (2024)
DDFAV: Remote Sensing Large Vision Language Models Dataset and Evaluation Benchmark
por: Li, Haodong, et al.
Publicado: (2024)
por: Li, Haodong, et al.
Publicado: (2024)
Training A Small Emotional Vision Language Model for Visual Art Comprehension
por: Zhang, Jing, et al.
Publicado: (2024)
por: Zhang, Jing, et al.
Publicado: (2024)
Ejemplares similares
-
HalluCXR: Benchmarking and Mitigating Hallucinations in Medical Vision-Language Models for Chest Radiograph Interpretation
por: Wang, Haoyu, et al.
Publicado: (2026) -
Chain-of-Models Pre-Training: Rethinking Training Acceleration of Vision Foundation Models
por: Fan, Jiawei, et al.
Publicado: (2026) -
Frozen Vision Transformers for Dense Prediction on Small Datasets: A Case Study in Arrow Localization
por: Shepherd, Maxwell
Publicado: (2026) -
FrozenSeg: Harmonizing Frozen Foundation Models for Open-Vocabulary Segmentation
por: Chen, Xi, et al.
Publicado: (2024) -
Benchmarking Deep Learning and Vision Foundation Models for Atypical vs. Normal Mitosis Classification with Cross-Dataset Evaluation
por: Banerjee, Sweta, et al.
Publicado: (2025)