Rethinking Noise-Robust Training for Frozen Vision Foundation Models: A Cross-Dataset Benchmark with a Case Study of Small-Loss Failure
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Zitong, Wang, Haoyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
HalluCXR: Benchmarking and Mitigating Hallucinations in Medical Vision-Language Models for Chest Radiograph Interpretation
di: Wang, Haoyu, et al.
Pubblicazione: (2026)
di: Wang, Haoyu, et al.
Pubblicazione: (2026)
Chain-of-Models Pre-Training: Rethinking Training Acceleration of Vision Foundation Models
di: Fan, Jiawei, et al.
Pubblicazione: (2026)
di: Fan, Jiawei, et al.
Pubblicazione: (2026)
Frozen Vision Transformers for Dense Prediction on Small Datasets: A Case Study in Arrow Localization
di: Shepherd, Maxwell
Pubblicazione: (2026)
di: Shepherd, Maxwell
Pubblicazione: (2026)
FrozenSeg: Harmonizing Frozen Foundation Models for Open-Vocabulary Segmentation
di: Chen, Xi, et al.
Pubblicazione: (2024)
di: Chen, Xi, et al.
Pubblicazione: (2024)
Benchmarking Deep Learning and Vision Foundation Models for Atypical vs. Normal Mitosis Classification with Cross-Dataset Evaluation
di: Banerjee, Sweta, et al.
Pubblicazione: (2025)
di: Banerjee, Sweta, et al.
Pubblicazione: (2025)
Beyond the Failures: Rethinking Foundation Models in Pathology
di: Tizhoosh, Hamid R.
Pubblicazione: (2025)
di: Tizhoosh, Hamid R.
Pubblicazione: (2025)
Frozen-DETR: Enhancing DETR with Image Understanding from Frozen Foundation Models
di: Fu, Shenghao, et al.
Pubblicazione: (2024)
di: Fu, Shenghao, et al.
Pubblicazione: (2024)
Depth-Wise Convolutions in Vision Transformers for Efficient Training on Small Datasets
di: Zhang, Tianxiao, et al.
Pubblicazione: (2024)
di: Zhang, Tianxiao, et al.
Pubblicazione: (2024)
Lens: Rethinking Training Efficiency for Foundational Text-to-Image Models
di: Chen, Dong, et al.
Pubblicazione: (2026)
di: Chen, Dong, et al.
Pubblicazione: (2026)
Continual Alignment for SAM: Rethinking Foundation Models for Medical Image Segmentation in Continual Learning
di: Wang, Jiayi, et al.
Pubblicazione: (2025)
di: Wang, Jiayi, et al.
Pubblicazione: (2025)
Vision Large Language Models Are Good Noise Handlers in Engagement Analysis
di: Vedernikov, Alexander, et al.
Pubblicazione: (2025)
di: Vedernikov, Alexander, et al.
Pubblicazione: (2025)
MedFM-Robust: Benchmarking Robustness of Medical Foundation Models
di: Cui, Xiangxiang, et al.
Pubblicazione: (2026)
di: Cui, Xiangxiang, et al.
Pubblicazione: (2026)
Asymmetric Masked Distillation for Pre-Training Small Foundation Models
di: Zhao, Zhiyu, et al.
Pubblicazione: (2023)
di: Zhao, Zhiyu, et al.
Pubblicazione: (2023)
Rethinking Generalizable Infrared Small Target Detection: A Real-scene Benchmark and Cross-view Representation Learning
di: Lu, Yahao, et al.
Pubblicazione: (2025)
di: Lu, Yahao, et al.
Pubblicazione: (2025)
Source-Free Domain Adaptation with Frozen Multimodal Foundation Model
di: Tang, Song, et al.
Pubblicazione: (2023)
di: Tang, Song, et al.
Pubblicazione: (2023)
Towards Small Object Editing: A Benchmark Dataset and A Training-Free Approach
di: Pan, Qihe, et al.
Pubblicazione: (2024)
di: Pan, Qihe, et al.
Pubblicazione: (2024)
GuiDINO: Rethinking Vision Foundation Model in Medical Image Segmentation
di: Liang, Zhuonan, et al.
Pubblicazione: (2026)
di: Liang, Zhuonan, et al.
Pubblicazione: (2026)
Rethinking Infrared Small Target Detection: A Foundation-Driven Efficient Paradigm
di: Yu, Chuang, et al.
Pubblicazione: (2025)
di: Yu, Chuang, et al.
Pubblicazione: (2025)
In-context Prompt Learning for Test-time Vision Recognition with Frozen Vision-language Model
di: Yin, Junhui, et al.
Pubblicazione: (2024)
di: Yin, Junhui, et al.
Pubblicazione: (2024)
REOBench: Benchmarking Robustness of Earth Observation Foundation Models
di: Li, Xiang, et al.
Pubblicazione: (2025)
di: Li, Xiang, et al.
Pubblicazione: (2025)
Robust Prompt Tuning for Vision-Language Models with Mild Semantic Noise
di: Gao, Yansheng, et al.
Pubblicazione: (2025)
di: Gao, Yansheng, et al.
Pubblicazione: (2025)
SOCO: Benchmarking Semantic Object Correspondence in Vision Foundation Models
di: Dünkel, Olaf, et al.
Pubblicazione: (2026)
di: Dünkel, Olaf, et al.
Pubblicazione: (2026)
Rethinking Facial Expression Recognition in the Era of Multimodal Large Language Models: Benchmark, Datasets, and Beyond
di: Zhang, Fan, et al.
Pubblicazione: (2025)
di: Zhang, Fan, et al.
Pubblicazione: (2025)
Failure Cases Are Better Learned But Boundary Says Sorry: Facilitating Smooth Perception Change for Accuracy-Robustness Trade-Off in Adversarial Training
di: Wang, Yanyun, et al.
Pubblicazione: (2025)
di: Wang, Yanyun, et al.
Pubblicazione: (2025)
Cracks in the Foundation: A Civil Infrastructure Dataset to Challenge Vision Foundation Models
di: Farronato, Nicola, et al.
Pubblicazione: (2026)
di: Farronato, Nicola, et al.
Pubblicazione: (2026)
Insect-Foundation: A Foundation Model and Large Multimodal Dataset for Vision-Language Insect Understanding
di: Truong, Thanh-Dat, et al.
Pubblicazione: (2025)
di: Truong, Thanh-Dat, et al.
Pubblicazione: (2025)
Benchmarking Vision Language Model Unlearning via Fictitious Facial Identity Dataset
di: Ma, Yingzi, et al.
Pubblicazione: (2024)
di: Ma, Yingzi, et al.
Pubblicazione: (2024)
Ivan-ISTD: Rethinking Cross-domain Heteroscedastic Noise Perturbations in Infrared Small Target Detection
di: Li, Yuehui, et al.
Pubblicazione: (2025)
di: Li, Yuehui, et al.
Pubblicazione: (2025)
Dimensional Coactivation for Representational Consistency in Frozen Vision Foundation Models
di: Saddik, Izaldein Al-Zyoud Abdulmotaleb El
Pubblicazione: (2026)
di: Saddik, Izaldein Al-Zyoud Abdulmotaleb El
Pubblicazione: (2026)
Towards Training-free Anomaly Detection with Vision and Language Foundation Models
di: Zhang, Jinjin, et al.
Pubblicazione: (2025)
di: Zhang, Jinjin, et al.
Pubblicazione: (2025)
Knowledge Transfer from Vision Foundation Models for Efficient Training of Small Task-specific Models
di: Vemulapalli, Raviteja, et al.
Pubblicazione: (2023)
di: Vemulapalli, Raviteja, et al.
Pubblicazione: (2023)
Towards Data-Efficient Video Pre-training with Frozen Image Foundation Models
di: Orlova, Svetlana, et al.
Pubblicazione: (2026)
di: Orlova, Svetlana, et al.
Pubblicazione: (2026)
Adapting Vision Foundation Models for Robust Cloud Segmentation in Remote Sensing Images
di: Zou, Xuechao, et al.
Pubblicazione: (2024)
di: Zou, Xuechao, et al.
Pubblicazione: (2024)
Benchmarking Vision Foundation Models for Input Monitoring in Autonomous Driving
di: Keser, Mert, et al.
Pubblicazione: (2025)
di: Keser, Mert, et al.
Pubblicazione: (2025)
Rethinking JEPA: Compute-Efficient Video SSL with Frozen Teachers
di: Li, Xianhang, et al.
Pubblicazione: (2025)
di: Li, Xianhang, et al.
Pubblicazione: (2025)
Seeing is Believing: Robust Vision-Guided Cross-Modal Prompt Learning under Label Noise
di: Geng, Zibin, et al.
Pubblicazione: (2026)
di: Geng, Zibin, et al.
Pubblicazione: (2026)
Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation
di: Wang, Xintong, et al.
Pubblicazione: (2025)
di: Wang, Xintong, et al.
Pubblicazione: (2025)
All-in-One: Transferring Vision Foundation Models into Stereo Matching
di: Zhou, Jingyi, et al.
Pubblicazione: (2024)
di: Zhou, Jingyi, et al.
Pubblicazione: (2024)
DDFAV: Remote Sensing Large Vision Language Models Dataset and Evaluation Benchmark
di: Li, Haodong, et al.
Pubblicazione: (2024)
di: Li, Haodong, et al.
Pubblicazione: (2024)
Training A Small Emotional Vision Language Model for Visual Art Comprehension
di: Zhang, Jing, et al.
Pubblicazione: (2024)
di: Zhang, Jing, et al.
Pubblicazione: (2024)
Documenti analoghi
-
HalluCXR: Benchmarking and Mitigating Hallucinations in Medical Vision-Language Models for Chest Radiograph Interpretation
di: Wang, Haoyu, et al.
Pubblicazione: (2026) -
Chain-of-Models Pre-Training: Rethinking Training Acceleration of Vision Foundation Models
di: Fan, Jiawei, et al.
Pubblicazione: (2026) -
Frozen Vision Transformers for Dense Prediction on Small Datasets: A Case Study in Arrow Localization
di: Shepherd, Maxwell
Pubblicazione: (2026) -
FrozenSeg: Harmonizing Frozen Foundation Models for Open-Vocabulary Segmentation
di: Chen, Xi, et al.
Pubblicazione: (2024) -
Benchmarking Deep Learning and Vision Foundation Models for Atypical vs. Normal Mitosis Classification with Cross-Dataset Evaluation
di: Banerjee, Sweta, et al.
Pubblicazione: (2025)