Directional Gradient Projection for Robust Fine-Tuning of Foundation Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Huang, Chengyue, Tian, Junjiao, Maneechotesuwan, Brisa, Chopra, Shivang, Kira, Zsolt |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering
von: Huang, Chengyue, et al.
Veröffentlicht: (2025)
von: Huang, Chengyue, et al.
Veröffentlicht: (2025)
Rethinking Weight Decay for Robust Fine-Tuning of Foundation Models
von: Tian, Junjiao, et al.
Veröffentlicht: (2024)
von: Tian, Junjiao, et al.
Veröffentlicht: (2024)
The Geometry of Robustness: Optimizing Loss Landscape Curvature and Feature Manifold Alignment for Robust Finetuning of Vision-Language Models
von: Chopra, Shivang, et al.
Veröffentlicht: (2026)
von: Chopra, Shivang, et al.
Veröffentlicht: (2026)
Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models
von: Huang, Chengyue, et al.
Veröffentlicht: (2025)
von: Huang, Chengyue, et al.
Veröffentlicht: (2025)
Continual Adaptation of Vision Transformers for Federated Learning
von: Halbe, Shaunak, et al.
Veröffentlicht: (2023)
von: Halbe, Shaunak, et al.
Veröffentlicht: (2023)
MAPS: Preserving Vision-Language Representations via Module-Wise Proximity Scheduling for Better Vision-Language-Action Generalization
von: Huang, Chengyue, et al.
Veröffentlicht: (2025)
von: Huang, Chengyue, et al.
Veröffentlicht: (2025)
NAS-LoRA: Empowering Parameter-Efficient Fine-Tuning for Visual Foundation Models with Searchable Adaptation
von: Chen, Renqi, et al.
Veröffentlicht: (2025)
von: Chen, Renqi, et al.
Veröffentlicht: (2025)
Historical Test-time Prompt Tuning for Vision Foundation Models
von: Zhang, Jingyi, et al.
Veröffentlicht: (2024)
von: Zhang, Jingyi, et al.
Veröffentlicht: (2024)
LARGO: Low-Rank Regulated Gradient Projection for Robust Parameter Efficient Fine-Tuning
von: Zhang, Haotian, et al.
Veröffentlicht: (2025)
von: Zhang, Haotian, et al.
Veröffentlicht: (2025)
Transcending Domains through Text-to-Image Diffusion: A Source-Free Approach to Domain Adaptation
von: Chopra, Shivang, et al.
Veröffentlicht: (2023)
von: Chopra, Shivang, et al.
Veröffentlicht: (2023)
Spatio-Temporal Side Tuning Pre-trained Foundation Models for Video-based Pedestrian Attribute Recognition
von: Wang, Xiao, et al.
Veröffentlicht: (2024)
von: Wang, Xiao, et al.
Veröffentlicht: (2024)
From Pampas to Pixels: Fine-Tuning Diffusion Models for Gaúcho Heritage
von: Amadeus, Marcellus, et al.
Veröffentlicht: (2024)
von: Amadeus, Marcellus, et al.
Veröffentlicht: (2024)
Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models
von: Sun, Haoyuan, et al.
Veröffentlicht: (2025)
von: Sun, Haoyuan, et al.
Veröffentlicht: (2025)
Robin3D: Improving 3D Large Language Model via Robust Instruction Tuning
von: Kang, Weitai, et al.
Veröffentlicht: (2024)
von: Kang, Weitai, et al.
Veröffentlicht: (2024)
Toward Robust Multimodal Learning using Multimodal Foundational Models
von: Zhao, Xianbing, et al.
Veröffentlicht: (2024)
von: Zhao, Xianbing, et al.
Veröffentlicht: (2024)
Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models
von: Zhu, Wenhui, et al.
Veröffentlicht: (2025)
von: Zhu, Wenhui, et al.
Veröffentlicht: (2025)
Comprehensive Evaluation of Multimodal AI Models in Medical Imaging Diagnosis: From Data Augmentation to Preference-Based Comparison
von: Ruan, Cailian, et al.
Veröffentlicht: (2024)
von: Ruan, Cailian, et al.
Veröffentlicht: (2024)
Refining Text-to-Image Generation: Towards Accurate Training-Free Glyph-Enhanced Image Generation
von: Lakhanpal, Sanyam, et al.
Veröffentlicht: (2024)
von: Lakhanpal, Sanyam, et al.
Veröffentlicht: (2024)
Sim-CLIP: Unsupervised Siamese Adversarial Fine-Tuning for Robust and Semantically-Rich Vision-Language Models
von: Hossain, Md Zarif, et al.
Veröffentlicht: (2024)
von: Hossain, Md Zarif, et al.
Veröffentlicht: (2024)
Arabic-Nougat: Fine-Tuning Vision Transformers for Arabic OCR and Markdown Extraction
von: Rashad, Mohamed
Veröffentlicht: (2024)
von: Rashad, Mohamed
Veröffentlicht: (2024)
MindGYM: What Matters in Question Synthesis for Thinking-Centric Fine-Tuning?
von: Xu, Zhe, et al.
Veröffentlicht: (2025)
von: Xu, Zhe, et al.
Veröffentlicht: (2025)
LatteCLIP: Unsupervised CLIP Fine-Tuning via LMM-Synthetic Texts
von: Cao, Anh-Quan, et al.
Veröffentlicht: (2024)
von: Cao, Anh-Quan, et al.
Veröffentlicht: (2024)
Sim2real Image Translation Enables Viewpoint-Robust Policies from Fixed-Camera Datasets
von: Coholich, Jeremiah, et al.
Veröffentlicht: (2026)
von: Coholich, Jeremiah, et al.
Veröffentlicht: (2026)
Source-Free Domain Adaptation with Diffusion-Guided Source Data Generation
von: Chopra, Shivang, et al.
Veröffentlicht: (2024)
von: Chopra, Shivang, et al.
Veröffentlicht: (2024)
MATRIX: Multimodal Agent Tuning for Robust Tool-Use Reasoning
von: Ashraf, Tajamul, et al.
Veröffentlicht: (2025)
von: Ashraf, Tajamul, et al.
Veröffentlicht: (2025)
BoxTuning: Directly Injecting the Object Box for Multimodal Model Fine-Tuning
von: Qian, Zekun, et al.
Veröffentlicht: (2026)
von: Qian, Zekun, et al.
Veröffentlicht: (2026)
Closing the Gap: Data-Centric Fine-Tuning of Vision Language Models for the Standardized Exam Questions
von: Sert, Egemen, et al.
Veröffentlicht: (2025)
von: Sert, Egemen, et al.
Veröffentlicht: (2025)
Interfacing Foundation Models' Embeddings
von: Zou, Xueyan, et al.
Veröffentlicht: (2023)
von: Zou, Xueyan, et al.
Veröffentlicht: (2023)
Self-Play Fine-Tuning of Diffusion Models for Text-to-Image Generation
von: Yuan, Huizhuo, et al.
Veröffentlicht: (2024)
von: Yuan, Huizhuo, et al.
Veröffentlicht: (2024)
Pre-trained Text-to-Image Diffusion Models Are Versatile Representation Learners for Control
von: Gupta, Gunshi, et al.
Veröffentlicht: (2024)
von: Gupta, Gunshi, et al.
Veröffentlicht: (2024)
Diffuse, Attend, and Segment: Unsupervised Zero-Shot Segmentation using Stable Diffusion
von: Tian, Junjiao, et al.
Veröffentlicht: (2023)
von: Tian, Junjiao, et al.
Veröffentlicht: (2023)
MedHallTune: An Instruction-Tuning Benchmark for Mitigating Medical Hallucination in Vision-Language Models
von: Yan, Qiao, et al.
Veröffentlicht: (2025)
von: Yan, Qiao, et al.
Veröffentlicht: (2025)
FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding
von: Faure, Gueter Josmy, et al.
Veröffentlicht: (2026)
von: Faure, Gueter Josmy, et al.
Veröffentlicht: (2026)
Towards Calibrated Robust Fine-Tuning of Vision-Language Models
von: Oh, Changdae, et al.
Veröffentlicht: (2023)
von: Oh, Changdae, et al.
Veröffentlicht: (2023)
EPEE: Towards Efficient and Effective Foundation Models in Biomedicine
von: Zhan, Zaifu, et al.
Veröffentlicht: (2025)
von: Zhan, Zaifu, et al.
Veröffentlicht: (2025)
From Pixels to Insights: A Survey on Automatic Chart Understanding in the Era of Large Foundation Models
von: Huang, Kung-Hsiang, et al.
Veröffentlicht: (2024)
von: Huang, Kung-Hsiang, et al.
Veröffentlicht: (2024)
Imperfect Vision Encoders: Efficient and Robust Tuning for Vision-Language Models
von: Panos, Aristeidis, et al.
Veröffentlicht: (2024)
von: Panos, Aristeidis, et al.
Veröffentlicht: (2024)
LEGO Co-builder: Exploring Fine-Grained Vision-Language Modeling for Multimodal LEGO Assembly Assistants
von: Huang, Haochen, et al.
Veröffentlicht: (2025)
von: Huang, Haochen, et al.
Veröffentlicht: (2025)
Domain-Aware Fine-Tuning of Foundation Models
von: Kaplan, Ugur Ali, et al.
Veröffentlicht: (2024)
von: Kaplan, Ugur Ali, et al.
Veröffentlicht: (2024)
COAP: Memory-Efficient Training with Correlation-Aware Gradient Projection
von: Xiao, Jinqi, et al.
Veröffentlicht: (2024)
von: Xiao, Jinqi, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering
von: Huang, Chengyue, et al.
Veröffentlicht: (2025) -
Rethinking Weight Decay for Robust Fine-Tuning of Foundation Models
von: Tian, Junjiao, et al.
Veröffentlicht: (2024) -
The Geometry of Robustness: Optimizing Loss Landscape Curvature and Feature Manifold Alignment for Robust Finetuning of Vision-Language Models
von: Chopra, Shivang, et al.
Veröffentlicht: (2026) -
Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models
von: Huang, Chengyue, et al.
Veröffentlicht: (2025) -
Continual Adaptation of Vision Transformers for Federated Learning
von: Halbe, Shaunak, et al.
Veröffentlicht: (2023)