Robust-LLaVA: On the Effectiveness of Large-Scale Robust Image Encoders for Multi-modal Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Malik, Hashmat Shadab, Shamshad, Fahad, Naseer, Muzammal, Nandakumar, Karthik, Khan, Fahad, Khan, Salman |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Towards Evaluating the Robustness of Visual State Space Models
di: Malik, Hashmat Shadab, et al.
Pubblicazione: (2024)
di: Malik, Hashmat Shadab, et al.
Pubblicazione: (2024)
Hierarchical Self-Supervised Adversarial Training for Robust Vision Models in Histopathology
di: Malik, Hashmat Shadab, et al.
Pubblicazione: (2025)
di: Malik, Hashmat Shadab, et al.
Pubblicazione: (2025)
PromptSmooth: Certifying Robustness of Medical Vision-Language Models via Prompt Learning
di: Hussein, Noor, et al.
Pubblicazione: (2024)
di: Hussein, Noor, et al.
Pubblicazione: (2024)
Makeup-Guided Facial Privacy Protection via Untrained Neural Network Priors
di: Shamshad, Fahad, et al.
Pubblicazione: (2024)
di: Shamshad, Fahad, et al.
Pubblicazione: (2024)
ObjectCompose: Evaluating Resilience of Vision-Based Models on Object-to-Background Compositional Changes
di: Malik, Hashmat Shadab, et al.
Pubblicazione: (2024)
di: Malik, Hashmat Shadab, et al.
Pubblicazione: (2024)
On Evaluating Adversarial Robustness of Volumetric Medical Segmentation Models
di: Malik, Hashmat Shadab, et al.
Pubblicazione: (2024)
di: Malik, Hashmat Shadab, et al.
Pubblicazione: (2024)
STEREO: A Two-Stage Framework for Adversarially Robust Concept Erasing from Text-to-Image Diffusion Models
di: Srivatsan, Koushik, et al.
Pubblicazione: (2024)
di: Srivatsan, Koushik, et al.
Pubblicazione: (2024)
BAPLe: Backdoor Attacks on Medical Foundational Models using Prompt Learning
di: Hanif, Asif, et al.
Pubblicazione: (2024)
di: Hanif, Asif, et al.
Pubblicazione: (2024)
Language Guided Domain Generalized Medical Image Segmentation
di: Kunhimon, Shahina, et al.
Pubblicazione: (2024)
di: Kunhimon, Shahina, et al.
Pubblicazione: (2024)
Cross-Modal Self-Training: Aligning Images and Pointclouds to Learn Classification without Labels
di: Dharmasiri, Amaya, et al.
Pubblicazione: (2024)
di: Dharmasiri, Amaya, et al.
Pubblicazione: (2024)
How Good is my Histopathology Vision-Language Foundation Model? A Holistic Benchmark
di: Majzoub, Roba Al, et al.
Pubblicazione: (2025)
di: Majzoub, Roba Al, et al.
Pubblicazione: (2025)
MedContext: Learning Contextual Cues for Efficient Volumetric Medical Segmentation
di: Gani, Hanan, et al.
Pubblicazione: (2024)
di: Gani, Hanan, et al.
Pubblicazione: (2024)
Enhancing Novel Object Detection via Cooperative Foundational Models
di: Bharadwaj, Rohit, et al.
Pubblicazione: (2023)
di: Bharadwaj, Rohit, et al.
Pubblicazione: (2023)
UniMed-CLIP: Towards a Unified Image-Text Pretraining Paradigm for Diverse Medical Imaging Modalities
di: Khattak, Muhammad Uzair, et al.
Pubblicazione: (2024)
di: Khattak, Muhammad Uzair, et al.
Pubblicazione: (2024)
Learnable Weight Initialization for Volumetric Medical Image Segmentation
di: Kunhimon, Shahina, et al.
Pubblicazione: (2023)
di: Kunhimon, Shahina, et al.
Pubblicazione: (2023)
RAVEN: Erasing Invisible Watermarks via Novel View Synthesis
di: Shamshad, Fahad, et al.
Pubblicazione: (2026)
di: Shamshad, Fahad, et al.
Pubblicazione: (2026)
VURF: A General-purpose Reasoning and Self-refinement Framework for Video Understanding
di: Mahmood, Ahmad, et al.
Pubblicazione: (2024)
di: Mahmood, Ahmad, et al.
Pubblicazione: (2024)
VANE-Bench: Video Anomaly Evaluation Benchmark for Conversational LMMs
di: Bharadwaj, Rohit, et al.
Pubblicazione: (2024)
di: Bharadwaj, Rohit, et al.
Pubblicazione: (2024)
Calibration-Aware Prompt Learning for Medical Vision-Language Models
di: Basu, Abhishek, et al.
Pubblicazione: (2025)
di: Basu, Abhishek, et al.
Pubblicazione: (2025)
CDChat: A Large Multimodal Model for Remote Sensing Change Description
di: Noman, Mubashir, et al.
Pubblicazione: (2024)
di: Noman, Mubashir, et al.
Pubblicazione: (2024)
Rethinking Transformers Pre-training for Multi-Spectral Satellite Imagery
di: Noman, Mubashir, et al.
Pubblicazione: (2024)
di: Noman, Mubashir, et al.
Pubblicazione: (2024)
How Good is my Video LMM? Complex Video Reasoning and Robustness Evaluation Suite for Video-LMMs
di: Khattak, Muhammad Uzair, et al.
Pubblicazione: (2024)
di: Khattak, Muhammad Uzair, et al.
Pubblicazione: (2024)
Hierarchical Text-to-Vision Self Supervised Alignment for Improved Histopathology Representation Learning
di: Watawana, Hasindri, et al.
Pubblicazione: (2024)
di: Watawana, Hasindri, et al.
Pubblicazione: (2024)
Video-GroundingDINO: Towards Open-Vocabulary Spatio-Temporal Video Grounding
di: Wasim, Syed Talal, et al.
Pubblicazione: (2023)
di: Wasim, Syed Talal, et al.
Pubblicazione: (2023)
VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding
di: Maaz, Muhammad, et al.
Pubblicazione: (2024)
di: Maaz, Muhammad, et al.
Pubblicazione: (2024)
FaceAnonyMixer: Cancelable Faces via Identity Consistent Latent Space Mixing
di: Alam, Mohammed Talha, et al.
Pubblicazione: (2025)
di: Alam, Mohammed Talha, et al.
Pubblicazione: (2025)
CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning
di: Deria, Ankan, et al.
Pubblicazione: (2026)
di: Deria, Ankan, et al.
Pubblicazione: (2026)
AgriCLIP: Adapting CLIP for Agriculture and Livestock via Domain-Specialized Cross-Model Alignment
di: Nawaz, Umair, et al.
Pubblicazione: (2024)
di: Nawaz, Umair, et al.
Pubblicazione: (2024)
Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models
di: Maaz, Muhammad, et al.
Pubblicazione: (2023)
di: Maaz, Muhammad, et al.
Pubblicazione: (2023)
Multi-Granularity Language-Guided Training for Multi-Object Tracking
di: Li, Yuhao, et al.
Pubblicazione: (2024)
di: Li, Yuhao, et al.
Pubblicazione: (2024)
Composed Video Retrieval via Enriched Context and Discriminative Embeddings
di: Thawakar, Omkar, et al.
Pubblicazione: (2024)
di: Thawakar, Omkar, et al.
Pubblicazione: (2024)
Align Your Prompts: Test-Time Prompting with Distribution Alignment for Zero-Shot Generalization
di: Hassan, Jameel, et al.
Pubblicazione: (2023)
di: Hassan, Jameel, et al.
Pubblicazione: (2023)
Multi-modal Generation via Cross-Modal In-Context Learning
di: Kumar, Amandeep, et al.
Pubblicazione: (2024)
di: Kumar, Amandeep, et al.
Pubblicazione: (2024)
LLaVA-LE: Large Language-and-Vision Assistant for Lunar Exploration
di: Inal, Gokce, et al.
Pubblicazione: (2026)
di: Inal, Gokce, et al.
Pubblicazione: (2026)
u-LLaVA: Unifying Multi-Modal Tasks via Large Language Model
di: Xu, Jinjin, et al.
Pubblicazione: (2023)
di: Xu, Jinjin, et al.
Pubblicazione: (2023)
GeoPixel: Pixel Grounding Large Multimodal Model in Remote Sensing
di: Shabbir, Akashah, et al.
Pubblicazione: (2025)
di: Shabbir, Akashah, et al.
Pubblicazione: (2025)
WSI-LLaVA: A Multimodal Large Language Model for Whole Slide Image
di: Liang, Yuci, et al.
Pubblicazione: (2024)
di: Liang, Yuci, et al.
Pubblicazione: (2024)
LLaVA-RE: Binary Image-Text Relevancy Evaluation with Multimodal Large Language Model
di: Sun, Tao, et al.
Pubblicazione: (2025)
di: Sun, Tao, et al.
Pubblicazione: (2025)
LLaVA-Ultra: Large Chinese Language and Vision Assistant for Ultrasound
di: Guo, Xuechen, et al.
Pubblicazione: (2024)
di: Guo, Xuechen, et al.
Pubblicazione: (2024)
First-Place Solution to NeurIPS 2024 Invisible Watermark Removal Challenge
di: Shamshad, Fahad, et al.
Pubblicazione: (2025)
di: Shamshad, Fahad, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Towards Evaluating the Robustness of Visual State Space Models
di: Malik, Hashmat Shadab, et al.
Pubblicazione: (2024) -
Hierarchical Self-Supervised Adversarial Training for Robust Vision Models in Histopathology
di: Malik, Hashmat Shadab, et al.
Pubblicazione: (2025) -
PromptSmooth: Certifying Robustness of Medical Vision-Language Models via Prompt Learning
di: Hussein, Noor, et al.
Pubblicazione: (2024) -
Makeup-Guided Facial Privacy Protection via Untrained Neural Network Priors
di: Shamshad, Fahad, et al.
Pubblicazione: (2024) -
ObjectCompose: Evaluating Resilience of Vision-Based Models on Object-to-Background Compositional Changes
di: Malik, Hashmat Shadab, et al.
Pubblicazione: (2024)