Leveraging Vision-Language Models for Improving Domain Generalization in Image Classification
Fuente:
arXiv
Guardado en:
| Autores principales: | Addepalli, Sravanti, Asokan, Ashish Ramayee, Sharma, Lakshay, Babu, R. Venkatesh |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ProFeAT: Projected Feature Adversarial Training for Self-Supervised Learning of Robust Representations
por: Addepalli, Sravanti, et al.
Publicado: (2024)
por: Addepalli, Sravanti, et al.
Publicado: (2024)
DeiT-LT Distillation Strikes Back for Vision Transformer Training on Long-Tailed Datasets
por: Rangwani, Harsh, et al.
Publicado: (2024)
por: Rangwani, Harsh, et al.
Publicado: (2024)
Do Vision Language Models Need to Process Image Tokens?
por: Ghosh, Sambit, et al.
Publicado: (2026)
por: Ghosh, Sambit, et al.
Publicado: (2026)
Harnessing Diffusion-Generated Synthetic Images for Fair Image Classification
por: Basu, Abhipsa, et al.
Publicado: (2025)
por: Basu, Abhipsa, et al.
Publicado: (2025)
Compass Control: Multi Object Orientation Control for Text-to-Image Generation
por: Parihar, Rishubh, et al.
Publicado: (2025)
por: Parihar, Rishubh, et al.
Publicado: (2025)
Landsat-Bench: Datasets and Benchmarks for Landsat Foundation Models
por: Corley, Isaac, et al.
Publicado: (2025)
por: Corley, Isaac, et al.
Publicado: (2025)
F4-ITS: Fine-grained Feature Fusion for Food Image-Text Search
por: Asokan, Raghul
Publicado: (2025)
por: Asokan, Raghul
Publicado: (2025)
SpectraIrisPAD: Leveraging Vision Foundation Models for Spectrally Conditioned Multispectral Iris Presentation Attack Detection
por: Ramachandra, Raghavendra, et al.
Publicado: (2025)
por: Ramachandra, Raghavendra, et al.
Publicado: (2025)
Subimage Overlap Prediction: Task-Aligned Self-Supervised Pretraining For Semantic Segmentation In Remote Sensing Imagery
por: Sharma, Lakshay, et al.
Publicado: (2026)
por: Sharma, Lakshay, et al.
Publicado: (2026)
Benchmarking Vision-Language Models on Optical Character Recognition in Dynamic Video Environments
por: Nagaonkar, Sankalp, et al.
Publicado: (2025)
por: Nagaonkar, Sankalp, et al.
Publicado: (2025)
MirrorVerse: Pushing Diffusion Models to Realistically Reflect the World
por: Dhiman, Ankit, et al.
Publicado: (2025)
por: Dhiman, Ankit, et al.
Publicado: (2025)
GeoDiv: Framework For Measuring Geographical Diversity In Text-To-Image Models
por: Basu, Abhipsa, et al.
Publicado: (2026)
por: Basu, Abhipsa, et al.
Publicado: (2026)
PreciseControl: Enhancing Text-To-Image Diffusion Models with Fine-Grained Attribute Control
por: Parihar, Rishubh, et al.
Publicado: (2024)
por: Parihar, Rishubh, et al.
Publicado: (2024)
Glo-VLMs: Leveraging Vision-Language Models for Fine-Grained Diseased Glomerulus Classification
por: Guo, Zhenhao, et al.
Publicado: (2025)
por: Guo, Zhenhao, et al.
Publicado: (2025)
Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding
por: Sharma, Shivam, et al.
Publicado: (2026)
por: Sharma, Shivam, et al.
Publicado: (2026)
Where Do Vision-Language Models Fail? World Scale Analysis for Image Geolocalization
por: Bharadwaj, Siddhant, et al.
Publicado: (2026)
por: Bharadwaj, Siddhant, et al.
Publicado: (2026)
From Classification to Cross-Modal Understanding: Leveraging Vision-Language Models for Fine-Grained Renal Pathology
por: Guo, Zhenhao, et al.
Publicado: (2025)
por: Guo, Zhenhao, et al.
Publicado: (2025)
Large Language Models Facilitate Vision Reflection in Image Classification
por: An, Guoyuan, et al.
Publicado: (2025)
por: An, Guoyuan, et al.
Publicado: (2025)
Leveraging Vision-Language Foundation Models to Reveal Hidden Image-Attribute Relationships in Medical Imaging
por: Kumar, Amar, et al.
Publicado: (2025)
por: Kumar, Amar, et al.
Publicado: (2025)
Objects in Generated Videos Are Slower Than They Appear: Models Suffer Sub-Earth Gravity and Don't Know Galileo's Principle...for now
por: Thozhiyoor, Varun Varma, et al.
Publicado: (2025)
por: Thozhiyoor, Varun Varma, et al.
Publicado: (2025)
Improved EATFormer: A Vision Transformer for Medical Image Classification
por: Shisu, Yulong, et al.
Publicado: (2024)
por: Shisu, Yulong, et al.
Publicado: (2024)
Data Adaptive Traceback for Vision-Language Foundation Models in Image Classification
por: Peng, Wenshuo, et al.
Publicado: (2024)
por: Peng, Wenshuo, et al.
Publicado: (2024)
Vision-Language Semantic Aggregation Leveraging Foundation Model for Generalizable Medical Image Segmentation
por: Yu, Wenjun, et al.
Publicado: (2025)
por: Yu, Wenjun, et al.
Publicado: (2025)
Training-free Conditional Image Embedding Framework Leveraging Large Vision Language Models
por: Kawarada, Masayuki, et al.
Publicado: (2025)
por: Kawarada, Masayuki, et al.
Publicado: (2025)
Mirage: Unveiling Hidden Artifacts in Synthetic Images with Large Vision-Language Models
por: Sharma, Pranav, et al.
Publicado: (2025)
por: Sharma, Pranav, et al.
Publicado: (2025)
A Novel Vision Transformer with Residual in Self-attention for Biomedical Image Classification
por: Sharma, Arun K., et al.
Publicado: (2023)
por: Sharma, Arun K., et al.
Publicado: (2023)
Leveraging SAM for Single-Source Domain Generalization in Medical Image Segmentation
por: Wang, Hanhui, et al.
Publicado: (2024)
por: Wang, Hanhui, et al.
Publicado: (2024)
SeeThrough3D: Occlusion Aware 3D Control in Text-to-Image Generation
por: Agrawal, Vaibhav, et al.
Publicado: (2026)
por: Agrawal, Vaibhav, et al.
Publicado: (2026)
CLIP-HandID: Vision-Language Model for Hand-Based Person Identification
por: Baisa, Nathanael L., et al.
Publicado: (2025)
por: Baisa, Nathanael L., et al.
Publicado: (2025)
Where Do Images Come From? Analyzing Captions to Geographically Profile Datasets
por: Basu, Abhipsa, et al.
Publicado: (2026)
por: Basu, Abhipsa, et al.
Publicado: (2026)
Leveraging Vision-Language Embeddings for Zero-Shot Learning in Histopathology Images
por: Rahaman, Md Mamunur, et al.
Publicado: (2025)
por: Rahaman, Md Mamunur, et al.
Publicado: (2025)
Frequency-Aware Vision-Language Multimodality Generalization Network for Remote Sensing Image Classification
por: Zhang, Junjie, et al.
Publicado: (2025)
por: Zhang, Junjie, et al.
Publicado: (2025)
Rule-Based Reinforcement Learning for Document Image Classification with Vision Language Models
por: Jungo, Michael, et al.
Publicado: (2025)
por: Jungo, Michael, et al.
Publicado: (2025)
Leveraging Depth and Language for Open-Vocabulary Domain-Generalized Semantic Segmentation
por: Chen, Siyu, et al.
Publicado: (2025)
por: Chen, Siyu, et al.
Publicado: (2025)
In-Domain Self-Supervised Learning Improves Remote Sensing Image Scene Classification
por: Dimitrovski, Ivica, et al.
Publicado: (2023)
por: Dimitrovski, Ivica, et al.
Publicado: (2023)
TAP into the Patch Tokens: Leveraging Vision Foundation Model Features for AI-Generated Image Detection
por: Abdullah, Ahmed, et al.
Publicado: (2026)
por: Abdullah, Ahmed, et al.
Publicado: (2026)
Text2Place: Affordance-aware Text Guided Human Placement
por: Parihar, Rishubh, et al.
Publicado: (2024)
por: Parihar, Rishubh, et al.
Publicado: (2024)
Category-level Text-to-Image Retrieval Improved: Bridging the Domain Gap with Diffusion Models and Vision Encoders
por: Khan, Faizan Farooq, et al.
Publicado: (2025)
por: Khan, Faizan Farooq, et al.
Publicado: (2025)
Bridging Different Language Models and Generative Vision Models for Text-to-Image Generation
por: Zhao, Shihao, et al.
Publicado: (2024)
por: Zhao, Shihao, et al.
Publicado: (2024)
Pseudo-Prompt Generating in Pre-trained Vision-Language Models for Multi-Label Medical Image Classification
por: Ye, Yaoqin, et al.
Publicado: (2024)
por: Ye, Yaoqin, et al.
Publicado: (2024)
Ejemplares similares
-
ProFeAT: Projected Feature Adversarial Training for Self-Supervised Learning of Robust Representations
por: Addepalli, Sravanti, et al.
Publicado: (2024) -
DeiT-LT Distillation Strikes Back for Vision Transformer Training on Long-Tailed Datasets
por: Rangwani, Harsh, et al.
Publicado: (2024) -
Do Vision Language Models Need to Process Image Tokens?
por: Ghosh, Sambit, et al.
Publicado: (2026) -
Harnessing Diffusion-Generated Synthetic Images for Fair Image Classification
por: Basu, Abhipsa, et al.
Publicado: (2025) -
Compass Control: Multi Object Orientation Control for Text-to-Image Generation
por: Parihar, Rishubh, et al.
Publicado: (2025)