DetailCLIP: Detail-Oriented CLIP for Fine-Grained Tasks
Fuente:
arXiv
Saved in:
| Main Authors: | Monsefi, Amin Karimi, Sailaja, Kishore Prakash, Alilooee, Ali, Lim, Ser-Nam, Ramnath, Rajiv |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
DetailCLIP: Injecting Image Details into CLIP's Feature Space
by: Zhang, Zilun, et al.
Published: (2022)
by: Zhang, Zilun, et al.
Published: (2022)
DiReCT: Disentangled Regularization of Contrastive Trajectories for Physics-Refined Video Generation
by: Meyarian, Abolfazl, et al.
Published: (2026)
by: Meyarian, Abolfazl, et al.
Published: (2026)
Frequency-Guided Masking for Enhanced Vision Self-Supervised Learning
by: Monsefi, Amin Karimi, et al.
Published: (2024)
by: Monsefi, Amin Karimi, et al.
Published: (2024)
Controlla: Learning Controllability via Graph-Constrained Latent Geometry
by: Murthy, Jamuna S., et al.
Published: (2026)
by: Murthy, Jamuna S., et al.
Published: (2026)
TaxaDiffusion: Progressively Trained Diffusion Model for Fine-Grained Species Generation
by: Monsefi, Amin Karimi, et al.
Published: (2025)
by: Monsefi, Amin Karimi, et al.
Published: (2025)
un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP
by: Li, Yinqi, et al.
Published: (2025)
by: Li, Yinqi, et al.
Published: (2025)
KnobGen: Controlling the Sophistication of Artwork in Sketch-Based Diffusion Models
by: Navard, Pouyan, et al.
Published: (2024)
by: Navard, Pouyan, et al.
Published: (2024)
DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness
by: Mohammadshirazi, Ahmad, et al.
Published: (2024)
by: Mohammadshirazi, Ahmad, et al.
Published: (2024)
Masked LoGoNet: Fast and Accurate 3D Image Analysis for Medical Domain
by: Monsefi, Amin Karimi, et al.
Published: (2024)
by: Monsefi, Amin Karimi, et al.
Published: (2024)
microCLIP: Unsupervised CLIP Adaptation via Coarse-Fine Token Fusion for Fine-Grained Image Classification
by: Silva, Sathira, et al.
Published: (2025)
by: Silva, Sathira, et al.
Published: (2025)
CLIP-FTI: Fine-Grained Face Template Inversion via CLIP-Driven Attribute Conditioning
by: Dai, Longchen, et al.
Published: (2025)
by: Dai, Longchen, et al.
Published: (2025)
TaxaAdapter: Vision Taxonomy Models are Key to Fine-grained Image Generation over the Tree of Life
by: Khurana, Mridul, et al.
Published: (2026)
by: Khurana, Mridul, et al.
Published: (2026)
CLIP Under the Microscope: A Fine-Grained Analysis of Multi-Object Representation
by: Abbasi, Reza, et al.
Published: (2025)
by: Abbasi, Reza, et al.
Published: (2025)
GazeCLIP: Gaze-Guided CLIP with Adaptive-Enhanced Fine-Grained Language Prompt for Deepfake Attribution and Detection
by: Zhang, Yaning, et al.
Published: (2026)
by: Zhang, Yaning, et al.
Published: (2026)
Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score
by: Ali, Eman, et al.
Published: (2025)
by: Ali, Eman, et al.
Published: (2025)
SeamCam: Quantifying Seamless Camouflage via Multi-Cue Visual Detectability
by: Monsefi, Amin Karimi, et al.
Published: (2026)
by: Monsefi, Amin Karimi, et al.
Published: (2026)
TaskCLIP: Extend Large Vision-Language Model for Task Oriented Object Detection
by: Chen, Hanning, et al.
Published: (2024)
by: Chen, Hanning, et al.
Published: (2024)
LowCLIP: Adapting the CLIP Model Architecture for Low-Resource Languages in Multimodal Image Retrieval Task
by: Asgarov, Ali, et al.
Published: (2024)
by: Asgarov, Ali, et al.
Published: (2024)
DEIG: Detail-Enhanced Instance Generation with Fine-Grained Semantic Control
by: Du, Shiyan, et al.
Published: (2026)
by: Du, Shiyan, et al.
Published: (2026)
FG-CLIP: Fine-Grained Visual and Textual Alignment
by: Xie, Chunyu, et al.
Published: (2025)
by: Xie, Chunyu, et al.
Published: (2025)
No Detail Left Behind: Revisiting Self-Retrieval for Fine-Grained Image Captioning
by: Gaur, Manu, et al.
Published: (2024)
by: Gaur, Manu, et al.
Published: (2024)
Beyond Illumination: Fine-Grained Detail Preservation in Extreme Dark Image Restoration
by: Zhang, Tongshun, et al.
Published: (2025)
by: Zhang, Tongshun, et al.
Published: (2025)
Robotic-CLIP: Fine-tuning CLIP on Action Data for Robotic Applications
by: Nguyen, Nghia, et al.
Published: (2024)
by: Nguyen, Nghia, et al.
Published: (2024)
GenCLIP: Generalizing CLIP Prompts for Zero-shot Anomaly Detection
by: Kim, Donghyeong, et al.
Published: (2025)
by: Kim, Donghyeong, et al.
Published: (2025)
MoCLIP: Motion-Aware Fine-Tuning and Distillation of CLIP for Human Motion Generation
by: Maldonado, Gabriel, et al.
Published: (2025)
by: Maldonado, Gabriel, et al.
Published: (2025)
Towards Chunk-Wise Generation for Long Videos
by: Zhang, Siyang, et al.
Published: (2024)
by: Zhang, Siyang, et al.
Published: (2024)
FiGKD: Fine-Grained Knowledge Distillation via High-Frequency Detail Transfer
by: Kim, Seonghak
Published: (2025)
by: Kim, Seonghak
Published: (2025)
Catching the Details: Self-Distilled RoI Predictors for Fine-Grained MLLM Perception
by: Shi, Yuheng, et al.
Published: (2025)
by: Shi, Yuheng, et al.
Published: (2025)
CLIP-Decoder : ZeroShot Multilabel Classification using Multimodal CLIP Aligned Representation
by: Ali, Muhammad, et al.
Published: (2024)
by: Ali, Muhammad, et al.
Published: (2024)
FarSLIP: Discovering Effective CLIP Adaptation for Fine-Grained Remote Sensing Understanding
by: Li, Zhenshi, et al.
Published: (2025)
by: Li, Zhenshi, et al.
Published: (2025)
DetailFlow: 1D Coarse-to-Fine Autoregressive Image Generation via Next-Detail Prediction
by: Liu, Yiheng, et al.
Published: (2025)
by: Liu, Yiheng, et al.
Published: (2025)
Semantic-aware Adversarial Fine-tuning for CLIP
by: Zhang, Jiacheng, et al.
Published: (2026)
by: Zhang, Jiacheng, et al.
Published: (2026)
MulCLIP: A Multi-level Alignment Framework for Enhancing Fine-grained Long-context CLIP
by: Truong, Chau, et al.
Published: (2025)
by: Truong, Chau, et al.
Published: (2025)
Detail Reinforcement Diffusion Model: Augmentation Fine-Grained Visual Categorization in Few-Shot Conditions
by: Wu, Tianxu, et al.
Published: (2023)
by: Wu, Tianxu, et al.
Published: (2023)
Indoor Scene Reconstruction with Fine-Grained Details Using Hybrid Representation and Normal Prior Enhancement
by: Ye, Sheng, et al.
Published: (2023)
by: Ye, Sheng, et al.
Published: (2023)
CLIP-Guided Multi-Task Regression for Multi-View Plant Phenotyping
by: Warmers, Simon, et al.
Published: (2026)
by: Warmers, Simon, et al.
Published: (2026)
SuperCLIP: CLIP with Simple Classification Supervision
by: Zhao, Weiheng, et al.
Published: (2025)
by: Zhao, Weiheng, et al.
Published: (2025)
UltraAD: Fine-Grained Ultrasound Anomaly Classification via Few-Shot CLIP Adaptation
by: Zhou, Yue, et al.
Published: (2025)
by: Zhou, Yue, et al.
Published: (2025)
Beyond Generation: Unlocking Universal Editing via Self-Supervised Fine-Tuning
by: Chen, Harold Haodong, et al.
Published: (2024)
by: Chen, Harold Haodong, et al.
Published: (2024)
LatteCLIP: Unsupervised CLIP Fine-Tuning via LMM-Synthetic Texts
by: Cao, Anh-Quan, et al.
Published: (2024)
by: Cao, Anh-Quan, et al.
Published: (2024)
Similar Items
-
DetailCLIP: Injecting Image Details into CLIP's Feature Space
by: Zhang, Zilun, et al.
Published: (2022) -
DiReCT: Disentangled Regularization of Contrastive Trajectories for Physics-Refined Video Generation
by: Meyarian, Abolfazl, et al.
Published: (2026) -
Frequency-Guided Masking for Enhanced Vision Self-Supervised Learning
by: Monsefi, Amin Karimi, et al.
Published: (2024) -
Controlla: Learning Controllability via Graph-Constrained Latent Geometry
by: Murthy, Jamuna S., et al.
Published: (2026) -
TaxaDiffusion: Progressively Trained Diffusion Model for Fine-Grained Species Generation
by: Monsefi, Amin Karimi, et al.
Published: (2025)