FG-CLIP: Fine-Grained Visual and Textual Alignment
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xie, Chunyu, Wang, Bin, Kong, Fanjing, Li, Jincheng, Liang, Dawei, Zhang, Gengshen, Leng, Dawei, Yin, Yuhui |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
FG-CLIP 2: A Bilingual Fine-grained Vision-Language Alignment Model
par: Xie, Chunyu, et autres
Publié: (2025)
par: Xie, Chunyu, et autres
Publié: (2025)
LMM-Det: Make Large Multimodal Models Excel in Object Detection
par: Li, Jincheng, et autres
Publié: (2025)
par: Li, Jincheng, et autres
Publié: (2025)
RzenEmbed: Towards Comprehensive Multimodal Retrieval
par: Jian, Weijian, et autres
Publié: (2025)
par: Jian, Weijian, et autres
Publié: (2025)
AMLRIS: Alignment-aware Masked Learning for Referring Image Segmentation
par: Chen, Tongfei, et autres
Publié: (2026)
par: Chen, Tongfei, et autres
Publié: (2026)
CLIPErase: Efficient Unlearning of Visual-Textual Associations in CLIP
par: Yang, Tianyu, et autres
Publié: (2024)
par: Yang, Tianyu, et autres
Publié: (2024)
FineLIP: Extending CLIP's Reach via Fine-Grained Alignment with Longer Text Inputs
par: Asokan, Mothilal, et autres
Publié: (2025)
par: Asokan, Mothilal, et autres
Publié: (2025)
SmartCLIP: Modular Vision-language Alignment with Identification Guarantees
par: Xie, Shaoan, et autres
Publié: (2025)
par: Xie, Shaoan, et autres
Publié: (2025)
microCLIP: Unsupervised CLIP Adaptation via Coarse-Fine Token Fusion for Fine-Grained Image Classification
par: Silva, Sathira, et autres
Publié: (2025)
par: Silva, Sathira, et autres
Publié: (2025)
AdaptCLIP: Adapting CLIP for Universal Visual Anomaly Detection
par: Gao, Bin-Bin, et autres
Publié: (2025)
par: Gao, Bin-Bin, et autres
Publié: (2025)
Fine-Grained Knowledge Structuring and Retrieval for Visual Question Answering
par: Zhang, Zhengxuan, et autres
Publié: (2025)
par: Zhang, Zhengxuan, et autres
Publié: (2025)
FB-CLIP: Fine-Grained Zero-Shot Anomaly Detection with Foreground-Background Disentanglement
par: Hu, Ming, et autres
Publié: (2026)
par: Hu, Ming, et autres
Publié: (2026)
Step-level Denoising-time Diffusion Alignment with Multiple Objectives
par: Zhang, Qi, et autres
Publié: (2026)
par: Zhang, Qi, et autres
Publié: (2026)
IAA: Inner-Adaptor Architecture Empowers Frozen Large Language Model with Multimodal Capabilities
par: Wang, Bin, et autres
Publié: (2024)
par: Wang, Bin, et autres
Publié: (2024)
CLIP Model for Images to Textual Prompts Based on Top-k Neighbors
par: Zhang, Xin, et autres
Publié: (2024)
par: Zhang, Xin, et autres
Publié: (2024)
Intelligent recognition of GPR road hidden defect images based on feature fusion and attention mechanism
par: Lv, Haotian, et autres
Publié: (2025)
par: Lv, Haotian, et autres
Publié: (2025)
Lightweight framework for underground pipeline recognition and spatial localization based on multi-view 2D GPR images
par: Lv, Haotian, et autres
Publié: (2025)
par: Lv, Haotian, et autres
Publié: (2025)
VISOR: Agentic Visual Retrieval-Augmented Generation via Iterative Search and Over-horizon Reasoning
par: Shen, Yucheng, et autres
Publié: (2026)
par: Shen, Yucheng, et autres
Publié: (2026)
Textual and Visual Prompt Fusion for Image Editing via Step-Wise Alignment
par: Feng, Zhanbo, et autres
Publié: (2023)
par: Feng, Zhanbo, et autres
Publié: (2023)
Understanding the Fine-Grained Knowledge Capabilities of Vision-Language Models
par: Ghosh, Dhruba, et autres
Publié: (2026)
par: Ghosh, Dhruba, et autres
Publié: (2026)
Saccadic Vision for Fine-Grained Visual Classification
par: Schmidt, Johann, et autres
Publié: (2025)
par: Schmidt, Johann, et autres
Publié: (2025)
ViTA-PAR: Visual and Textual Attribute Alignment with Attribute Prompting for Pedestrian Attribute Recognition
par: Park, Minjeong, et autres
Publié: (2025)
par: Park, Minjeong, et autres
Publié: (2025)
AIFIND: Artifact-Aware Interpreting Fine-Grained Alignment for Incremental Face Forgery Detection
par: Wang, Hao, et autres
Publié: (2026)
par: Wang, Hao, et autres
Publié: (2026)
Enhancing Spatial Reasoning through Visual and Textual Thinking
par: Liang, Xun, et autres
Publié: (2025)
par: Liang, Xun, et autres
Publié: (2025)
Decomposed Vision-Language Alignment for Fine-Grained Open-Vocabulary Segmentation
par: Wang, Chenhao, et autres
Publié: (2026)
par: Wang, Chenhao, et autres
Publié: (2026)
Capturing Fine-Grained Alignments Improves 3D Affordance Detection
par: Tokumitsu, Junsei, et autres
Publié: (2025)
par: Tokumitsu, Junsei, et autres
Publié: (2025)
Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding
par: Kim, Namho, et autres
Publié: (2025)
par: Kim, Namho, et autres
Publié: (2025)
ViP$^2$-CLIP: Visual-Perception Prompting with Unified Alignment for Zero-Shot Anomaly Detection
par: Yang, Ziteng, et autres
Publié: (2025)
par: Yang, Ziteng, et autres
Publié: (2025)
A Knowledge-guided Adversarial Defense for Resisting Malicious Visual Manipulation
par: Zhou, Dawei, et autres
Publié: (2025)
par: Zhou, Dawei, et autres
Publié: (2025)
CleanerCLIP: Fine-grained Counterfactual Semantic Augmentation for Backdoor Defense in Contrastive Learning
par: Xun, Yuan, et autres
Publié: (2024)
par: Xun, Yuan, et autres
Publié: (2024)
COHERENCE: Benchmarking Fine-Grained Image-Text Alignment in Interleaved Multimodal Contexts
par: Wang, Bingli, et autres
Publié: (2026)
par: Wang, Bingli, et autres
Publié: (2026)
LookWise: Knowing When and Where to Look for Fine-Grained Visual Reasoning in Multimodal Large Language Models
par: Shen, Yuxiang, et autres
Publié: (2026)
par: Shen, Yuxiang, et autres
Publié: (2026)
CLIPin: A Non-contrastive Plug-in to CLIP for Multimodal Semantic Alignment
par: Yang, Shengzhu, et autres
Publié: (2025)
par: Yang, Shengzhu, et autres
Publié: (2025)
AnnoPage Dataset: Dataset of Non-Textual Elements in Documents with Fine-Grained Categorization
par: Kišš, Martin, et autres
Publié: (2025)
par: Kišš, Martin, et autres
Publié: (2025)
No Captions, No Problem: Captionless 3D-CLIP Alignment with Hard Negatives via CLIP Knowledge and LLMs
par: Sbrolli, Cristian, et autres
Publié: (2024)
par: Sbrolli, Cristian, et autres
Publié: (2024)
Adversarial Attack for RGB-Event based Visual Object Tracking
par: Chen, Qiang, et autres
Publié: (2025)
par: Chen, Qiang, et autres
Publié: (2025)
Towards Commonsense Knowledge based Fuzzy Systems for Supporting Size-Related Fine-Grained Object Detection
par: Zhang, Pu, et autres
Publié: (2023)
par: Zhang, Pu, et autres
Publié: (2023)
Omni-NegCLIP: Enhancing CLIP with Front-Layer Contrastive Fine-Tuning for Comprehensive Negation Understanding
par: Xu, Jingqi
Publié: (2026)
par: Xu, Jingqi
Publié: (2026)
PAND: Prompt-Aware Neighborhood Distillation for Lightweight Fine-Grained Visual Classification
par: Luo, Qiuming, et autres
Publié: (2026)
par: Luo, Qiuming, et autres
Publié: (2026)
CLIP-MUSED: CLIP-Guided Multi-Subject Visual Neural Information Semantic Decoding
par: Zhou, Qiongyi, et autres
Publié: (2024)
par: Zhou, Qiongyi, et autres
Publié: (2024)
ReasonMap: Towards Fine-Grained Visual Reasoning from Transit Maps
par: Feng, Sicheng, et autres
Publié: (2025)
par: Feng, Sicheng, et autres
Publié: (2025)
Documents similaires
-
FG-CLIP 2: A Bilingual Fine-grained Vision-Language Alignment Model
par: Xie, Chunyu, et autres
Publié: (2025) -
LMM-Det: Make Large Multimodal Models Excel in Object Detection
par: Li, Jincheng, et autres
Publié: (2025) -
RzenEmbed: Towards Comprehensive Multimodal Retrieval
par: Jian, Weijian, et autres
Publié: (2025) -
AMLRIS: Alignment-aware Masked Learning for Referring Image Segmentation
par: Chen, Tongfei, et autres
Publié: (2026) -
CLIPErase: Efficient Unlearning of Visual-Textual Associations in CLIP
par: Yang, Tianyu, et autres
Publié: (2024)