$β$-CLIP: Text-Conditioned Contrastive Learning for Multi-Granular Vision-Language Alignment
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zohra, Fatimah, Zhao, Chen, Itani, Hani, Ghanem, Bernard |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
X-VARS: Introducing Explainability in Football Refereeing with Multi-Modal Large Language Model
par: Held, Jan, et autres
Publié: (2024)
par: Held, Jan, et autres
Publié: (2024)
SynthCLIP: Are We Ready for a Fully Synthetic CLIP Training?
par: Hammoud, Hasan Abed Al Kader, et autres
Publié: (2024)
par: Hammoud, Hasan Abed Al Kader, et autres
Publié: (2024)
Compressed-Language Models for Understanding Compressed File Formats: a JPEG Exploration
par: Pérez, Juan C., et autres
Publié: (2024)
par: Pérez, Juan C., et autres
Publié: (2024)
GeoAlignCLIP: Enhancing Fine-Grained Vision-Language Alignment in Remote Sensing via Multi-Granular Consistency Learning
par: Yang, Xiao, et autres
Publié: (2026)
par: Yang, Xiao, et autres
Publié: (2026)
DGTRSD & DGTRS-CLIP: A Dual-Granularity Remote Sensing Image-Text Dataset and Vision Language Foundation Model for Alignment
par: Chen, Weizhi, et autres
Publié: (2025)
par: Chen, Weizhi, et autres
Publié: (2025)
Dr$^2$Net: Dynamic Reversible Dual-Residual Networks for Memory-Efficient Finetuning
par: Zhao, Chen, et autres
Publié: (2024)
par: Zhao, Chen, et autres
Publié: (2024)
MoralCLIP: Contrastive Alignment of Vision-and-Language Representations with Moral Foundations Theory
par: Condez, Ana Carolina, et autres
Publié: (2025)
par: Condez, Ana Carolina, et autres
Publié: (2025)
BOLT: Boost Large Vision-Language Model Without Training for Long-form Video Understanding
par: Liu, Shuming, et autres
Publié: (2025)
par: Liu, Shuming, et autres
Publié: (2025)
UMG-CLIP: A Unified Multi-Granularity Vision Generalist for Open-World Understanding
par: Shi, Bowen, et autres
Publié: (2024)
par: Shi, Bowen, et autres
Publié: (2024)
DiffCLIP: Differential Attention Meets CLIP
par: Hammoud, Hasan Abed Al Kader, et autres
Publié: (2025)
par: Hammoud, Hasan Abed Al Kader, et autres
Publié: (2025)
HiMo-CLIP: Modeling Semantic Hierarchy and Monotonicity in Vision-Language Alignment
par: Wu, Ruijia, et autres
Publié: (2025)
par: Wu, Ruijia, et autres
Publié: (2025)
Contrast-Aware Calibration for Fine-Tuned CLIP: Leveraging Image-Text Alignment
par: Lv, Song-Lin, et autres
Publié: (2025)
par: Lv, Song-Lin, et autres
Publié: (2025)
PowerCLIP: Powerset Alignment for Contrastive Pre-Training
par: Kawamura, Masaki, et autres
Publié: (2025)
par: Kawamura, Masaki, et autres
Publié: (2025)
MTA-CLIP: Language-Guided Semantic Segmentation with Mask-Text Alignment
par: Das, Anurag, et autres
Publié: (2024)
par: Das, Anurag, et autres
Publié: (2024)
Video Self-Stitching Graph Network for Temporal Action Localization
par: Zhao, Chen, et autres
Publié: (2020)
par: Zhao, Chen, et autres
Publié: (2020)
HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models
par: Wei, Zhixiang, et autres
Publié: (2025)
par: Wei, Zhixiang, et autres
Publié: (2025)
TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval
par: Zhao, Zixu, et autres
Publié: (2025)
par: Zhao, Zixu, et autres
Publié: (2025)
ProCLIP: Progressive Vision-Language Alignment via LLM-based Embedder
par: Hu, Xiaoxing, et autres
Publié: (2025)
par: Hu, Xiaoxing, et autres
Publié: (2025)
OpenTAD: A Unified Framework and Comprehensive Study of Temporal Action Detection
par: Liu, Shuming, et autres
Publié: (2025)
par: Liu, Shuming, et autres
Publié: (2025)
SMILE: Infusing Spatial and Motion Semantics in Masked Video Learning
par: Thoker, Fida Mohammad, et autres
Publié: (2025)
par: Thoker, Fida Mohammad, et autres
Publié: (2025)
Ultrasound Vision-Language Alignment via Contrastive Learning
par: Lyu, Zhuoyang, et autres
Publié: (2026)
par: Lyu, Zhuoyang, et autres
Publié: (2026)
ClearCLIP: Decomposing CLIP Representations for Dense Vision-Language Inference
par: Lan, Mengcheng, et autres
Publié: (2024)
par: Lan, Mengcheng, et autres
Publié: (2024)
Cascade-CLIP: Cascaded Vision-Language Embeddings Alignment for Zero-Shot Semantic Segmentation
par: Li, Yunheng, et autres
Publié: (2024)
par: Li, Yunheng, et autres
Publié: (2024)
FairCLIP: Harnessing Fairness in Vision-Language Learning
par: Luo, Yan, et autres
Publié: (2024)
par: Luo, Yan, et autres
Publié: (2024)
Extending CLIP's Image-Text Alignment to Referring Image Segmentation
par: Kim, Seoyeon, et autres
Publié: (2023)
par: Kim, Seoyeon, et autres
Publié: (2023)
CLIP4STR: A Simple Baseline for Scene Text Recognition with Pre-trained Vision-Language Model
par: Zhao, Shuai, et autres
Publié: (2023)
par: Zhao, Shuai, et autres
Publié: (2023)
Non-Contrastive Vision-Language Learning with Predictive Embedding Alignment
par: Kuhn, Lukas, et autres
Publié: (2026)
par: Kuhn, Lukas, et autres
Publié: (2026)
PixCLIP: Achieving Fine-grained Visual Language Understanding via Any-granularity Pixel-Text Alignment Learning
par: Xiao, Yicheng, et autres
Publié: (2025)
par: Xiao, Yicheng, et autres
Publié: (2025)
CapCLIP: A Vision-Language Representation Alignment Approach for Wireless Capsule Endoscopy Analysis
par: Wahab, Haroon, et autres
Publié: (2026)
par: Wahab, Haroon, et autres
Publié: (2026)
EntityCLIP: Entity-Centric Image-Text Matching via Multimodal Attentive Contrastive Learning
par: Wang, Yaxiong, et autres
Publié: (2024)
par: Wang, Yaxiong, et autres
Publié: (2024)
Evaluation of Test-Time Adaptation Under Computational Time Constraints
par: Alfarra, Motasem, et autres
Publié: (2023)
par: Alfarra, Motasem, et autres
Publié: (2023)
SAVeS: Steering Safety Judgments in Vision-Language Models via Semantic Cues
par: Hinojosa, Carlos, et autres
Publié: (2026)
par: Hinojosa, Carlos, et autres
Publié: (2026)
Multi-Granularity and Multi-modal Feature Interaction Approach for Text Video Retrieval
par: Li, Wenjun, et autres
Publié: (2024)
par: Li, Wenjun, et autres
Publié: (2024)
Enhancing Representation in Radiography-Reports Foundation Model: A Granular Alignment Algorithm Using Masked Contrastive Learning
par: Huang, Weijian, et autres
Publié: (2023)
par: Huang, Weijian, et autres
Publié: (2023)
Contrastive Learning-Driven Traffic Sign Perception: Multi-Modal Fusion of Text and Vision
par: Lu, Qiang, et autres
Publié: (2025)
par: Lu, Qiang, et autres
Publié: (2025)
End-to-End Temporal Action Detection with 1B Parameters Across 1000 Frames
par: Liu, Shuming, et autres
Publié: (2023)
par: Liu, Shuming, et autres
Publié: (2023)
Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models
par: Yang, Shijun, et autres
Publié: (2025)
par: Yang, Shijun, et autres
Publié: (2025)
HarmoCLIP: Harmonizing Global and Regional Representations in Contrastive Vision-Language Models
par: Zeng, Haoxi, et autres
Publié: (2025)
par: Zeng, Haoxi, et autres
Publié: (2025)
HPT++: Hierarchically Prompting Vision-Language Models with Multi-Granularity Knowledge Generation and Improved Structure Modeling
par: Wang, Yubin, et autres
Publié: (2024)
par: Wang, Yubin, et autres
Publié: (2024)
HCCM: Hierarchical Cross-Granularity Contrastive and Matching Learning for Natural Language-Guided Drones
par: Ruan, Hao, et autres
Publié: (2025)
par: Ruan, Hao, et autres
Publié: (2025)
Documents similaires
-
X-VARS: Introducing Explainability in Football Refereeing with Multi-Modal Large Language Model
par: Held, Jan, et autres
Publié: (2024) -
SynthCLIP: Are We Ready for a Fully Synthetic CLIP Training?
par: Hammoud, Hasan Abed Al Kader, et autres
Publié: (2024) -
Compressed-Language Models for Understanding Compressed File Formats: a JPEG Exploration
par: Pérez, Juan C., et autres
Publié: (2024) -
GeoAlignCLIP: Enhancing Fine-Grained Vision-Language Alignment in Remote Sensing via Multi-Granular Consistency Learning
par: Yang, Xiao, et autres
Publié: (2026) -
DGTRSD & DGTRS-CLIP: A Dual-Granularity Remote Sensing Image-Text Dataset and Vision Language Foundation Model for Alignment
par: Chen, Weizhi, et autres
Publié: (2025)