Teach CLIP to Develop a Number Sense for Ordinal Regression
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Du, Yao, Zhai, Qiang, Dai, Weihang, Li, Xiaomeng |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Injecting Distributional Awareness into MLLMs via Reinforcement Learning for Deep Imbalanced Regression
par: Du, Yao, et autres
Publié: (2026)
par: Du, Yao, et autres
Publié: (2026)
Exploring How Generative MLLMs Perceive More Than CLIP with the Same Vision Encoder
par: Li, Siting, et autres
Publié: (2024)
par: Li, Siting, et autres
Publié: (2024)
Calibration of Ordinal Regression Networks
par: Kim, Daehwan, et autres
Publié: (2024)
par: Kim, Daehwan, et autres
Publié: (2024)
TiC-CLIP: Continual Training of CLIP Models
par: Garg, Saurabh, et autres
Publié: (2023)
par: Garg, Saurabh, et autres
Publié: (2023)
BioCLIP: A Vision Foundation Model for the Tree of Life
par: Stevens, Samuel, et autres
Publié: (2023)
par: Stevens, Samuel, et autres
Publié: (2023)
Language Plays a Pivotal Role in the Object-Attribute Compositional Generalization of CLIP
par: Abbasi, Reza, et autres
Publié: (2024)
par: Abbasi, Reza, et autres
Publié: (2024)
Semantic Token Reweighting for Interpretable and Controllable Text Embeddings in CLIP
par: Kim, Eunji, et autres
Publié: (2024)
par: Kim, Eunji, et autres
Publié: (2024)
MoDE: CLIP Data Experts via Clustering
par: Ma, Jiawei, et autres
Publié: (2024)
par: Ma, Jiawei, et autres
Publié: (2024)
CLIP as RNN: Segment Countless Visual Concepts without Training Endeavor
par: Sun, Shuyang, et autres
Publié: (2023)
par: Sun, Shuyang, et autres
Publié: (2023)
AMU-Tuning: Effective Logit Bias for CLIP-based Few-shot Learning
par: Tang, Yuwei, et autres
Publié: (2024)
par: Tang, Yuwei, et autres
Publié: (2024)
BioCLIP 2: Emergent Properties from Scaling Hierarchical Contrastive Learning
par: Gu, Jianyang, et autres
Publié: (2025)
par: Gu, Jianyang, et autres
Publié: (2025)
CLIP meets DINO for Tuning Zero-Shot Classifier using Unlabeled Image Collections
par: Imam, Mohamed Fazli, et autres
Publié: (2024)
par: Imam, Mohamed Fazli, et autres
Publié: (2024)
MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training
par: Vasu, Pavan Kumar Anasosalu, et autres
Publié: (2023)
par: Vasu, Pavan Kumar Anasosalu, et autres
Publié: (2023)
CardiacCLIP: Video-based CLIP Adaptation for LVEF Prediction in a Few-shot Manner
par: Du, Yao, et autres
Publié: (2025)
par: Du, Yao, et autres
Publié: (2025)
If CLIP Could Talk: Understanding Vision-Language Model Representations Through Their Preferred Concept Descriptions
par: Esfandiarpoor, Reza, et autres
Publié: (2024)
par: Esfandiarpoor, Reza, et autres
Publié: (2024)
Classifying Phonotrauma Severity from Vocal Fold Images with Soft Ordinal Regression
par: Matton, Katie, et autres
Publié: (2025)
par: Matton, Katie, et autres
Publié: (2025)
What Makes CLIP More Robust to Long-Tailed Pre-Training Data? A Controlled Study for Transferable Insights
par: Wen, Xin, et autres
Publié: (2024)
par: Wen, Xin, et autres
Publié: (2024)
REBEL: Reinforcement Learning via Regressing Relative Rewards
par: Gao, Zhaolin, et autres
Publié: (2024)
par: Gao, Zhaolin, et autres
Publié: (2024)
Rethinking Misalignment in Vision-Language Model Adaptation from a Causal Perspective
par: Zhang, Yanan, et autres
Publié: (2024)
par: Zhang, Yanan, et autres
Publié: (2024)
X-Transfer Attacks: Towards Super Transferable Adversarial Attacks on CLIP
par: Huang, Hanxun, et autres
Publié: (2025)
par: Huang, Hanxun, et autres
Publié: (2025)
Who's in and who's out? A case study of multimodal CLIP-filtering in DataComp
par: Hong, Rachel, et autres
Publié: (2024)
par: Hong, Rachel, et autres
Publié: (2024)
CountCLIP -- [Re] Teaching CLIP to Count to Ten
par: Mestha, Harshvardhan, et autres
Publié: (2024)
par: Mestha, Harshvardhan, et autres
Publié: (2024)
Enhancing CLIP Conceptual Embedding through Knowledge Distillation
par: Kao, Kuei-Chun
Publié: (2024)
par: Kao, Kuei-Chun
Publié: (2024)
PerceptionCLIP: Visual Classification by Inferring and Conditioning on Contexts
par: An, Bang, et autres
Publié: (2023)
par: An, Bang, et autres
Publié: (2023)
SpikeCLIP: A Contrastive Language-Image Pretrained Spiking Neural Network
par: Lv, Changze, et autres
Publié: (2023)
par: Lv, Changze, et autres
Publié: (2023)
MobileCLIP2: Improving Multi-Modal Reinforced Training
par: Faghri, Fartash, et autres
Publié: (2025)
par: Faghri, Fartash, et autres
Publié: (2025)
BiCLIP: Domain Canonicalization via Structured Geometric Transformation
par: Mantini, Pranav, et autres
Publié: (2026)
par: Mantini, Pranav, et autres
Publié: (2026)
Highlighting What Matters: Promptable Embeddings for Attribute-Focused Image Retrieval
par: Li, Siting, et autres
Publié: (2025)
par: Li, Siting, et autres
Publié: (2025)
GET: Unlocking the Multi-modal Potential of CLIP for Generalized Category Discovery
par: Wang, Enguang, et autres
Publié: (2024)
par: Wang, Enguang, et autres
Publié: (2024)
Mitigate the Gap: Investigating Approaches for Improving Cross-Modal Alignment in CLIP
par: Eslami, Sedigheh, et autres
Publié: (2024)
par: Eslami, Sedigheh, et autres
Publié: (2024)
Using Knowledge Graphs to harvest datasets for efficient CLIP model training
par: Ging, Simon, et autres
Publié: (2025)
par: Ging, Simon, et autres
Publié: (2025)
Learning Ordinality in Semantic Segmentation
par: Cruz, Ricardo P. M., et autres
Publié: (2024)
par: Cruz, Ricardo P. M., et autres
Publié: (2024)
Set-CLIP: Exploring Aligned Semantic From Low-Alignment Multimodal Data Through A Distribution View
par: Song, Zijia, et autres
Publié: (2024)
par: Song, Zijia, et autres
Publié: (2024)
What If the TV Was Off? Examining Counterfactual Reasoning Abilities of Multi-modal Language Models
par: Zhang, Letian, et autres
Publié: (2023)
par: Zhang, Letian, et autres
Publié: (2023)
Teaching Embodied Reinforcement Learning Agents: Informativeness and Diversity of Language Use
par: Xi, Jiajun, et autres
Publié: (2024)
par: Xi, Jiajun, et autres
Publié: (2024)
Can Language Beat Numerical Regression? Language-Based Multimodal Trajectory Prediction
par: Bae, Inhwan, et autres
Publié: (2024)
par: Bae, Inhwan, et autres
Publié: (2024)
CLIP-UP: A Simple and Efficient Mixture-of-Experts CLIP Training Recipe with Sparse Upcycling
par: Wang, Xinze, et autres
Publié: (2025)
par: Wang, Xinze, et autres
Publié: (2025)
Sim-CLIP: Unsupervised Siamese Adversarial Fine-Tuning for Robust and Semantically-Rich Vision-Language Models
par: Hossain, Md Zarif, et autres
Publié: (2024)
par: Hossain, Md Zarif, et autres
Publié: (2024)
Exploring CLIP's Dense Knowledge for Weakly Supervised Semantic Segmentation
par: Yang, Zhiwei, et autres
Publié: (2025)
par: Yang, Zhiwei, et autres
Publié: (2025)
IPO: Interpretable Prompt Optimization for Vision-Language Models
par: Du, Yingjun, et autres
Publié: (2024)
par: Du, Yingjun, et autres
Publié: (2024)
Documents similaires
-
Injecting Distributional Awareness into MLLMs via Reinforcement Learning for Deep Imbalanced Regression
par: Du, Yao, et autres
Publié: (2026) -
Exploring How Generative MLLMs Perceive More Than CLIP with the Same Vision Encoder
par: Li, Siting, et autres
Publié: (2024) -
Calibration of Ordinal Regression Networks
par: Kim, Daehwan, et autres
Publié: (2024) -
TiC-CLIP: Continual Training of CLIP Models
par: Garg, Saurabh, et autres
Publié: (2023) -
BioCLIP: A Vision Foundation Model for the Tree of Life
par: Stevens, Samuel, et autres
Publié: (2023)