Not Just What's There: Enabling CLIP to Comprehend Negated Visual Descriptions Without Fine-tuning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xiao, Junhao, Wu, Zhiyu, Lin, Hao, Chen, Yi, Liu, Yahui, Zhao, Xiaoran, Wang, Zixu, He, Zejiang |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Dual-Stream Decoupled Learning for Temporal Consistency and Speaker Interaction in AVSD
par: Xiao, Junhao, et autres
Publié: (2025)
par: Xiao, Junhao, et autres
Publié: (2025)
Fine-grained Knowledge Graph-driven Video-Language Learning for Action Recognition
par: Zhang, Rui, et autres
Publié: (2024)
par: Zhang, Rui, et autres
Publié: (2024)
PixCLIP: Achieving Fine-grained Visual Language Understanding via Any-granularity Pixel-Text Alignment Learning
par: Xiao, Yicheng, et autres
Publié: (2025)
par: Xiao, Yicheng, et autres
Publié: (2025)
Identity-Aware Vision-Language Model for Explainable Face Forgery Detection
par: Xu, Junhao, et autres
Publié: (2025)
par: Xu, Junhao, et autres
Publié: (2025)
Efficient Vision Language Model Fine-tuning for Text-based Person Anomaly Search
par: He, Jiayi, et autres
Publié: (2025)
par: He, Jiayi, et autres
Publié: (2025)
FineBadminton: A Multi-Level Dataset for Fine-Grained Badminton Video Understanding
par: He, Xusheng, et autres
Publié: (2025)
par: He, Xusheng, et autres
Publié: (2025)
Is One-Shot In-Context Learning Helpful for Data Selection in Task-Specific Fine-Tuning of Multimodal LLMs?
par: An, Xiao, et autres
Publié: (2026)
par: An, Xiao, et autres
Publié: (2026)
VideoCLIP-XL: Advancing Long Description Understanding for Video CLIP Models
par: Wang, Jiapeng, et autres
Publié: (2024)
par: Wang, Jiapeng, et autres
Publié: (2024)
FashionDPO:Fine-tune Fashion Outfit Generation Model using Direct Preference Optimization
par: Yu, Mingzhe, et autres
Publié: (2025)
par: Yu, Mingzhe, et autres
Publié: (2025)
SpeechCraft: A Fine-grained Expressive Speech Dataset with Natural Language Description
par: Jin, Zeyu, et autres
Publié: (2024)
par: Jin, Zeyu, et autres
Publié: (2024)
PC-JND: Subjective Study and Dataset on Just Noticeable Difference for Point Clouds in 6DoF Virtual Reality
par: Fan, Chunling, et autres
Publié: (2025)
par: Fan, Chunling, et autres
Publié: (2025)
A CLIP-based siamese approach for meme classification
par: Huertas-Tato, Javier, et autres
Publié: (2024)
par: Huertas-Tato, Javier, et autres
Publié: (2024)
CLIP Brings Better Features to Visual Aesthetics Learners
par: Xu, Liwu, et autres
Publié: (2023)
par: Xu, Liwu, et autres
Publié: (2023)
Selective Vision-Language Subspace Projection for Few-shot CLIP
par: Zhu, Xingyu, et autres
Publié: (2024)
par: Zhu, Xingyu, et autres
Publié: (2024)
High-level Codes and Fine-grained Weights for Online Multi-modal Hashing Retrieval
par: Zhan, Yu-Wei, et autres
Publié: (2024)
par: Zhan, Yu-Wei, et autres
Publié: (2024)
A Novel FACS-Aligned Anatomical Text Description Paradigm for Fine-Grained Facial Behavior Synthesis
par: Wang, Jiahe, et autres
Publié: (2026)
par: Wang, Jiahe, et autres
Publié: (2026)
Test-Time Adaptation with CLIP Reward for Zero-Shot Generalization in Vision-Language Models
par: Zhao, Shuai, et autres
Publié: (2023)
par: Zhao, Shuai, et autres
Publié: (2023)
Towards Alleviating Text-to-Image Retrieval Hallucination for CLIP in Zero-shot Learning
par: Wang, Hanyao, et autres
Publié: (2024)
par: Wang, Hanyao, et autres
Publié: (2024)
Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval
par: Jiang, Xin, et autres
Publié: (2025)
par: Jiang, Xin, et autres
Publié: (2025)
PathVLM-R1: A Reinforcement Learning-Driven Reasoning Model for Pathology Visual-Language Tasks
par: Wu, Jianyu, et autres
Publié: (2025)
par: Wu, Jianyu, et autres
Publié: (2025)
When Top-ranked Recommendations Fail: Modeling Multi-Granular Negative Feedback for Explainable and Robust Video Recommendation
par: Chen, Siran, et autres
Publié: (2025)
par: Chen, Siran, et autres
Publié: (2025)
Inter-Frame Coding for Dynamic Meshes via Coarse-to-Fine Anchor Mesh Generation
par: Huang, He, et autres
Publié: (2024)
par: Huang, He, et autres
Publié: (2024)
Episode-specific Fine-tuning for Metric-based Few-shot Learners with Optimization-based Training
par: Zhuang, Xuanyu, et autres
Publié: (2025)
par: Zhuang, Xuanyu, et autres
Publié: (2025)
AV-Edit: Multimodal Generative Sound Effect Editing via Audio-Visual Semantic Joint Control
par: Guo, Xinyue, et autres
Publié: (2025)
par: Guo, Xinyue, et autres
Publié: (2025)
AVID: A Benchmark for Omni-Modal Audio-Visual Inconsistency Understanding via Agent-Driven Construction
par: Chen, Zixuan, et autres
Publié: (2026)
par: Chen, Zixuan, et autres
Publié: (2026)
MemeCLIP: Leveraging CLIP Representations for Multimodal Meme Classification
par: Shah, Siddhant Bikram, et autres
Publié: (2024)
par: Shah, Siddhant Bikram, et autres
Publié: (2024)
VSpeechLM: A Visual Speech Language Model for Visual Text-to-Speech Task
par: Wang, Yuyue, et autres
Publié: (2025)
par: Wang, Yuyue, et autres
Publié: (2025)
Think before You Leap: Content-Aware Low-Cost Edge-Assisted Video Semantic Segmentation
par: Yan, Mingxuan, et autres
Publié: (2024)
par: Yan, Mingxuan, et autres
Publié: (2024)
What's Wrong with the Bottom-up Methods in Arbitrary-shape Scene Text Detection
par: Xu, Chengpei, et autres
Publié: (2021)
par: Xu, Chengpei, et autres
Publié: (2021)
DiffBrush:Just Painting the Art by Your Hands
par: Chu, Jiaming, et autres
Publié: (2025)
par: Chu, Jiaming, et autres
Publié: (2025)
MultiSoundGen: Video-to-Audio Generation for Multi-Event Scenarios via SlowFast Contrastive Audio-Visual Pretraining and Direct Preference Optimization
par: Yang, Jianxuan, et autres
Publié: (2025)
par: Yang, Jianxuan, et autres
Publié: (2025)
LaF-GRPO: In-Situ Navigation Instruction Generation for the Visually Impaired via GRPO with LLM-as-Follower Reward
par: Zhao, Yi, et autres
Publié: (2025)
par: Zhao, Yi, et autres
Publié: (2025)
ScaleTrotter: Illustrative Visual Travels Across Negative Scales
par: Halladjian, Sarkis, et autres
Publié: (2019)
par: Halladjian, Sarkis, et autres
Publié: (2019)
Learning Contrastive Self-Distillation for Ultra-Fine-Grained Visual Categorization Targeting Limited Samples
par: Fang, Ziye, et autres
Publié: (2023)
par: Fang, Ziye, et autres
Publié: (2023)
Manipulated Regions Localization For Partially Deepfake Audio: A Survey
par: He, Jiayi, et autres
Publié: (2025)
par: He, Jiayi, et autres
Publié: (2025)
MAR3: Multi-Agent Recognition, Reasoning, and Reflection for Reference Audio-Visual Segmentation
par: Zhao, Yuan, et autres
Publié: (2026)
par: Zhao, Yuan, et autres
Publié: (2026)
Hierarchical Action Recognition: A Contrastive Video-Language Approach with Hierarchical Interactions
par: Zhang, Rui, et autres
Publié: (2024)
par: Zhang, Rui, et autres
Publié: (2024)
Visual Semantic Description Generation with MLLMs for Image-Text Matching
par: Chen, Junyu, et autres
Publié: (2025)
par: Chen, Junyu, et autres
Publié: (2025)
On the Brittleness of CLIP Text Encoders
par: Tran, Allie, et autres
Publié: (2025)
par: Tran, Allie, et autres
Publié: (2025)
SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding
par: Sun, Luoyi, et autres
Publié: (2026)
par: Sun, Luoyi, et autres
Publié: (2026)
Documents similaires
-
Dual-Stream Decoupled Learning for Temporal Consistency and Speaker Interaction in AVSD
par: Xiao, Junhao, et autres
Publié: (2025) -
Fine-grained Knowledge Graph-driven Video-Language Learning for Action Recognition
par: Zhang, Rui, et autres
Publié: (2024) -
PixCLIP: Achieving Fine-grained Visual Language Understanding via Any-granularity Pixel-Text Alignment Learning
par: Xiao, Yicheng, et autres
Publié: (2025) -
Identity-Aware Vision-Language Model for Explainable Face Forgery Detection
par: Xu, Junhao, et autres
Publié: (2025) -
Efficient Vision Language Model Fine-tuning for Text-based Person Anomaly Search
par: He, Jiayi, et autres
Publié: (2025)