When Negation Is a Geometry Problem in Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Sammani, Fawaz, Chamiti, Tzoulio, Gavrikov, Paul, Deligiannis, Nikos |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Interpreting and Analysing CLIP's Zero-Shot Image Classification via Mutual Knowledge
di: Sammani, Fawaz, et al.
Pubblicazione: (2024)
di: Sammani, Fawaz, et al.
Pubblicazione: (2024)
CLIP-Free, Label Free, Unsupervised Concept Bottleneck Models
di: Sammani, Fawaz, et al.
Pubblicazione: (2025)
di: Sammani, Fawaz, et al.
Pubblicazione: (2025)
ReferGPT: Towards Zero-Shot Referring Multi-Object Tracking
di: Chamiti, Tzoulio, et al.
Pubblicazione: (2025)
di: Chamiti, Tzoulio, et al.
Pubblicazione: (2025)
GATA2Floor: Graph attention for floor counting in street-view facades
di: Le, Ngoc Tan, et al.
Pubblicazione: (2026)
di: Le, Ngoc Tan, et al.
Pubblicazione: (2026)
Temporal Concept Dynamics in Diffusion Models via Prompt-Conditioned Interventions
di: Gorgun, Ada, et al.
Pubblicazione: (2025)
di: Gorgun, Ada, et al.
Pubblicazione: (2025)
Large Models in Dialogue for Active Perception and Anomaly Detection
di: Chamiti, Tzoulio, et al.
Pubblicazione: (2025)
di: Chamiti, Tzoulio, et al.
Pubblicazione: (2025)
Scalable Context-Preserving Model-Aware Deep Clustering for Hyperspectral Images
di: Li, Xianlu, et al.
Pubblicazione: (2025)
di: Li, Xianlu, et al.
Pubblicazione: (2025)
Vision Transformers: the threat of realistic adversarial patches
di: Cools, Kasper, et al.
Pubblicazione: (2025)
di: Cools, Kasper, et al.
Pubblicazione: (2025)
TTRV: Test-Time Reinforcement Learning for Vision Language Models
di: Singh, Akshit, et al.
Pubblicazione: (2025)
di: Singh, Akshit, et al.
Pubblicazione: (2025)
Vision-Language Models Do Not Understand Negation
di: Alhamoud, Kumail, et al.
Pubblicazione: (2025)
di: Alhamoud, Kumail, et al.
Pubblicazione: (2025)
GLOV: Guided Large Language Models as Implicit Optimizers for Vision Language Models
di: Mirza, M. Jehanzeb, et al.
Pubblicazione: (2024)
di: Mirza, M. Jehanzeb, et al.
Pubblicazione: (2024)
FUTON: Fourier Tensor Network for Implicit Neural Representations
di: Ashtari, Pooya, et al.
Pubblicazione: (2026)
di: Ashtari, Pooya, et al.
Pubblicazione: (2026)
Negation-Aware Test-Time Adaptation for Vision-Language Models
di: Han, Haochen, et al.
Pubblicazione: (2025)
di: Han, Haochen, et al.
Pubblicazione: (2025)
SpaceVLM: Sub-Space Modeling of Negation in Vision-Language Models
di: Ranjbar, Sepehr Kazemi, et al.
Pubblicazione: (2025)
di: Ranjbar, Sepehr Kazemi, et al.
Pubblicazione: (2025)
GeoCoder: Solving Geometry Problems by Generating Modular Code through Vision-Language Models
di: Sharma, Aditya, et al.
Pubblicazione: (2024)
di: Sharma, Aditya, et al.
Pubblicazione: (2024)
How Do Training Methods Influence the Utilization of Vision Models?
di: Gavrikov, Paul, et al.
Pubblicazione: (2024)
di: Gavrikov, Paul, et al.
Pubblicazione: (2024)
When Visuals Aren't the Problem: Evaluating Vision-Language Models on Misleading Data Visualizations
di: Lalai, Harsh Nishant, et al.
Pubblicazione: (2026)
di: Lalai, Harsh Nishant, et al.
Pubblicazione: (2026)
Can Biases in ImageNet Models Explain Generalization?
di: Gavrikov, Paul, et al.
Pubblicazione: (2024)
di: Gavrikov, Paul, et al.
Pubblicazione: (2024)
Learn "No" to Say "Yes" Better: Improving Vision-Language Models via Negations
di: Singh, Jaisidh, et al.
Pubblicazione: (2024)
di: Singh, Jaisidh, et al.
Pubblicazione: (2024)
When Large Vision-Language Models Meet Person Re-Identification
di: Wang, Qizao, et al.
Pubblicazione: (2024)
di: Wang, Qizao, et al.
Pubblicazione: (2024)
Layer-Specific Fine-Tuning for Improved Negation Handling in Medical Vision-Language Models
di: Abbasi, Ali, et al.
Pubblicazione: (2026)
di: Abbasi, Ali, et al.
Pubblicazione: (2026)
Knowledge Regularized Negative Feature Tuning of Vision-Language Models for Out-of-Distribution Detection
di: Zhu, Wenjie, et al.
Pubblicazione: (2025)
di: Zhu, Wenjie, et al.
Pubblicazione: (2025)
The Geometry of Representational Failures in Vision Language Models
di: Savietto, Daniele, et al.
Pubblicazione: (2026)
di: Savietto, Daniele, et al.
Pubblicazione: (2026)
When LLaVA Meets Objects: Token Composition for Vision-Language-Models
di: Jahagirdar, Soumya, et al.
Pubblicazione: (2026)
di: Jahagirdar, Soumya, et al.
Pubblicazione: (2026)
When Background Matters: Breaking Medical Vision Language Models by Transferable Attack
di: Ghosh, Akash, et al.
Pubblicazione: (2026)
di: Ghosh, Akash, et al.
Pubblicazione: (2026)
When Language Model Guides Vision: Grounding DINO for Cattle Muzzle Detection
di: Dulal, Rabin, et al.
Pubblicazione: (2025)
di: Dulal, Rabin, et al.
Pubblicazione: (2025)
Class-Aware Prototype Learning with Negative Contrast for Test-Time Adaptation of Vision-Language Models
di: Qiao, Xiaozhen, et al.
Pubblicazione: (2025)
di: Qiao, Xiaozhen, et al.
Pubblicazione: (2025)
Enhancing Fine-Grained Vision-Language Pretraining with Negative Augmented Samples
di: Wang, Yeyuan, et al.
Pubblicazione: (2024)
di: Wang, Yeyuan, et al.
Pubblicazione: (2024)
Let Language Constrain Geometry: Vision-Language Models as Semantic and Spatial Critics for 3D Generation
di: Bai, Weimin, et al.
Pubblicazione: (2025)
di: Bai, Weimin, et al.
Pubblicazione: (2025)
When Language Overwrites Vision: Over-Alignment and Geometric Debiasing in Vision-Language Models
di: Saini, Harshvardhan, et al.
Pubblicazione: (2026)
di: Saini, Harshvardhan, et al.
Pubblicazione: (2026)
Negative Object Presence Evaluation (NOPE) to Measure Object Hallucination in Vision-Language Models
di: Lovenia, Holy, et al.
Pubblicazione: (2023)
di: Lovenia, Holy, et al.
Pubblicazione: (2023)
Enhancing Vision-Language Few-Shot Adaptation with Negative Learning
di: Zhang, Ce, et al.
Pubblicazione: (2024)
di: Zhang, Ce, et al.
Pubblicazione: (2024)
Negative Label Guided OOD Detection with Pretrained Vision-Language Models
di: Jiang, Xue, et al.
Pubblicazione: (2024)
di: Jiang, Xue, et al.
Pubblicazione: (2024)
Probing Visual Concepts in Lightweight Vision-Language Models for Automated Driving
di: Theodoridis, Nikos, et al.
Pubblicazione: (2026)
di: Theodoridis, Nikos, et al.
Pubblicazione: (2026)
When Sinks Help or Hurt: Unified Framework for Attention Sink in Large Vision-Language Models
di: Choi, Jiho, et al.
Pubblicazione: (2026)
di: Choi, Jiho, et al.
Pubblicazione: (2026)
When Surfaces Lie: Exploiting Wrinkle-Induced Attention Shift to Attack Vision-Language Models
di: Hu, Chengyin, et al.
Pubblicazione: (2026)
di: Hu, Chengyin, et al.
Pubblicazione: (2026)
FALCON: False-Negative Aware Learning of Contrastive Negatives in Vision-Language Alignment
di: Kim, Myunsoo, et al.
Pubblicazione: (2025)
di: Kim, Myunsoo, et al.
Pubblicazione: (2025)
SpanVLA: Efficient Action Bridging and Learning from Negative-Recovery Samples for Vision-Language-Action Model
di: Zhou, Zewei, et al.
Pubblicazione: (2026)
di: Zhou, Zewei, et al.
Pubblicazione: (2026)
Malayalam Sign Language Identification using Finetuned YOLOv8 and Computer Vision Techniques
di: K., Abhinand, et al.
Pubblicazione: (2024)
di: K., Abhinand, et al.
Pubblicazione: (2024)
When Do We Not Need Larger Vision Models?
di: Shi, Baifeng, et al.
Pubblicazione: (2024)
di: Shi, Baifeng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Interpreting and Analysing CLIP's Zero-Shot Image Classification via Mutual Knowledge
di: Sammani, Fawaz, et al.
Pubblicazione: (2024) -
CLIP-Free, Label Free, Unsupervised Concept Bottleneck Models
di: Sammani, Fawaz, et al.
Pubblicazione: (2025) -
ReferGPT: Towards Zero-Shot Referring Multi-Object Tracking
di: Chamiti, Tzoulio, et al.
Pubblicazione: (2025) -
GATA2Floor: Graph attention for floor counting in street-view facades
di: Le, Ngoc Tan, et al.
Pubblicazione: (2026) -
Temporal Concept Dynamics in Diffusion Models via Prompt-Conditioned Interventions
di: Gorgun, Ada, et al.
Pubblicazione: (2025)