SpaceVLM: Sub-Space Modeling of Negation in Vision-Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Ranjbar, Sepehr Kazemi, Alhamoud, Kumail, Ghassemi, Marzyeh |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Vision-Language Models Do Not Understand Negation
by: Alhamoud, Kumail, et al.
Published: (2025)
by: Alhamoud, Kumail, et al.
Published: (2025)
Disparities In Negation Understanding Across Languages In Vision-Language Models
by: Moraitaki, Charikleia, et al.
Published: (2026)
by: Moraitaki, Charikleia, et al.
Published: (2026)
ExIQA: Explainable Image Quality Assessment Using Distortion Attributes
by: Ranjbar, Sepehr Kazemi, et al.
Published: (2024)
by: Ranjbar, Sepehr Kazemi, et al.
Published: (2024)
FedMedICL: Towards Holistic Evaluation of Distribution Shifts in Federated Medical Imaging
by: Alhamoud, Kumail, et al.
Published: (2024)
by: Alhamoud, Kumail, et al.
Published: (2024)
BendVLM: Test-Time Debiasing of Vision-Language Embeddings
by: Gerych, Walter, et al.
Published: (2024)
by: Gerych, Walter, et al.
Published: (2024)
Multi-Rationale Explainable Object Recognition via Contrastive Conditional Inference
by: Rasekh, Ali, et al.
Published: (2025)
by: Rasekh, Ali, et al.
Published: (2025)
Views Can Be Deceiving: Improved SSL Through Feature Space Augmentation
by: Hamidieh, Kimia, et al.
Published: (2024)
by: Hamidieh, Kimia, et al.
Published: (2024)
Identifying Implicit Social Biases in Vision-Language Models
by: Hamidieh, Kimia, et al.
Published: (2024)
by: Hamidieh, Kimia, et al.
Published: (2024)
MaskMedPaint: Masked Medical Image Inpainting with Diffusion Models for Mitigation of Spurious Correlations
by: Jin, Qixuan, et al.
Published: (2024)
by: Jin, Qixuan, et al.
Published: (2024)
ECOR: Explainable CLIP for Object Recognition
by: Rasekh, Ali, et al.
Published: (2024)
by: Rasekh, Ali, et al.
Published: (2024)
OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference
by: Chen, Wei, et al.
Published: (2024)
by: Chen, Wei, et al.
Published: (2024)
CoSpace: Benchmarking Continuous Space Perception Ability for Vision-Language Models
by: Zhu, Yiqi, et al.
Published: (2025)
by: Zhu, Yiqi, et al.
Published: (2025)
TrojVLM: Backdoor Attack Against Vision Language Models
by: Lyu, Weimin, et al.
Published: (2024)
by: Lyu, Weimin, et al.
Published: (2024)
FloorplanVLM: A Vision-Language Model for Floorplan Vectorization
by: Liu, Yuanqing, et al.
Published: (2026)
by: Liu, Yuanqing, et al.
Published: (2026)
U-VLM: Hierarchical Vision Language Modeling for Report Generation
by: Shi, Pengcheng, et al.
Published: (2026)
by: Shi, Pengcheng, et al.
Published: (2026)
GEOBench-VLM: Benchmarking Vision-Language Models for Geospatial Tasks
by: Danish, Muhammad Sohail, et al.
Published: (2024)
by: Danish, Muhammad Sohail, et al.
Published: (2024)
QuoVLA: Quotient Space for Vision-Language-Action Models
by: Wang, Xuan, et al.
Published: (2026)
by: Wang, Xuan, et al.
Published: (2026)
Selective State Space Memory for Large Vision-Language Models
by: Ng, Chee, et al.
Published: (2024)
by: Ng, Chee, et al.
Published: (2024)
BackdoorVLM: A Benchmark for Backdoor Attacks on Vision-Language Models
by: Li, Juncheng, et al.
Published: (2025)
by: Li, Juncheng, et al.
Published: (2025)
Q-VLM: Post-training Quantization for Large Vision-Language Models
by: Wang, Changyuan, et al.
Published: (2024)
by: Wang, Changyuan, et al.
Published: (2024)
DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models
by: Tian, Xiaoyu, et al.
Published: (2024)
by: Tian, Xiaoyu, et al.
Published: (2024)
PolarVLM: Bridging the Semantic-Physical Gap in Vision-Language Models
by: Li, Yuliang, et al.
Published: (2026)
by: Li, Yuliang, et al.
Published: (2026)
VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models
by: Zhang, Jianke, et al.
Published: (2026)
by: Zhang, Jianke, et al.
Published: (2026)
FedVLM: Scalable Personalized Vision-Language Models through Federated Learning
by: Mitra, Arkajyoti, et al.
Published: (2025)
by: Mitra, Arkajyoti, et al.
Published: (2025)
R-VLM: Region-Aware Vision Language Model for Precise GUI Grounding
by: Park, Joonhyung, et al.
Published: (2025)
by: Park, Joonhyung, et al.
Published: (2025)
Scene-VLM: Multimodal Video Scene Segmentation via Vision-Language Models
by: Berman, Nimrod, et al.
Published: (2025)
by: Berman, Nimrod, et al.
Published: (2025)
RelationVLM: Making Large Vision-Language Models Understand Visual Relations
by: Huang, Zhipeng, et al.
Published: (2024)
by: Huang, Zhipeng, et al.
Published: (2024)
SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference
by: Zhang, Yuan, et al.
Published: (2024)
by: Zhang, Yuan, et al.
Published: (2024)
VLM-Loc: Localization in Point Cloud Maps via Vision-Language Models
by: Kang, Shuhao, et al.
Published: (2026)
by: Kang, Shuhao, et al.
Published: (2026)
IIR-VLM: In-Context Instance-level Recognition for Large Vision-Language Models
by: Shi, Liang, et al.
Published: (2026)
by: Shi, Liang, et al.
Published: (2026)
ScVLM: Enhancing Vision-Language Model for Safety-Critical Event Understanding
by: Shi, Liang, et al.
Published: (2024)
by: Shi, Liang, et al.
Published: (2024)
StateSpaceDiffuser: Bringing Long Context to Diffusion World Models
by: Savov, Nedko, et al.
Published: (2025)
by: Savov, Nedko, et al.
Published: (2025)
LAST: LeArning to Think in Space and Time for Generalist Vision-Language Models
by: Wang, Shuai, et al.
Published: (2025)
by: Wang, Shuai, et al.
Published: (2025)
Multimodal Chain of Continuous Thought for Latent-Space Reasoning in Vision-Language Models
by: Pham, Tan-Hanh, et al.
Published: (2025)
by: Pham, Tan-Hanh, et al.
Published: (2025)
Dynamic VLM-Guided Negative Prompting for Diffusion Models
by: Chang, Hoyeon, et al.
Published: (2025)
by: Chang, Hoyeon, et al.
Published: (2025)
WorldVLM: Combining World Model Forecasting and Vision-Language Reasoning
by: Englmeier, Stefan, et al.
Published: (2026)
by: Englmeier, Stefan, et al.
Published: (2026)
EchoVLM: Dynamic Mixture-of-Experts Vision-Language Model for Universal Ultrasound Intelligence
by: She, Chaoyin, et al.
Published: (2025)
by: She, Chaoyin, et al.
Published: (2025)
ST-VLM: Kinematic Instruction Tuning for Spatio-Temporal Reasoning in Vision-Language Models
by: Ko, Dohwan, et al.
Published: (2025)
by: Ko, Dohwan, et al.
Published: (2025)
HanMoVLM: Large Vision-Language Models for Professional Artistic Painting Evaluation
by: Yang, Hongji, et al.
Published: (2026)
by: Yang, Hongji, et al.
Published: (2026)
StateVLM: A State-Aware Vision-Language Model for Robotic Affordance Reasoning
by: Sun, Xiaowen, et al.
Published: (2026)
by: Sun, Xiaowen, et al.
Published: (2026)
Similar Items
-
Vision-Language Models Do Not Understand Negation
by: Alhamoud, Kumail, et al.
Published: (2025) -
Disparities In Negation Understanding Across Languages In Vision-Language Models
by: Moraitaki, Charikleia, et al.
Published: (2026) -
ExIQA: Explainable Image Quality Assessment Using Distortion Attributes
by: Ranjbar, Sepehr Kazemi, et al.
Published: (2024) -
FedMedICL: Towards Holistic Evaluation of Distribution Shifts in Federated Medical Imaging
by: Alhamoud, Kumail, et al.
Published: (2024) -
BendVLM: Test-Time Debiasing of Vision-Language Embeddings
by: Gerych, Walter, et al.
Published: (2024)