Left-Right Symmetry Breaking in CLIP-style Vision-Language Models Trained on Synthetic Spatial-Relation Data
Fuente:
arXiv
Salvato in:
| Autori principali: | Yamamoto, Takaki, Noguchi, Chihiro, Tanizawa, Toshihiro |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
From Binary to Semantic: Utilizing Large-Scale Binary Occupancy Data for 3D Semantic Occupancy Prediction
di: Noguchi, Chihiro, et al.
Pubblicazione: (2025)
di: Noguchi, Chihiro, et al.
Pubblicazione: (2025)
Pseudo-Expert Regularized Offline RL for End-to-End Autonomous Driving in Photorealistic Closed-Loop Environments
di: Noguchi, Chihiro, et al.
Pubblicazione: (2025)
di: Noguchi, Chihiro, et al.
Pubblicazione: (2025)
AtteConDA: Attention-Based Conflict Suppression in Multi-Condition Diffusion Models and Synthetic Data Augmentation
di: Noguchi, Shogo
Pubblicazione: (2026)
di: Noguchi, Shogo
Pubblicazione: (2026)
LRR-Bench: Left, Right or Rotate? Vision-Language models Still Struggle With Spatial Understanding Tasks
di: Kong, Fei, et al.
Pubblicazione: (2025)
di: Kong, Fei, et al.
Pubblicazione: (2025)
SpaRE: Enhancing Spatial Reasoning in Vision-Language Models with Synthetic Data
di: Ogezi, Michael, et al.
Pubblicazione: (2025)
di: Ogezi, Michael, et al.
Pubblicazione: (2025)
SynthCLIP: Are We Ready for a Fully Synthetic CLIP Training?
di: Hammoud, Hasan Abed Al Kader, et al.
Pubblicazione: (2024)
di: Hammoud, Hasan Abed Al Kader, et al.
Pubblicazione: (2024)
TNG-CLIP:Training-Time Negation Data Generation for Negation Awareness of CLIP
di: Cai, Yuliang, et al.
Pubblicazione: (2025)
di: Cai, Yuliang, et al.
Pubblicazione: (2025)
Fake & Square: Training Self-Supervised Vision Transformers with Synthetic Data and Synthetic Hard Negatives
di: Giakoumoglou, Nikolaos, et al.
Pubblicazione: (2025)
di: Giakoumoglou, Nikolaos, et al.
Pubblicazione: (2025)
Investigating and Mitigating Object Hallucinations in Pretrained Vision-Language (CLIP) Models
di: Liu, Yufang, et al.
Pubblicazione: (2024)
di: Liu, Yufang, et al.
Pubblicazione: (2024)
SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
di: Li, Hongxing, et al.
Pubblicazione: (2025)
di: Li, Hongxing, et al.
Pubblicazione: (2025)
HarmoCLIP: Harmonizing Global and Regional Representations in Contrastive Vision-Language Models
di: Zeng, Haoxi, et al.
Pubblicazione: (2025)
di: Zeng, Haoxi, et al.
Pubblicazione: (2025)
AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis
di: Alawode, Basit, et al.
Pubblicazione: (2025)
di: Alawode, Basit, et al.
Pubblicazione: (2025)
Unsupervised Training of Vision Transformers with Synthetic Negatives
di: Giakoumoglou, Nikolaos, et al.
Pubblicazione: (2025)
di: Giakoumoglou, Nikolaos, et al.
Pubblicazione: (2025)
TernaryCLIP: Efficiently Compressing Vision-Language Models with Ternary Weights and Distilled Knowledge
di: Zhang, Shu-Hao, et al.
Pubblicazione: (2025)
di: Zhang, Shu-Hao, et al.
Pubblicazione: (2025)
Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation
di: Zhang, Pingrui, et al.
Pubblicazione: (2025)
di: Zhang, Pingrui, et al.
Pubblicazione: (2025)
To Agree or To Be Right? The Grounding-Sycophancy Tradeoff in Medical Vision-Language Models
di: Aranya, OFM Riaz Rahman, et al.
Pubblicazione: (2026)
di: Aranya, OFM Riaz Rahman, et al.
Pubblicazione: (2026)
Is There Knowledge Left to Extract? Evidence of Fragility in Medically Fine-Tuned Vision-Language Models
di: McLaughlin, Oliver, et al.
Pubblicazione: (2026)
di: McLaughlin, Oliver, et al.
Pubblicazione: (2026)
Enhancing the Safety of Medical Vision-Language Models by Synthetic Demonstrations
di: Xue, Zhiyu, et al.
Pubblicazione: (2025)
di: Xue, Zhiyu, et al.
Pubblicazione: (2025)
Text-Only Data Synthesis for Vision Language Model Training
di: Yu, Xiaomin, et al.
Pubblicazione: (2025)
di: Yu, Xiaomin, et al.
Pubblicazione: (2025)
Can Medical Vision-Language Pre-training Succeed with Purely Synthetic Data?
di: Liu, Che, et al.
Pubblicazione: (2024)
di: Liu, Che, et al.
Pubblicazione: (2024)
SafeR-CLIP: Mitigating NSFW Content in Vision-Language Models While Preserving Pre-Trained Knowledge
di: Yousaf, Adeel, et al.
Pubblicazione: (2025)
di: Yousaf, Adeel, et al.
Pubblicazione: (2025)
Breaking Modality Heterogeneity in Low-Bit Quantization for Large Vision-Language Models
di: Zhong, Yi, et al.
Pubblicazione: (2026)
di: Zhong, Yi, et al.
Pubblicazione: (2026)
MedProbCLIP: Probabilistic Adaptation of Vision-Language Foundation Model for Reliable Radiograph-Report Retrieval
di: Elallaf, Ahmad, et al.
Pubblicazione: (2026)
di: Elallaf, Ahmad, et al.
Pubblicazione: (2026)
PriorCLIP: Visual Prior Guided Vision-Language Model for Remote Sensing Image-Text Retrieval
di: Pan, Jiancheng, et al.
Pubblicazione: (2024)
di: Pan, Jiancheng, et al.
Pubblicazione: (2024)
InstAP: Instance-Aware Vision-Language Pre-Train for Spatial-Temporal Understanding
di: Kumar, Ashutosh, et al.
Pubblicazione: (2026)
di: Kumar, Ashutosh, et al.
Pubblicazione: (2026)
Pedestrian Attribute Recognition via CLIP based Prompt Vision-Language Fusion
di: Wang, Xiao, et al.
Pubblicazione: (2023)
di: Wang, Xiao, et al.
Pubblicazione: (2023)
SynCDR : Training Cross Domain Retrieval Models with Synthetic Data
di: Mishra, Samarth, et al.
Pubblicazione: (2023)
di: Mishra, Samarth, et al.
Pubblicazione: (2023)
Color in Visual-Language Models: CLIP deficiencies
di: Arias, Guillem, et al.
Pubblicazione: (2025)
di: Arias, Guillem, et al.
Pubblicazione: (2025)
WAVER: Writing-style Agnostic Text-Video Retrieval via Distilling Vision-Language Models Through Open-Vocabulary Knowledge
di: Le, Huy, et al.
Pubblicazione: (2023)
di: Le, Huy, et al.
Pubblicazione: (2023)
MROVSeg: Breaking the Resolution Curse of Vision-Language Models in Open-Vocabulary Image Segmentation
di: Zhu, Yuanbing, et al.
Pubblicazione: (2024)
di: Zhu, Yuanbing, et al.
Pubblicazione: (2024)
ViCLIP-OT: The First Foundation Vision-Language Model for Vietnamese Image-Text Retrieval with Optimal Transport
di: Tran, Quoc-Khang, et al.
Pubblicazione: (2026)
di: Tran, Quoc-Khang, et al.
Pubblicazione: (2026)
VisionCLIP: An Med-AIGC based Ethical Language-Image Foundation Model for Generalizable Retina Image Analysis
di: Wei, Hao, et al.
Pubblicazione: (2024)
di: Wei, Hao, et al.
Pubblicazione: (2024)
XAI-CLIP: ROI-Guided Perturbation Framework for Explainable Medical Image Segmentation in Multimodal Vision-Language Models
di: Alzubaidi, Thuraya, et al.
Pubblicazione: (2026)
di: Alzubaidi, Thuraya, et al.
Pubblicazione: (2026)
MultihopSpatial: Multi-hop Compositional Spatial Reasoning Benchmark for Vision-Language Model
di: Lee, Youngwan, et al.
Pubblicazione: (2026)
di: Lee, Youngwan, et al.
Pubblicazione: (2026)
CLIP Tricks You: Training-free Token Pruning for Efficient Pixel Grounding in Large VIsion-Language Models
di: Lee, Sangin, et al.
Pubblicazione: (2026)
di: Lee, Sangin, et al.
Pubblicazione: (2026)
Training-Free Unsupervised Prompt for Vision-Language Models
di: Long, Sifan, et al.
Pubblicazione: (2024)
di: Long, Sifan, et al.
Pubblicazione: (2024)
Pre-Trained Vision-Language Models as Partial Annotators
di: Wang, Qian-Wei, et al.
Pubblicazione: (2024)
di: Wang, Qian-Wei, et al.
Pubblicazione: (2024)
Reasoning under Vision: Understanding Visual-Spatial Cognition in Vision-Language Models for CAPTCHA
di: Song, Python, et al.
Pubblicazione: (2025)
di: Song, Python, et al.
Pubblicazione: (2025)
Unifying Biomedical Vision-Language Expertise: Towards a Generalist Foundation Model via Multi-CLIP Knowledge Distillation
di: Wang, Shansong, et al.
Pubblicazione: (2025)
di: Wang, Shansong, et al.
Pubblicazione: (2025)
Spatial 3D-LLM: Exploring Spatial Awareness in 3D Vision-Language Models
di: Wang, Xiaoyan, et al.
Pubblicazione: (2025)
di: Wang, Xiaoyan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
From Binary to Semantic: Utilizing Large-Scale Binary Occupancy Data for 3D Semantic Occupancy Prediction
di: Noguchi, Chihiro, et al.
Pubblicazione: (2025) -
Pseudo-Expert Regularized Offline RL for End-to-End Autonomous Driving in Photorealistic Closed-Loop Environments
di: Noguchi, Chihiro, et al.
Pubblicazione: (2025) -
AtteConDA: Attention-Based Conflict Suppression in Multi-Condition Diffusion Models and Synthetic Data Augmentation
di: Noguchi, Shogo
Pubblicazione: (2026) -
LRR-Bench: Left, Right or Rotate? Vision-Language models Still Struggle With Spatial Understanding Tasks
di: Kong, Fei, et al.
Pubblicazione: (2025) -
SpaRE: Enhancing Spatial Reasoning in Vision-Language Models with Synthetic Data
di: Ogezi, Michael, et al.
Pubblicazione: (2025)