Auto-Comp: An Automated Pipeline for Scalable Compositional Probing of Contrastive Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Sbrolli, Cristian, Matteucci, Matteo, Yamasaki, Toshihiko |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PolyGen: Fully Synthetic Vision-Language Training via Multi-Generator Ensembles
di: Brusini, Leonardo, et al.
Pubblicazione: (2026)
di: Brusini, Leonardo, et al.
Pubblicazione: (2026)
No Captions, No Problem: Captionless 3D-CLIP Alignment with Hard Negatives via CLIP Knowledge and LLMs
di: Sbrolli, Cristian, et al.
Pubblicazione: (2024)
di: Sbrolli, Cristian, et al.
Pubblicazione: (2024)
Can Shape-Infused Joint Embeddings Improve Image-Conditioned 3D Diffusion?
di: Sbrolli, Cristian, et al.
Pubblicazione: (2024)
di: Sbrolli, Cristian, et al.
Pubblicazione: (2024)
SCENEFORGE: Enhancing 3D-text alignment with Structured Scene Compositions
di: Sbrolli, Cristian, et al.
Pubblicazione: (2025)
di: Sbrolli, Cristian, et al.
Pubblicazione: (2025)
Your Image Generator Is Your New Private Dataset
di: Resmini, Nicolo, et al.
Pubblicazione: (2025)
di: Resmini, Nicolo, et al.
Pubblicazione: (2025)
Neuro-Symbolic Scene Graph Conditioning for Synthetic Image Dataset Generation
di: Savazzi, Giacomo, et al.
Pubblicazione: (2025)
di: Savazzi, Giacomo, et al.
Pubblicazione: (2025)
A Multihead Continual Learning Framework for Fine-Grained Fashion Image Retrieval with Contrastive Learning and Exponential Moving Average Distillation
di: Xiao, Ling, et al.
Pubblicazione: (2026)
di: Xiao, Ling, et al.
Pubblicazione: (2026)
Probing Visual Concepts in Lightweight Vision-Language Models for Automated Driving
di: Theodoridis, Nikos, et al.
Pubblicazione: (2026)
di: Theodoridis, Nikos, et al.
Pubblicazione: (2026)
Few Shot Semantic Segmentation: a review of methodologies, benchmarks, and open challenges
di: Catalano, Nico, et al.
Pubblicazione: (2023)
di: Catalano, Nico, et al.
Pubblicazione: (2023)
Trust in Vision-Language Models: Insights from a Participatory User Workshop
di: Chiatti, Agnese, et al.
Pubblicazione: (2025)
di: Chiatti, Agnese, et al.
Pubblicazione: (2025)
Data-Driven Prediction of Seismic Intensity Distributions Featuring Hybrid Classification-Regression Models
di: Mizutani, Koyu, et al.
Pubblicazione: (2024)
di: Mizutani, Koyu, et al.
Pubblicazione: (2024)
In-Context Learning Improves Compositional Understanding of Vision-Language Models
di: Nulli, Matteo, et al.
Pubblicazione: (2024)
di: Nulli, Matteo, et al.
Pubblicazione: (2024)
Attribute-Guided Multi-Level Attention Network for Fine-Grained Fashion Retrieval
di: Xiao, Ling, et al.
Pubblicazione: (2022)
di: Xiao, Ling, et al.
Pubblicazione: (2022)
AutoVDC: Automated Vision Data Cleaning Using Vision-Language Models
di: Vasa, Santosh, et al.
Pubblicazione: (2025)
di: Vasa, Santosh, et al.
Pubblicazione: (2025)
Iterative Self-Improvement of Vision Language Models for Image Scoring and Self-Explanation
di: Tanji, Naoto, et al.
Pubblicazione: (2025)
di: Tanji, Naoto, et al.
Pubblicazione: (2025)
Language-Guided Invariance Probing of Vision-Language Models
di: Lee, Jae Joong
Pubblicazione: (2025)
di: Lee, Jae Joong
Pubblicazione: (2025)
Disentanglement and Compositionality of Letter Identity and Letter Position in Variational Auto-Encoder Vision Models
di: Bianchi, Bruno, et al.
Pubblicazione: (2024)
di: Bianchi, Bruno, et al.
Pubblicazione: (2024)
Federated Knowledge Recycling: Privacy-Preserving Synthetic Data Sharing
di: Lomurno, Eugenio, et al.
Pubblicazione: (2024)
di: Lomurno, Eugenio, et al.
Pubblicazione: (2024)
CompCap: Improving Multimodal Large Language Models with Composite Captions
di: Chen, Xiaohui, et al.
Pubblicazione: (2024)
di: Chen, Xiaohui, et al.
Pubblicazione: (2024)
AutoLTS: Automating Cycling Stress Assessment via Contrastive Learning and Spatial Post-processing
di: Lin, Bo, et al.
Pubblicazione: (2023)
di: Lin, Bo, et al.
Pubblicazione: (2023)
Probing Perceptual Constancy in Large Vision-Language Models
di: Sun, Haoran, et al.
Pubblicazione: (2025)
di: Sun, Haoran, et al.
Pubblicazione: (2025)
Semantic Compositions Enhance Vision-Language Contrastive Learning
di: Aladago, Maxwell, et al.
Pubblicazione: (2024)
di: Aladago, Maxwell, et al.
Pubblicazione: (2024)
PhysQuantAgent: An Inference Pipeline of Mass Estimation for Vision-Language Models
di: Yokomizo, Hisayuki, et al.
Pubblicazione: (2026)
di: Yokomizo, Hisayuki, et al.
Pubblicazione: (2026)
AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?
di: Bao, Han, et al.
Pubblicazione: (2024)
di: Bao, Han, et al.
Pubblicazione: (2024)
No Filter: Cultural and Socioeconomic Diversity in Contrastive Vision-Language Models
di: Pouget, Angéline, et al.
Pubblicazione: (2024)
di: Pouget, Angéline, et al.
Pubblicazione: (2024)
Mapping User Trust in Vision Language Models: Research Landscape, Challenges, and Prospects
di: Chiatti, Agnese, et al.
Pubblicazione: (2025)
di: Chiatti, Agnese, et al.
Pubblicazione: (2025)
Comp-Attn: Present-and-Align Attention for Compositional Video Generation
di: Zhang, Hongyu, et al.
Pubblicazione: (2025)
di: Zhang, Hongyu, et al.
Pubblicazione: (2025)
Stable Diffusion Dataset Generation for Downstream Classification Tasks
di: Lomurno, Eugenio, et al.
Pubblicazione: (2024)
di: Lomurno, Eugenio, et al.
Pubblicazione: (2024)
AutoCLIP: Auto-tuning Zero-Shot Classifiers for Vision-Language Models
di: Metzen, Jan Hendrik, et al.
Pubblicazione: (2023)
di: Metzen, Jan Hendrik, et al.
Pubblicazione: (2023)
Prompting Large Vision-Language Models for Compositional Reasoning
di: Ossowski, Timothy, et al.
Pubblicazione: (2024)
di: Ossowski, Timothy, et al.
Pubblicazione: (2024)
Generalized Out-of-Distribution Detection and Beyond in Vision Language Model Era: A Survey
di: Miyai, Atsuyuki, et al.
Pubblicazione: (2024)
di: Miyai, Atsuyuki, et al.
Pubblicazione: (2024)
Bias Beyond Demographics: Probing Decision Boundaries in Black-Box LVLMs via Counterfactual VQA
di: Zhao, Zaiying, et al.
Pubblicazione: (2025)
di: Zhao, Zaiying, et al.
Pubblicazione: (2025)
AutoMR: A Universal Time Series Motion Recognition Pipeline
di: Zhang, Likun, et al.
Pubblicazione: (2025)
di: Zhang, Likun, et al.
Pubblicazione: (2025)
Probing and Inducing Combinational Creativity in Vision-Language Models
di: Peng, Yongqian, et al.
Pubblicazione: (2025)
di: Peng, Yongqian, et al.
Pubblicazione: (2025)
HarmoCLIP: Harmonizing Global and Regional Representations in Contrastive Vision-Language Models
di: Zeng, Haoxi, et al.
Pubblicazione: (2025)
di: Zeng, Haoxi, et al.
Pubblicazione: (2025)
POMONAG: Pareto-Optimal Many-Objective Neural Architecture Generator
di: Lomurno, Eugenio, et al.
Pubblicazione: (2024)
di: Lomurno, Eugenio, et al.
Pubblicazione: (2024)
VLM-AutoDrive: Post-Training Vision-Language Models for Safety-Critical Autonomous Driving Events
di: Bhat, Mohammad Qazim, et al.
Pubblicazione: (2026)
di: Bhat, Mohammad Qazim, et al.
Pubblicazione: (2026)
SDCD: Structure-Disrupted Contrastive Decoding for Mitigating Hallucinations in Large Vision-Language Models
di: Xia, Yuxuan, et al.
Pubblicazione: (2026)
di: Xia, Yuxuan, et al.
Pubblicazione: (2026)
Evading Visual Aphasia: Contrastive Adaptive Semantic Token Pruning for Vision-Language Models
di: Ma, Jie, et al.
Pubblicazione: (2026)
di: Ma, Jie, et al.
Pubblicazione: (2026)
Probing the Robustness of Vision-Language Pretrained Models: A Multimodal Adversarial Attack Approach
di: Guan, Jiwei, et al.
Pubblicazione: (2024)
di: Guan, Jiwei, et al.
Pubblicazione: (2024)
Documenti analoghi
-
PolyGen: Fully Synthetic Vision-Language Training via Multi-Generator Ensembles
di: Brusini, Leonardo, et al.
Pubblicazione: (2026) -
No Captions, No Problem: Captionless 3D-CLIP Alignment with Hard Negatives via CLIP Knowledge and LLMs
di: Sbrolli, Cristian, et al.
Pubblicazione: (2024) -
Can Shape-Infused Joint Embeddings Improve Image-Conditioned 3D Diffusion?
di: Sbrolli, Cristian, et al.
Pubblicazione: (2024) -
SCENEFORGE: Enhancing 3D-text alignment with Structured Scene Compositions
di: Sbrolli, Cristian, et al.
Pubblicazione: (2025) -
Your Image Generator Is Your New Private Dataset
di: Resmini, Nicolo, et al.
Pubblicazione: (2025)