Do Pre-trained Vision-Language Models Encode Object States?
Fuente:
arXiv
Guardado en:
| Autores principales: | Newman, Kaleb, Wang, Shijie, Zang, Yuan, Heffren, David, Sun, Chen |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Pre-trained Vision-Language Models Learn Discoverable Visual Concepts
por: Zang, Yuan, et al.
Publicado: (2024)
por: Zang, Yuan, et al.
Publicado: (2024)
Superpixel Semantics Representation and Pre-training for Vision-Language Task
por: Zhang, Siyu, et al.
Publicado: (2023)
por: Zhang, Siyu, et al.
Publicado: (2023)
Conjugated Semantic Pool Improves OOD Detection with Pre-trained Vision-Language Models
por: Chen, Mengyuan, et al.
Publicado: (2024)
por: Chen, Mengyuan, et al.
Publicado: (2024)
A Two-Stage Globally-Diverse Adversarial Attack for Vision-Language Pre-training Models
por: Chen, Wutao, et al.
Publicado: (2026)
por: Chen, Wutao, et al.
Publicado: (2026)
Can Medical Vision-Language Pre-training Succeed with Purely Synthetic Data?
por: Liu, Che, et al.
Publicado: (2024)
por: Liu, Che, et al.
Publicado: (2024)
Efficient Adaptation of Pre-trained Vision Transformer via Householder Transformation
por: Dong, Wei, et al.
Publicado: (2024)
por: Dong, Wei, et al.
Publicado: (2024)
SocialFusion: Addressing Social Degradation in Pre-trained Vision-Language Models
por: Tahboub, Hamza, et al.
Publicado: (2025)
por: Tahboub, Hamza, et al.
Publicado: (2025)
Fine-tuning Pre-trained Vision-Language Models in a Human-Annotation-Free Manner
por: Wang, Qian-Wei, et al.
Publicado: (2026)
por: Wang, Qian-Wei, et al.
Publicado: (2026)
MAFA: Managing False Negatives for Vision-Language Pre-training
por: Byun, Jaeseok, et al.
Publicado: (2023)
por: Byun, Jaeseok, et al.
Publicado: (2023)
Respecting Modality Gap in Post-hoc Out-of-distribution Detection with Pre-trained Vision-Language Models
por: Hu, Yuanwei, et al.
Publicado: (2026)
por: Hu, Yuanwei, et al.
Publicado: (2026)
Patch is Enough: Naturalistic Adversarial Patch against Vision-Language Pre-training Models
por: Kong, Dehong, et al.
Publicado: (2024)
por: Kong, Dehong, et al.
Publicado: (2024)
Low-hallucination Synthetic Captions for Large-Scale Vision-Language Model Pre-training
por: Zhang, Xinsong, et al.
Publicado: (2025)
por: Zhang, Xinsong, et al.
Publicado: (2025)
TAP-VL: Text Layout-Aware Pre-training for Enriched Vision-Language Models
por: Fhima, Jonathan, et al.
Publicado: (2024)
por: Fhima, Jonathan, et al.
Publicado: (2024)
Grounded Knowledge-Enhanced Medical Vision-Language Pre-training for Chest X-Ray
por: Deng, Qiao, et al.
Publicado: (2024)
por: Deng, Qiao, et al.
Publicado: (2024)
On Pre-training of Multimodal Language Models Customized for Chart Understanding
por: Fan, Wan-Cyuan, et al.
Publicado: (2024)
por: Fan, Wan-Cyuan, et al.
Publicado: (2024)
DanQing: An Up-to-Date Large-Scale Chinese Vision-Language Pre-training Dataset
por: Shen, Hengyu, et al.
Publicado: (2026)
por: Shen, Hengyu, et al.
Publicado: (2026)
Efficient Adaptation of Pre-trained Vision Transformer underpinned by Approximately Orthogonal Fine-Tuning Strategy
por: Yang, Yiting, et al.
Publicado: (2025)
por: Yang, Yiting, et al.
Publicado: (2025)
A Unified Understanding of Adversarial Vulnerability Regarding Unimodal Models and Vision-Language Pre-training Models
por: Zheng, Haonan, et al.
Publicado: (2024)
por: Zheng, Haonan, et al.
Publicado: (2024)
Overcoming the Pitfalls of Vision-Language Model Finetuning for OOD Generalization
por: Zang, Yuhang, et al.
Publicado: (2024)
por: Zang, Yuhang, et al.
Publicado: (2024)
Contextual Object Detection with Multimodal Large Language Models
por: Zang, Yuhang, et al.
Publicado: (2023)
por: Zang, Yuhang, et al.
Publicado: (2023)
Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
por: Ye, Wei, et al.
Publicado: (2024)
por: Ye, Wei, et al.
Publicado: (2024)
Avoid Wasted Annotation Costs in Open-set Active Learning with Pre-trained Vision-Language Model
por: Heo, Jaehyuk, et al.
Publicado: (2024)
por: Heo, Jaehyuk, et al.
Publicado: (2024)
Dragonfly: Multi-Resolution Zoom-In Encoding Enhances Vision-Language Models
por: Thapa, Rahul, et al.
Publicado: (2024)
por: Thapa, Rahul, et al.
Publicado: (2024)
MedUnifier: Unifying Vision-and-Language Pre-training on Medical Data with Vision Generation Task using Discrete Visual Representations
por: Zhang, Ziyang, et al.
Publicado: (2025)
por: Zhang, Ziyang, et al.
Publicado: (2025)
Effective Backdoor Mitigation in Vision-Language Models Depends on the Pre-training Objective
por: Verma, Sahil, et al.
Publicado: (2023)
por: Verma, Sahil, et al.
Publicado: (2023)
MG-3D: Multi-Grained Knowledge-Enhanced 3D Medical Vision-Language Pre-training
por: Ni, Xuefeng, et al.
Publicado: (2024)
por: Ni, Xuefeng, et al.
Publicado: (2024)
Object-Centric Vision Token Pruning for Vision Language Models
por: Li, Guangyuan, et al.
Publicado: (2025)
por: Li, Guangyuan, et al.
Publicado: (2025)
TRIPS: Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
por: Jiang, Chaoya, et al.
Publicado: (2023)
por: Jiang, Chaoya, et al.
Publicado: (2023)
Pre-Trained Vision-Language Models as Partial Annotators
por: Wang, Qian-Wei, et al.
Publicado: (2024)
por: Wang, Qian-Wei, et al.
Publicado: (2024)
3D Modality-Aware Pre-training for Vision-Language Model in MRI Multi-organ Abnormality Detection
por: Zhu, Haowen, et al.
Publicado: (2026)
por: Zhu, Haowen, et al.
Publicado: (2026)
VITAL: Vision-Encoder-centered Pre-training for LMMs in Visual Quality Assessment
por: Jia, Ziheng, et al.
Publicado: (2025)
por: Jia, Ziheng, et al.
Publicado: (2025)
SD-VLM: Spatial Measuring and Understanding with Depth-Encoded Vision-Language Models
por: Chen, Pingyi, et al.
Publicado: (2025)
por: Chen, Pingyi, et al.
Publicado: (2025)
Multi-Object Hallucination in Vision-Language Models
por: Chen, Xuweiyi, et al.
Publicado: (2024)
por: Chen, Xuweiyi, et al.
Publicado: (2024)
Towards Seamless Adaptation of Pre-trained Models for Visual Place Recognition
por: Lu, Feng, et al.
Publicado: (2024)
por: Lu, Feng, et al.
Publicado: (2024)
In-Depth and In-Breadth: Pre-training Multimodal Language Models Customized for Comprehensive Chart Understanding
por: Fan, Wan-Cyuan, et al.
Publicado: (2025)
por: Fan, Wan-Cyuan, et al.
Publicado: (2025)
Investigating and Mitigating Object Hallucinations in Pretrained Vision-Language (CLIP) Models
por: Liu, Yufang, et al.
Publicado: (2024)
por: Liu, Yufang, et al.
Publicado: (2024)
Downstream Transfer Attack: Adversarial Attacks on Downstream Models with Pre-trained Vision Transformers
por: Zheng, Weijie, et al.
Publicado: (2024)
por: Zheng, Weijie, et al.
Publicado: (2024)
MURE: Hierarchical Multi-Resolution Encoding via Vision-Language Models for Visual Document Retrieval
por: Zhu, Fengbin, et al.
Publicado: (2026)
por: Zhu, Fengbin, et al.
Publicado: (2026)
Equipping Sketch Patches with Context-Aware Positional Encoding for Graphic Sketch Representation
por: Zang, Sicong, et al.
Publicado: (2024)
por: Zang, Sicong, et al.
Publicado: (2024)
Generative Pre-trained Autoregressive Diffusion Transformer
por: Zhang, Yuan, et al.
Publicado: (2025)
por: Zhang, Yuan, et al.
Publicado: (2025)
Ejemplares similares
-
Pre-trained Vision-Language Models Learn Discoverable Visual Concepts
por: Zang, Yuan, et al.
Publicado: (2024) -
Superpixel Semantics Representation and Pre-training for Vision-Language Task
por: Zhang, Siyu, et al.
Publicado: (2023) -
Conjugated Semantic Pool Improves OOD Detection with Pre-trained Vision-Language Models
por: Chen, Mengyuan, et al.
Publicado: (2024) -
A Two-Stage Globally-Diverse Adversarial Attack for Vision-Language Pre-training Models
por: Chen, Wutao, et al.
Publicado: (2026) -
Can Medical Vision-Language Pre-training Succeed with Purely Synthetic Data?
por: Liu, Che, et al.
Publicado: (2024)