MAFA: Managing False Negatives for Vision-Language Pre-training
Fuente:
arXiv
Salvato in:
| Autori principali: | Byun, Jaeseok, Kim, Dohoon, Moon, Taesup |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DoMIX: An Efficient Framework for Exploiting Domain Knowledge in Fine-Tuning
di: Kim, Dohoon, et al.
Pubblicazione: (2025)
di: Kim, Dohoon, et al.
Pubblicazione: (2025)
FALCON: False-Negative Aware Learning of Contrastive Negatives in Vision-Language Alignment
di: Kim, Myunsoo, et al.
Pubblicazione: (2025)
di: Kim, Myunsoo, et al.
Pubblicazione: (2025)
An Efficient Post-hoc Framework for Reducing Task Discrepancy of Text Encoders for Composed Image Retrieval
di: Byun, Jaeseok, et al.
Pubblicazione: (2024)
di: Byun, Jaeseok, et al.
Pubblicazione: (2024)
Missing Modality Prediction for Unpaired Multimodal Learning via Joint Embedding of Unimodal Models
di: Kim, Donggeun, et al.
Pubblicazione: (2024)
di: Kim, Donggeun, et al.
Pubblicazione: (2024)
Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling
di: Kim, Donggeun, et al.
Pubblicazione: (2024)
di: Kim, Donggeun, et al.
Pubblicazione: (2024)
Solving 3D Inverse Problems using Pre-trained 2D Diffusion Models
di: Chung, Hyungjin, et al.
Pubblicazione: (2022)
di: Chung, Hyungjin, et al.
Pubblicazione: (2022)
Do Pre-trained Vision-Language Models Encode Object States?
di: Newman, Kaleb, et al.
Pubblicazione: (2024)
di: Newman, Kaleb, et al.
Pubblicazione: (2024)
Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
di: Ye, Wei, et al.
Pubblicazione: (2024)
di: Ye, Wei, et al.
Pubblicazione: (2024)
Can Medical Vision-Language Pre-training Succeed with Purely Synthetic Data?
di: Liu, Che, et al.
Pubblicazione: (2024)
di: Liu, Che, et al.
Pubblicazione: (2024)
SocialFusion: Addressing Social Degradation in Pre-trained Vision-Language Models
di: Tahboub, Hamza, et al.
Pubblicazione: (2025)
di: Tahboub, Hamza, et al.
Pubblicazione: (2025)
Superpixel Semantics Representation and Pre-training for Vision-Language Task
di: Zhang, Siyu, et al.
Pubblicazione: (2023)
di: Zhang, Siyu, et al.
Pubblicazione: (2023)
Object-Centric World Model for Language-Guided Manipulation
di: Jeong, Youngjoon, et al.
Pubblicazione: (2025)
di: Jeong, Youngjoon, et al.
Pubblicazione: (2025)
TRIPS: Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
Conjugated Semantic Pool Improves OOD Detection with Pre-trained Vision-Language Models
di: Chen, Mengyuan, et al.
Pubblicazione: (2024)
di: Chen, Mengyuan, et al.
Pubblicazione: (2024)
Patch is Enough: Naturalistic Adversarial Patch against Vision-Language Pre-training Models
di: Kong, Dehong, et al.
Pubblicazione: (2024)
di: Kong, Dehong, et al.
Pubblicazione: (2024)
Grounded Knowledge-Enhanced Medical Vision-Language Pre-training for Chest X-Ray
di: Deng, Qiao, et al.
Pubblicazione: (2024)
di: Deng, Qiao, et al.
Pubblicazione: (2024)
Low-hallucination Synthetic Captions for Large-Scale Vision-Language Model Pre-training
di: Zhang, Xinsong, et al.
Pubblicazione: (2025)
di: Zhang, Xinsong, et al.
Pubblicazione: (2025)
TAP-VL: Text Layout-Aware Pre-training for Enriched Vision-Language Models
di: Fhima, Jonathan, et al.
Pubblicazione: (2024)
di: Fhima, Jonathan, et al.
Pubblicazione: (2024)
Fine-tuning Pre-trained Vision-Language Models in a Human-Annotation-Free Manner
di: Wang, Qian-Wei, et al.
Pubblicazione: (2026)
di: Wang, Qian-Wei, et al.
Pubblicazione: (2026)
A Two-Stage Globally-Diverse Adversarial Attack for Vision-Language Pre-training Models
di: Chen, Wutao, et al.
Pubblicazione: (2026)
di: Chen, Wutao, et al.
Pubblicazione: (2026)
DanQing: An Up-to-Date Large-Scale Chinese Vision-Language Pre-training Dataset
di: Shen, Hengyu, et al.
Pubblicazione: (2026)
di: Shen, Hengyu, et al.
Pubblicazione: (2026)
COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training
di: Kim, Sanghwan, et al.
Pubblicazione: (2024)
di: Kim, Sanghwan, et al.
Pubblicazione: (2024)
Addressing the Pitfalls of Image-Based Structural Health Monitoring: A Focus on False Positives, False Negatives, and Base Rate Bias
di: Plevris, Vagelis
Pubblicazione: (2024)
di: Plevris, Vagelis
Pubblicazione: (2024)
Preserving Multi-Modal Capabilities of Pre-trained VLMs for Improving Vision-Linguistic Compositionality
di: Oh, Youngtaek, et al.
Pubblicazione: (2024)
di: Oh, Youngtaek, et al.
Pubblicazione: (2024)
MedUnifier: Unifying Vision-and-Language Pre-training on Medical Data with Vision Generation Task using Discrete Visual Representations
di: Zhang, Ziyang, et al.
Pubblicazione: (2025)
di: Zhang, Ziyang, et al.
Pubblicazione: (2025)
CANVAS: A Benchmark for Vision-Language Models on Tool-Based User Interface Design
di: Jeong, Daeheon, et al.
Pubblicazione: (2025)
di: Jeong, Daeheon, et al.
Pubblicazione: (2025)
Sparse Imagination for Efficient Visual World Model Planning
di: Chun, Junha, et al.
Pubblicazione: (2025)
di: Chun, Junha, et al.
Pubblicazione: (2025)
A Unified Understanding of Adversarial Vulnerability Regarding Unimodal Models and Vision-Language Pre-training Models
di: Zheng, Haonan, et al.
Pubblicazione: (2024)
di: Zheng, Haonan, et al.
Pubblicazione: (2024)
Avoid Wasted Annotation Costs in Open-set Active Learning with Pre-trained Vision-Language Model
di: Heo, Jaehyuk, et al.
Pubblicazione: (2024)
di: Heo, Jaehyuk, et al.
Pubblicazione: (2024)
Respecting Modality Gap in Post-hoc Out-of-distribution Detection with Pre-trained Vision-Language Models
di: Hu, Yuanwei, et al.
Pubblicazione: (2026)
di: Hu, Yuanwei, et al.
Pubblicazione: (2026)
Efficient Adaptation of Pre-trained Vision Transformer via Householder Transformation
di: Dong, Wei, et al.
Pubblicazione: (2024)
di: Dong, Wei, et al.
Pubblicazione: (2024)
MG-3D: Multi-Grained Knowledge-Enhanced 3D Medical Vision-Language Pre-training
di: Ni, Xuefeng, et al.
Pubblicazione: (2024)
di: Ni, Xuefeng, et al.
Pubblicazione: (2024)
3D Modality-Aware Pre-training for Vision-Language Model in MRI Multi-organ Abnormality Detection
di: Zhu, Haowen, et al.
Pubblicazione: (2026)
di: Zhu, Haowen, et al.
Pubblicazione: (2026)
VITAL: Vision-Encoder-centered Pre-training for LMMs in Visual Quality Assessment
di: Jia, Ziheng, et al.
Pubblicazione: (2025)
di: Jia, Ziheng, et al.
Pubblicazione: (2025)
Homeomorphism Prior for False Positive and Negative Problem in Medical Image Dense Contrastive Representation Learning
di: He, Yuting, et al.
Pubblicazione: (2025)
di: He, Yuting, et al.
Pubblicazione: (2025)
Effective Backdoor Mitigation in Vision-Language Models Depends on the Pre-training Objective
di: Verma, Sahil, et al.
Pubblicazione: (2023)
di: Verma, Sahil, et al.
Pubblicazione: (2023)
Multi-Group Proportional Representation for Text-to-Image Models
di: Jung, Sangwon, et al.
Pubblicazione: (2025)
di: Jung, Sangwon, et al.
Pubblicazione: (2025)
Downstream Transfer Attack: Adversarial Attacks on Downstream Models with Pre-trained Vision Transformers
di: Zheng, Weijie, et al.
Pubblicazione: (2024)
di: Zheng, Weijie, et al.
Pubblicazione: (2024)
Adaptive Self-training Framework for Fine-grained Scene Graph Generation
di: Kim, Kibum, et al.
Pubblicazione: (2024)
di: Kim, Kibum, et al.
Pubblicazione: (2024)
Attention-space Contrastive Guidance for Efficient Hallucination Mitigation in LVLMs
di: Jo, Yujin, et al.
Pubblicazione: (2026)
di: Jo, Yujin, et al.
Pubblicazione: (2026)
Documenti analoghi
-
DoMIX: An Efficient Framework for Exploiting Domain Knowledge in Fine-Tuning
di: Kim, Dohoon, et al.
Pubblicazione: (2025) -
FALCON: False-Negative Aware Learning of Contrastive Negatives in Vision-Language Alignment
di: Kim, Myunsoo, et al.
Pubblicazione: (2025) -
An Efficient Post-hoc Framework for Reducing Task Discrepancy of Text Encoders for Composed Image Retrieval
di: Byun, Jaeseok, et al.
Pubblicazione: (2024) -
Missing Modality Prediction for Unpaired Multimodal Learning via Joint Embedding of Unimodal Models
di: Kim, Donggeun, et al.
Pubblicazione: (2024) -
Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling
di: Kim, Donggeun, et al.
Pubblicazione: (2024)