Low-hallucination Synthetic Captions for Large-Scale Vision-Language Model Pre-training
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Xinsong, Zeng, Yarong, Huang, Xinting, Hu, Hu, Xie, Runquan, Hu, Han, Kang, Zhanhui |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PhD: A ChatGPT-Prompted Visual hallucination Evaluation Dataset
di: Liu, Jiazhen, et al.
Pubblicazione: (2024)
di: Liu, Jiazhen, et al.
Pubblicazione: (2024)
Revisit Large-Scale Image-Caption Data in Pre-training Multimodal Foundation Models
di: Lai, Zhengfeng, et al.
Pubblicazione: (2024)
di: Lai, Zhengfeng, et al.
Pubblicazione: (2024)
A Reinforcement Learning-Based Automatic Video Editing Method Using Pre-trained Vision-Language Model
di: Hu, Panwen, et al.
Pubblicazione: (2024)
di: Hu, Panwen, et al.
Pubblicazione: (2024)
QAVA: Query-Agnostic Visual Attack to Large Vision-Language Models
di: Zhang, Yudong, et al.
Pubblicazione: (2025)
di: Zhang, Yudong, et al.
Pubblicazione: (2025)
FashionFAE: Fine-grained Attributes Enhanced Fashion Vision-Language Pre-training
di: Huang, Jiale, et al.
Pubblicazione: (2024)
di: Huang, Jiale, et al.
Pubblicazione: (2024)
Scaling up Multimodal Pre-training for Sign Language Understanding
di: Zhou, Wengang, et al.
Pubblicazione: (2024)
di: Zhou, Wengang, et al.
Pubblicazione: (2024)
Semantics-enhanced Cross-modal Masked Image Modeling for Vision-Language Pre-training
di: Liu, Haowei, et al.
Pubblicazione: (2024)
di: Liu, Haowei, et al.
Pubblicazione: (2024)
Large-scale Pre-training for Grounded Video Caption Generation
di: Kazakos, Evangelos, et al.
Pubblicazione: (2025)
di: Kazakos, Evangelos, et al.
Pubblicazione: (2025)
DHCP: Detecting Hallucinations by Cross-modal Attention Pattern in Large Vision-Language Models
di: Zhang, Yudong, et al.
Pubblicazione: (2024)
di: Zhang, Yudong, et al.
Pubblicazione: (2024)
Scaling Backwards: Minimal Synthetic Pre-training?
di: Nakamura, Ryo, et al.
Pubblicazione: (2024)
di: Nakamura, Ryo, et al.
Pubblicazione: (2024)
DreamLIP: Language-Image Pre-training with Long Captions
di: Zheng, Kecheng, et al.
Pubblicazione: (2024)
di: Zheng, Kecheng, et al.
Pubblicazione: (2024)
Unsupervised Pre-training with Language-Vision Prompts for Low-Data Instance Segmentation
di: Zhang, Dingwen, et al.
Pubblicazione: (2024)
di: Zhang, Dingwen, et al.
Pubblicazione: (2024)
MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models
di: Hua, Hang, et al.
Pubblicazione: (2024)
di: Hua, Hang, et al.
Pubblicazione: (2024)
Muskie: Multi-view Masked Image Modeling for 3D Vision Pre-training
di: Li, Wenyu, et al.
Pubblicazione: (2025)
di: Li, Wenyu, et al.
Pubblicazione: (2025)
Scaling Pre-training to One Hundred Billion Data for Vision Language Models
di: Wang, Xiao, et al.
Pubblicazione: (2025)
di: Wang, Xiao, et al.
Pubblicazione: (2025)
Sparse Reasoning is Enough: Biological-Inspired Framework for Video Anomaly Detection with Large Pre-trained Models
di: Huang, He, et al.
Pubblicazione: (2025)
di: Huang, He, et al.
Pubblicazione: (2025)
LongCaptioning: Unlocking the Power of Long Video Caption Generation in Large Multimodal Models
di: Wei, Hongchen, et al.
Pubblicazione: (2025)
di: Wei, Hongchen, et al.
Pubblicazione: (2025)
Are Large Pre-trained Vision Language Models Effective Construction Safety Inspectors?
di: Chen, Xuezheng, et al.
Pubblicazione: (2025)
di: Chen, Xuezheng, et al.
Pubblicazione: (2025)
Understanding the Multi-modal Prompts of the Pre-trained Vision-Language Model
di: Ma, Shuailei, et al.
Pubblicazione: (2023)
di: Ma, Shuailei, et al.
Pubblicazione: (2023)
Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models
di: Li, Hengzhuang, et al.
Pubblicazione: (2025)
di: Li, Hengzhuang, et al.
Pubblicazione: (2025)
UniQA: Unified Vision-Language Pre-training for Image Quality and Aesthetic Assessment
di: Zhou, Hantao, et al.
Pubblicazione: (2024)
di: Zhou, Hantao, et al.
Pubblicazione: (2024)
MTA-CLIP: Language-Guided Semantic Segmentation with Mask-Text Alignment
di: Das, Anurag, et al.
Pubblicazione: (2024)
di: Das, Anurag, et al.
Pubblicazione: (2024)
CAS-IQA: Teaching Vision-Language Models for Synthetic Angiography Quality Assessment
di: Wang, Bo, et al.
Pubblicazione: (2025)
di: Wang, Bo, et al.
Pubblicazione: (2025)
3D Vision and Language Pretraining with Large-Scale Synthetic Data
di: Yang, Dejie, et al.
Pubblicazione: (2024)
di: Yang, Dejie, et al.
Pubblicazione: (2024)
Respecting Modality Gap in Post-hoc Out-of-distribution Detection with Pre-trained Vision-Language Models
di: Hu, Yuanwei, et al.
Pubblicazione: (2026)
di: Hu, Yuanwei, et al.
Pubblicazione: (2026)
MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models
di: Zhang, Peng-Fei, et al.
Pubblicazione: (2025)
di: Zhang, Peng-Fei, et al.
Pubblicazione: (2025)
Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves
di: Wu, Shihan, et al.
Pubblicazione: (2024)
di: Wu, Shihan, et al.
Pubblicazione: (2024)
An Explainable Biomedical Foundation Model via Large-Scale Concept-Enhanced Vision-Language Pre-training
di: Nie, Yuxiang, et al.
Pubblicazione: (2025)
di: Nie, Yuxiang, et al.
Pubblicazione: (2025)
Can Medical Vision-Language Pre-training Succeed with Purely Synthetic Data?
di: Liu, Che, et al.
Pubblicazione: (2024)
di: Liu, Che, et al.
Pubblicazione: (2024)
Omniview-Tuning: Boosting Viewpoint Invariance of Vision-Language Pre-training Models
di: Ruan, Shouwei, et al.
Pubblicazione: (2024)
di: Ruan, Shouwei, et al.
Pubblicazione: (2024)
LL-Bench: Rethinking Low-Level Vision Evaluation in the Era of Large-Scale Generative Models
di: Liu, Lu, et al.
Pubblicazione: (2026)
di: Liu, Lu, et al.
Pubblicazione: (2026)
DanQing: An Up-to-Date Large-Scale Chinese Vision-Language Pre-training Dataset
di: Shen, Hengyu, et al.
Pubblicazione: (2026)
di: Shen, Hengyu, et al.
Pubblicazione: (2026)
RITUAL: Random Image Transformations as a Universal Anti-hallucination Lever in Large Vision Language Models
di: Woo, Sangmin, et al.
Pubblicazione: (2024)
di: Woo, Sangmin, et al.
Pubblicazione: (2024)
Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness
di: Wang, Zeyu, et al.
Pubblicazione: (2025)
di: Wang, Zeyu, et al.
Pubblicazione: (2025)
Segment and Caption Anything
di: Huang, Xiaoke, et al.
Pubblicazione: (2023)
di: Huang, Xiaoke, et al.
Pubblicazione: (2023)
Conflict Adaptation in Vision-Language Models
di: Hu, Xiaoyang
Pubblicazione: (2025)
di: Hu, Xiaoyang
Pubblicazione: (2025)
Efficient and Effective Universal Adversarial Attack against Vision-Language Pre-training Models
di: Yang, Fan, et al.
Pubblicazione: (2024)
di: Yang, Fan, et al.
Pubblicazione: (2024)
Industrial Synthetic Segment Pre-training
di: Mae, Shinichi, et al.
Pubblicazione: (2025)
di: Mae, Shinichi, et al.
Pubblicazione: (2025)
VL-Uncertainty: Detecting Hallucination in Large Vision-Language Model via Uncertainty Estimation
di: Zhang, Ruiyang, et al.
Pubblicazione: (2024)
di: Zhang, Ruiyang, et al.
Pubblicazione: (2024)
Boosting Image Restoration via Priors from Pre-trained Models
di: Xu, Xiaogang, et al.
Pubblicazione: (2024)
di: Xu, Xiaogang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
PhD: A ChatGPT-Prompted Visual hallucination Evaluation Dataset
di: Liu, Jiazhen, et al.
Pubblicazione: (2024) -
Revisit Large-Scale Image-Caption Data in Pre-training Multimodal Foundation Models
di: Lai, Zhengfeng, et al.
Pubblicazione: (2024) -
A Reinforcement Learning-Based Automatic Video Editing Method Using Pre-trained Vision-Language Model
di: Hu, Panwen, et al.
Pubblicazione: (2024) -
QAVA: Query-Agnostic Visual Attack to Large Vision-Language Models
di: Zhang, Yudong, et al.
Pubblicazione: (2025) -
FashionFAE: Fine-grained Attributes Enhanced Fashion Vision-Language Pre-training
di: Huang, Jiale, et al.
Pubblicazione: (2024)