Low-hallucination Synthetic Captions for Large-Scale Vision-Language Model Pre-training
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Xinsong, Zeng, Yarong, Huang, Xinting, Hu, Hu, Xie, Runquan, Hu, Han, Kang, Zhanhui |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PhD: A ChatGPT-Prompted Visual hallucination Evaluation Dataset
par: Liu, Jiazhen, et autres
Publié: (2024)
par: Liu, Jiazhen, et autres
Publié: (2024)
Revisit Large-Scale Image-Caption Data in Pre-training Multimodal Foundation Models
par: Lai, Zhengfeng, et autres
Publié: (2024)
par: Lai, Zhengfeng, et autres
Publié: (2024)
A Reinforcement Learning-Based Automatic Video Editing Method Using Pre-trained Vision-Language Model
par: Hu, Panwen, et autres
Publié: (2024)
par: Hu, Panwen, et autres
Publié: (2024)
QAVA: Query-Agnostic Visual Attack to Large Vision-Language Models
par: Zhang, Yudong, et autres
Publié: (2025)
par: Zhang, Yudong, et autres
Publié: (2025)
FashionFAE: Fine-grained Attributes Enhanced Fashion Vision-Language Pre-training
par: Huang, Jiale, et autres
Publié: (2024)
par: Huang, Jiale, et autres
Publié: (2024)
Scaling up Multimodal Pre-training for Sign Language Understanding
par: Zhou, Wengang, et autres
Publié: (2024)
par: Zhou, Wengang, et autres
Publié: (2024)
Semantics-enhanced Cross-modal Masked Image Modeling for Vision-Language Pre-training
par: Liu, Haowei, et autres
Publié: (2024)
par: Liu, Haowei, et autres
Publié: (2024)
Large-scale Pre-training for Grounded Video Caption Generation
par: Kazakos, Evangelos, et autres
Publié: (2025)
par: Kazakos, Evangelos, et autres
Publié: (2025)
DHCP: Detecting Hallucinations by Cross-modal Attention Pattern in Large Vision-Language Models
par: Zhang, Yudong, et autres
Publié: (2024)
par: Zhang, Yudong, et autres
Publié: (2024)
Scaling Backwards: Minimal Synthetic Pre-training?
par: Nakamura, Ryo, et autres
Publié: (2024)
par: Nakamura, Ryo, et autres
Publié: (2024)
DreamLIP: Language-Image Pre-training with Long Captions
par: Zheng, Kecheng, et autres
Publié: (2024)
par: Zheng, Kecheng, et autres
Publié: (2024)
Unsupervised Pre-training with Language-Vision Prompts for Low-Data Instance Segmentation
par: Zhang, Dingwen, et autres
Publié: (2024)
par: Zhang, Dingwen, et autres
Publié: (2024)
MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models
par: Hua, Hang, et autres
Publié: (2024)
par: Hua, Hang, et autres
Publié: (2024)
Muskie: Multi-view Masked Image Modeling for 3D Vision Pre-training
par: Li, Wenyu, et autres
Publié: (2025)
par: Li, Wenyu, et autres
Publié: (2025)
Scaling Pre-training to One Hundred Billion Data for Vision Language Models
par: Wang, Xiao, et autres
Publié: (2025)
par: Wang, Xiao, et autres
Publié: (2025)
Sparse Reasoning is Enough: Biological-Inspired Framework for Video Anomaly Detection with Large Pre-trained Models
par: Huang, He, et autres
Publié: (2025)
par: Huang, He, et autres
Publié: (2025)
LongCaptioning: Unlocking the Power of Long Video Caption Generation in Large Multimodal Models
par: Wei, Hongchen, et autres
Publié: (2025)
par: Wei, Hongchen, et autres
Publié: (2025)
Are Large Pre-trained Vision Language Models Effective Construction Safety Inspectors?
par: Chen, Xuezheng, et autres
Publié: (2025)
par: Chen, Xuezheng, et autres
Publié: (2025)
Understanding the Multi-modal Prompts of the Pre-trained Vision-Language Model
par: Ma, Shuailei, et autres
Publié: (2023)
par: Ma, Shuailei, et autres
Publié: (2023)
Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models
par: Li, Hengzhuang, et autres
Publié: (2025)
par: Li, Hengzhuang, et autres
Publié: (2025)
UniQA: Unified Vision-Language Pre-training for Image Quality and Aesthetic Assessment
par: Zhou, Hantao, et autres
Publié: (2024)
par: Zhou, Hantao, et autres
Publié: (2024)
MTA-CLIP: Language-Guided Semantic Segmentation with Mask-Text Alignment
par: Das, Anurag, et autres
Publié: (2024)
par: Das, Anurag, et autres
Publié: (2024)
CAS-IQA: Teaching Vision-Language Models for Synthetic Angiography Quality Assessment
par: Wang, Bo, et autres
Publié: (2025)
par: Wang, Bo, et autres
Publié: (2025)
3D Vision and Language Pretraining with Large-Scale Synthetic Data
par: Yang, Dejie, et autres
Publié: (2024)
par: Yang, Dejie, et autres
Publié: (2024)
Respecting Modality Gap in Post-hoc Out-of-distribution Detection with Pre-trained Vision-Language Models
par: Hu, Yuanwei, et autres
Publié: (2026)
par: Hu, Yuanwei, et autres
Publié: (2026)
MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models
par: Zhang, Peng-Fei, et autres
Publié: (2025)
par: Zhang, Peng-Fei, et autres
Publié: (2025)
Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves
par: Wu, Shihan, et autres
Publié: (2024)
par: Wu, Shihan, et autres
Publié: (2024)
An Explainable Biomedical Foundation Model via Large-Scale Concept-Enhanced Vision-Language Pre-training
par: Nie, Yuxiang, et autres
Publié: (2025)
par: Nie, Yuxiang, et autres
Publié: (2025)
Can Medical Vision-Language Pre-training Succeed with Purely Synthetic Data?
par: Liu, Che, et autres
Publié: (2024)
par: Liu, Che, et autres
Publié: (2024)
Omniview-Tuning: Boosting Viewpoint Invariance of Vision-Language Pre-training Models
par: Ruan, Shouwei, et autres
Publié: (2024)
par: Ruan, Shouwei, et autres
Publié: (2024)
LL-Bench: Rethinking Low-Level Vision Evaluation in the Era of Large-Scale Generative Models
par: Liu, Lu, et autres
Publié: (2026)
par: Liu, Lu, et autres
Publié: (2026)
DanQing: An Up-to-Date Large-Scale Chinese Vision-Language Pre-training Dataset
par: Shen, Hengyu, et autres
Publié: (2026)
par: Shen, Hengyu, et autres
Publié: (2026)
RITUAL: Random Image Transformations as a Universal Anti-hallucination Lever in Large Vision Language Models
par: Woo, Sangmin, et autres
Publié: (2024)
par: Woo, Sangmin, et autres
Publié: (2024)
Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness
par: Wang, Zeyu, et autres
Publié: (2025)
par: Wang, Zeyu, et autres
Publié: (2025)
Segment and Caption Anything
par: Huang, Xiaoke, et autres
Publié: (2023)
par: Huang, Xiaoke, et autres
Publié: (2023)
Conflict Adaptation in Vision-Language Models
par: Hu, Xiaoyang
Publié: (2025)
par: Hu, Xiaoyang
Publié: (2025)
Efficient and Effective Universal Adversarial Attack against Vision-Language Pre-training Models
par: Yang, Fan, et autres
Publié: (2024)
par: Yang, Fan, et autres
Publié: (2024)
Industrial Synthetic Segment Pre-training
par: Mae, Shinichi, et autres
Publié: (2025)
par: Mae, Shinichi, et autres
Publié: (2025)
VL-Uncertainty: Detecting Hallucination in Large Vision-Language Model via Uncertainty Estimation
par: Zhang, Ruiyang, et autres
Publié: (2024)
par: Zhang, Ruiyang, et autres
Publié: (2024)
Boosting Image Restoration via Priors from Pre-trained Models
par: Xu, Xiaogang, et autres
Publié: (2024)
par: Xu, Xiaogang, et autres
Publié: (2024)
Documents similaires
-
PhD: A ChatGPT-Prompted Visual hallucination Evaluation Dataset
par: Liu, Jiazhen, et autres
Publié: (2024) -
Revisit Large-Scale Image-Caption Data in Pre-training Multimodal Foundation Models
par: Lai, Zhengfeng, et autres
Publié: (2024) -
A Reinforcement Learning-Based Automatic Video Editing Method Using Pre-trained Vision-Language Model
par: Hu, Panwen, et autres
Publié: (2024) -
QAVA: Query-Agnostic Visual Attack to Large Vision-Language Models
par: Zhang, Yudong, et autres
Publié: (2025) -
FashionFAE: Fine-grained Attributes Enhanced Fashion Vision-Language Pre-training
par: Huang, Jiale, et autres
Publié: (2024)