DreamLIP: Language-Image Pre-training with Long Captions
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zheng, Kecheng, Zhang, Yifei, Wu, Wei, Lu, Fan, Ma, Shuailei, Jin, Xin, Chen, Wei, Shen, Yujun |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
LoTLIP: Improving Language-Image Pre-training for Long Text Understanding
von: Wu, Wei, et al.
Veröffentlicht: (2024)
von: Wu, Wei, et al.
Veröffentlicht: (2024)
Benchmarking Large Vision-Language Models via Directed Scene Graph for Comprehensive Image Captioning
von: Lu, Fan, et al.
Veröffentlicht: (2024)
von: Lu, Fan, et al.
Veröffentlicht: (2024)
Learning Visual Generative Priors without Text
von: Ma, Shuailei, et al.
Veröffentlicht: (2024)
von: Ma, Shuailei, et al.
Veröffentlicht: (2024)
Understanding the Multi-modal Prompts of the Pre-trained Vision-Language Model
von: Ma, Shuailei, et al.
Veröffentlicht: (2023)
von: Ma, Shuailei, et al.
Veröffentlicht: (2023)
FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training
von: Cao, Anjia, et al.
Veröffentlicht: (2024)
von: Cao, Anjia, et al.
Veröffentlicht: (2024)
Efficient and Long-Tailed Generalization for Pre-trained Vision-Language Model
von: Shi, Jiang-Xin, et al.
Veröffentlicht: (2024)
von: Shi, Jiang-Xin, et al.
Veröffentlicht: (2024)
UKnow: A Unified Knowledge Protocol with Multimodal Knowledge Graph Datasets for Reasoning and Vision-Language Pre-Training
von: Gong, Biao, et al.
Veröffentlicht: (2023)
von: Gong, Biao, et al.
Veröffentlicht: (2023)
Paying More Attention to Image: A Training-Free Method for Alleviating Hallucination in LVLMs
von: Liu, Shi, et al.
Veröffentlicht: (2024)
von: Liu, Shi, et al.
Veröffentlicht: (2024)
TagAlign: Improving Vision-Language Alignment with Multi-Tag Classification
von: Liu, Qinying, et al.
Veröffentlicht: (2023)
von: Liu, Qinying, et al.
Veröffentlicht: (2023)
CoReS: Orchestrating the Dance of Reasoning and Segmentation
von: Bao, Xiaoyi, et al.
Veröffentlicht: (2024)
von: Bao, Xiaoyi, et al.
Veröffentlicht: (2024)
Contextual AD Narration with Interleaved Multimodal Sequence
von: Wang, Hanlin, et al.
Veröffentlicht: (2024)
von: Wang, Hanlin, et al.
Veröffentlicht: (2024)
Aligned Better, Listen Better for Audio-Visual Large Language Models
von: Guo, Yuxin, et al.
Veröffentlicht: (2025)
von: Guo, Yuxin, et al.
Veröffentlicht: (2025)
Vision-Centric Activation and Coordination for Multimodal Large Language Models
von: Wang, Yunnan, et al.
Veröffentlicht: (2025)
von: Wang, Yunnan, et al.
Veröffentlicht: (2025)
Sculpting Holistic 3D Representation in Contrastive Language-Image-3D Pre-training
von: Gao, Yipeng, et al.
Veröffentlicht: (2023)
von: Gao, Yipeng, et al.
Veröffentlicht: (2023)
SeLIP: Similarity Enhanced Contrastive Language Image Pretraining for Multi-modal Head MRI
von: Liu, Zhiyang, et al.
Veröffentlicht: (2025)
von: Liu, Zhiyang, et al.
Veröffentlicht: (2025)
LongProLIP: A Probabilistic Vision-Language Model with Long Context Text
von: Chun, Sanghyuk, et al.
Veröffentlicht: (2025)
von: Chun, Sanghyuk, et al.
Veröffentlicht: (2025)
AmorLIP: Efficient Language-Image Pretraining via Amortization
von: Sun, Haotian, et al.
Veröffentlicht: (2025)
von: Sun, Haotian, et al.
Veröffentlicht: (2025)
Evaluating Remote Sensing Image Captions Beyond Metric Biases
von: Chen, Ziyun, et al.
Veröffentlicht: (2026)
von: Chen, Ziyun, et al.
Veröffentlicht: (2026)
Large-scale Pre-training for Grounded Video Caption Generation
von: Kazakos, Evangelos, et al.
Veröffentlicht: (2025)
von: Kazakos, Evangelos, et al.
Veröffentlicht: (2025)
JaiLIP: Jailbreaking Vision-Language Models via Loss Guided Image Perturbation
von: Mia, Md Jueal, et al.
Veröffentlicht: (2025)
von: Mia, Md Jueal, et al.
Veröffentlicht: (2025)
Let ViT Speak: Generative Language-Image Pre-training
von: Fang, Yan, et al.
Veröffentlicht: (2026)
von: Fang, Yan, et al.
Veröffentlicht: (2026)
LongCaptioning: Unlocking the Power of Long Video Caption Generation in Large Multimodal Models
von: Wei, Hongchen, et al.
Veröffentlicht: (2025)
von: Wei, Hongchen, et al.
Veröffentlicht: (2025)
CAPformer: Compression-Aware Pre-trained Transformer for Low-Light Image Enhancement
von: Wang, Wei, et al.
Veröffentlicht: (2024)
von: Wang, Wei, et al.
Veröffentlicht: (2024)
Universal Image Restoration Pre-training via Degradation Classification
von: Hu, JiaKui, et al.
Veröffentlicht: (2025)
von: Hu, JiaKui, et al.
Veröffentlicht: (2025)
Accelerating Pre-training of Multimodal LLMs via Chain-of-Sight
von: Huang, Ziyuan, et al.
Veröffentlicht: (2024)
von: Huang, Ziyuan, et al.
Veröffentlicht: (2024)
VILA: On Pre-training for Visual Language Models
von: Lin, Ji, et al.
Veröffentlicht: (2023)
von: Lin, Ji, et al.
Veröffentlicht: (2023)
Efficient Vision-Language Pre-training by Cluster Masking
von: Wei, Zihao, et al.
Veröffentlicht: (2024)
von: Wei, Zihao, et al.
Veröffentlicht: (2024)
Universal Image Restoration Pre-training via Masked Degradation Classification
von: Hu, JiaKui, et al.
Veröffentlicht: (2025)
von: Hu, JiaKui, et al.
Veröffentlicht: (2025)
DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge
von: Zhang, Wenyao, et al.
Veröffentlicht: (2025)
von: Zhang, Wenyao, et al.
Veröffentlicht: (2025)
FlashFace: Human Image Personalization with High-fidelity Identity Preservation
von: Zhang, Shilong, et al.
Veröffentlicht: (2024)
von: Zhang, Shilong, et al.
Veröffentlicht: (2024)
Low-hallucination Synthetic Captions for Large-Scale Vision-Language Model Pre-training
von: Zhang, Xinsong, et al.
Veröffentlicht: (2025)
von: Zhang, Xinsong, et al.
Veröffentlicht: (2025)
Dream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model Backbone
von: Ye, Jiacheng, et al.
Veröffentlicht: (2025)
von: Ye, Jiacheng, et al.
Veröffentlicht: (2025)
VIXEN: Visual Text Comparison Network for Image Difference Captioning
von: Black, Alexander, et al.
Veröffentlicht: (2024)
von: Black, Alexander, et al.
Veröffentlicht: (2024)
Long-Tailed Object Detection Pre-training: Dynamic Rebalancing Contrastive Learning with Dual Reconstruction
von: Duan, Chen-Long, et al.
Veröffentlicht: (2024)
von: Duan, Chen-Long, et al.
Veröffentlicht: (2024)
Masked Pre-training Enables Universal Zero-shot Denoiser
von: Ma, Xiaoxiao, et al.
Veröffentlicht: (2024)
von: Ma, Xiaoxiao, et al.
Veröffentlicht: (2024)
Continual Retinal Vision-Language Pre-training upon Incremental Imaging Modalities
von: Yao, Yuang, et al.
Veröffentlicht: (2025)
von: Yao, Yuang, et al.
Veröffentlicht: (2025)
TextBlockV2: Towards Precise-Detection-Free Scene Text Spotting with Pre-trained Language Model
von: Lyu, Jiahao, et al.
Veröffentlicht: (2024)
von: Lyu, Jiahao, et al.
Veröffentlicht: (2024)
Micro-Expression Recognition by Motion Feature Extraction based on Pre-training
von: Li, Ruolin, et al.
Veröffentlicht: (2024)
von: Li, Ruolin, et al.
Veröffentlicht: (2024)
SKDF: A Simple Knowledge Distillation Framework for Distilling Open-Vocabulary Knowledge to Open-world Object Detector
von: Ma, Shuailei, et al.
Veröffentlicht: (2023)
von: Ma, Shuailei, et al.
Veröffentlicht: (2023)
Technical Report for Soccernet 2023 -- Dense Video Captioning
von: Ruan, Zheng, et al.
Veröffentlicht: (2024)
von: Ruan, Zheng, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
LoTLIP: Improving Language-Image Pre-training for Long Text Understanding
von: Wu, Wei, et al.
Veröffentlicht: (2024) -
Benchmarking Large Vision-Language Models via Directed Scene Graph for Comprehensive Image Captioning
von: Lu, Fan, et al.
Veröffentlicht: (2024) -
Learning Visual Generative Priors without Text
von: Ma, Shuailei, et al.
Veröffentlicht: (2024) -
Understanding the Multi-modal Prompts of the Pre-trained Vision-Language Model
von: Ma, Shuailei, et al.
Veröffentlicht: (2023) -
FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training
von: Cao, Anjia, et al.
Veröffentlicht: (2024)