Unleashing Text-to-Image Diffusion Prior for Zero-Shot Image Captioning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Luo, Jianjie, Chen, Jingwen, Li, Yehao, Pan, Yingwei, Feng, Jianlin, Chao, Hongyang, Yao, Ting |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SD-DiT: Unleashing the Power of Self-supervised Discrimination in Diffusion Transformer
par: Zhu, Rui, et autres
Publié: (2024)
par: Zhu, Rui, et autres
Publié: (2024)
Improving Text-guided Object Inpainting with Semantic Pre-inpainting
par: Chen, Yifu, et autres
Publié: (2024)
par: Chen, Yifu, et autres
Publié: (2024)
Improving Virtual Try-On with Garment-focused Diffusion Models
par: Wan, Siqi, et autres
Publié: (2024)
par: Wan, Siqi, et autres
Publié: (2024)
HIRI-ViT: Scaling Vision Transformer with High Resolution Inputs
par: Yao, Ting, et autres
Publié: (2024)
par: Yao, Ting, et autres
Publié: (2024)
TRIP: Temporal Residual Learning with Image Noise Prior for Image-to-Video Diffusion Models
par: Zhang, Zhongwei, et autres
Publié: (2024)
par: Zhang, Zhongwei, et autres
Publié: (2024)
Creatively Upscaling Images with Global-Regional Priors
par: Qian, Yurui, et autres
Publié: (2025)
par: Qian, Yurui, et autres
Publié: (2025)
VP3D: Unleashing 2D Visual Prompt for Text-to-3D Generation
par: Chen, Yang, et autres
Publié: (2024)
par: Chen, Yang, et autres
Publié: (2024)
Visual Autoregressive Modeling for Instruction-Guided Image Editing
par: Mao, Qingyang, et autres
Publié: (2025)
par: Mao, Qingyang, et autres
Publié: (2025)
Incorporating Visual Correspondence into Diffusion Model for Virtual Try-On
par: Wan, Siqi, et autres
Publié: (2025)
par: Wan, Siqi, et autres
Publié: (2025)
Boosting Diffusion Models with Moving Average Sampling in Frequency Domain
par: Qian, Yurui, et autres
Publié: (2024)
par: Qian, Yurui, et autres
Publié: (2024)
See or Guess: Counterfactually Regularized Image Captioning
par: Cao, Qian, et autres
Publié: (2024)
par: Cao, Qian, et autres
Publié: (2024)
Hierarchical Masked Autoregressive Models with Low-Resolution Token Pivots
par: Zheng, Guangting, et autres
Publié: (2025)
par: Zheng, Guangting, et autres
Publié: (2025)
HiDream-I1: A High-Efficient Image Generative Foundation Model with Sparse Diffusion Transformer
par: Cai, Qi, et autres
Publié: (2025)
par: Cai, Qi, et autres
Publié: (2025)
Hi3D: Pursuing High-Resolution Image-to-3D Generation with Video Diffusion Models
par: Yang, Haibo, et autres
Publié: (2024)
par: Yang, Haibo, et autres
Publié: (2024)
DreamArtist++: Controllable One-Shot Text-to-Image Generation via Positive-Negative Adapter
par: Dong, Ziyi, et autres
Publié: (2022)
par: Dong, Ziyi, et autres
Publié: (2022)
DetailVerifyBench: A Benchmark for Dense Hallucination Localization in Long Image Captions
par: Wang, Xinran, et autres
Publié: (2026)
par: Wang, Xinran, et autres
Publié: (2026)
MotionPro: A Precise Motion Controller for Image-to-Video Generation
par: Zhang, Zhongwei, et autres
Publié: (2025)
par: Zhang, Zhongwei, et autres
Publié: (2025)
Towards Retrieval-Augmented Architectures for Image Captioning
par: Sarto, Sara, et autres
Publié: (2024)
par: Sarto, Sara, et autres
Publié: (2024)
Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion
par: Lv, Zheqi, et autres
Publié: (2025)
par: Lv, Zheqi, et autres
Publié: (2025)
Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis
par: Bucciarelli, Davide, et autres
Publié: (2024)
par: Bucciarelli, Davide, et autres
Publié: (2024)
BRIDGE: Bridging Gaps in Image Captioning Evaluation with Stronger Visual Cues
par: Sarto, Sara, et autres
Publié: (2024)
par: Sarto, Sara, et autres
Publié: (2024)
HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer
par: Cai, Qi, et autres
Publié: (2026)
par: Cai, Qi, et autres
Publié: (2026)
Revisiting Image Captioning Training Paradigm via Direct CLIP-based Optimization
par: Moratelli, Nicholas, et autres
Publié: (2024)
par: Moratelli, Nicholas, et autres
Publié: (2024)
DiffuseST: Unleashing the Capability of the Diffusion Model for Style Transfer
par: Hu, Ying, et autres
Publié: (2024)
par: Hu, Ying, et autres
Publié: (2024)
DreamMesh: Jointly Manipulating and Texturing Triangle Meshes for Text-to-3D Generation
par: Yang, Haibo, et autres
Publié: (2024)
par: Yang, Haibo, et autres
Publié: (2024)
Scaling Prompt Instructed Zero Shot Composed Image Retrieval with Image-Only Data
par: Duan, Yiqun, et autres
Publié: (2025)
par: Duan, Yiqun, et autres
Publié: (2025)
InteractEdit: Zero-Shot Editing of Human-Object Interactions in Images
par: Hoe, Jiun Tian, et autres
Publié: (2025)
par: Hoe, Jiun Tian, et autres
Publié: (2025)
Discriminative Probing and Tuning for Text-to-Image Generation
par: Qu, Leigang, et autres
Publié: (2024)
par: Qu, Leigang, et autres
Publié: (2024)
Fine-grained Textual Inversion Network for Zero-Shot Composed Image Retrieval
par: Lin, Haoqiang, et autres
Publié: (2025)
par: Lin, Haoqiang, et autres
Publié: (2025)
FinCap: Topic-Aligned Captions for Short-Form Financial YouTube Videos
par: Sukhani, Siddhant, et autres
Publié: (2025)
par: Sukhani, Siddhant, et autres
Publié: (2025)
Multimodal LLMs Can Reason about Aesthetics in Zero-Shot
par: Jiang, Ruixiang, et autres
Publié: (2025)
par: Jiang, Ruixiang, et autres
Publié: (2025)
Video Summarization: Towards Entity-Aware Captions
par: Ayyubi, Hammad A., et autres
Publié: (2023)
par: Ayyubi, Hammad A., et autres
Publié: (2023)
HAIC: Improving Human Action Understanding and Generation with Better Captions for Multi-modal Large Language Models
par: Wang, Xiao, et autres
Publié: (2025)
par: Wang, Xiao, et autres
Publié: (2025)
Mitigating Image Captioning Hallucinations in Vision-Language Models
par: Zhao, Fei, et autres
Publié: (2025)
par: Zhao, Fei, et autres
Publié: (2025)
Automatic Prompt Generation and Grounding Object Detection for Zero-Shot Image Anomaly Detection
par: Cheung, Tsun-Hin, et autres
Publié: (2024)
par: Cheung, Tsun-Hin, et autres
Publié: (2024)
Improving Long-Text Alignment for Text-to-Image Diffusion Models
par: Liu, Luping, et autres
Publié: (2024)
par: Liu, Luping, et autres
Publié: (2024)
Hierarchical Textual Knowledge for Enhanced Image Clustering
par: Zhong, Yijie, et autres
Publié: (2026)
par: Zhong, Yijie, et autres
Publié: (2026)
Harmfully Manipulated Images Matter in Multimodal Misinformation Detection
par: Wang, Bing, et autres
Publié: (2024)
par: Wang, Bing, et autres
Publié: (2024)
OneDiff: A Generalist Model for Image Difference Captioning
par: Hu, Erdong, et autres
Publié: (2024)
par: Hu, Erdong, et autres
Publié: (2024)
Embedded Heterogeneous Attention Transformer for Cross-lingual Image Captioning
par: Song, Zijie, et autres
Publié: (2023)
par: Song, Zijie, et autres
Publié: (2023)
Documents similaires
-
SD-DiT: Unleashing the Power of Self-supervised Discrimination in Diffusion Transformer
par: Zhu, Rui, et autres
Publié: (2024) -
Improving Text-guided Object Inpainting with Semantic Pre-inpainting
par: Chen, Yifu, et autres
Publié: (2024) -
Improving Virtual Try-On with Garment-focused Diffusion Models
par: Wan, Siqi, et autres
Publié: (2024) -
HIRI-ViT: Scaling Vision Transformer with High Resolution Inputs
par: Yao, Ting, et autres
Publié: (2024) -
TRIP: Temporal Residual Learning with Image Noise Prior for Image-to-Video Diffusion Models
par: Zhang, Zhongwei, et autres
Publié: (2024)