Salvato in:
| Autori principali: | Han, Yucheng, Wang, Rui, Zhang, Chi, Hu, Juntao, Cheng, Pei, Fu, Bin, Zhang, Hanwang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2406.09162 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Prompt-aligned Gradient for Prompt Tuning
di: Zhu, Beier, et al.
Pubblicazione: (2022)
di: Zhu, Beier, et al.
Pubblicazione: (2022)
Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark
di: Hao, Yunzhuo, et al.
Pubblicazione: (2025)
di: Hao, Yunzhuo, et al.
Pubblicazione: (2025)
Dual-Modal Prompting for Sketch-Based Image Retrieval
di: Gao, Liying, et al.
Pubblicazione: (2024)
di: Gao, Liying, et al.
Pubblicazione: (2024)
EMMA: Efficient Visual Alignment in Multi-Modal LLMs
di: Ghazanfari, Sara, et al.
Pubblicazione: (2024)
di: Ghazanfari, Sara, et al.
Pubblicazione: (2024)
PromptMID: Modal Invariant Descriptors Based on Diffusion and Vision Foundation Models for Optical-SAR Image Matching
di: Nie, Han, et al.
Pubblicazione: (2025)
di: Nie, Han, et al.
Pubblicazione: (2025)
Mining Your Own Secrets: Diffusion Classifier Scores for Continual Personalization of Text-to-Image Diffusion Models
di: Jha, Saurav, et al.
Pubblicazione: (2024)
di: Jha, Saurav, et al.
Pubblicazione: (2024)
Lever LM: Configuring In-Context Sequence to Lever Large Vision Language Models
di: Yang, Xu, et al.
Pubblicazione: (2023)
di: Yang, Xu, et al.
Pubblicazione: (2023)
DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?
di: Jiao, Qirui, et al.
Pubblicazione: (2025)
di: Jiao, Qirui, et al.
Pubblicazione: (2025)
Distilling Parallel Gradients for Fast ODE Solvers of Diffusion Models
di: Zhu, Beier, et al.
Pubblicazione: (2025)
di: Zhu, Beier, et al.
Pubblicazione: (2025)
Dynamic Prompting of Frozen Text-to-Image Diffusion Models for Panoptic Narrative Grounding
di: Li, Hongyu, et al.
Pubblicazione: (2024)
di: Li, Hongyu, et al.
Pubblicazione: (2024)
Self-Rewarding Large Vision-Language Models for Optimizing Prompts in Text-to-Image Generation
di: Yang, Hongji, et al.
Pubblicazione: (2025)
di: Yang, Hongji, et al.
Pubblicazione: (2025)
ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment
di: Hu, Xiwei, et al.
Pubblicazione: (2024)
di: Hu, Xiwei, et al.
Pubblicazione: (2024)
Your ViT is Secretly an Image Segmentation Model
di: Kerssies, Tommie, et al.
Pubblicazione: (2025)
di: Kerssies, Tommie, et al.
Pubblicazione: (2025)
Text-DiFuse: An Interactive Multi-Modal Image Fusion Framework based on Text-modulated Diffusion Model
di: Zhang, Hao, et al.
Pubblicazione: (2024)
di: Zhang, Hao, et al.
Pubblicazione: (2024)
One Prompt to Verify Your Models: Black-Box Text-to-Image Models Verification via Non-Transferable Adversarial Attacks
di: Guo, Ji, et al.
Pubblicazione: (2024)
di: Guo, Ji, et al.
Pubblicazione: (2024)
Dual-Perspective Knowledge Enrichment for Semi-Supervised 3D Object Detection
di: Han, Yucheng, et al.
Pubblicazione: (2024)
di: Han, Yucheng, et al.
Pubblicazione: (2024)
VaMP: Variational Multi-Modal Prompt Learning for Vision-Language Models
di: Cheng, Silin, et al.
Pubblicazione: (2025)
di: Cheng, Silin, et al.
Pubblicazione: (2025)
Good Seed Makes a Good Crop: Discovering Secret Seeds in Text-to-Image Diffusion Models
di: Xu, Katherine, et al.
Pubblicazione: (2024)
di: Xu, Katherine, et al.
Pubblicazione: (2024)
Multi-Modal Prompt Learning on Blind Image Quality Assessment
di: Pan, Wensheng, et al.
Pubblicazione: (2024)
di: Pan, Wensheng, et al.
Pubblicazione: (2024)
TRACE: Your Diffusion Model is Secretly an Instance Edge Detector
di: Jo, Sanghyun, et al.
Pubblicazione: (2025)
di: Jo, Sanghyun, et al.
Pubblicazione: (2025)
Pretrained Image-Text Models are Secretly Video Captioners
di: Zhang, Chunhui, et al.
Pubblicazione: (2025)
di: Zhang, Chunhui, et al.
Pubblicazione: (2025)
TextCraftor: Your Text Encoder Can be Image Quality Controller
di: Li, Yanyu, et al.
Pubblicazione: (2024)
di: Li, Yanyu, et al.
Pubblicazione: (2024)
Image Can Bring Your Memory Back: A Novel Multi-Modal Guided Attack against Image Generation Model Unlearning
di: Liu, Renyang, et al.
Pubblicazione: (2025)
di: Liu, Renyang, et al.
Pubblicazione: (2025)
The CLIP Model is Secretly an Image-to-Prompt Converter
di: Ding, Yuxuan, et al.
Pubblicazione: (2023)
di: Ding, Yuxuan, et al.
Pubblicazione: (2023)
CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder
di: Ma, Lichen, et al.
Pubblicazione: (2024)
di: Ma, Lichen, et al.
Pubblicazione: (2024)
DiFiC: Your Diffusion Model Holds the Secret to Fine-Grained Clustering
di: Yang, Ruohong, et al.
Pubblicazione: (2024)
di: Yang, Ruohong, et al.
Pubblicazione: (2024)
Your Diffusion Model is Secretly a Certifiably Robust Classifier
di: Chen, Huanran, et al.
Pubblicazione: (2024)
di: Chen, Huanran, et al.
Pubblicazione: (2024)
Your Pre-trained Diffusion Model Secretly Knows Restoration
di: Rajagopalan, Sudarshan, et al.
Pubblicazione: (2026)
di: Rajagopalan, Sudarshan, et al.
Pubblicazione: (2026)
Personalize Your Gaussian: Consistent 3D Scene Personalization from a Single Image
di: Wang, Yuxuan, et al.
Pubblicazione: (2025)
di: Wang, Yuxuan, et al.
Pubblicazione: (2025)
Disciplined Diffusion: Text-to-Image Diffusion Model against NSFW Generation
di: Zhang, Chi, et al.
Pubblicazione: (2026)
di: Zhang, Chi, et al.
Pubblicazione: (2026)
Image Super-Resolution with Text Prompt Diffusion
di: Chen, Zheng, et al.
Pubblicazione: (2023)
di: Chen, Zheng, et al.
Pubblicazione: (2023)
Debiased Fine-Tuning for Vision-language Models by Prompt Regularization
di: Zhu, Beier, et al.
Pubblicazione: (2023)
di: Zhu, Beier, et al.
Pubblicazione: (2023)
SGDiff: Scene Graph Guided Diffusion Model for Image Collaborative SegCaptioning
di: Zhang, Xu, et al.
Pubblicazione: (2025)
di: Zhang, Xu, et al.
Pubblicazione: (2025)
Dysen-VDM: Empowering Dynamics-aware Text-to-Video Diffusion with LLMs
di: Fei, Hao, et al.
Pubblicazione: (2023)
di: Fei, Hao, et al.
Pubblicazione: (2023)
Unsupervised Modality Adaptation with Text-to-Image Diffusion Models for Semantic Segmentation
di: Xia, Ruihao, et al.
Pubblicazione: (2024)
di: Xia, Ruihao, et al.
Pubblicazione: (2024)
Adaptively Clustering Neighbor Elements for Image-Text Generation
di: Wang, Zihua, et al.
Pubblicazione: (2023)
di: Wang, Zihua, et al.
Pubblicazione: (2023)
Your AI-Generated Image Detector Can Secretly Achieve SOTA Accuracy, If Calibrated
di: Yang, Muli, et al.
Pubblicazione: (2026)
di: Yang, Muli, et al.
Pubblicazione: (2026)
Learning from Mistakes: Iterative Prompt Relabeling for Text-to-Image Diffusion Model Training
di: Chen, Xinyan, et al.
Pubblicazione: (2023)
di: Chen, Xinyan, et al.
Pubblicazione: (2023)
Project-Probe-Aggregate: Efficient Fine-Tuning for Group Robustness
di: Zhu, Beier, et al.
Pubblicazione: (2025)
di: Zhu, Beier, et al.
Pubblicazione: (2025)
EDITOR: Effective and Interpretable Prompt Inversion for Text-to-Image Diffusion Models
di: Li, Mingzhe, et al.
Pubblicazione: (2025)
di: Li, Mingzhe, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Prompt-aligned Gradient for Prompt Tuning
di: Zhu, Beier, et al.
Pubblicazione: (2022) -
Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark
di: Hao, Yunzhuo, et al.
Pubblicazione: (2025) -
Dual-Modal Prompting for Sketch-Based Image Retrieval
di: Gao, Liying, et al.
Pubblicazione: (2024) -
EMMA: Efficient Visual Alignment in Multi-Modal LLMs
di: Ghazanfari, Sara, et al.
Pubblicazione: (2024) -
PromptMID: Modal Invariant Descriptors Based on Diffusion and Vision Foundation Models for Optical-SAR Image Matching
di: Nie, Han, et al.
Pubblicazione: (2025)