Interactive Visual Assessment for Text-to-Image Generation Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Mi, Xiaoyue, Tang, Fan, Cao, Juan, Sheng, Qiang, Huang, Ziyao, Li, Peng, Liu, Yang, Lee, Tong-Yee |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Visual-Friendly Concept Protection via Selective Adversarial Perturbations
par: Mi, Xiaoyue, et autres
Publié: (2024)
par: Mi, Xiaoyue, et autres
Publié: (2024)
Make-Your-Anchor: A Diffusion-based 2D Avatar Generation Framework
par: Huang, Ziyao, et autres
Publié: (2024)
par: Huang, Ziyao, et autres
Publié: (2024)
U-VAP: User-specified Visual Appearance Personalization via Decoupled Self Augmentation
par: Wu, You, et autres
Publié: (2024)
par: Wu, You, et autres
Publié: (2024)
Attend to Not Attended: Structure-then-Detail Token Merging for Post-training DiT Acceleration
par: Fang, Haipeng, et autres
Publié: (2025)
par: Fang, Haipeng, et autres
Publié: (2025)
Topology-preserving Adversarial Training for Alleviating Natural Accuracy Degradation
par: Mi, Xiaoyue, et autres
Publié: (2023)
par: Mi, Xiaoyue, et autres
Publié: (2023)
Text-Visual Semantic Constrained AI-Generated Image Quality Assessment
par: Li, Qiang, et autres
Publié: (2025)
par: Li, Qiang, et autres
Publié: (2025)
TPG-INR: Target Prior-Guided Implicit 3D CT Reconstruction for Enhanced Sparse-view Imaging
par: Cao, Qinglei, et autres
Publié: (2025)
par: Cao, Qinglei, et autres
Publié: (2025)
IP-Prompter: Training-Free Theme-Specific Image Generation via Dynamic Visual Prompting
par: Zhang, Yuxin, et autres
Publié: (2025)
par: Zhang, Yuxin, et autres
Publié: (2025)
AnchorCrafter: Animate Cyber-Anchors Selling Your Products via Human-Object Interacting Video Generation
par: Xu, Ziyi, et autres
Publié: (2024)
par: Xu, Ziyi, et autres
Publié: (2024)
Visual Concept-driven Image Generation with Text-to-Image Diffusion Model
par: Rahman, Tanzila, et autres
Publié: (2024)
par: Rahman, Tanzila, et autres
Publié: (2024)
Beyond Pixels: Visual Metaphor Transfer via Schema-Driven Agentic Reasoning
par: Xu, Yu, et autres
Publié: (2026)
par: Xu, Yu, et autres
Publié: (2026)
Bridging Different Language Models and Generative Vision Models for Text-to-Image Generation
par: Zhao, Shihao, et autres
Publié: (2024)
par: Zhao, Shihao, et autres
Publié: (2024)
HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation
par: Huang, Ziyao, et autres
Publié: (2025)
par: Huang, Ziyao, et autres
Publié: (2025)
Visual Text Generation in the Wild
par: Zhu, Yuanzhi, et autres
Publié: (2024)
par: Zhu, Yuanzhi, et autres
Publié: (2024)
PKU-AIGIQA-4K: A Perceptual Quality Assessment Database for Both Text-to-Image and Image-to-Image AI-Generated Images
par: Yuan, Jiquan, et autres
Publié: (2024)
par: Yuan, Jiquan, et autres
Publié: (2024)
Bridging Cognitive Gap: Hierarchical Description Learning for Artistic Image Aesthetics Assessment
par: Liu, Henglin, et autres
Publié: (2025)
par: Liu, Henglin, et autres
Publié: (2025)
Detect-and-Guide: Self-regulation of Diffusion Models for Safe Text-to-Image Generation via Guideline Token Optimization
par: Li, Feifei, et autres
Publié: (2025)
par: Li, Feifei, et autres
Publié: (2025)
Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models
par: Hu, Nanxing, et autres
Publié: (2025)
par: Hu, Nanxing, et autres
Publié: (2025)
Knowledge Visualization: A Benchmark and Method for Knowledge-Intensive Text-to-Image Generation
par: Zhao, Ran, et autres
Publié: (2026)
par: Zhao, Ran, et autres
Publié: (2026)
HeadRouter: A Training-free Image Editing Framework for MM-DiTs by Adaptively Routing Attention Heads
par: Xu, Yu, et autres
Publié: (2024)
par: Xu, Yu, et autres
Publié: (2024)
Few-Step Distillation for Text-to-Image Generation: A Practical Guide
par: Pu, Yifan, et autres
Publié: (2025)
par: Pu, Yifan, et autres
Publié: (2025)
VAR-CLIP: Text-to-Image Generator with Visual Auto-Regressive Modeling
par: Zhang, Qian, et autres
Publié: (2024)
par: Zhang, Qian, et autres
Publié: (2024)
Controllable Generation with Text-to-Image Diffusion Models: A Survey
par: Cao, Pu, et autres
Publié: (2024)
par: Cao, Pu, et autres
Publié: (2024)
NTIRE 2025 challenge on Text to Image Generation Model Quality Assessment
par: Han, Shuhao, et autres
Publié: (2025)
par: Han, Shuhao, et autres
Publié: (2025)
Precision or Recall? An Analysis of Image Captions for Training Text-to-Image Generation Model
par: Cheng, Sheng, et autres
Publié: (2024)
par: Cheng, Sheng, et autres
Publié: (2024)
EmoGen: Emotional Image Content Generation with Text-to-Image Diffusion Models
par: Yang, Jingyuan, et autres
Publié: (2024)
par: Yang, Jingyuan, et autres
Publié: (2024)
Text-driven Multiplanar Visual Interaction for Semi-supervised Medical Image Segmentation
par: Huang, Kaiwen, et autres
Publié: (2025)
par: Huang, Kaiwen, et autres
Publié: (2025)
Unified Prompt Attack Against Text-to-Image Generation Models
par: Peng, Duo, et autres
Publié: (2025)
par: Peng, Duo, et autres
Publié: (2025)
Detecting Dataset Abuse in Fine-Tuning Stable Diffusion Models for Text-to-Image Synthesis
par: Wang, Songrui, et autres
Publié: (2024)
par: Wang, Songrui, et autres
Publié: (2024)
ArtCrafter: Text-Image Aligning Style Transfer via Embedding Reframing
par: Huang, Nisha, et autres
Publié: (2025)
par: Huang, Nisha, et autres
Publié: (2025)
Multimodal Priors-Augmented Text-Driven 3D Human-Object Interaction Generation
par: Wang, Yin, et autres
Publié: (2026)
par: Wang, Yin, et autres
Publié: (2026)
DreamDrone: Text-to-Image Diffusion Models are Zero-shot Perpetual View Generators
par: Kong, Hanyang, et autres
Publié: (2023)
par: Kong, Hanyang, et autres
Publié: (2023)
DiffChat: Learning to Chat with Text-to-Image Synthesis Models for Interactive Image Creation
par: Wang, Jiapeng, et autres
Publié: (2024)
par: Wang, Jiapeng, et autres
Publié: (2024)
Video Generation Models Are Good Latent Reward Models
par: Mi, Xiaoyue, et autres
Publié: (2025)
par: Mi, Xiaoyue, et autres
Publié: (2025)
Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models
par: Cheng, Hao, et autres
Publié: (2024)
par: Cheng, Hao, et autres
Publié: (2024)
Text-DiFuse: An Interactive Multi-Modal Image Fusion Framework based on Text-modulated Diffusion Model
par: Zhang, Hao, et autres
Publié: (2024)
par: Zhang, Hao, et autres
Publié: (2024)
SketchTriplet: Self-Supervised Scenarized Sketch-Text-Image Triplet Generation
par: Wu, Zhenbei, et autres
Publié: (2024)
par: Wu, Zhenbei, et autres
Publié: (2024)
Beyond Semantic Features: Pixel-level Mapping for Generalized AI-Generated Image Detection
par: Zhou, Chenming, et autres
Publié: (2025)
par: Zhou, Chenming, et autres
Publié: (2025)
Unbridled Icarus: A Survey of the Potential Perils of Image Inputs in Multimodal Large Language Model Security
par: Fan, Yihe, et autres
Publié: (2024)
par: Fan, Yihe, et autres
Publié: (2024)
Harmonizing Visual Text Comprehension and Generation
par: Zhao, Zhen, et autres
Publié: (2024)
par: Zhao, Zhen, et autres
Publié: (2024)
Documents similaires
-
Visual-Friendly Concept Protection via Selective Adversarial Perturbations
par: Mi, Xiaoyue, et autres
Publié: (2024) -
Make-Your-Anchor: A Diffusion-based 2D Avatar Generation Framework
par: Huang, Ziyao, et autres
Publié: (2024) -
U-VAP: User-specified Visual Appearance Personalization via Decoupled Self Augmentation
par: Wu, You, et autres
Publié: (2024) -
Attend to Not Attended: Structure-then-Detail Token Merging for Post-training DiT Acceleration
par: Fang, Haipeng, et autres
Publié: (2025) -
Topology-preserving Adversarial Training for Alleviating Natural Accuracy Degradation
par: Mi, Xiaoyue, et autres
Publié: (2023)