Semantic Approach to Quantifying the Consistency of Diffusion Model Image Generation
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Bent, Brinnae |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Foundational Generative Model for Breast Ultrasound Image Analysis
par: Yu, Haojun, et autres
Publié: (2025)
par: Yu, Haojun, et autres
Publié: (2025)
Zero-shot Emotion Annotation in Facial Images Using Large Multimodal Models: Benchmarking and Prospects for Multi-Class, Multi-Frame Approaches
par: Zhang, He, et autres
Publié: (2025)
par: Zhang, He, et autres
Publié: (2025)
Generating Synthetic Satellite Imagery With Deep-Learning Text-to-Image Models -- Technical Challenges and Implications for Monitoring and Verification
par: Nguyen, Tuong Vy, et autres
Publié: (2024)
par: Nguyen, Tuong Vy, et autres
Publié: (2024)
LEDITS++: Limitless Image Editing using Text-to-Image Models
par: Brack, Manuel, et autres
Publié: (2023)
par: Brack, Manuel, et autres
Publié: (2023)
MNIST-Gen: A Modular MNIST-Style Dataset Generation Using Hierarchical Semantics, Reinforcement Learning, and Category Theory
par: Shaeri, Pouya, et autres
Publié: (2025)
par: Shaeri, Pouya, et autres
Publié: (2025)
HERO: Human-Feedback Efficient Reinforcement Learning for Online Diffusion Model Finetuning
par: Hiranaka, Ayano, et autres
Publié: (2024)
par: Hiranaka, Ayano, et autres
Publié: (2024)
ExpressEdit: Fast Editing of Stylized Facial Expressions with Diffusion Models in Photoshop
par: Tang, Kenan, et autres
Publié: (2026)
par: Tang, Kenan, et autres
Publié: (2026)
Screen2AX: Vision-Based Approach for Automatic macOS Accessibility Generation
par: Muryn, Viktor, et autres
Publié: (2025)
par: Muryn, Viktor, et autres
Publié: (2025)
I-CEE: Tailoring Explanations of Image Classification Models to User Expertise
par: Rong, Yao, et autres
Publié: (2023)
par: Rong, Yao, et autres
Publié: (2023)
Efficient Retail Video Annotation: A Robust Key Frame Generation Approach for Product and Customer Interaction Analysis
par: Mannam, Varun, et autres
Publié: (2025)
par: Mannam, Varun, et autres
Publié: (2025)
FERGI: Automatic Scoring of User Preferences for Text-to-Image Generation from Spontaneous Facial Expression Reaction
par: Feng, Shuangquan, et autres
Publié: (2023)
par: Feng, Shuangquan, et autres
Publié: (2023)
SpiderNets: Vision Models Predict Human Fear From Aversive Images
par: Pegler, Dominik, et autres
Publié: (2025)
par: Pegler, Dominik, et autres
Publié: (2025)
Interaction as Explanation: A User Interaction-based Method for Explaining Image Classification Models
par: Yun, Hyeonggeun
Publié: (2024)
par: Yun, Hyeonggeun
Publié: (2024)
What's Producible May Not Be Reachable: Measuring the Steerability of Generative Models
par: Vafa, Keyon, et autres
Publié: (2025)
par: Vafa, Keyon, et autres
Publié: (2025)
DebiasPI: Inference-time Debiasing by Prompt Iteration of a Text-to-Image Generative Model
par: Bonna, Sarah, et autres
Publié: (2025)
par: Bonna, Sarah, et autres
Publié: (2025)
Generating Synthetic Satellite Imagery for Rare Objects: An Empirical Comparison of Models and Metrics
par: Nguyen, Tuong Vy, et autres
Publié: (2024)
par: Nguyen, Tuong Vy, et autres
Publié: (2024)
Characterizing Photorealism and Artifacts in Diffusion Model-Generated Images
par: Kamali, Negar, et autres
Publié: (2025)
par: Kamali, Negar, et autres
Publié: (2025)
QPM: Discrete Optimization for Globally Interpretable Image Classification
par: Norrenbrock, Thomas, et autres
Publié: (2025)
par: Norrenbrock, Thomas, et autres
Publié: (2025)
Deep Learning Based Approach to Enhanced Recognition of Emotions and Behavioral Patterns of Autistic Children
par: R, Nelaka K. A., et autres
Publié: (2025)
par: R, Nelaka K. A., et autres
Publié: (2025)
Improving Uncertainty-Error Correspondence in Deep Bayesian Medical Image Segmentation
par: Mody, Prerak, et autres
Publié: (2024)
par: Mody, Prerak, et autres
Publié: (2024)
A Study of Acquisition Functions for Medical Imaging Deep Active Learning
par: Dossou, Bonaventure F. P.
Publié: (2024)
par: Dossou, Bonaventure F. P.
Publié: (2024)
Efficient Personalization of Generative User Interfaces
par: Peng, Yi-Hao, et autres
Publié: (2026)
par: Peng, Yi-Hao, et autres
Publié: (2026)
GPT Sonograpy: Hand Gesture Decoding from Forearm Ultrasound Images via VLM
par: Bimbraw, Keshav, et autres
Publié: (2024)
par: Bimbraw, Keshav, et autres
Publié: (2024)
Generalization of CNNs on Relational Reasoning with Bar Charts
par: Cui, Zhenxing, et autres
Publié: (2025)
par: Cui, Zhenxing, et autres
Publié: (2025)
Revision Matters: Generative Design Guided by Revision Edits
par: Li, Tao, et autres
Publié: (2024)
par: Li, Tao, et autres
Publié: (2024)
ThermoHands: A Benchmark for 3D Hand Pose Estimation from Egocentric Thermal Images
par: Ding, Fangqiang, et autres
Publié: (2024)
par: Ding, Fangqiang, et autres
Publié: (2024)
Deep Generative Domain Adaptation with Temporal Attention for Cross-User Activity Recognition
par: Ye, Xiaozhou, et autres
Publié: (2024)
par: Ye, Xiaozhou, et autres
Publié: (2024)
EmoGene: Audio-Driven Emotional 3D Talking-Head Generation
par: Wang, Wenqing, et autres
Publié: (2024)
par: Wang, Wenqing, et autres
Publié: (2024)
Deep Generative Domain Adaptation with Temporal Relation Knowledge for Cross-User Activity Recognition
par: Ye, Xiaozhou, et autres
Publié: (2024)
par: Ye, Xiaozhou, et autres
Publié: (2024)
Unraveling the Truth: Do VLMs really Understand Charts? A Deep Dive into Consistency and Robustness
par: Mukhopadhyay, Srija, et autres
Publié: (2024)
par: Mukhopadhyay, Srija, et autres
Publié: (2024)
Training a Vision Language Model as Smartphone Assistant
par: Dorka, Nicolai, et autres
Publié: (2024)
par: Dorka, Nicolai, et autres
Publié: (2024)
A Survey on Trustworthiness in Foundation Models for Medical Image Analysis
par: Shi, Congzhen, et autres
Publié: (2024)
par: Shi, Congzhen, et autres
Publié: (2024)
InterVLS: Interactive Model Understanding and Improvement with Vision-Language Surrogates
par: Huang, Jinbin, et autres
Publié: (2023)
par: Huang, Jinbin, et autres
Publié: (2023)
Predicting and Explaining Mobile UI Tappability with Vision Modeling and Saliency Analysis
par: Schoop, Eldon, et autres
Publié: (2022)
par: Schoop, Eldon, et autres
Publié: (2022)
Evaluating VisualRAG: Quantifying Cross-Modal Performance in Enterprise Document Understanding
par: Mannam, Varun, et autres
Publié: (2025)
par: Mannam, Varun, et autres
Publié: (2025)
ReSemAct: Advancing Fine-Grained Robotic Manipulation via Semantic Structuring and Affordance Refinement
par: Su, Chenyu, et autres
Publié: (2025)
par: Su, Chenyu, et autres
Publié: (2025)
Vision-Language Models for Ergonomic Assessment of Manual Lifting Tasks: Estimating Horizontal and Vertical Hand Distances from RGB Video
par: Rajabi, Mohammad Sadra, et autres
Publié: (2026)
par: Rajabi, Mohammad Sadra, et autres
Publié: (2026)
ML-EcoLyzer: Quantifying the Environmental Cost of Machine Learning Inference Across Frameworks and Hardware
par: Minoza, Jose Marie Antonio, et autres
Publié: (2025)
par: Minoza, Jose Marie Antonio, et autres
Publié: (2025)
NeuralOS: Towards Simulating Operating Systems via Neural Generative Models
par: Rivard, Luke, et autres
Publié: (2025)
par: Rivard, Luke, et autres
Publié: (2025)
An Approach to Systematic Data Acquisition and Data-Driven Simulation for the Safety Testing of Automated Driving Functions
par: Eisemann, Leon, et autres
Publié: (2024)
par: Eisemann, Leon, et autres
Publié: (2024)
Documents similaires
-
A Foundational Generative Model for Breast Ultrasound Image Analysis
par: Yu, Haojun, et autres
Publié: (2025) -
Zero-shot Emotion Annotation in Facial Images Using Large Multimodal Models: Benchmarking and Prospects for Multi-Class, Multi-Frame Approaches
par: Zhang, He, et autres
Publié: (2025) -
Generating Synthetic Satellite Imagery With Deep-Learning Text-to-Image Models -- Technical Challenges and Implications for Monitoring and Verification
par: Nguyen, Tuong Vy, et autres
Publié: (2024) -
LEDITS++: Limitless Image Editing using Text-to-Image Models
par: Brack, Manuel, et autres
Publié: (2023) -
MNIST-Gen: A Modular MNIST-Style Dataset Generation Using Hierarchical Semantics, Reinforcement Learning, and Category Theory
par: Shaeri, Pouya, et autres
Publié: (2025)