Evaluating Text-to-Image and Text-to-Video Synthesis with a Conditional Fréchet Distance
Fuente:
arXiv
Salvato in:
| Autori principali: | Koo, Jaywon, Hernandez, Jefferson, Haji-Ali, Moayed, Yang, Ziyan, Ordonez, Vicente |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
NoiseShift: Resolution-Aware Noise Recalibration for Better Low-Resolution Image Generation
di: He, Ruozhen, et al.
Pubblicazione: (2025)
di: He, Ruozhen, et al.
Pubblicazione: (2025)
ElasticDiffusion: Training-free Arbitrary Size Image Generation through Global-Local Content Separation
di: Haji-Ali, Moayed, et al.
Pubblicazione: (2023)
di: Haji-Ali, Moayed, et al.
Pubblicazione: (2023)
PropTest: Automatic Property Testing for Improved Visual Programming
di: Koo, Jaywon, et al.
Pubblicazione: (2024)
di: Koo, Jaywon, et al.
Pubblicazione: (2024)
Agentic Discovery with Active Hypothesis Exploration for Visual Recognition
di: Koo, Jaywon, et al.
Pubblicazione: (2026)
di: Koo, Jaywon, et al.
Pubblicazione: (2026)
ProxyThinker: Test-Time Guidance through Small Visual Reasoners
di: Xiao, Zilin, et al.
Pubblicazione: (2025)
di: Xiao, Zilin, et al.
Pubblicazione: (2025)
SCoRD: Subject-Conditional Relation Detection with Text-Augmented Data
di: Yang, Ziyan, et al.
Pubblicazione: (2023)
di: Yang, Ziyan, et al.
Pubblicazione: (2023)
ViC-MAE: Self-Supervised Representation Learning from Images and Video with Contrastive Masked Autoencoders
di: Hernandez, Jefferson, et al.
Pubblicazione: (2023)
di: Hernandez, Jefferson, et al.
Pubblicazione: (2023)
Beyond Referring Expressions: Scenario Comprehension Visual Grounding
di: He, Ruozhen, et al.
Pubblicazione: (2026)
di: He, Ruozhen, et al.
Pubblicazione: (2026)
Taming Data and Transformers for Audio Generation
di: Haji-Ali, Moayed, et al.
Pubblicazione: (2024)
di: Haji-Ali, Moayed, et al.
Pubblicazione: (2024)
Improving Progressive Generation with Decomposable Flow Matching
di: Haji-Ali, Moayed, et al.
Pubblicazione: (2025)
di: Haji-Ali, Moayed, et al.
Pubblicazione: (2025)
Anatomy-Aware Conditional Image-Text Retrieval
di: Zheng, Meng, et al.
Pubblicazione: (2025)
di: Zheng, Meng, et al.
Pubblicazione: (2025)
Fréchet Video Motion Distance: A Metric for Evaluating Motion Consistency in Videos
di: Liu, Jiahe, et al.
Pubblicazione: (2024)
di: Liu, Jiahe, et al.
Pubblicazione: (2024)
One Model, Many Budgets: Elastic Latent Interfaces for Diffusion Transformers
di: Haji-Ali, Moayed, et al.
Pubblicazione: (2026)
di: Haji-Ali, Moayed, et al.
Pubblicazione: (2026)
Counting Guidance for High Fidelity Text-to-Image Synthesis
di: Kang, Wonjun, et al.
Pubblicazione: (2023)
di: Kang, Wonjun, et al.
Pubblicazione: (2023)
VidStyleODE: Disentangled Video Editing via StyleGAN and NeuralODEs
di: Ali, Moayed Haji, et al.
Pubblicazione: (2023)
di: Ali, Moayed Haji, et al.
Pubblicazione: (2023)
All-in-One Conditioning for Text-to-Image Synthesis
di: Jayasekara, Hirunima, et al.
Pubblicazione: (2026)
di: Jayasekara, Hirunima, et al.
Pubblicazione: (2026)
Generative Visual Instruction Tuning
di: Hernandez, Jefferson, et al.
Pubblicazione: (2024)
di: Hernandez, Jefferson, et al.
Pubblicazione: (2024)
Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis
di: Su, Tongtong, et al.
Pubblicazione: (2025)
di: Su, Tongtong, et al.
Pubblicazione: (2025)
AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation
di: Haji-Ali, Moayed, et al.
Pubblicazione: (2024)
di: Haji-Ali, Moayed, et al.
Pubblicazione: (2024)
A Pragmatic Note on Evaluating Generative Models with Fréchet Inception Distance for Retinal Image Synthesis
di: Wu, Yuli, et al.
Pubblicazione: (2025)
di: Wu, Yuli, et al.
Pubblicazione: (2025)
EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video Generation
di: He, Ruozhen, et al.
Pubblicazione: (2026)
di: He, Ruozhen, et al.
Pubblicazione: (2026)
On the Content Bias in Fréchet Video Distance
di: Ge, Songwei, et al.
Pubblicazione: (2024)
di: Ge, Songwei, et al.
Pubblicazione: (2024)
HANDI: Hand-Centric Text-and-Image Conditioned Video Generation
di: Li, Yayuan, et al.
Pubblicazione: (2024)
di: Li, Yayuan, et al.
Pubblicazione: (2024)
LOVE: Benchmarking and Evaluating Text-to-Video Generation and Video-to-Text Interpretation
di: Wang, Jiarui, et al.
Pubblicazione: (2025)
di: Wang, Jiarui, et al.
Pubblicazione: (2025)
VidText: Towards Comprehensive Evaluation for Video Text Understanding
di: Yang, Zhoufaran, et al.
Pubblicazione: (2025)
di: Yang, Zhoufaran, et al.
Pubblicazione: (2025)
TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval
di: Zhao, Zixu, et al.
Pubblicazione: (2025)
di: Zhao, Zixu, et al.
Pubblicazione: (2025)
DynamicEval: Rethinking Evaluation for Dynamic Text-to-Video Synthesis
di: Babu, Nithin C., et al.
Pubblicazione: (2025)
di: Babu, Nithin C., et al.
Pubblicazione: (2025)
Facial Image Feature Analysis and its Specialization for Fréchet Distance and Neighborhoods
di: Cetin, Doruk, et al.
Pubblicazione: (2024)
di: Cetin, Doruk, et al.
Pubblicazione: (2024)
PathDiff: Histopathology Image Synthesis with Unpaired Text and Mask Conditions
di: Bhosale, Mahesh, et al.
Pubblicazione: (2025)
di: Bhosale, Mahesh, et al.
Pubblicazione: (2025)
Test-time Conditional Text-to-Image Synthesis Using Diffusion Models
di: Shukla, Tripti, et al.
Pubblicazione: (2024)
di: Shukla, Tripti, et al.
Pubblicazione: (2024)
ConditionVideo: Training-Free Condition-Guided Text-to-Video Generation
di: Peng, Bo, et al.
Pubblicazione: (2023)
di: Peng, Bo, et al.
Pubblicazione: (2023)
Wavelet-Guided Acceleration of Text Inversion in Diffusion-Based Image Editing
di: Koo, Gwanhyeong, et al.
Pubblicazione: (2024)
di: Koo, Gwanhyeong, et al.
Pubblicazione: (2024)
Conditional Text-to-Image Generation with Reference Guidance
di: Kim, Taewook, et al.
Pubblicazione: (2024)
di: Kim, Taewook, et al.
Pubblicazione: (2024)
BideDPO: Conditional Image Generation with Simultaneous Text and Condition Alignment
di: Zhou, Dewei, et al.
Pubblicazione: (2025)
di: Zhou, Dewei, et al.
Pubblicazione: (2025)
Local Conditional Controlling for Text-to-Image Diffusion Models
di: Zhao, Yibo, et al.
Pubblicazione: (2023)
di: Zhao, Yibo, et al.
Pubblicazione: (2023)
SafeGen-Bench: Benchmarking Safety in Image-Conditioned Text-to-Video Generation
di: Ma, Yingzi, et al.
Pubblicazione: (2026)
di: Ma, Yingzi, et al.
Pubblicazione: (2026)
Fréchet Denoised Distance: Enhancing Plausibility Evaluation for Generated Designs with Denoising Autoencoder
di: Fan, Jiajie, et al.
Pubblicazione: (2024)
di: Fan, Jiajie, et al.
Pubblicazione: (2024)
Text-Image Conditioned 3D Generation
di: Cen, Jiazhong, et al.
Pubblicazione: (2026)
di: Cen, Jiazhong, et al.
Pubblicazione: (2026)
Improving Large Vision and Language Models by Learning from a Panel of Peers
di: Hernandez, Jefferson, et al.
Pubblicazione: (2025)
di: Hernandez, Jefferson, et al.
Pubblicazione: (2025)
Progressive Image Restoration via Text-Conditioned Video Generation
di: Kang, Peng, et al.
Pubblicazione: (2025)
di: Kang, Peng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
NoiseShift: Resolution-Aware Noise Recalibration for Better Low-Resolution Image Generation
di: He, Ruozhen, et al.
Pubblicazione: (2025) -
ElasticDiffusion: Training-free Arbitrary Size Image Generation through Global-Local Content Separation
di: Haji-Ali, Moayed, et al.
Pubblicazione: (2023) -
PropTest: Automatic Property Testing for Improved Visual Programming
di: Koo, Jaywon, et al.
Pubblicazione: (2024) -
Agentic Discovery with Active Hypothesis Exploration for Visual Recognition
di: Koo, Jaywon, et al.
Pubblicazione: (2026) -
ProxyThinker: Test-Time Guidance through Small Visual Reasoners
di: Xiao, Zilin, et al.
Pubblicazione: (2025)