Beyond the Noise: Aligning Prompts with Latent Representations in Diffusion Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Ramos, Vasco, Cohen, Regev, Szpektor, Idan, Magalhaes, Joao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Latent Beam Diffusion Models for Generating Visual Sequences
di: Fernandes, Guilherme, et al.
Pubblicazione: (2025)
di: Fernandes, Guilherme, et al.
Pubblicazione: (2025)
Contrastive Sequential-Diffusion Learning: Non-linear and Multi-Scene Instructional Video Synthesis
di: Ramos, Vasco, et al.
Pubblicazione: (2024)
di: Ramos, Vasco, et al.
Pubblicazione: (2024)
Generating Coherent Sequences of Visual Illustrations for Real-World Manual Tasks
di: Bordalo, João, et al.
Pubblicazione: (2024)
di: Bordalo, João, et al.
Pubblicazione: (2024)
Anchored Diffusion for Video Face Reenactment
di: Kligvasser, Idan, et al.
Pubblicazione: (2024)
di: Kligvasser, Idan, et al.
Pubblicazione: (2024)
Looks Too Good To Be True: An Information-Theoretic Analysis of Hallucinations in Generative Restoration Models
di: Cohen, Regev, et al.
Pubblicazione: (2024)
di: Cohen, Regev, et al.
Pubblicazione: (2024)
Unblocking Fine-Grained Evaluation of Detailed Captions: An Explaining AutoRater and Critic-and-Revise Pipeline
di: Gordon, Brian, et al.
Pubblicazione: (2025)
di: Gordon, Brian, et al.
Pubblicazione: (2025)
TALC: Time-Aligned Captions for Multi-Scene Text-to-Video Generation
di: Bansal, Hritik, et al.
Pubblicazione: (2024)
di: Bansal, Hritik, et al.
Pubblicazione: (2024)
FineVAU: A Novel Human-Aligned Benchmark for Fine-Grained Video Anomaly Understanding
di: Pereira, João, et al.
Pubblicazione: (2026)
di: Pereira, João, et al.
Pubblicazione: (2026)
Diffusion-Based sRGB Real Noise Generation via Prompt-Driven Noise Representation Learning
di: Ko, Jaekyun, et al.
Pubblicazione: (2026)
di: Ko, Jaekyun, et al.
Pubblicazione: (2026)
Mismatch Quest: Visual and Textual Feedback for Image-Text Misalignment
di: Gordon, Brian, et al.
Pubblicazione: (2023)
di: Gordon, Brian, et al.
Pubblicazione: (2023)
Bridging the Visual Gap: Fine-Tuning Multimodal Models with Knowledge-Adapted Captions
di: Yanuka, Moran, et al.
Pubblicazione: (2024)
di: Yanuka, Moran, et al.
Pubblicazione: (2024)
Forging and Removing Latent-Noise Diffusion Watermarks Using a Single Image
di: Jain, Anubhav, et al.
Pubblicazione: (2025)
di: Jain, Anubhav, et al.
Pubblicazione: (2025)
What Matters for Diffusion-Friendly Latent Manifold? Prior-Aligned Autoencoders for Latent Diffusion
di: Yue, Zhengrong, et al.
Pubblicazione: (2026)
di: Yue, Zhengrong, et al.
Pubblicazione: (2026)
Aligning Diffusion Models with Noise-Conditioned Perception
di: Gambashidze, Alexander, et al.
Pubblicazione: (2024)
di: Gambashidze, Alexander, et al.
Pubblicazione: (2024)
Video-STaR: Self-Training Enables Video Instruction Tuning with Any Supervision
di: Zohar, Orr, et al.
Pubblicazione: (2024)
di: Zohar, Orr, et al.
Pubblicazione: (2024)
Beyond the Linear Separability Ceiling: Aligning Representations in VLMs
di: Vompa, Enrico, et al.
Pubblicazione: (2025)
di: Vompa, Enrico, et al.
Pubblicazione: (2025)
Face inpainting with Identity Preserving Latent Diffusion Models
di: Santos, João, et al.
Pubblicazione: (2026)
di: Santos, João, et al.
Pubblicazione: (2026)
Prompt-SID: Learning Structural Representation Prompt via Latent Diffusion for Single-Image Denoising
di: Li, Huaqiu, et al.
Pubblicazione: (2025)
di: Li, Huaqiu, et al.
Pubblicazione: (2025)
Aligned Datasets Improve Detection of Latent Diffusion-Generated Images
di: Rajan, Anirudh Sundara, et al.
Pubblicazione: (2024)
di: Rajan, Anirudh Sundara, et al.
Pubblicazione: (2024)
MoAlign: Motion-Centric Representation Alignment for Video Diffusion Models
di: Bhowmik, Aritra, et al.
Pubblicazione: (2025)
di: Bhowmik, Aritra, et al.
Pubblicazione: (2025)
Boosting Latent Diffusion Models via Disentangled Representation Alignment
di: Page, John, et al.
Pubblicazione: (2026)
di: Page, John, et al.
Pubblicazione: (2026)
CASL: Concept-Aligned Sparse Latents for Interpreting Diffusion Models
di: He, Zhenghao, et al.
Pubblicazione: (2026)
di: He, Zhenghao, et al.
Pubblicazione: (2026)
Diffusion Model as a Noise-Aware Latent Reward Model for Step-Level Preference Optimization
di: Zhang, Tao, et al.
Pubblicazione: (2025)
di: Zhang, Tao, et al.
Pubblicazione: (2025)
LADB: Latent Aligned Diffusion Bridges for Semi-Supervised Domain Translation
di: Wang, Xuqin, et al.
Pubblicazione: (2025)
di: Wang, Xuqin, et al.
Pubblicazione: (2025)
Self-ReS: Self-Reflection in Large Vision-Language Models for Long Video Understanding
di: Pereira, Joao, et al.
Pubblicazione: (2025)
di: Pereira, Joao, et al.
Pubblicazione: (2025)
Seeing Isn't Knowing: Do VLMs Know When Not to Answer Spatial Questions (and Why)?
di: Zhang, Yue, et al.
Pubblicazione: (2026)
di: Zhang, Yue, et al.
Pubblicazione: (2026)
Editor's Choice: Evaluating Abstract Intent in Image Editing through Atomic Entity Analysis
di: Ventura, Mor, et al.
Pubblicazione: (2026)
di: Ventura, Mor, et al.
Pubblicazione: (2026)
Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation
di: Zhang, Wenchao, et al.
Pubblicazione: (2025)
di: Zhang, Wenchao, et al.
Pubblicazione: (2025)
Beyond Binary Preference: Aligning Diffusion Models to Fine-grained Criteria by Decoupling Attributes
di: Meng, Chenye, et al.
Pubblicazione: (2026)
di: Meng, Chenye, et al.
Pubblicazione: (2026)
Canonical Latent Representations in Conditional Diffusion Models
di: Xu, Yitao, et al.
Pubblicazione: (2025)
di: Xu, Yitao, et al.
Pubblicazione: (2025)
Smoothed Preference Optimization via ReNoise Inversion for Aligning Diffusion Models with Varied Human Preferences
di: Lu, Yunhong, et al.
Pubblicazione: (2025)
di: Lu, Yunhong, et al.
Pubblicazione: (2025)
Prompt-A-Video: Prompt Your Video Diffusion Model via Preference-Aligned LLM
di: Ji, Yatai, et al.
Pubblicazione: (2024)
di: Ji, Yatai, et al.
Pubblicazione: (2024)
Detection-Driven Object Count Optimization for Text-to-Image Diffusion Models
di: Zafar, Oz, et al.
Pubblicazione: (2024)
di: Zafar, Oz, et al.
Pubblicazione: (2024)
Visual Riddles: a Commonsense and World Knowledge Challenge for Large Vision and Language Models
di: Bitton-Guetta, Nitzan, et al.
Pubblicazione: (2024)
di: Bitton-Guetta, Nitzan, et al.
Pubblicazione: (2024)
Anatomy-Grounded Weakly Supervised Prompt Tuning for Chest X-ray Latent Diffusion Models
di: Vilouras, Konstantinos, et al.
Pubblicazione: (2025)
di: Vilouras, Konstantinos, et al.
Pubblicazione: (2025)
LEAF: Latent Diffusion with Efficient Encoder Distillation for Aligned Features in Medical Image Segmentation
di: Huang, Qilin, et al.
Pubblicazione: (2025)
di: Huang, Qilin, et al.
Pubblicazione: (2025)
SG-LDM: Semantic-Guided LiDAR Generation via Latent-Aligned Diffusion
di: Xiang, Zhengkang, et al.
Pubblicazione: (2025)
di: Xiang, Zhengkang, et al.
Pubblicazione: (2025)
Error-Driven Scene Editing for 3D Grounding in Large Language Models
di: Zhang, Yue, et al.
Pubblicazione: (2025)
di: Zhang, Yue, et al.
Pubblicazione: (2025)
MoralCLIP: Contrastive Alignment of Vision-and-Language Representations with Moral Foundations Theory
di: Condez, Ana Carolina, et al.
Pubblicazione: (2025)
di: Condez, Ana Carolina, et al.
Pubblicazione: (2025)
PALP: Prompt Aligned Personalization of Text-to-Image Models
di: Arar, Moab, et al.
Pubblicazione: (2024)
di: Arar, Moab, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Latent Beam Diffusion Models for Generating Visual Sequences
di: Fernandes, Guilherme, et al.
Pubblicazione: (2025) -
Contrastive Sequential-Diffusion Learning: Non-linear and Multi-Scene Instructional Video Synthesis
di: Ramos, Vasco, et al.
Pubblicazione: (2024) -
Generating Coherent Sequences of Visual Illustrations for Real-World Manual Tasks
di: Bordalo, João, et al.
Pubblicazione: (2024) -
Anchored Diffusion for Video Face Reenactment
di: Kligvasser, Idan, et al.
Pubblicazione: (2024) -
Looks Too Good To Be True: An Information-Theoretic Analysis of Hallucinations in Generative Restoration Models
di: Cohen, Regev, et al.
Pubblicazione: (2024)