Shape-Guided Diffusion with Inside-Outside Attention
Fuente:
arXiv
Salvato in:
| Autori principali: | Park, Dong Huk, Luo, Grace, Toste, Clayton, Azadi, Samaneh, Liu, Xihui, Karalashvili, Maka, Rohrbach, Anna, Darrell, Trevor |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2022
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Diffusion Hyperfeatures: Searching Through Time and Space for Semantic Correspondence
di: Luo, Grace, et al.
Pubblicazione: (2023)
di: Luo, Grace, et al.
Pubblicazione: (2023)
Readout Guidance: Learning Control from Diffusion Features
di: Luo, Grace, et al.
Pubblicazione: (2023)
di: Luo, Grace, et al.
Pubblicazione: (2023)
Vision-Language Models Create Cross-Modal Task Representations
di: Luo, Grace, et al.
Pubblicazione: (2024)
di: Luo, Grace, et al.
Pubblicazione: (2024)
Dual-Process Image Generation
di: Luo, Grace, et al.
Pubblicazione: (2025)
di: Luo, Grace, et al.
Pubblicazione: (2025)
V$^2$Dial: Unification of Video and Visual Dialog via Multimodal Experts
di: Abdessaied, Adnen, et al.
Pubblicazione: (2025)
di: Abdessaied, Adnen, et al.
Pubblicazione: (2025)
LLM-grounded Diffusion: Enhancing Prompt Understanding of Text-to-Image Diffusion Models with Large Language Models
di: Lian, Long, et al.
Pubblicazione: (2023)
di: Lian, Long, et al.
Pubblicazione: (2023)
DEFAME: Dynamic Evidence-based FAct-checking with Multimodal Experts
di: Braun, Tobias, et al.
Pubblicazione: (2024)
di: Braun, Tobias, et al.
Pubblicazione: (2024)
Diffusion Classifiers Understand Compositionality, but Conditions Apply
di: Jeong, Yujin, et al.
Pubblicazione: (2025)
di: Jeong, Yujin, et al.
Pubblicazione: (2025)
Chrono: A Simple Blueprint for Representing Time in MLLMs
di: Rodriguez, Hector, et al.
Pubblicazione: (2024)
di: Rodriguez, Hector, et al.
Pubblicazione: (2024)
Tuning Just Enough: Lightweight Backdoor Attacks on Multi-Encoder Diffusion Models
di: Chen, Ziyuan, et al.
Pubblicazione: (2026)
di: Chen, Ziyuan, et al.
Pubblicazione: (2026)
Segment Anything without Supervision
di: Wang, XuDong, et al.
Pubblicazione: (2024)
di: Wang, XuDong, et al.
Pubblicazione: (2024)
VeriTaS: The First Dynamic Benchmark for Multimodal Automated Fact-Checking
di: Rothermel, Mark, et al.
Pubblicazione: (2026)
di: Rothermel, Mark, et al.
Pubblicazione: (2026)
Generating Multi-Image Synthetic Data for Text-to-Image Customization
di: Kumari, Nupur, et al.
Pubblicazione: (2025)
di: Kumari, Nupur, et al.
Pubblicazione: (2025)
UnSAMv2: Self-Supervised Learning Enables Segment Anything at Any Granularity
di: Yu, Junwei, et al.
Pubblicazione: (2025)
di: Yu, Junwei, et al.
Pubblicazione: (2025)
MotiF: Making Text Count in Image Animation with Motion Focal Loss
di: Wang, Shijie, et al.
Pubblicazione: (2024)
di: Wang, Shijie, et al.
Pubblicazione: (2024)
When Do Diffusion Models learn to Generate Multiple Objects?
di: Jeong, Yujin, et al.
Pubblicazione: (2026)
di: Jeong, Yujin, et al.
Pubblicazione: (2026)
HaloProbe: Bayesian Detection and Mitigation of Object Hallucinations in Vision-Language Models
di: Zohrabi, Reihaneh, et al.
Pubblicazione: (2026)
di: Zohrabi, Reihaneh, et al.
Pubblicazione: (2026)
LLM-grounded Video Diffusion Models
di: Lian, Long, et al.
Pubblicazione: (2023)
di: Lian, Long, et al.
Pubblicazione: (2023)
Spurious-Aware Prototype Refinement for Reliable Out-of-Distribution Detection
di: Zohrabi, Reihaneh, et al.
Pubblicazione: (2025)
di: Zohrabi, Reihaneh, et al.
Pubblicazione: (2025)
Constantly Improving Image Models Need Constantly Improving Benchmarks
di: Ge, Jiaxin, et al.
Pubblicazione: (2025)
di: Ge, Jiaxin, et al.
Pubblicazione: (2025)
It's Never Too Late: Noise Optimization for Collapse Recovery in Trained Diffusion Models
di: Harrington, Anne, et al.
Pubblicazione: (2025)
di: Harrington, Anne, et al.
Pubblicazione: (2025)
InstanceDiffusion: Instance-level Control for Image Generation
di: Wang, Xudong, et al.
Pubblicazione: (2024)
di: Wang, Xudong, et al.
Pubblicazione: (2024)
Reconstruction Alignment Improves Unified Multimodal Models
di: Xie, Ji, et al.
Pubblicazione: (2025)
di: Xie, Ji, et al.
Pubblicazione: (2025)
ODPG: Outfitting Diffusion with Pose Guided Condition
di: Lee, Seohyun, et al.
Pubblicazione: (2025)
di: Lee, Seohyun, et al.
Pubblicazione: (2025)
Diffree: Text-Guided Shape Free Object Inpainting with Diffusion Model
di: Zhao, Lirui, et al.
Pubblicazione: (2024)
di: Zhao, Lirui, et al.
Pubblicazione: (2024)
Vector Quantized Feature Fields for Fast 3D Semantic Lifting
di: Tang, George, et al.
Pubblicazione: (2025)
di: Tang, George, et al.
Pubblicazione: (2025)
Finding Visual Task Vectors
di: Hojel, Alberto, et al.
Pubblicazione: (2024)
di: Hojel, Alberto, et al.
Pubblicazione: (2024)
When Do We Not Need Larger Vision Models?
di: Shi, Baifeng, et al.
Pubblicazione: (2024)
di: Shi, Baifeng, et al.
Pubblicazione: (2024)
SIEVES: Selective Prediction Generalizes through Visual Evidence Scoring
di: Rodriguez, Hector G., et al.
Pubblicazione: (2026)
di: Rodriguez, Hector G., et al.
Pubblicazione: (2026)
Prompt2Perturb (P2P): Text-Guided Diffusion-Based Adversarial Attacks on Breast Ultrasound Images
di: Medghalchi, Yasamin, et al.
Pubblicazione: (2024)
di: Medghalchi, Yasamin, et al.
Pubblicazione: (2024)
RAGSR: Regional Attention Guided Diffusion for Image Super-Resolution
di: He, Haodong, et al.
Pubblicazione: (2025)
di: He, Haodong, et al.
Pubblicazione: (2025)
UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation
di: Guo, Qin, et al.
Pubblicazione: (2025)
di: Guo, Qin, et al.
Pubblicazione: (2025)
LaCon: Late-Constraint Diffusion for Steerable Guided Image Synthesis
di: Liu, Chang, et al.
Pubblicazione: (2023)
di: Liu, Chang, et al.
Pubblicazione: (2023)
Coherent Video Inpainting Using Optical Flow-Guided Efficient Diffusion
di: Gu, Bohai, et al.
Pubblicazione: (2024)
di: Gu, Bohai, et al.
Pubblicazione: (2024)
4Diffusion: Multi-view Video Diffusion Model for 4D Generation
di: Zhang, Haiyu, et al.
Pubblicazione: (2024)
di: Zhang, Haiyu, et al.
Pubblicazione: (2024)
Visual Lexicon: Rich Image Features in Language Space
di: Wang, XuDong, et al.
Pubblicazione: (2024)
di: Wang, XuDong, et al.
Pubblicazione: (2024)
Attention Frequency Modulation: Training-Free Spectral Modulation of Diffusion Cross-Attention
di: Oh, Seunghun, et al.
Pubblicazione: (2026)
di: Oh, Seunghun, et al.
Pubblicazione: (2026)
Atlas: Multi-Scale Attention Improves Long Context Image Modeling
di: Agrawal, Kumar Krishna, et al.
Pubblicazione: (2025)
di: Agrawal, Kumar Krishna, et al.
Pubblicazione: (2025)
Neural Network Diffusion
di: Wang, Kai, et al.
Pubblicazione: (2024)
di: Wang, Kai, et al.
Pubblicazione: (2024)
Hidden in plain sight: VLMs overlook their visual representations
di: Fu, Stephanie, et al.
Pubblicazione: (2025)
di: Fu, Stephanie, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Diffusion Hyperfeatures: Searching Through Time and Space for Semantic Correspondence
di: Luo, Grace, et al.
Pubblicazione: (2023) -
Readout Guidance: Learning Control from Diffusion Features
di: Luo, Grace, et al.
Pubblicazione: (2023) -
Vision-Language Models Create Cross-Modal Task Representations
di: Luo, Grace, et al.
Pubblicazione: (2024) -
Dual-Process Image Generation
di: Luo, Grace, et al.
Pubblicazione: (2025) -
V$^2$Dial: Unification of Video and Visual Dialog via Multimodal Experts
di: Abdessaied, Adnen, et al.
Pubblicazione: (2025)