FAM Diffusion: Frequency and Attention Modulation for High-Resolution Image Generation with Stable Diffusion
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Haosen, Bulat, Adrian, Hadji, Isma, Pham, Hai X., Zhu, Xiatian, Tzimiropoulos, Georgios, Martinez, Brais |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
You Only Need One Step: Fast Super-Resolution with Stable Diffusion via Scale Distillation
por: Noroozi, Mehdi, et al.
Publicado: (2024)
por: Noroozi, Mehdi, et al.
Publicado: (2024)
Hierarchical Image Tokenization for Multi-Scale Image Super Resolution
por: Hadji, Isma, et al.
Publicado: (2026)
por: Hadji, Isma, et al.
Publicado: (2026)
Multi-scale Image Super Resolution with a Single Auto-Regressive Model
por: Sanchez, Enrique, et al.
Publicado: (2025)
por: Sanchez, Enrique, et al.
Publicado: (2025)
Edge-SD-SR: Low Latency and Parameter Efficient On-device Super-Resolution with Stable Diffusion via Bidirectional Conditioning
por: Noroozi, Mehdi, et al.
Publicado: (2024)
por: Noroozi, Mehdi, et al.
Publicado: (2024)
Knowledge Distillation Meets Open-Set Semi-Supervised Learning
por: Yang, Jing, et al.
Publicado: (2022)
por: Yang, Jing, et al.
Publicado: (2022)
Restore, Assess, Repeat: A Unified Framework for Iterative Image Restoration
por: Chen, I-Hsiang, et al.
Publicado: (2026)
por: Chen, I-Hsiang, et al.
Publicado: (2026)
CLIP-DPO: Vision-Language Models as a Source of Preference for Fixing Hallucinations in LVLMs
por: Ouali, Yassine, et al.
Publicado: (2024)
por: Ouali, Yassine, et al.
Publicado: (2024)
Graph Guided Question Answer Generation for Procedural Question-Answering
por: Pham, Hai X., et al.
Publicado: (2024)
por: Pham, Hai X., et al.
Publicado: (2024)
Aligned Unsupervised Pretraining of Object Detectors with Self-training
por: Metaxas, Ioannis Maniadis, et al.
Publicado: (2023)
por: Metaxas, Ioannis Maniadis, et al.
Publicado: (2023)
Fwd2Bot: LVLM Visual Token Compression with Double Forward Bottleneck
por: Bulat, Adrian, et al.
Publicado: (2025)
por: Bulat, Adrian, et al.
Publicado: (2025)
FFF: Fixing Flawed Foundations in contrastive pre-training results in very strong Vision-Language models
por: Bulat, Adrian, et al.
Publicado: (2024)
por: Bulat, Adrian, et al.
Publicado: (2024)
More Images, More Problems? A Controlled Analysis of VLM Failure Modes
por: Das, Anurag, et al.
Publicado: (2026)
por: Das, Anurag, et al.
Publicado: (2026)
VladVA: Discriminative Fine-tuning of LVLMs
por: Ouali, Yassine, et al.
Publicado: (2024)
por: Ouali, Yassine, et al.
Publicado: (2024)
Single Image, Any Face: Generalisable 3D Face Generation
por: Wang, Wenqing, et al.
Publicado: (2024)
por: Wang, Wenqing, et al.
Publicado: (2024)
Vision-Free Retrieval: Rethinking Multimodal Search with Textual Scene Descriptions
por: Ntinou, Ioanna, et al.
Publicado: (2025)
por: Ntinou, Ioanna, et al.
Publicado: (2025)
VISion On Request: Enhanced VLLM efficiency with sparse, dynamically selected, vision-language interactions
por: Bulat, Adrian, et al.
Publicado: (2026)
por: Bulat, Adrian, et al.
Publicado: (2026)
DiffusionAct: Controllable Diffusion Autoencoder for One-shot Face Reenactment
por: Bounareli, Stella, et al.
Publicado: (2024)
por: Bounareli, Stella, et al.
Publicado: (2024)
No Hard Negatives Required: Concept Centric Learning Leads to Compositionality without Degrading Zero-shot Capabilities of Contrastive Models
por: Pham, Hai X., et al.
Publicado: (2026)
por: Pham, Hai X., et al.
Publicado: (2026)
Dynamic Avatar-Scene Rendering from Human-centric Context
por: Wang, Wenqing, et al.
Publicado: (2025)
por: Wang, Wenqing, et al.
Publicado: (2025)
Attention Frequency Modulation: Training-Free Spectral Modulation of Diffusion Cross-Attention
por: Oh, Seunghun, et al.
Publicado: (2026)
por: Oh, Seunghun, et al.
Publicado: (2026)
Uncertainty-Aware Pseudo-Label Filtering for Source-Free Unsupervised Domain Adaptation
por: Chen, Xi, et al.
Publicado: (2024)
por: Chen, Xi, et al.
Publicado: (2024)
AV-GS: Learning Material and Geometry Aware Priors for Novel View Acoustic Synthesis
por: Bhosale, Swapnil, et al.
Publicado: (2024)
por: Bhosale, Swapnil, et al.
Publicado: (2024)
Unsupervised Audio-Visual Segmentation with Modality Alignment
por: Bhosale, Swapnil, et al.
Publicado: (2024)
por: Bhosale, Swapnil, et al.
Publicado: (2024)
FrozenSeg: Harmonizing Frozen Foundation Models for Open-Vocabulary Segmentation
por: Chen, Xi, et al.
Publicado: (2024)
por: Chen, Xi, et al.
Publicado: (2024)
Enhancing High-Resolution 3D Generation through Pixel-wise Gradient Clipping
por: Pan, Zijie, et al.
Publicado: (2023)
por: Pan, Zijie, et al.
Publicado: (2023)
Training-Free Generation of Diverse and High-Fidelity Images via Prompt Semantic Space Optimization
por: Meng, Debin, et al.
Publicado: (2025)
por: Meng, Debin, et al.
Publicado: (2025)
Improving Gaussian Splatting with Localized Points Management
por: Yang, Haosen, et al.
Publicado: (2024)
por: Yang, Haosen, et al.
Publicado: (2024)
HDW-SR: High-Frequency Guided Diffusion Model based on Wavelet Decomposition for Image Super-Resolution
por: Yang, Chao, et al.
Publicado: (2025)
por: Yang, Chao, et al.
Publicado: (2025)
CookingDiffusion: Cooking Procedural Image Generation with Stable Diffusion
por: Wang, Yuan, et al.
Publicado: (2025)
por: Wang, Yuan, et al.
Publicado: (2025)
MobileQuant: Mobile-friendly Quantization for On-device Language Models
por: Tan, Fuwen, et al.
Publicado: (2024)
por: Tan, Fuwen, et al.
Publicado: (2024)
Diffusion Deepfake
por: Bhattacharyya, Chaitali, et al.
Publicado: (2024)
por: Bhattacharyya, Chaitali, et al.
Publicado: (2024)
Dynamic Attention-Guided Diffusion for Image Super-Resolution
por: Moser, Brian B., et al.
Publicado: (2023)
por: Moser, Brian B., et al.
Publicado: (2023)
A Nonlinear Hybrid Filter for Salt & Pepper Noise Removal from Color Images
por: Isma Irum
Publicado: (2015)
por: Isma Irum
Publicado: (2015)
Synthesis and Perceptual Scaling of High Resolution Naturalistic Images Using Stable Diffusion
por: Pettini, Leonardo, et al.
Publicado: (2024)
por: Pettini, Leonardo, et al.
Publicado: (2024)
PRISM: High-Resolution & Precise Counterfactual Medical Image Generation using Language-guided Stable Diffusion
por: Kumar, Amar, et al.
Publicado: (2025)
por: Kumar, Amar, et al.
Publicado: (2025)
Diffusion Transformer-to-Mamba Distillation for High-Resolution Image Generation
por: Yao, Yuan, et al.
Publicado: (2025)
por: Yao, Yuan, et al.
Publicado: (2025)
Ultra-High-Resolution Image Synthesis with Pyramid Diffusion Model
por: Yang, Jiajie
Publicado: (2024)
por: Yang, Jiajie
Publicado: (2024)
Recognize Any Regions
por: Yang, Haosen, et al.
Publicado: (2023)
por: Yang, Haosen, et al.
Publicado: (2023)
RAGSR: Regional Attention Guided Diffusion for Image Super-Resolution
por: He, Haodong, et al.
Publicado: (2025)
por: He, Haodong, et al.
Publicado: (2025)
Multiscale Vision Transformers meet Bipartite Matching for efficient single-stage Action Localization
por: Ntinou, Ioanna, et al.
Publicado: (2023)
por: Ntinou, Ioanna, et al.
Publicado: (2023)
Ejemplares similares
-
You Only Need One Step: Fast Super-Resolution with Stable Diffusion via Scale Distillation
por: Noroozi, Mehdi, et al.
Publicado: (2024) -
Hierarchical Image Tokenization for Multi-Scale Image Super Resolution
por: Hadji, Isma, et al.
Publicado: (2026) -
Multi-scale Image Super Resolution with a Single Auto-Regressive Model
por: Sanchez, Enrique, et al.
Publicado: (2025) -
Edge-SD-SR: Low Latency and Parameter Efficient On-device Super-Resolution with Stable Diffusion via Bidirectional Conditioning
por: Noroozi, Mehdi, et al.
Publicado: (2024) -
Knowledge Distillation Meets Open-Set Semi-Supervised Learning
por: Yang, Jing, et al.
Publicado: (2022)