Multi-scale Image Super Resolution with a Single Auto-Regressive Model
Fuente:
arXiv
Saved in:
| Main Authors: | Sanchez, Enrique, Hadji, Isma, Bulat, Adrian, Tzelepis, Christos, Martinez, Brais, Tzimiropoulos, Georgios |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Hierarchical Image Tokenization for Multi-Scale Image Super Resolution
by: Hadji, Isma, et al.
Published: (2026)
by: Hadji, Isma, et al.
Published: (2026)
You Only Need One Step: Fast Super-Resolution with Stable Diffusion via Scale Distillation
by: Noroozi, Mehdi, et al.
Published: (2024)
by: Noroozi, Mehdi, et al.
Published: (2024)
FAM Diffusion: Frequency and Attention Modulation for High-Resolution Image Generation with Stable Diffusion
by: Yang, Haosen, et al.
Published: (2024)
by: Yang, Haosen, et al.
Published: (2024)
Edge-SD-SR: Low Latency and Parameter Efficient On-device Super-Resolution with Stable Diffusion via Bidirectional Conditioning
by: Noroozi, Mehdi, et al.
Published: (2024)
by: Noroozi, Mehdi, et al.
Published: (2024)
Restore, Assess, Repeat: A Unified Framework for Iterative Image Restoration
by: Chen, I-Hsiang, et al.
Published: (2026)
by: Chen, I-Hsiang, et al.
Published: (2026)
CLIP-DPO: Vision-Language Models as a Source of Preference for Fixing Hallucinations in LVLMs
by: Ouali, Yassine, et al.
Published: (2024)
by: Ouali, Yassine, et al.
Published: (2024)
Knowledge Distillation Meets Open-Set Semi-Supervised Learning
by: Yang, Jing, et al.
Published: (2022)
by: Yang, Jing, et al.
Published: (2022)
Aligned Unsupervised Pretraining of Object Detectors with Self-training
by: Metaxas, Ioannis Maniadis, et al.
Published: (2023)
by: Metaxas, Ioannis Maniadis, et al.
Published: (2023)
MM2Latent: Text-to-facial image generation and editing in GANs with multimodal assistance
by: Meng, Debin, et al.
Published: (2024)
by: Meng, Debin, et al.
Published: (2024)
More Images, More Problems? A Controlled Analysis of VLM Failure Modes
by: Das, Anurag, et al.
Published: (2026)
by: Das, Anurag, et al.
Published: (2026)
FFF: Fixing Flawed Foundations in contrastive pre-training results in very strong Vision-Language models
by: Bulat, Adrian, et al.
Published: (2024)
by: Bulat, Adrian, et al.
Published: (2024)
One-shot Neural Face Reenactment via Finding Directions in GAN's Latent Space
by: Bounareli, Stella, et al.
Published: (2024)
by: Bounareli, Stella, et al.
Published: (2024)
Fwd2Bot: LVLM Visual Token Compression with Double Forward Bottleneck
by: Bulat, Adrian, et al.
Published: (2025)
by: Bulat, Adrian, et al.
Published: (2025)
DiffusionAct: Controllable Diffusion Autoencoder for One-shot Face Reenactment
by: Bounareli, Stella, et al.
Published: (2024)
by: Bounareli, Stella, et al.
Published: (2024)
VladVA: Discriminative Fine-tuning of LVLMs
by: Ouali, Yassine, et al.
Published: (2024)
by: Ouali, Yassine, et al.
Published: (2024)
Vision-Free Retrieval: Rethinking Multimodal Search with Textual Scene Descriptions
by: Ntinou, Ioanna, et al.
Published: (2025)
by: Ntinou, Ioanna, et al.
Published: (2025)
Multiscale Vision Transformers meet Bipartite Matching for efficient single-stage Action Localization
by: Ntinou, Ioanna, et al.
Published: (2023)
by: Ntinou, Ioanna, et al.
Published: (2023)
MeMSVD: Long-Range Temporal Structure Capturing Using Incremental SVD
by: Ntinou, Ioanna, et al.
Published: (2024)
by: Ntinou, Ioanna, et al.
Published: (2024)
CycleCap: Improving VLMs Captioning Performance via Self-Supervised Cycle Consistency Fine-Tuning
by: Krestenitis, Marios, et al.
Published: (2026)
by: Krestenitis, Marios, et al.
Published: (2026)
VISion On Request: Enhanced VLLM efficiency with sparse, dynamically selected, vision-language interactions
by: Bulat, Adrian, et al.
Published: (2026)
by: Bulat, Adrian, et al.
Published: (2026)
Are CLIP features all you need for Universal Synthetic Image Origin Attribution?
by: Cioni, Dario, et al.
Published: (2024)
by: Cioni, Dario, et al.
Published: (2024)
A Watermark for Auto-Regressive Image Generation Models
by: Wu, Yihan, et al.
Published: (2025)
by: Wu, Yihan, et al.
Published: (2025)
Multi-scale Attention Network for Single Image Super-Resolution
by: Wang, Yan, et al.
Published: (2022)
by: Wang, Yan, et al.
Published: (2022)
Infinity: Scaling Bitwise AutoRegressive Modeling for High-Resolution Image Synthesis
by: Han, Jian, et al.
Published: (2024)
by: Han, Jian, et al.
Published: (2024)
CLIPCleaner: Cleaning Noisy Labels with CLIP
by: Feng, Chen, et al.
Published: (2024)
by: Feng, Chen, et al.
Published: (2024)
Stream-DiffVSR: Low-Latency Streamable Video Super-Resolution via Auto-Regressive Diffusion
by: Shiu, Hau-Shiang, et al.
Published: (2025)
by: Shiu, Hau-Shiang, et al.
Published: (2025)
Rotation Equivariant Arbitrary-scale Image Super-Resolution
by: Xie, Qi, et al.
Published: (2025)
by: Xie, Qi, et al.
Published: (2025)
Semantic-Guided Diffusion Model for Single-Step Image Super-Resolution
by: Liu, Zihang, et al.
Published: (2025)
by: Liu, Zihang, et al.
Published: (2025)
Efficient Unsupervised Visual Representation Learning with Explicit Cluster Balancing
by: Metaxas, Ioannis Maniadis, et al.
Published: (2024)
by: Metaxas, Ioannis Maniadis, et al.
Published: (2024)
Progressive Focused Transformer for Single Image Super-Resolution
by: Long, Wei, et al.
Published: (2025)
by: Long, Wei, et al.
Published: (2025)
Auto-Regressively Generating Multi-View Consistent Images
by: Hu, JiaKui, et al.
Published: (2025)
by: Hu, JiaKui, et al.
Published: (2025)
Diffusion Transformer meets Multi-level Wavelet Spectrum for Single Image Super-Resolution
by: Du, Peng, et al.
Published: (2025)
by: Du, Peng, et al.
Published: (2025)
Auto-Encoded Supervision for Perceptual Image Super-Resolution
by: Lee, MinKyu, et al.
Published: (2024)
by: Lee, MinKyu, et al.
Published: (2024)
SuperF: Neural Implicit Fields for Multi-Image Super-Resolution
by: Jyhne, Sander Riisøen, et al.
Published: (2025)
by: Jyhne, Sander Riisøen, et al.
Published: (2025)
SSR: An Efficient and Robust Framework for Learning with Unknown Label Noise
by: Feng, Chen, et al.
Published: (2021)
by: Feng, Chen, et al.
Published: (2021)
CemiFace: Center-based Semi-hard Synthetic Face Generation for Face Recognition
by: Sun, Zhonglin, et al.
Published: (2024)
by: Sun, Zhonglin, et al.
Published: (2024)
Personalized Text-to-Image Generation with Auto-Regressive Models
by: Sun, Kaiyue, et al.
Published: (2025)
by: Sun, Kaiyue, et al.
Published: (2025)
Sample- and Parameter-Efficient Auto-Regressive Image Models
by: Amrani, Elad, et al.
Published: (2024)
by: Amrani, Elad, et al.
Published: (2024)
Attention-Guided Multi-scale Interaction Network for Face Super-Resolution
by: Wan, Xujie, et al.
Published: (2024)
by: Wan, Xujie, et al.
Published: (2024)
Single Image Super-Resolution Based on Global-Local Information Synergy
by: Qiao, Nianzu, et al.
Published: (2024)
by: Qiao, Nianzu, et al.
Published: (2024)
Similar Items
-
Hierarchical Image Tokenization for Multi-Scale Image Super Resolution
by: Hadji, Isma, et al.
Published: (2026) -
You Only Need One Step: Fast Super-Resolution with Stable Diffusion via Scale Distillation
by: Noroozi, Mehdi, et al.
Published: (2024) -
FAM Diffusion: Frequency and Attention Modulation for High-Resolution Image Generation with Stable Diffusion
by: Yang, Haosen, et al.
Published: (2024) -
Edge-SD-SR: Low Latency and Parameter Efficient On-device Super-Resolution with Stable Diffusion via Bidirectional Conditioning
by: Noroozi, Mehdi, et al.
Published: (2024) -
Restore, Assess, Repeat: A Unified Framework for Iterative Image Restoration
by: Chen, I-Hsiang, et al.
Published: (2026)