Enregistré dans:
| Auteurs principaux: | Tschannen, Michael, Pinto, André Susano, Kolesnikov, Alexander |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2411.19722 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Jet: A Modern Transformer-Based Normalizing Flow
par: Kolesnikov, Alexander, et autres
Publié: (2024)
par: Kolesnikov, Alexander, et autres
Publié: (2024)
Towards Truly Zero-shot Compositional Visual Reasoning with LLMs as Programmers
par: Stanić, Aleksandar, et autres
Publié: (2024)
par: Stanić, Aleksandar, et autres
Publié: (2024)
Enhancing Diffusion Models for High-Quality Image Generation
par: Shah, Jaineet, et autres
Publié: (2024)
par: Shah, Jaineet, et autres
Publié: (2024)
E-CAR: Efficient Continuous Autoregressive Image Generation via Multistage Modeling
par: Yuan, Zhihang, et autres
Publié: (2024)
par: Yuan, Zhihang, et autres
Publié: (2024)
VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation
par: Lin, Huawei, et autres
Publié: (2025)
par: Lin, Huawei, et autres
Publié: (2025)
Annealed Relaxation of Speculative Decoding for Faster Autoregressive Image Generation
par: Li, Xingyao, et autres
Publié: (2026)
par: Li, Xingyao, et autres
Publié: (2026)
Watermarking Autoregressive Image Generation
par: Jovanović, Nikola, et autres
Publié: (2025)
par: Jovanović, Nikola, et autres
Publié: (2025)
PaliGemma: A versatile 3B VLM for transfer
par: Beyer, Lucas, et autres
Publié: (2024)
par: Beyer, Lucas, et autres
Publié: (2024)
Astra: General Interactive World Model with Autoregressive Denoising
par: Zhu, Yixuan, et autres
Publié: (2025)
par: Zhu, Yixuan, et autres
Publié: (2025)
MASC: Boosting Autoregressive Image Generation with a Manifold-Aligned Semantic Clustering
par: He, Lixuan, et autres
Publié: (2025)
par: He, Lixuan, et autres
Publié: (2025)
Optimizing Negative Prompts for Enhanced Aesthetics and Fidelity in Text-To-Image Generation
par: Ogezi, Michael, et autres
Publié: (2024)
par: Ogezi, Michael, et autres
Publié: (2024)
Contextualized Diffusion Models for Text-Guided Image and Video Generation
par: Yang, Ling, et autres
Publié: (2024)
par: Yang, Ling, et autres
Publié: (2024)
DocSynthv2: A Practical Autoregressive Modeling for Document Generation
par: Biswas, Sanket, et autres
Publié: (2024)
par: Biswas, Sanket, et autres
Publié: (2024)
Text-To-Image with Generative Adversarial Networks
par: Momen-Tayefeh, Mehrshad
Publié: (2024)
par: Momen-Tayefeh, Mehrshad
Publié: (2024)
Identity Curvature Laplace Approximation for Improved Out-of-Distribution Detection
par: Zhdanov, Maksim, et autres
Publié: (2023)
par: Zhdanov, Maksim, et autres
Publié: (2023)
RL for Consistency Models: Faster Reward Guided Text-to-Image Generation
par: Oertell, Owen, et autres
Publié: (2024)
par: Oertell, Owen, et autres
Publié: (2024)
Pre-trained Language Models Do Not Help Auto-regressive Text-to-Image Generation
par: Zhang, Yuhui, et autres
Publié: (2023)
par: Zhang, Yuhui, et autres
Publié: (2023)
SpectralAR: Spectral Autoregressive Visual Generation
par: Huang, Yuanhui, et autres
Publié: (2025)
par: Huang, Yuanhui, et autres
Publié: (2025)
On the Scalability of Diffusion-based Text-to-Image Generation
par: Li, Hao, et autres
Publié: (2024)
par: Li, Hao, et autres
Publié: (2024)
EdgeFusion: On-Device Text-to-Image Generation
par: Castells, Thibault, et autres
Publié: (2024)
par: Castells, Thibault, et autres
Publié: (2024)
MetaFormer Baselines for Vision
par: Yu, Weihao, et autres
Publié: (2022)
par: Yu, Weihao, et autres
Publié: (2022)
PoGDiff: Product-of-Gaussians Diffusion Models for Imbalanced Text-to-Image Generation
par: Wang, Ziyan, et autres
Publié: (2025)
par: Wang, Ziyan, et autres
Publié: (2025)
ReText: Text Boosts Generalization in Image-Based Person Re-identification
par: Mamedov, Timur, et autres
Publié: (2026)
par: Mamedov, Timur, et autres
Publié: (2026)
Image Captions are Natural Prompts for Text-to-Image Models
par: Lei, Shiye, et autres
Publié: (2023)
par: Lei, Shiye, et autres
Publié: (2023)
HART: Efficient Visual Generation with Hybrid Autoregressive Transformer
par: Tang, Haotian, et autres
Publié: (2024)
par: Tang, Haotian, et autres
Publié: (2024)
Towards Understanding and Quantifying Uncertainty for Text-to-Image Generation
par: Franchi, Gianni, et autres
Publié: (2024)
par: Franchi, Gianni, et autres
Publié: (2024)
Compositional Text-to-Image Generation with Dense Blob Representations
par: Nie, Weili, et autres
Publié: (2024)
par: Nie, Weili, et autres
Publié: (2024)
ScribFormer: Transformer Makes CNN Work Better for Scribble-based Medical Image Segmentation
par: Li, Zihan, et autres
Publié: (2024)
par: Li, Zihan, et autres
Publié: (2024)
Soft-TransFormers for Continual Learning
par: Kang, Haeyong, et autres
Publié: (2024)
par: Kang, Haeyong, et autres
Publié: (2024)
Diversifying Deep Ensembles: A Saliency Map Approach for Enhanced OOD Detection, Calibration, and Accuracy
par: Dereka, Stanislav, et autres
Publié: (2023)
par: Dereka, Stanislav, et autres
Publié: (2023)
Text-Aware Image Restoration with Diffusion Models
par: Min, Jaewon, et autres
Publié: (2025)
par: Min, Jaewon, et autres
Publié: (2025)
Curriculum-DPO++: Direct Preference Optimization via Data and Model Curricula for Text-to-Image Generation
par: Croitoru, Florinel-Alin, et autres
Publié: (2026)
par: Croitoru, Florinel-Alin, et autres
Publié: (2026)
Skrr: Skip and Re-use Text Encoder Layers for Memory Efficient Text-to-Image Generation
par: Seo, Hoigi, et autres
Publié: (2025)
par: Seo, Hoigi, et autres
Publié: (2025)
UNCAGE: Contrastive Attention Guidance for Masked Generative Transformers in Text-to-Image Generation
par: Kang, Wonjun, et autres
Publié: (2025)
par: Kang, Wonjun, et autres
Publié: (2025)
AlignGuard: Scalable Safety Alignment for Text-to-Image Generation
par: Liu, Runtao, et autres
Publié: (2024)
par: Liu, Runtao, et autres
Publié: (2024)
Minority-Focused Text-to-Image Generation via Prompt Optimization
par: Um, Soobin, et autres
Publié: (2024)
par: Um, Soobin, et autres
Publié: (2024)
Self-Evaluation Unlocks Any-Step Text-to-Image Generation
par: Yu, Xin, et autres
Publié: (2025)
par: Yu, Xin, et autres
Publié: (2025)
PreciseCam: Precise Camera Control for Text-to-Image Generation
par: Bernal-Berdun, Edurne, et autres
Publié: (2025)
par: Bernal-Berdun, Edurne, et autres
Publié: (2025)
Understanding Implosion in Text-to-Image Generative Models
par: Ding, Wenxin, et autres
Publié: (2024)
par: Ding, Wenxin, et autres
Publié: (2024)
Autoregressive Adversarial Post-Training for Real-Time Interactive Video Generation
par: Lin, Shanchuan, et autres
Publié: (2025)
par: Lin, Shanchuan, et autres
Publié: (2025)
Documents similaires
-
Jet: A Modern Transformer-Based Normalizing Flow
par: Kolesnikov, Alexander, et autres
Publié: (2024) -
Towards Truly Zero-shot Compositional Visual Reasoning with LLMs as Programmers
par: Stanić, Aleksandar, et autres
Publié: (2024) -
Enhancing Diffusion Models for High-Quality Image Generation
par: Shah, Jaineet, et autres
Publié: (2024) -
E-CAR: Efficient Continuous Autoregressive Image Generation via Multistage Modeling
par: Yuan, Zhihang, et autres
Publié: (2024) -
VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation
par: Lin, Huawei, et autres
Publié: (2025)