CART: Compositional Auto-Regressive Transformer for Image Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Roheda, Siddharth, Chowdhury, Rohit, Bala, Aniruddha, Jaiswal, Rohan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Vid-Freeze: Protecting Images from Malicious Image-to-Video Generation via Temporal Freezing
di: Chowdhury, Rohit, et al.
Pubblicazione: (2025)
di: Chowdhury, Rohit, et al.
Pubblicazione: (2025)
DCT-Shield: A Robust Frequency Domain Defense against Malicious Image Editing
di: Bala, Aniruddha, et al.
Pubblicazione: (2025)
di: Bala, Aniruddha, et al.
Pubblicazione: (2025)
VNODE: A Piecewise Continuous Volterra Neural Network
di: Roheda, Siddharth, et al.
Pubblicazione: (2025)
di: Roheda, Siddharth, et al.
Pubblicazione: (2025)
GalaxyEdit: Large-Scale Image Editing Dataset with Enhanced Diffusion Adapter
di: Bala, Aniruddha, et al.
Pubblicazione: (2024)
di: Bala, Aniruddha, et al.
Pubblicazione: (2024)
LLVD: LSTM-based Explicit Motion Modeling in Latent Space for Blind Video Denoising
di: Rashid, Loay, et al.
Pubblicazione: (2025)
di: Rashid, Loay, et al.
Pubblicazione: (2025)
Privacy Attacks on Image AutoRegressive Models
di: Kowalczuk, Antoni, et al.
Pubblicazione: (2025)
di: Kowalczuk, Antoni, et al.
Pubblicazione: (2025)
HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation
di: Kumbong, Hermann, et al.
Pubblicazione: (2025)
di: Kumbong, Hermann, et al.
Pubblicazione: (2025)
AutoRegressive Generation with B-rep Holistic Token Sequence Representation
di: Li, Jiahao, et al.
Pubblicazione: (2026)
di: Li, Jiahao, et al.
Pubblicazione: (2026)
A U-Net and Transformer Pipeline for Multilingual Image Translation
di: Sahay, Siddharth, et al.
Pubblicazione: (2025)
di: Sahay, Siddharth, et al.
Pubblicazione: (2025)
HiPART: Hierarchical Pose AutoRegressive Transformer for Occluded 3D Human Pose Estimation
di: Zheng, Hongwei, et al.
Pubblicazione: (2025)
di: Zheng, Hongwei, et al.
Pubblicazione: (2025)
Iterative Refinement Improves Compositional Image Generation
di: Jaiswal, Shantanu, et al.
Pubblicazione: (2026)
di: Jaiswal, Shantanu, et al.
Pubblicazione: (2026)
MVAR: MultiVariate AutoRegressive Air Pollutants Forecasting Model
di: Fan, Xu, et al.
Pubblicazione: (2025)
di: Fan, Xu, et al.
Pubblicazione: (2025)
Adversarial Machine Learning: Attacking and Safeguarding Image Datasets
di: Chowdhury, Koushik
Pubblicazione: (2025)
di: Chowdhury, Koushik
Pubblicazione: (2025)
Image-Specific Adaptation of Transformer Encoders for Compute-Efficient Segmentation
di: Yao, Manyi, et al.
Pubblicazione: (2024)
di: Yao, Manyi, et al.
Pubblicazione: (2024)
VAR-3D: View-aware Auto-Regressive Model for Text-to-3D Generation via a 3D Tokenizer
di: Han, Zongcheng, et al.
Pubblicazione: (2026)
di: Han, Zongcheng, et al.
Pubblicazione: (2026)
Attention-Guided Dual-Stream Learning for Group Engagement Recognition: Fusing Transformer-Encoded Motion Dynamics with Scene Context via Adaptive Gating
di: Chowdhury, Saniah Kayenat, et al.
Pubblicazione: (2026)
di: Chowdhury, Saniah Kayenat, et al.
Pubblicazione: (2026)
X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models
di: Sun, Zeyi, et al.
Pubblicazione: (2024)
di: Sun, Zeyi, et al.
Pubblicazione: (2024)
Progressive Compositionality in Text-to-Image Generative Models
di: Han, Evans Xu, et al.
Pubblicazione: (2024)
di: Han, Evans Xu, et al.
Pubblicazione: (2024)
XSpecMesh: Quality-Preserving Auto-Regressive Mesh Generation Acceleration via Multi-Head Speculative Decoding
di: Chen, Dian, et al.
Pubblicazione: (2025)
di: Chen, Dian, et al.
Pubblicazione: (2025)
A Fast and Efficient Modern BERT based Text-Conditioned Diffusion Model for Medical Image Segmentation
di: Dhara, Venkata Siddharth, et al.
Pubblicazione: (2025)
di: Dhara, Venkata Siddharth, et al.
Pubblicazione: (2025)
Posture-Driven Action Intent Inference for Playing style and Fatigue Assessment
di: Jaiswal, Abhishek, et al.
Pubblicazione: (2025)
di: Jaiswal, Abhishek, et al.
Pubblicazione: (2025)
Regressing Transformers for Data-efficient Visual Place Recognition
di: Leyva-Vallina, María, et al.
Pubblicazione: (2024)
di: Leyva-Vallina, María, et al.
Pubblicazione: (2024)
Generalizable Blood Cell Detection via Unified Dataset and Faster R-CNN
di: Sahay, Siddharth
Pubblicazione: (2025)
di: Sahay, Siddharth
Pubblicazione: (2025)
Edify Image: High-Quality Image Generation with Pixel Space Laplacian Diffusion Models
di: NVIDIA, et al.
Pubblicazione: (2024)
di: NVIDIA, et al.
Pubblicazione: (2024)
Fine-Grained Alignment and Noise Refinement for Compositional Text-to-Image Generation
di: Izadi, Amir Mohammad, et al.
Pubblicazione: (2025)
di: Izadi, Amir Mohammad, et al.
Pubblicazione: (2025)
Detecting AutoEncoder is Enough to Catch LDM Generated Images
di: Vesnin, Dmitry, et al.
Pubblicazione: (2024)
di: Vesnin, Dmitry, et al.
Pubblicazione: (2024)
HiAP: A Multi-Granular Stochastic Auto-Pruning Framework for Vision Transformers
di: Li, Andy, et al.
Pubblicazione: (2026)
di: Li, Andy, et al.
Pubblicazione: (2026)
DART: Denoising Autoregressive Transformer for Scalable Text-to-Image Generation
di: Gu, Jiatao, et al.
Pubblicazione: (2024)
di: Gu, Jiatao, et al.
Pubblicazione: (2024)
Masked Generative Transformer Is What You Need for Image Editing
di: Chow, Wei, et al.
Pubblicazione: (2026)
di: Chow, Wei, et al.
Pubblicazione: (2026)
MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation
di: Chen, Junhao, et al.
Pubblicazione: (2025)
di: Chen, Junhao, et al.
Pubblicazione: (2025)
Rethinking the Use of Vision Transformers for AI-Generated Image Detection
di: Park, NaHyeon, et al.
Pubblicazione: (2025)
di: Park, NaHyeon, et al.
Pubblicazione: (2025)
BornoViT: A Novel Efficient Vision Transformer for Bengali Handwritten Basic Characters Classification
di: Chowdhury, Rafi Hassan, et al.
Pubblicazione: (2026)
di: Chowdhury, Rafi Hassan, et al.
Pubblicazione: (2026)
Data-Efficient Contrastive Language-Image Pretraining: Prioritizing Data Quality over Quantity
di: Joshi, Siddharth, et al.
Pubblicazione: (2024)
di: Joshi, Siddharth, et al.
Pubblicazione: (2024)
UNIC-Adapter: Unified Image-instruction Adapter with Multi-modal Transformer for Image Generation
di: Duan, Lunhao, et al.
Pubblicazione: (2024)
di: Duan, Lunhao, et al.
Pubblicazione: (2024)
Early Glaucoma Detection using Deep Learning with Multiple Datasets of Fundus Images
di: Chowdhury, Rishiraj Paul, et al.
Pubblicazione: (2025)
di: Chowdhury, Rishiraj Paul, et al.
Pubblicazione: (2025)
BARD: Bridging AutoRegressive and Diffusion Vision-Language Models Via Highly Efficient Progressive Block Merging and Stage-Wise Distillation
di: Chen, Baoyou, et al.
Pubblicazione: (2026)
di: Chen, Baoyou, et al.
Pubblicazione: (2026)
Contrastive Test-Time Composition of Multiple LoRA Models for Image Generation
di: Meral, Tuna Han Salih, et al.
Pubblicazione: (2024)
di: Meral, Tuna Han Salih, et al.
Pubblicazione: (2024)
Preserving Identity with Variational Score for General-purpose 3D Editing
di: Le, Duong H., et al.
Pubblicazione: (2024)
di: Le, Duong H., et al.
Pubblicazione: (2024)
GD doesn't make the cut: Three ways that non-differentiability affects neural network training
di: Kumar, Siddharth Krishna
Pubblicazione: (2024)
di: Kumar, Siddharth Krishna
Pubblicazione: (2024)
Your Image is My Video: Reshaping the Receptive Field via Image-To-Video Differentiable AutoAugmentation and Fusion
di: Casarin, Sofia, et al.
Pubblicazione: (2024)
di: Casarin, Sofia, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Vid-Freeze: Protecting Images from Malicious Image-to-Video Generation via Temporal Freezing
di: Chowdhury, Rohit, et al.
Pubblicazione: (2025) -
DCT-Shield: A Robust Frequency Domain Defense against Malicious Image Editing
di: Bala, Aniruddha, et al.
Pubblicazione: (2025) -
VNODE: A Piecewise Continuous Volterra Neural Network
di: Roheda, Siddharth, et al.
Pubblicazione: (2025) -
GalaxyEdit: Large-Scale Image Editing Dataset with Enhanced Diffusion Adapter
di: Bala, Aniruddha, et al.
Pubblicazione: (2024) -
LLVD: LSTM-based Explicit Motion Modeling in Latent Space for Blind Video Denoising
di: Rashid, Loay, et al.
Pubblicazione: (2025)