Image Generation Models: A Technical History
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Shirvani, Rouzbeh |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Multimodal Cinematic Video Synthesis Using Text-to-Image and Audio Generation Models
par: S, Sridhar, et autres
Publié: (2025)
par: S, Sridhar, et autres
Publié: (2025)
Generative Powers of Ten
par: Wang, Xiaojuan, et autres
Publié: (2023)
par: Wang, Xiaojuan, et autres
Publié: (2023)
VisionGPT-3D: A Generalized Multimodal Agent for Enhanced 3D Vision Understanding
par: Kelly, Chris, et autres
Publié: (2024)
par: Kelly, Chris, et autres
Publié: (2024)
SIMS: Simulating Stylized Human-Scene Interactions with Retrieval-Augmented Script Generation
par: Wang, Wenjia, et autres
Publié: (2024)
par: Wang, Wenjia, et autres
Publié: (2024)
Towards Understanding Graphical Perception in Large Multimodal Models
par: Zhang, Kai, et autres
Publié: (2025)
par: Zhang, Kai, et autres
Publié: (2025)
Multi-LoRA Composition for Image Generation
par: Zhong, Ming, et autres
Publié: (2024)
par: Zhong, Ming, et autres
Publié: (2024)
JoyAI-Image: Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation
par: Song, Lin, et autres
Publié: (2026)
par: Song, Lin, et autres
Publié: (2026)
Uncovering Conceptual Blindspots in Generative Image Models Using Sparse Autoencoders
par: Bohacek, Matyas, et autres
Publié: (2025)
par: Bohacek, Matyas, et autres
Publié: (2025)
DynamicGTR: Leveraging Graph Topology Representation Preferences to Boost VLM Capabilities on Graph QAs
par: Wei, Yanbin, et autres
Publié: (2026)
par: Wei, Yanbin, et autres
Publié: (2026)
Grounding Language in Multi-Perspective Referential Communication
par: Tang, Zineng, et autres
Publié: (2024)
par: Tang, Zineng, et autres
Publié: (2024)
A Survey on Quality Metrics for Text-to-Image Generation
par: Hartwig, Sebastian, et autres
Publié: (2024)
par: Hartwig, Sebastian, et autres
Publié: (2024)
DreamDrive: Generative 4D Scene Modeling from Street View Images
par: Mao, Jiageng, et autres
Publié: (2024)
par: Mao, Jiageng, et autres
Publié: (2024)
BootPIG: Bootstrapping Zero-shot Personalized Image Generation Capabilities in Pretrained Diffusion Models
par: Purushwalkam, Senthil, et autres
Publié: (2024)
par: Purushwalkam, Senthil, et autres
Publié: (2024)
GazeFusion: Saliency-Guided Image Generation
par: Zhang, Yunxiang, et autres
Publié: (2024)
par: Zhang, Yunxiang, et autres
Publié: (2024)
SyncDreamer: Generating Multiview-consistent Images from a Single-view Image
par: Liu, Yuan, et autres
Publié: (2023)
par: Liu, Yuan, et autres
Publié: (2023)
MoA: Mixture-of-Attention for Subject-Context Disentanglement in Personalized Image Generation
par: Wang, Kuan-Chieh, et autres
Publié: (2024)
par: Wang, Kuan-Chieh, et autres
Publié: (2024)
Object-level Visual Prompts for Compositional Image Generation
par: Parmar, Gaurav, et autres
Publié: (2025)
par: Parmar, Gaurav, et autres
Publié: (2025)
Unbounded: A Generative Infinite Game of Character Life Simulation
par: Li, Jialu, et autres
Publié: (2024)
par: Li, Jialu, et autres
Publié: (2024)
Make It Count: Text-to-Image Generation with an Accurate Number of Objects
par: Binyamin, Lital, et autres
Publié: (2024)
par: Binyamin, Lital, et autres
Publié: (2024)
GraphicsDreamer: Image to 3D Generation with Physical Consistency
par: Chen, Pei, et autres
Publié: (2024)
par: Chen, Pei, et autres
Publié: (2024)
Vector Grimoire: Codebook-based Shape Generation under Raster Image Supervision
par: Feuerpfeil, Moritz, et autres
Publié: (2024)
par: Feuerpfeil, Moritz, et autres
Publié: (2024)
Annotated Hands for Generative Models
par: Yang, Yue, et autres
Publié: (2024)
par: Yang, Yue, et autres
Publié: (2024)
An Image is Worth Multiple Words: Discovering Object Level Concepts using Multi-Concept Prompt Learning
par: Jin, Chen, et autres
Publié: (2023)
par: Jin, Chen, et autres
Publié: (2023)
WonderPlay: Dynamic 3D Scene Generation from a Single Image and Actions
par: Li, Zizhang, et autres
Publié: (2025)
par: Li, Zizhang, et autres
Publié: (2025)
VideoMV: Consistent Multi-View Generation Based on Large Video Generative Model
par: Zuo, Qi, et autres
Publié: (2024)
par: Zuo, Qi, et autres
Publié: (2024)
ReLumix: Extending Image Relighting to Video via Video Diffusion Models
par: Wang, Lezhong, et autres
Publié: (2025)
par: Wang, Lezhong, et autres
Publié: (2025)
FabricDiffusion: High-Fidelity Texture Transfer for 3D Garments Generation from In-The-Wild Clothing Images
par: Zhang, Cheng, et autres
Publié: (2024)
par: Zhang, Cheng, et autres
Publié: (2024)
TEXGen: a Generative Diffusion Model for Mesh Textures
par: Yu, Xin, et autres
Publié: (2024)
par: Yu, Xin, et autres
Publié: (2024)
Stylus: Automatic Adapter Selection for Diffusion Models
par: Luo, Michael, et autres
Publié: (2024)
par: Luo, Michael, et autres
Publié: (2024)
Transcending Dimensions using Generative AI: Real-Time 3D Model Generation in Augmented Reality
par: Behravan, Majid, et autres
Publié: (2025)
par: Behravan, Majid, et autres
Publié: (2025)
Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models
par: Liu, Bingchen, et autres
Publié: (2024)
par: Liu, Bingchen, et autres
Publié: (2024)
Text-guided Controllable Mesh Refinement for Interactive 3D Modeling
par: Chen, Yun-Chun, et autres
Publié: (2024)
par: Chen, Yun-Chun, et autres
Publié: (2024)
Generative Object Insertion in Gaussian Splatting with a Multi-View Diffusion Model
par: Zhong, Hongliang, et autres
Publié: (2024)
par: Zhong, Hongliang, et autres
Publié: (2024)
EMDM: Efficient Motion Diffusion Model for Fast and High-Quality Motion Generation
par: Zhou, Wenyang, et autres
Publié: (2023)
par: Zhou, Wenyang, et autres
Publié: (2023)
HY-Motion 1.0: Scaling Flow Matching Models for Text-To-Motion Generation
par: Wen, Yuxin, et autres
Publié: (2025)
par: Wen, Yuxin, et autres
Publié: (2025)
PixelMan: Consistent Object Editing with Diffusion Models via Pixel Manipulation and Generation
par: Jiang, Liyao, et autres
Publié: (2024)
par: Jiang, Liyao, et autres
Publié: (2024)
FlexCAD: Unified and Versatile Controllable CAD Generation with Fine-tuned Large Language Models
par: Zhang, Zhanwei, et autres
Publié: (2024)
par: Zhang, Zhanwei, et autres
Publié: (2024)
MAPWise: Evaluating Vision-Language Models for Advanced Map Queries
par: Mukhopadhyay, Srija, et autres
Publié: (2024)
par: Mukhopadhyay, Srija, et autres
Publié: (2024)
Bridging Text and Video Generation: A Survey
par: Kumar, Nilay, et autres
Publié: (2025)
par: Kumar, Nilay, et autres
Publié: (2025)
Taming Video Models for 3D and 4D Generation via Zero-Shot Camera Control
par: Song, Chenxi, et autres
Publié: (2025)
par: Song, Chenxi, et autres
Publié: (2025)
Documents similaires
-
Multimodal Cinematic Video Synthesis Using Text-to-Image and Audio Generation Models
par: S, Sridhar, et autres
Publié: (2025) -
Generative Powers of Ten
par: Wang, Xiaojuan, et autres
Publié: (2023) -
VisionGPT-3D: A Generalized Multimodal Agent for Enhanced 3D Vision Understanding
par: Kelly, Chris, et autres
Publié: (2024) -
SIMS: Simulating Stylized Human-Scene Interactions with Retrieval-Augmented Script Generation
par: Wang, Wenjia, et autres
Publié: (2024) -
Towards Understanding Graphical Perception in Large Multimodal Models
par: Zhang, Kai, et autres
Publié: (2025)