Stable-Pose: Leveraging Transformers for Pose-Guided Text-to-Image Generation
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Jiajun, Ghahremani, Morteza, Li, Yitong, Ommer, Björn, Wachinger, Christian |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Adapting Foundation Vision-Language Models to Medical Diagnosis via Query-Driven Expert Bridging
by: Li, Yitong, et al.
Published: (2025)
by: Li, Yitong, et al.
Published: (2025)
DiaMond: Dementia Diagnosis with Multi-Modal Vision Transformers Using MRI and PET
by: Li, Yitong, et al.
Published: (2024)
by: Li, Yitong, et al.
Published: (2024)
Conditional Diffusion for 3D CT Volume Reconstruction from 2D X-rays
by: Rath, Martin, et al.
Published: (2026)
by: Rath, Martin, et al.
Published: (2026)
Generating Reports or Repeating Templates? Measuring and Mitigating Template Collapse in 3D CT Report Generation
by: Maye-Lasserre, Tom, et al.
Published: (2026)
by: Maye-Lasserre, Tom, et al.
Published: (2026)
Follow Your Pose: Pose-Guided Text-to-Video Generation using Pose-Free Videos
by: Ma, Yue, et al.
Published: (2023)
by: Ma, Yue, et al.
Published: (2023)
Mamba? Catch The Hype Or Rethink What Really Helps for Image Registration
by: Jian, Bailiang, et al.
Published: (2024)
by: Jian, Bailiang, et al.
Published: (2024)
Diffusion Bridge Networks Simulate Clinical-grade PET from MRI for Dementia Diagnostics
by: Li, Yitong, et al.
Published: (2025)
by: Li, Yitong, et al.
Published: (2025)
3D Shape-to-Image Brownian Bridge Diffusion for Brain MRI Synthesis from Cortical Surfaces
by: Bongratz, Fabian, et al.
Published: (2025)
by: Bongratz, Fabian, et al.
Published: (2025)
WheelPose: Data Synthesis Techniques to Improve Pose Estimation Performance on Wheelchair Users
by: Huang, William, et al.
Published: (2024)
by: Huang, William, et al.
Published: (2024)
FashionPose: Text to Pose to Relight Image Generation for Personalized Fashion Visualization
by: Shi, Chuancheng, et al.
Published: (2025)
by: Shi, Chuancheng, et al.
Published: (2025)
Cortex-Grounded Diffusion Models for Brain Image Generation
by: Bongratz, Fabian, et al.
Published: (2026)
by: Bongratz, Fabian, et al.
Published: (2026)
RePoseDM: Recurrent Pose Alignment and Gradient Guidance for Pose Guided Image Synthesis
by: Khandelwal, Anant
Published: (2023)
by: Khandelwal, Anant
Published: (2023)
Disentangling Progress in Medical Image Registration: Beyond Trend-Driven Architectures towards Domain-Specific Strategies
by: Jian, Bailiang, et al.
Published: (2025)
by: Jian, Bailiang, et al.
Published: (2025)
Object Pose Transformer: Unifying Unseen Object Pose Estimation
by: Li, Weihang, et al.
Published: (2026)
by: Li, Weihang, et al.
Published: (2026)
AG-EgoPose: Leveraging Action-Guided Motion and Kinematic Joint Encoding for Egocentric 3D Pose Estimation
by: Azam, Md Mushfiqur, et al.
Published: (2026)
by: Azam, Md Mushfiqur, et al.
Published: (2026)
CoDi: Subject-Consistent and Pose-Diverse Text-to-Image Generation
by: Gao, Zhanxin, et al.
Published: (2025)
by: Gao, Zhanxin, et al.
Published: (2025)
Pose-Guided Residual Refinement for Interpretable Text-to-Motion Generation and Editing
by: Jeong, Sukhyun, et al.
Published: (2025)
by: Jeong, Sukhyun, et al.
Published: (2025)
UnrealPose: Leveraging Game Engine Kinematics for Large-Scale Synthetic Human Pose Data
by: Kawaguchi, Joshua, et al.
Published: (2026)
by: Kawaguchi, Joshua, et al.
Published: (2026)
DisPose: Disentangling Pose Guidance for Controllable Human Image Animation
by: Li, Hongxiang, et al.
Published: (2024)
by: Li, Hongxiang, et al.
Published: (2024)
Linear Relative Pose Estimation Founded on Pose-only Imaging Geometry
by: Cai, Qi, et al.
Published: (2024)
by: Cai, Qi, et al.
Published: (2024)
End-to-End Multi-Person Pose Estimation with Pose-Aware Video Transformer
by: Yu, Yonghui, et al.
Published: (2025)
by: Yu, Yonghui, et al.
Published: (2025)
Controllable Complex Human Motion Video Generation via Text-to-Skeleton Cascades
by: Taghipour, Ashkan, et al.
Published: (2026)
by: Taghipour, Ashkan, et al.
Published: (2026)
TransPose: 6D Object Pose Estimation with Geometry-Aware Transformer
by: Lin, Xiao, et al.
Published: (2023)
by: Lin, Xiao, et al.
Published: (2023)
One-Shot Learning for Pose-Guided Person Image Synthesis in the Wild
by: Fan, Dongqi, et al.
Published: (2024)
by: Fan, Dongqi, et al.
Published: (2024)
MaskFlow: Discrete Flows For Flexible and Efficient Long Video Generation
by: Fuest, Michael, et al.
Published: (2025)
by: Fuest, Michael, et al.
Published: (2025)
A Global Depth-Range-Free Multi-View Stereo Transformer Network with Pose Embedding
by: Dong, Yitong, et al.
Published: (2024)
by: Dong, Yitong, et al.
Published: (2024)
PoseDiffusion: Solving Pose Estimation via Diffusion-aided Bundle Adjustment
by: Wang, Jianyuan, et al.
Published: (2023)
by: Wang, Jianyuan, et al.
Published: (2023)
Denoising, Fast and Slow: Difficulty-Aware Adaptive Sampling for Image Generation
by: Schusterbauer, Johannes, et al.
Published: (2026)
by: Schusterbauer, Johannes, et al.
Published: (2026)
Advancing Pose-Guided Image Synthesis with Progressive Conditional Diffusion Models
by: Shen, Fei, et al.
Published: (2023)
by: Shen, Fei, et al.
Published: (2023)
VividPose: Advancing Stable Video Diffusion for Realistic Human Image Animation
by: Wang, Qilin, et al.
Published: (2024)
by: Wang, Qilin, et al.
Published: (2024)
Dual Recursive Feedback on Generation and Appearance Latents for Pose-Robust Text-to-Image Diffusion
by: Kim, Jiwon, et al.
Published: (2025)
by: Kim, Jiwon, et al.
Published: (2025)
PoseLLM: Enhancing Language-Guided Human Pose Estimation with MLP Alignment
by: Zhang, Dewen, et al.
Published: (2025)
by: Zhang, Dewen, et al.
Published: (2025)
Translating MRI to PET through Conditional Diffusion Models with Enhanced Pathology Awareness
by: Li, Yitong, et al.
Published: (2026)
by: Li, Yitong, et al.
Published: (2026)
MultiAnimate: Pose-Guided Image Animation Made Extensible
by: Hu, Yingcheng, et al.
Published: (2026)
by: Hu, Yingcheng, et al.
Published: (2026)
Follow-Your-MultiPose: Tuning-Free Multi-Character Text-to-Video Generation via Pose Guidance
by: Zhang, Beiyuan, et al.
Published: (2024)
by: Zhang, Beiyuan, et al.
Published: (2024)
AutoComPose: Automatic Generation of Pose Transition Descriptions for Composed Pose Retrieval Using Multimodal LLMs
by: Shen, Yi-Ting, et al.
Published: (2025)
by: Shen, Yi-Ting, et al.
Published: (2025)
Generative Hierarchical Temporal Transformer for Hand Pose and Action Modeling
by: Wen, Yilin, et al.
Published: (2023)
by: Wen, Yilin, et al.
Published: (2023)
HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation
by: Gan, Qijun, et al.
Published: (2025)
by: Gan, Qijun, et al.
Published: (2025)
Leveraging Image Matching Toward End-to-End Relative Camera Pose Regression
by: Khatib, Fadi, et al.
Published: (2022)
by: Khatib, Fadi, et al.
Published: (2022)
Leveraging RGB Images for Pre-Training of Event-Based Hand Pose Estimation
by: Liu, Ruicong, et al.
Published: (2025)
by: Liu, Ruicong, et al.
Published: (2025)
Similar Items
-
Adapting Foundation Vision-Language Models to Medical Diagnosis via Query-Driven Expert Bridging
by: Li, Yitong, et al.
Published: (2025) -
DiaMond: Dementia Diagnosis with Multi-Modal Vision Transformers Using MRI and PET
by: Li, Yitong, et al.
Published: (2024) -
Conditional Diffusion for 3D CT Volume Reconstruction from 2D X-rays
by: Rath, Martin, et al.
Published: (2026) -
Generating Reports or Repeating Templates? Measuring and Mitigating Template Collapse in 3D CT Report Generation
by: Maye-Lasserre, Tom, et al.
Published: (2026) -
Follow Your Pose: Pose-Guided Text-to-Video Generation using Pose-Free Videos
by: Ma, Yue, et al.
Published: (2023)