Learning Flow Fields in Attention for Controllable Person Image Generation
Fuente:
arXiv
Saved in:
| Main Authors: | Zhou, Zijian, Liu, Shikun, Han, Xiao, Liu, Haozhe, Ng, Kam Woh, Xie, Tian, Cong, Yuren, Li, Hang, Xu, Mengmeng, Pérez-Rúa, Juan-Manuel, Patel, Aditya, Xiang, Tao, Shi, Miaojing, He, Sen |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Scaling Zero-Shot Reference-to-Video Generation
by: Zhou, Zijian, et al.
Published: (2025)
by: Zhou, Zijian, et al.
Published: (2025)
Mixture of States: Routing Token-Level Dynamics for Multimodal Generation
by: Liu, Haozhe, et al.
Published: (2025)
by: Liu, Haozhe, et al.
Published: (2025)
Scaling Sequence-to-Sequence Generative Neural Rendering
by: Liu, Shikun, et al.
Published: (2025)
by: Liu, Shikun, et al.
Published: (2025)
Rays as Pixels: Learning A Joint Distribution of Videos and Camera Trajectories
by: Jang, Wonbong, et al.
Published: (2026)
by: Jang, Wonbong, et al.
Published: (2026)
ConceptHash: Interpretable Fine-Grained Hashing via Concept Discovery
by: Ng, Kam Woh, et al.
Published: (2024)
by: Ng, Kam Woh, et al.
Published: (2024)
PartCraft: Crafting Creative Objects by Parts
by: Ng, Kam Woh, et al.
Published: (2024)
by: Ng, Kam Woh, et al.
Published: (2024)
IPR-NeRF: Ownership Verification meets Neural Radiance Field
by: Ong, Win Kent, et al.
Published: (2024)
by: Ong, Win Kent, et al.
Published: (2024)
HiStream: Efficient High-Resolution Video Generation via Redundancy-Eliminated Streaming
by: Qiu, Haonan, et al.
Published: (2025)
by: Qiu, Haonan, et al.
Published: (2025)
VecGlypher: Unified Vector Glyph Generation with Language Models
by: Huang, Xiaoke, et al.
Published: (2026)
by: Huang, Xiaoke, et al.
Published: (2026)
Faster Diffusion via Temporal Attention Decomposition
by: Liu, Haozhe, et al.
Published: (2024)
by: Liu, Haozhe, et al.
Published: (2024)
GenTron: Diffusion Transformers for Image and Video Generation
by: Chen, Shoufa, et al.
Published: (2023)
by: Chen, Shoufa, et al.
Published: (2023)
FLATTEN: optical FLow-guided ATTENtion for consistent text-to-video editing
by: Cong, Yuren, et al.
Published: (2023)
by: Cong, Yuren, et al.
Published: (2023)
MarDini: Masked Autoregressive Diffusion for Video Generation at Scale
by: Liu, Haozhe, et al.
Published: (2024)
by: Liu, Haozhe, et al.
Published: (2024)
VLPrompt: Vision-Language Prompting for Panoptic Scene Graph Generation
by: Zhou, Zijian, et al.
Published: (2023)
by: Zhou, Zijian, et al.
Published: (2023)
TUNA: Taming Unified Visual Representations for Native Unified Multimodal Models
by: Liu, Zhiheng, et al.
Published: (2025)
by: Liu, Zhiheng, et al.
Published: (2025)
OpenPSG: Open-set Panoptic Scene Graph Generation via Large Multimodal Models
by: Zhou, Zijian, et al.
Published: (2024)
by: Zhou, Zijian, et al.
Published: (2024)
Chirpy3D: Part-Aware Multi-View Diffusion for Creative Fine-Grained Object Generation
by: Ng, Kam Woh, et al.
Published: (2025)
by: Ng, Kam Woh, et al.
Published: (2025)
Hyper-VolTran: Fast and Generalizable One-Shot Image to 3D Object Structure via HyperNetworks
by: Simon, Christian, et al.
Published: (2023)
by: Simon, Christian, et al.
Published: (2023)
Memory-guided Network with Uncertainty-based Feature Augmentation for Few-shot Semantic Segmentation
by: Chen, Xinyue, et al.
Published: (2024)
by: Chen, Xinyue, et al.
Published: (2024)
Enhancing Space-time Video Super-resolution via Spatial-temporal Feature Interaction
by: Yue, Zijie, et al.
Published: (2022)
by: Yue, Zijie, et al.
Published: (2022)
Enhancing Generalized Few-Shot Semantic Segmentation via Effective Knowledge Transfer
by: Chen, Xinyue, et al.
Published: (2024)
by: Chen, Xinyue, et al.
Published: (2024)
Text Promptable Surgical Instrument Segmentation with Vision-Language Models
by: Zhou, Zijian, et al.
Published: (2023)
by: Zhou, Zijian, et al.
Published: (2023)
SEG-SAM: Semantic-Guided SAM for Unified Medical Image Segmentation
by: Huang, Shuangping, et al.
Published: (2024)
by: Huang, Shuangping, et al.
Published: (2024)
Large Model driven Radiology Report Generation with Clinical Quality Reinforcement Learning
by: Zhou, Zijian, et al.
Published: (2024)
by: Zhou, Zijian, et al.
Published: (2024)
FAAR: Efficient Frequency-Aware Multi-Task Fine-Tuning via Automatic Rank Selection
by: Fontana, Maxime, et al.
Published: (2026)
by: Fontana, Maxime, et al.
Published: (2026)
When Multi-Task Learning Meets Partial Supervision: A Computer Vision Review
by: Fontana, Maxime, et al.
Published: (2023)
by: Fontana, Maxime, et al.
Published: (2023)
Boosting Object Detection with Zero-Shot Day-Night Domain Adaptation
by: Du, Zhipeng, et al.
Published: (2023)
by: Du, Zhipeng, et al.
Published: (2023)
Multitask Learning in Minimally Invasive Surgical Vision: A Review
by: Alabi, Oluwatosin, et al.
Published: (2024)
by: Alabi, Oluwatosin, et al.
Published: (2024)
Optimizing Dense Visual Predictions Through Multi-Task Coherence and Prioritization
by: Fontana, Maxime, et al.
Published: (2024)
by: Fontana, Maxime, et al.
Published: (2024)
Newsvendor Decisions under Stochastic and Strategic Uncertainties: Theory and Experimental Evidence
by: Wu, Hang, et al.
Published: (2025)
by: Wu, Hang, et al.
Published: (2025)
AutoFed: Personalized Federated Traffic Prediction via Adaptive Prompt
by: Zhao, Zijian, et al.
Published: (2025)
by: Zhao, Zijian, et al.
Published: (2025)
WorldAfford: Affordance Grounding based on Natural Language Instructions
by: Chen, Changmao, et al.
Published: (2024)
by: Chen, Changmao, et al.
Published: (2024)
MPDrive: Improving Spatial Understanding with Marker-Based Prompt Learning for Autonomous Driving
by: Zhang, Zhiyuan, et al.
Published: (2025)
by: Zhang, Zhiyuan, et al.
Published: (2025)
Adaptive Caching for Faster Video Generation with Diffusion Transformers
by: Kahatapitiya, Kumara, et al.
Published: (2024)
by: Kahatapitiya, Kumara, et al.
Published: (2024)
WavFlow: Audio Generation in Waveform Space
by: Zhou, Feiyan, et al.
Published: (2026)
by: Zhou, Feiyan, et al.
Published: (2026)
An Investigation of Robustness of LLMs in Mathematical Reasoning: Benchmarking with Mathematically-Equivalent Transformation of Advanced Mathematical Problems
by: Hao, Yuren, et al.
Published: (2025)
by: Hao, Yuren, et al.
Published: (2025)
Weakly-Supervised Referring Video Object Segmentation through Text Supervision
by: Shi, Miaojing, et al.
Published: (2026)
by: Shi, Miaojing, et al.
Published: (2026)
LoSh: Long-Short Text Joint Prediction Network for Referring Video Object Segmentation
by: Yuan, Linfeng, et al.
Published: (2023)
by: Yuan, Linfeng, et al.
Published: (2023)
Personalized Federated Learning with Attention-based Client Selection
by: Chen, Zihan, et al.
Published: (2023)
by: Chen, Zihan, et al.
Published: (2023)
A Note on Kinematic Flow and Differential Equations for Two-Site One-Loop Graph in FRW Spacetime
by: Hang, Yanfeng, et al.
Published: (2024)
by: Hang, Yanfeng, et al.
Published: (2024)
Similar Items
-
Scaling Zero-Shot Reference-to-Video Generation
by: Zhou, Zijian, et al.
Published: (2025) -
Mixture of States: Routing Token-Level Dynamics for Multimodal Generation
by: Liu, Haozhe, et al.
Published: (2025) -
Scaling Sequence-to-Sequence Generative Neural Rendering
by: Liu, Shikun, et al.
Published: (2025) -
Rays as Pixels: Learning A Joint Distribution of Videos and Camera Trajectories
by: Jang, Wonbong, et al.
Published: (2026) -
ConceptHash: Interpretable Fine-Grained Hashing via Concept Discovery
by: Ng, Kam Woh, et al.
Published: (2024)