P-Flow: Prompting Visual Effects Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Rui, Shou, Mike Zheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DoraCycle: Domain-Oriented Adaptation of Unified Generative Model in Multimodal Cycles
di: Zhao, Rui, et al.
Pubblicazione: (2025)
di: Zhao, Rui, et al.
Pubblicazione: (2025)
StreamingEffect: Real-Time Human-Centric Video Effect Generation
di: Song, Yiren, et al.
Pubblicazione: (2026)
di: Song, Yiren, et al.
Pubblicazione: (2026)
DiffSim: Taming Diffusion Models for Evaluating Visual Similarity
di: Song, Yiren, et al.
Pubblicazione: (2024)
di: Song, Yiren, et al.
Pubblicazione: (2024)
Factorized Visual Tokenization and Generation
di: Bai, Zechen, et al.
Pubblicazione: (2024)
di: Bai, Zechen, et al.
Pubblicazione: (2024)
VLog: Video-Language Models by Generative Retrieval of Narration Vocabulary
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2025)
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2025)
Automated Movie Generation via Multi-Agent CoT Planning
di: Wu, Weijia, et al.
Pubblicazione: (2025)
di: Wu, Weijia, et al.
Pubblicazione: (2025)
MakeAnything: Harnessing Diffusion Transformers for Multi-Domain Procedural Sequence Generation
di: Song, Yiren, et al.
Pubblicazione: (2025)
di: Song, Yiren, et al.
Pubblicazione: (2025)
VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting
di: Ilaslan, Muhammet Furkan, et al.
Pubblicazione: (2024)
di: Ilaslan, Muhammet Furkan, et al.
Pubblicazione: (2024)
TPDiff: Temporal Pyramid Video Diffusion Model
di: Ran, Lingmin, et al.
Pubblicazione: (2025)
di: Ran, Lingmin, et al.
Pubblicazione: (2025)
D-AR: Diffusion via Autoregressive Models
di: Gao, Ziteng, et al.
Pubblicazione: (2025)
di: Gao, Ziteng, et al.
Pubblicazione: (2025)
Ego-centric Predictive Model Conditioned on Hand Trajectories
di: Zhang, Binjie, et al.
Pubblicazione: (2025)
di: Zhang, Binjie, et al.
Pubblicazione: (2025)
ShowUI-$π$: Flow-based Generative Models as GUI Dexterous Hands
di: Hu, Siyuan, et al.
Pubblicazione: (2025)
di: Hu, Siyuan, et al.
Pubblicazione: (2025)
Genixer: Empowering Multimodal Large Language Models as a Powerful Data Generator
di: Zhao, Henry Hengyuan, et al.
Pubblicazione: (2023)
di: Zhao, Henry Hengyuan, et al.
Pubblicazione: (2023)
Mitty: Diffusion-based Human-to-Robot Video Generation
di: Song, Yiren, et al.
Pubblicazione: (2025)
di: Song, Yiren, et al.
Pubblicazione: (2025)
OmniPSD: Layered PSD Generation with Diffusion Transformer
di: Liu, Cheng, et al.
Pubblicazione: (2025)
di: Liu, Cheng, et al.
Pubblicazione: (2025)
ROICtrl: Boosting Instance Control for Visual Generation
di: Gu, Yuchao, et al.
Pubblicazione: (2024)
di: Gu, Yuchao, et al.
Pubblicazione: (2024)
X-Humanoid: Robotize Human Videos to Generate Humanoid Videos at Scale
di: Yang, Pei, et al.
Pubblicazione: (2025)
di: Yang, Pei, et al.
Pubblicazione: (2025)
The Image as Its Own Reward: Reinforcement Learning with Adversarial Reward for Image Generation
di: Mao, Weijia, et al.
Pubblicazione: (2025)
di: Mao, Weijia, et al.
Pubblicazione: (2025)
IDProtector: An Adversarial Noise Encoder to Protect Against ID-Preserving Image Generation
di: Song, Yiren, et al.
Pubblicazione: (2024)
di: Song, Yiren, et al.
Pubblicazione: (2024)
Multi-human Interactive Talking Dataset
di: Zhu, Zeyu, et al.
Pubblicazione: (2025)
di: Zhu, Zeyu, et al.
Pubblicazione: (2025)
PANDA: Towards Generalist Video Anomaly Detection via Agentic AI Engineer
di: Yang, Zhiwei, et al.
Pubblicazione: (2025)
di: Yang, Zhiwei, et al.
Pubblicazione: (2025)
Show-o2: Improved Native Unified Multimodal Models
di: Xie, Jinheng, et al.
Pubblicazione: (2025)
di: Xie, Jinheng, et al.
Pubblicazione: (2025)
UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning
di: Mao, Weijia, et al.
Pubblicazione: (2025)
di: Mao, Weijia, et al.
Pubblicazione: (2025)
Long-Context Autoregressive Video Modeling with Next-Frame Prediction
di: Gu, Yuchao, et al.
Pubblicazione: (2025)
di: Gu, Yuchao, et al.
Pubblicazione: (2025)
Edit2Perceive: Image Editing Diffusion Models Are Strong Dense Perceivers
di: Shi, Yiqing, et al.
Pubblicazione: (2025)
di: Shi, Yiqing, et al.
Pubblicazione: (2025)
SAM-I2V: Upgrading SAM to Support Promptable Video Segmentation with Less than 0.2% Training Cost
di: Mei, Haiyang, et al.
Pubblicazione: (2025)
di: Mei, Haiyang, et al.
Pubblicazione: (2025)
Impossible Videos
di: Bai, Zechen, et al.
Pubblicazione: (2025)
di: Bai, Zechen, et al.
Pubblicazione: (2025)
OmniConsistency: Learning Style-Agnostic Consistency from Paired Stylization Data
di: Song, Yiren, et al.
Pubblicazione: (2025)
di: Song, Yiren, et al.
Pubblicazione: (2025)
LayerTracer: Cognitive-Aligned Layered SVG Synthesis via Diffusion Transformer
di: Song, Yiren, et al.
Pubblicazione: (2025)
di: Song, Yiren, et al.
Pubblicazione: (2025)
UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths
di: Mao, Weijia, et al.
Pubblicazione: (2025)
di: Mao, Weijia, et al.
Pubblicazione: (2025)
WorldWander: Bridging Egocentric and Exocentric Worlds in Video Generation
di: Song, Quanjian, et al.
Pubblicazione: (2025)
di: Song, Quanjian, et al.
Pubblicazione: (2025)
OmniHumanoid: Streaming Cross-Embodiment Video Generation with Paired-Free Adaptation
di: Song, Yiren, et al.
Pubblicazione: (2026)
di: Song, Yiren, et al.
Pubblicazione: (2026)
Leveraging Visual Tokens for Extended Text Contexts in Multi-Modal Learning
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2024)
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2024)
LOVA3: Learning to Visual Question Answering, Asking and Assessment
di: Zhao, Henry Hengyuan, et al.
Pubblicazione: (2024)
di: Zhao, Henry Hengyuan, et al.
Pubblicazione: (2024)
Personalized Vision via Visual In-Context Learning
di: Jiang, Yuxin, et al.
Pubblicazione: (2025)
di: Jiang, Yuxin, et al.
Pubblicazione: (2025)
EVOLVE-VLA: Test-Time Training from Environment Feedback for Vision-Language-Action Models
di: Bai, Zechen, et al.
Pubblicazione: (2025)
di: Bai, Zechen, et al.
Pubblicazione: (2025)
DiffuMask: Synthesizing Images with Pixel-level Annotations for Semantic Segmentation Using Diffusion Models
di: Wu, Weijia, et al.
Pubblicazione: (2023)
di: Wu, Weijia, et al.
Pubblicazione: (2023)
Show-1: Marrying Pixel and Latent Diffusion Models for Text-to-Video Generation
di: Zhang, David Junhao, et al.
Pubblicazione: (2023)
di: Zhang, David Junhao, et al.
Pubblicazione: (2023)
VISTA: Triplet-Supervised Video Style Transfer with Diffusion Transformers
di: Song, Yiren, et al.
Pubblicazione: (2026)
di: Song, Yiren, et al.
Pubblicazione: (2026)
Steganalysis on Digital Watermarking: Is Your Defense Truly Impervious?
di: Yang, Pei, et al.
Pubblicazione: (2024)
di: Yang, Pei, et al.
Pubblicazione: (2024)
Documenti analoghi
-
DoraCycle: Domain-Oriented Adaptation of Unified Generative Model in Multimodal Cycles
di: Zhao, Rui, et al.
Pubblicazione: (2025) -
StreamingEffect: Real-Time Human-Centric Video Effect Generation
di: Song, Yiren, et al.
Pubblicazione: (2026) -
DiffSim: Taming Diffusion Models for Evaluating Visual Similarity
di: Song, Yiren, et al.
Pubblicazione: (2024) -
Factorized Visual Tokenization and Generation
di: Bai, Zechen, et al.
Pubblicazione: (2024) -
VLog: Video-Language Models by Generative Retrieval of Narration Vocabulary
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2025)