Plan-X: Instruct Video Generation via Semantic Planning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huang, Lun, Xie, You, Xu, Hongyi, Gu, Tianpei, Zhang, Chenxu, Song, Guoxian, Li, Zenan, Zhao, Xiaochen, Luo, Linjie, Sapiro, Guillermo |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
X-UniMotion: Animating Human Images with Expressive, Unified and Identity-Agnostic Motion Latents
par: Song, Guoxian, et autres
Publié: (2025)
par: Song, Guoxian, et autres
Publié: (2025)
X-Streamer: Unified Human World Modeling with Audiovisual Interaction
par: Xie, You, et autres
Publié: (2025)
par: Xie, You, et autres
Publié: (2025)
X-Actor: Emotional and Expressive Long-Range Portrait Acting from Audio
par: Zhang, Chenxu, et autres
Publié: (2025)
par: Zhang, Chenxu, et autres
Publié: (2025)
X-NeMo: Expressive Neural Motion Reenactment via Disentangled Latent Attention
par: Zhao, Xiaochen, et autres
Publié: (2025)
par: Zhao, Xiaochen, et autres
Publié: (2025)
X-Dancer: Expressive Music to Human Dance Video Generation
par: Chen, Zeyuan, et autres
Publié: (2025)
par: Chen, Zeyuan, et autres
Publié: (2025)
X-Portrait: Expressive Portrait Animation with Hierarchical Motion Attention
par: Xie, You, et autres
Publié: (2024)
par: Xie, You, et autres
Publié: (2024)
DiffPortrait3D: Controllable Diffusion for Zero-Shot Portrait View Synthesis
par: Gu, Yuming, et autres
Publié: (2023)
par: Gu, Yuming, et autres
Publié: (2023)
Lynx: Towards High-Fidelity Personalized Video Generation
par: Sang, Shen, et autres
Publié: (2025)
par: Sang, Shen, et autres
Publié: (2025)
Video-As-Prompt: Unified Semantic Control for Video Generation
par: Bian, Yuxuan, et autres
Publié: (2025)
par: Bian, Yuxuan, et autres
Publié: (2025)
X-Dyna: Expressive Dynamic Human Image Animation
par: Chang, Di, et autres
Publié: (2025)
par: Chang, Di, et autres
Publié: (2025)
High Quality Human Image Animation using Regional Supervision and Motion Blur Condition
par: Xu, Zhongcong, et autres
Publié: (2024)
par: Xu, Zhongcong, et autres
Publié: (2024)
Bridging Your Imagination with Audio-Video Generation via a Unified Director
par: Zhang, Jiaxu, et autres
Publié: (2025)
par: Zhang, Jiaxu, et autres
Publié: (2025)
Timber: Training-free Instruct Model Refining with Base via Effective Rank
par: Wu, Taiqiang, et autres
Publié: (2025)
par: Wu, Taiqiang, et autres
Publié: (2025)
Vision Transformers with Natural Language Semantics
par: Kim, Young Kyung, et autres
Publié: (2024)
par: Kim, Young Kyung, et autres
Publié: (2024)
VMAS: Video-to-Music Generation via Semantic Alignment in Web Music Videos
par: Lin, Yan-Bo, et autres
Publié: (2024)
par: Lin, Yan-Bo, et autres
Publié: (2024)
Seer: Language Instructed Video Prediction with Latent Diffusion Models
par: Gu, Xianfan, et autres
Publié: (2023)
par: Gu, Xianfan, et autres
Publié: (2023)
GenPlanX. Generation of Plans and Execution
par: Borrajo, Daniel, et autres
Publié: (2025)
par: Borrajo, Daniel, et autres
Publié: (2025)
Bernini: Latent Semantic Planning for Video Diffusion
par: Bernini Team, et autres
Publié: (2026)
par: Bernini Team, et autres
Publié: (2026)
InstructSing: High-Fidelity Singing Voice Generation via Instructing Yourself
par: Zeng, Chang, et autres
Publié: (2024)
par: Zeng, Chang, et autres
Publié: (2024)
CU-Mamba: Selective State Space Models with Channel Learning for Image Restoration
par: Deng, Rui, et autres
Publié: (2024)
par: Deng, Rui, et autres
Publié: (2024)
How Does Mandated Non‐Financial Disclosure Affect Corporate Cash Holdings? Evidence From the CSR Disclosure Mandate in China
par: Adrian Cheung, et autres
Publié: (2026)
par: Adrian Cheung, et autres
Publié: (2026)
Robotic Programmer: Video Instructed Policy Code Generation for Robotic Manipulation
par: Xie, Senwei, et autres
Publié: (2025)
par: Xie, Senwei, et autres
Publié: (2025)
Entre o nacional e o internacional: o surgimento histórico da sociologia como campo
par: Gisèle Sapiro
Publié: (2018)
par: Gisèle Sapiro
Publié: (2018)
Un dialogue: entretien avec Gisèle Sapiro*
par: Gisèle Sapiro
Publié: (2022)
par: Gisèle Sapiro
Publié: (2022)
Os processos literários e a construção da imagem do intelectual engajado
par: Gisèle Sapiro
Publié: (2013)
par: Gisèle Sapiro
Publié: (2013)
Repensar o conceito de autonomia para uma sociologia dos bens simbólicos
par: Gisèle Sapiro
Publié: (2020)
par: Gisèle Sapiro
Publié: (2020)
Modelos de intervención política de los intelectuales. El caso francés
par: Gisèle Sapiro
Publié: (2011)
par: Gisèle Sapiro
Publié: (2011)
De la figura de autor a la movilidad de textos. La contribución de Roger Chartier a la sociología y a la historia de la literatura
par: Gisèle Sapiro
Publié: (2022)
par: Gisèle Sapiro
Publié: (2022)
A noção de campo de uma perspectiva transnacional: A teoria da diferenciação social sob o prisma da história global
par: Gisèle Sapiro
Publié: (2019)
par: Gisèle Sapiro
Publié: (2019)
Semi-Instruct: Bridging Natural-Instruct and Self-Instruct for Code Large Language Models
par: Luo, Xianzhen, et autres
Publié: (2024)
par: Luo, Xianzhen, et autres
Publié: (2024)
InstructRAG: Leveraging Retrieval-Augmented Generation on Instruction Graphs for LLM-Based Task Planning
par: Wang, Zheng, et autres
Publié: (2025)
par: Wang, Zheng, et autres
Publié: (2025)
Latent Plan Transformer for Trajectory Abstraction: Planning as Latent Space Inference
par: Kong, Deqian, et autres
Publié: (2024)
par: Kong, Deqian, et autres
Publié: (2024)
Knowledge-Intensive Video Generation
par: Wang, Chenxu, et autres
Publié: (2026)
par: Wang, Chenxu, et autres
Publié: (2026)
Adapting Reinforcement Learning for Path Planning in Constrained Parking Scenarios
par: Tao, Feng, et autres
Publié: (2026)
par: Tao, Feng, et autres
Publié: (2026)
Chain-of-Image Generation: Toward Monitorable and Controllable Image Generation
par: Kim, Young Kyung, et autres
Publié: (2025)
par: Kim, Young Kyung, et autres
Publié: (2025)
CoFineLLM: Conformal Finetuning of LLMs for Language-Instructed Robot Planning
par: Wang, Jun, et autres
Publié: (2025)
par: Wang, Jun, et autres
Publié: (2025)
Grounding Generated Videos in Feasible Plans via World Models
par: Ziakas, Christos, et autres
Publié: (2026)
par: Ziakas, Christos, et autres
Publié: (2026)
PlanLLM: Video Procedure Planning with Refinable Large Language Models
par: Yang, Dejie, et autres
Publié: (2024)
par: Yang, Dejie, et autres
Publié: (2024)
Retrieve-Plan-Generation: An Iterative Planning and Answering Framework for Knowledge-Intensive LLM Generation
par: Lyu, Yuanjie, et autres
Publié: (2024)
par: Lyu, Yuanjie, et autres
Publié: (2024)
Semformer: Transformer Language Models with Semantic Planning
par: Yin, Yongjing, et autres
Publié: (2024)
par: Yin, Yongjing, et autres
Publié: (2024)
Documents similaires
-
X-UniMotion: Animating Human Images with Expressive, Unified and Identity-Agnostic Motion Latents
par: Song, Guoxian, et autres
Publié: (2025) -
X-Streamer: Unified Human World Modeling with Audiovisual Interaction
par: Xie, You, et autres
Publié: (2025) -
X-Actor: Emotional and Expressive Long-Range Portrait Acting from Audio
par: Zhang, Chenxu, et autres
Publié: (2025) -
X-NeMo: Expressive Neural Motion Reenactment via Disentangled Latent Attention
par: Zhao, Xiaochen, et autres
Publié: (2025) -
X-Dancer: Expressive Music to Human Dance Video Generation
par: Chen, Zeyuan, et autres
Publié: (2025)