DragEntity: Trajectory Guided Video Generation using Entity and Positional Relationships
Fuente:
arXiv
Guardado en:
| Autores principales: | Wan, Zhang, Tang, Sheng, Wei, Jiawei, Zhang, Ruize, Cao, Juan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DragAnything: Motion Control for Anything using Entity Representation
por: Wu, Weijia, et al.
Publicado: (2024)
por: Wu, Weijia, et al.
Publicado: (2024)
3DTrajMaster: Mastering 3D Trajectory for Multi-Entity Motion in Video Generation
por: Fu, Xiao, et al.
Publicado: (2024)
por: Fu, Xiao, et al.
Publicado: (2024)
Leveraging Entity Information for Cross-Modality Correlation Learning: The Entity-Guided Multimodal Summarization
por: Zhang, Yanghai, et al.
Publicado: (2024)
por: Zhang, Yanghai, et al.
Publicado: (2024)
EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video Generation
por: He, Ruozhen, et al.
Publicado: (2026)
por: He, Ruozhen, et al.
Publicado: (2026)
DragVideo: Interactive Drag-style Video Editing
por: Deng, Yufan, et al.
Publicado: (2023)
por: Deng, Yufan, et al.
Publicado: (2023)
Knowledge Guided Entity-aware Video Captioning and A Basketball Benchmark
por: Xi, Zeyu, et al.
Publicado: (2024)
por: Xi, Zeyu, et al.
Publicado: (2024)
OmniDrag: Enabling Motion Control for Omnidirectional Image-to-Video Generation
por: Li, Weiqi, et al.
Publicado: (2024)
por: Li, Weiqi, et al.
Publicado: (2024)
Tora2: Motion and Appearance Customized Diffusion Transformer for Multi-Entity Video Generation
por: Zhang, Zhenghao, et al.
Publicado: (2025)
por: Zhang, Zhenghao, et al.
Publicado: (2025)
EAMA : Entity-Aware Multimodal Alignment Based Approach for News Image Captioning
por: Zhang, Junzhe, et al.
Publicado: (2024)
por: Zhang, Junzhe, et al.
Publicado: (2024)
VP-MEL: Visual Prompts Guided Multimodal Entity Linking
por: Mi, Hongze, et al.
Publicado: (2024)
por: Mi, Hongze, et al.
Publicado: (2024)
EliGen: Entity-Level Controlled Image Generation with Regional Attention
por: Zhang, Hong, et al.
Publicado: (2025)
por: Zhang, Hong, et al.
Publicado: (2025)
DragMesh: Interactive 3D Generation Made Easy
por: Zhang, Tianshan, et al.
Publicado: (2025)
por: Zhang, Tianshan, et al.
Publicado: (2025)
A Proposal-Free Query-Guided Network for Grounded Multimodal Named Entity Recognition
por: Li, Hongbing, et al.
Publicado: (2026)
por: Li, Hongbing, et al.
Publicado: (2026)
Entity-NeRF: Detecting and Removing Moving Entities in Urban Scenes
por: Otonari, Takashi, et al.
Publicado: (2024)
por: Otonari, Takashi, et al.
Publicado: (2024)
Streaming Drag-Oriented Interactive Video Manipulation: Drag Anything, Anytime!
por: Zhou, Junbao, et al.
Publicado: (2025)
por: Zhou, Junbao, et al.
Publicado: (2025)
Causal-Entity Reflected Egocentric Traffic Accident Video Synthesis
por: Li, Lei-lei, et al.
Publicado: (2025)
por: Li, Lei-lei, et al.
Publicado: (2025)
Causal Prompt Calibration Guided Segment Anything Model for Open-Vocabulary Multi-Entity Segmentation
por: Wang, Jingyao, et al.
Publicado: (2025)
por: Wang, Jingyao, et al.
Publicado: (2025)
ECIS-VQG: Generation of Entity-centric Information-seeking Questions from Videos
por: Phukan, Arpan, et al.
Publicado: (2024)
por: Phukan, Arpan, et al.
Publicado: (2024)
Self-supervised Video Instance Segmentation Can Boost Geographic Entity Alignment in Historical Maps
por: Xia, Xue, et al.
Publicado: (2024)
por: Xia, Xue, et al.
Publicado: (2024)
Video Summarization: Towards Entity-Aware Captions
por: Ayyubi, Hammad A., et al.
Publicado: (2023)
por: Ayyubi, Hammad A., et al.
Publicado: (2023)
Entity-Guided Multi-Task Learning for Infrared and Visible Image Fusion
por: Shao, Wenyu, et al.
Publicado: (2026)
por: Shao, Wenyu, et al.
Publicado: (2026)
StableDrag: Stable Dragging for Point-based Image Editing
por: Cui, Yutao, et al.
Publicado: (2024)
por: Cui, Yutao, et al.
Publicado: (2024)
HENASY: Learning to Assemble Scene-Entities for Egocentric Video-Language Model
por: Vo, Khoa, et al.
Publicado: (2024)
por: Vo, Khoa, et al.
Publicado: (2024)
EntityCLIP: Entity-Centric Image-Text Matching via Multimodal Attentive Contrastive Learning
por: Wang, Yaxiong, et al.
Publicado: (2024)
por: Wang, Yaxiong, et al.
Publicado: (2024)
C-Drag: Chain-of-Thought Driven Motion Controller for Video Generation
por: Li, Yuhao, et al.
Publicado: (2025)
por: Li, Yuhao, et al.
Publicado: (2025)
KITTEN: A Knowledge-Intensive Evaluation of Image Generation on Visual Entities
por: Huang, Hsin-Ping, et al.
Publicado: (2024)
por: Huang, Hsin-Ping, et al.
Publicado: (2024)
When and What: Diffusion-Grounded VideoLLM with Entity Aware Segmentation for Long Video Understanding
por: Fang, Pengcheng, et al.
Publicado: (2025)
por: Fang, Pengcheng, et al.
Publicado: (2025)
Incantation: Natural Language as the Action Interface for Multi-Entity Video World Models
por: Zhu, Shangwen, et al.
Publicado: (2026)
por: Zhu, Shangwen, et al.
Publicado: (2026)
Entity-Centric World Models: Interaction-Aware Masking for Causal Video Prediction
por: Paidi, Santosh Kumar
Publicado: (2026)
por: Paidi, Santosh Kumar
Publicado: (2026)
E-SAM: Training-Free Segment Every Entity Model
por: Zhang, Weiming, et al.
Publicado: (2025)
por: Zhang, Weiming, et al.
Publicado: (2025)
Entity6K: A Large Open-Domain Evaluation Dataset for Real-World Entity Recognition
por: Qiu, Jielin, et al.
Publicado: (2024)
por: Qiu, Jielin, et al.
Publicado: (2024)
A Generative Approach for Wikipedia-Scale Visual Entity Recognition
por: Caron, Mathilde, et al.
Publicado: (2024)
por: Caron, Mathilde, et al.
Publicado: (2024)
Grounding Language Models for Visual Entity Recognition
por: Xiao, Zilin, et al.
Publicado: (2024)
por: Xiao, Zilin, et al.
Publicado: (2024)
E2E-GMNER: End-to-End Generative Grounded Multimodal Named Entity Recognition
por: Zhang, Meng, et al.
Publicado: (2026)
por: Zhang, Meng, et al.
Publicado: (2026)
VFM$^{4}$SDG: Unveiling the Power of VFMs for Single-Domain Generalized Object Detection
por: Zhang, Yupeng, et al.
Publicado: (2026)
por: Zhang, Yupeng, et al.
Publicado: (2026)
Generating Fine Details of Entity Interactions
por: Gu, Xinyi, et al.
Publicado: (2025)
por: Gu, Xinyi, et al.
Publicado: (2025)
Light Up the Shadows: Enhance Long-Tailed Entity Grounding with Concept-Guided Vision-Language Models
por: Zhang, Yikai, et al.
Publicado: (2024)
por: Zhang, Yikai, et al.
Publicado: (2024)
Unified Camera Positional Encoding for Controlled Video Generation
por: Zhang, Cheng, et al.
Publicado: (2025)
por: Zhang, Cheng, et al.
Publicado: (2025)
One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition
por: Darur, Balaji, et al.
Publicado: (2026)
por: Darur, Balaji, et al.
Publicado: (2026)
AdaptiveDrag: Semantic-Driven Dragging on Diffusion-Based Image Editing
por: Chen, DuoSheng, et al.
Publicado: (2024)
por: Chen, DuoSheng, et al.
Publicado: (2024)
Ejemplares similares
-
DragAnything: Motion Control for Anything using Entity Representation
por: Wu, Weijia, et al.
Publicado: (2024) -
3DTrajMaster: Mastering 3D Trajectory for Multi-Entity Motion in Video Generation
por: Fu, Xiao, et al.
Publicado: (2024) -
Leveraging Entity Information for Cross-Modality Correlation Learning: The Entity-Guided Multimodal Summarization
por: Zhang, Yanghai, et al.
Publicado: (2024) -
EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video Generation
por: He, Ruozhen, et al.
Publicado: (2026) -
DragVideo: Interactive Drag-style Video Editing
por: Deng, Yufan, et al.
Publicado: (2023)