TGT: Text-Grounded Trajectories for Locally Controlled Video Generation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Guofeng, Wang, Angtian, Fang, Jacob Zhiyuan, Jiang, Liming, Yang, Haotian, Liu, Bo, Yang, Yiding, Chen, Guang, Wen, Longyin, Yuille, Alan, Ma, Chongyang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
HECTOR: Hybrid Editable Compositional Object References for Video Generation
von: Zhang, Guofeng, et al.
Veröffentlicht: (2026)
von: Zhang, Guofeng, et al.
Veröffentlicht: (2026)
ATI: Any Trajectory Instruction for Controllable Video Generation
von: Wang, Angtian, et al.
Veröffentlicht: (2025)
von: Wang, Angtian, et al.
Veröffentlicht: (2025)
VIVA: VLM-Guided Instruction-Based Video Editing with Reward Optimization
von: Cong, Xiaoyan, et al.
Veröffentlicht: (2025)
von: Cong, Xiaoyan, et al.
Veröffentlicht: (2025)
CINEMA: Coherent Multi-Subject Video Generation via MLLM-Based Guidance
von: Deng, Yufan, et al.
Veröffentlicht: (2025)
von: Deng, Yufan, et al.
Veröffentlicht: (2025)
MAGREF: Masked Guidance for Any-Reference Video Generation with Subject Disentanglement
von: Deng, Yufan, et al.
Veröffentlicht: (2025)
von: Deng, Yufan, et al.
Veröffentlicht: (2025)
NOVUM: Neural Object Volumes for Robust Object Classification
von: Jesslen, Artur, et al.
Veröffentlicht: (2023)
von: Jesslen, Artur, et al.
Veröffentlicht: (2023)
Compositional 4D Dynamic Scenes Understanding with Physics Priors for Video Question Answering
von: Wang, Xingrui, et al.
Veröffentlicht: (2024)
von: Wang, Xingrui, et al.
Veröffentlicht: (2024)
StoryMem: Multi-shot Long Video Storytelling with Memory
von: Zhang, Kaiwen, et al.
Veröffentlicht: (2025)
von: Zhang, Kaiwen, et al.
Veröffentlicht: (2025)
From Pixel to Cancer: Cellular Automata in Computed Tomography
von: Lai, Yuxiang, et al.
Veröffentlicht: (2024)
von: Lai, Yuxiang, et al.
Veröffentlicht: (2024)
VoGE: A Differentiable Volume Renderer using Gaussian Ellipsoids for Analysis-by-Synthesis
von: Wang, Angtian, et al.
Veröffentlicht: (2022)
von: Wang, Angtian, et al.
Veröffentlicht: (2022)
Structure-Aware Sparse-View X-ray 3D Reconstruction
von: Cai, Yuanhao, et al.
Veröffentlicht: (2023)
von: Cai, Yuanhao, et al.
Veröffentlicht: (2023)
DINeMo: Learning Neural Mesh Models with no 3D Annotations
von: Guo, Weijie, et al.
Veröffentlicht: (2025)
von: Guo, Weijie, et al.
Veröffentlicht: (2025)
EchoFoley: Event-Centric Hierarchical Control for Video Grounded Creative Sound Generation
von: Li, Bingxuan, et al.
Veröffentlicht: (2025)
von: Li, Bingxuan, et al.
Veröffentlicht: (2025)
ViMix-14M: A Curated Multi-Source Video-Text Dataset with Long-Form, High-Quality Captions and Crawl-Free Access
von: Yang, Timing, et al.
Veröffentlicht: (2025)
von: Yang, Timing, et al.
Veröffentlicht: (2025)
FSVideo: Fast Speed Video Diffusion Model in a Highly-Compressed Latent Space
von: FSVideo Team, et al.
Veröffentlicht: (2026)
von: FSVideo Team, et al.
Veröffentlicht: (2026)
Radiative Gaussian Splatting for Efficient X-ray Novel View Synthesis
von: Cai, Yuanhao, et al.
Veröffentlicht: (2024)
von: Cai, Yuanhao, et al.
Veröffentlicht: (2024)
Rethinking Video-Text Understanding: Retrieval from Counterfactually Augmented Data
von: Ma, Wufei, et al.
Veröffentlicht: (2024)
von: Ma, Wufei, et al.
Veröffentlicht: (2024)
Learning a Category-level Object Pose Estimator without Pose Annotations
von: Tian, Fengrui, et al.
Veröffentlicht: (2024)
von: Tian, Fengrui, et al.
Veröffentlicht: (2024)
Thinking With Bounding Boxes: Enhancing Spatio-Temporal Video Grounding via Reinforcement Fine-Tuning
von: Gu, Xin, et al.
Veröffentlicht: (2025)
von: Gu, Xin, et al.
Veröffentlicht: (2025)
PASR: Pose-Aware 3D Shape Retrieval from Occluded Single Views
von: Shi, Jiaxin, et al.
Veröffentlicht: (2026)
von: Shi, Jiaxin, et al.
Veröffentlicht: (2026)
Envision: Embodied Visual Planning via Goal-Imagery Video Diffusion
von: Gu, Yuming, et al.
Veröffentlicht: (2025)
von: Gu, Yuming, et al.
Veröffentlicht: (2025)
4D-Animal: Freely Reconstructing Animatable 3D Animals from Videos
von: Zhong, Shanshan, et al.
Veröffentlicht: (2025)
von: Zhong, Shanshan, et al.
Veröffentlicht: (2025)
A Simple Video Segmenter by Tracking Objects Along Axial Trajectories
von: He, Ju, et al.
Veröffentlicht: (2023)
von: He, Ju, et al.
Veröffentlicht: (2023)
phiTGT: RP² Topological DHOST Ia Framework—10D Phase Space Single Scalar DOF Analysis
von: Cheng, Yi-Wen
Veröffentlicht: (2026)
von: Cheng, Yi-Wen
Veröffentlicht: (2026)
phiTGT: RP² Topological DHOST Ia Framework—10D Phase Space Single Scalar DOF Analysis
von: Cheng, Yi-Wen
Veröffentlicht: (2026)
von: Cheng, Yi-Wen
Veröffentlicht: (2026)
phiTGT: RP² Topological DHOST Ia Framework—10D Phase Space Single Scalar DOF Analysis
von: Cheng, Yi-Wen
Veröffentlicht: (2026)
von: Cheng, Yi-Wen
Veröffentlicht: (2026)
Adventurer: Optimizing Vision Mamba Architecture Designs for Efficiency
von: Wang, Feng, et al.
Veröffentlicht: (2024)
von: Wang, Feng, et al.
Veröffentlicht: (2024)
Impact of Stickers on Multimodal Sentiment and Intent in Social Media: A New Task, Dataset and Baseline
von: Shi, Yuanchen, et al.
Veröffentlicht: (2024)
von: Shi, Yuanchen, et al.
Veröffentlicht: (2024)
Generating Images with 3D Annotations Using Diffusion Models
von: Ma, Wufei, et al.
Veröffentlicht: (2023)
von: Ma, Wufei, et al.
Veröffentlicht: (2023)
VideoAuteur: Towards Long Narrative Video Generation
von: Xiao, Junfei, et al.
Veröffentlicht: (2025)
von: Xiao, Junfei, et al.
Veröffentlicht: (2025)
Beyond Raw Videos: Understanding Edited Videos with Large Multimodal Model
von: Xu, Lu, et al.
Veröffentlicht: (2024)
von: Xu, Lu, et al.
Veröffentlicht: (2024)
Text-Driven Diverse Facial Texture Generation via Progressive Latent-Space Refinement
von: Wang, Chi, et al.
Veröffentlicht: (2024)
von: Wang, Chi, et al.
Veröffentlicht: (2024)
TGT: A Temporal Gating Transformer for Smartphone App Usage Prediction
von: Li, Longlong, et al.
Veröffentlicht: (2025)
von: Li, Longlong, et al.
Veröffentlicht: (2025)
Toward Real-World Chinese Psychological Support Dialogues: CPsDD Dataset and a Co-Evolving Multi-Agent System
von: Shi, Yuanchen, et al.
Veröffentlicht: (2025)
von: Shi, Yuanchen, et al.
Veröffentlicht: (2025)
Multi-Hop Question Generation via Dual-Perspective Keyword Guidance
von: Li, Maodong, et al.
Veröffentlicht: (2025)
von: Li, Maodong, et al.
Veröffentlicht: (2025)
iNeMo: Incremental Neural Mesh Models for Robust Class-Incremental Learning
von: Fischer, Tom, et al.
Veröffentlicht: (2024)
von: Fischer, Tom, et al.
Veröffentlicht: (2024)
PartInstruct: Part-level Instruction Following for Fine-grained Robot Manipulation
von: Yin, Yifan, et al.
Veröffentlicht: (2025)
von: Yin, Yifan, et al.
Veröffentlicht: (2025)
VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing
von: Deng, Andong, et al.
Veröffentlicht: (2026)
von: Deng, Andong, et al.
Veröffentlicht: (2026)
Computer Vision and Its Relationship to Cognitive Science: A perspective from Bayes Decision Theory
von: Yuille, Alan, et al.
Veröffentlicht: (2026)
von: Yuille, Alan, et al.
Veröffentlicht: (2026)
Accurate and Fast Compressed Video Captioning
von: Shen, Yaojie, et al.
Veröffentlicht: (2023)
von: Shen, Yaojie, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
HECTOR: Hybrid Editable Compositional Object References for Video Generation
von: Zhang, Guofeng, et al.
Veröffentlicht: (2026) -
ATI: Any Trajectory Instruction for Controllable Video Generation
von: Wang, Angtian, et al.
Veröffentlicht: (2025) -
VIVA: VLM-Guided Instruction-Based Video Editing with Reward Optimization
von: Cong, Xiaoyan, et al.
Veröffentlicht: (2025) -
CINEMA: Coherent Multi-Subject Video Generation via MLLM-Based Guidance
von: Deng, Yufan, et al.
Veröffentlicht: (2025) -
MAGREF: Masked Guidance for Any-Reference Video Generation with Subject Disentanglement
von: Deng, Yufan, et al.
Veröffentlicht: (2025)