HECTOR: Hybrid Editable Compositional Object References for Video Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Guofeng, Wang, Angtian, Fang, Jacob Zhiyuan, Jiang, Liming, Yang, Haotian, Yuille, Alan, Ma, Chongyang |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TGT: Text-Grounded Trajectories for Locally Controlled Video Generation
par: Zhang, Guofeng, et autres
Publié: (2025)
par: Zhang, Guofeng, et autres
Publié: (2025)
NOVUM: Neural Object Volumes for Robust Object Classification
par: Jesslen, Artur, et autres
Publié: (2023)
par: Jesslen, Artur, et autres
Publié: (2023)
ATI: Any Trajectory Instruction for Controllable Video Generation
par: Wang, Angtian, et autres
Publié: (2025)
par: Wang, Angtian, et autres
Publié: (2025)
MAGREF: Masked Guidance for Any-Reference Video Generation with Subject Disentanglement
par: Deng, Yufan, et autres
Publié: (2025)
par: Deng, Yufan, et autres
Publié: (2025)
Compositional 4D Dynamic Scenes Understanding with Physics Priors for Video Question Answering
par: Wang, Xingrui, et autres
Publié: (2024)
par: Wang, Xingrui, et autres
Publié: (2024)
VIVA: VLM-Guided Instruction-Based Video Editing with Reward Optimization
par: Cong, Xiaoyan, et autres
Publié: (2025)
par: Cong, Xiaoyan, et autres
Publié: (2025)
CINEMA: Coherent Multi-Subject Video Generation via MLLM-Based Guidance
par: Deng, Yufan, et autres
Publié: (2025)
par: Deng, Yufan, et autres
Publié: (2025)
StoryMem: Multi-shot Long Video Storytelling with Memory
par: Zhang, Kaiwen, et autres
Publié: (2025)
par: Zhang, Kaiwen, et autres
Publié: (2025)
DINeMo: Learning Neural Mesh Models with no 3D Annotations
par: Guo, Weijie, et autres
Publié: (2025)
par: Guo, Weijie, et autres
Publié: (2025)
Learning a Category-level Object Pose Estimator without Pose Annotations
par: Tian, Fengrui, et autres
Publié: (2024)
par: Tian, Fengrui, et autres
Publié: (2024)
ImageNet3D: Towards General-Purpose Object-Level 3D Understanding
par: Ma, Wufei, et autres
Publié: (2024)
par: Ma, Wufei, et autres
Publié: (2024)
VoGE: A Differentiable Volume Renderer using Gaussian Ellipsoids for Analysis-by-Synthesis
par: Wang, Angtian, et autres
Publié: (2022)
par: Wang, Angtian, et autres
Publié: (2022)
From Pixel to Cancer: Cellular Automata in Computed Tomography
par: Lai, Yuxiang, et autres
Publié: (2024)
par: Lai, Yuxiang, et autres
Publié: (2024)
Structure-Aware Sparse-View X-ray 3D Reconstruction
par: Cai, Yuanhao, et autres
Publié: (2023)
par: Cai, Yuanhao, et autres
Publié: (2023)
Generating Images with 3D Annotations Using Diffusion Models
par: Ma, Wufei, et autres
Publié: (2023)
par: Ma, Wufei, et autres
Publié: (2023)
PASR: Pose-Aware 3D Shape Retrieval from Occluded Single Views
par: Shi, Jiaxin, et autres
Publié: (2026)
par: Shi, Jiaxin, et autres
Publié: (2026)
VideoAuteur: Towards Long Narrative Video Generation
par: Xiao, Junfei, et autres
Publié: (2025)
par: Xiao, Junfei, et autres
Publié: (2025)
Direct-a-Video: Customized Video Generation with User-Directed Camera Movement and Object Motion
par: Yang, Shiyuan, et autres
Publié: (2024)
par: Yang, Shiyuan, et autres
Publié: (2024)
4D-Animal: Freely Reconstructing Animatable 3D Animals from Videos
par: Zhong, Shanshan, et autres
Publié: (2025)
par: Zhong, Shanshan, et autres
Publié: (2025)
Dictionary-based Framework for Interpretable and Consistent Object Parsing
par: Zhang, Tiezheng, et autres
Publié: (2025)
par: Zhang, Tiezheng, et autres
Publié: (2025)
Geometry-Editable and Appearance-Preserving Object Compositon
par: Lin, Jianman, et autres
Publié: (2025)
par: Lin, Jianman, et autres
Publié: (2025)
From Pixels to Objects: A Hierarchical Approach for Part and Object Segmentation Using Local and Global Aggregation
par: Xie, Yunfei, et autres
Publié: (2024)
par: Xie, Yunfei, et autres
Publié: (2024)
CompoNeRF: Text-guided Multi-object Compositional NeRF with Editable 3D Scene Layout
par: Bai, Haotian, et autres
Publié: (2023)
par: Bai, Haotian, et autres
Publié: (2023)
DreamMix: Decoupling Object Attributes for Enhanced Editability in Customized Image Inpainting
par: Yang, Yicheng, et autres
Publié: (2024)
par: Yang, Yicheng, et autres
Publié: (2024)
Refer-Agent: A Collaborative Multi-Agent System with Reasoning and Reflection for Referring Video Object Segmentation
par: Jiang, Haichao, et autres
Publié: (2026)
par: Jiang, Haichao, et autres
Publié: (2026)
Thinking with Spatial Code for Physical-World Video Reasoning
par: Chen, Jieneng, et autres
Publié: (2026)
par: Chen, Jieneng, et autres
Publié: (2026)
Radiative Gaussian Splatting for Efficient X-ray Novel View Synthesis
par: Cai, Yuanhao, et autres
Publié: (2024)
par: Cai, Yuanhao, et autres
Publié: (2024)
ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations
par: Liang, Tianming, et autres
Publié: (2025)
par: Liang, Tianming, et autres
Publié: (2025)
Envision: Embodied Visual Planning via Goal-Imagery Video Diffusion
par: Gu, Yuming, et autres
Publié: (2025)
par: Gu, Yuming, et autres
Publié: (2025)
A Simple Video Segmenter by Tracking Objects Along Axial Trajectories
par: He, Ju, et autres
Publié: (2023)
par: He, Ju, et autres
Publié: (2023)
Temporally Consistent Referring Video Object Segmentation with Hybrid Memory
par: Miao, Bo, et autres
Publié: (2024)
par: Miao, Bo, et autres
Publié: (2024)
AutoFigure-Edit: Generating Editable Scientific Illustration
par: Lin, Zhen, et autres
Publié: (2026)
par: Lin, Zhen, et autres
Publié: (2026)
ViMix-14M: A Curated Multi-Source Video-Text Dataset with Long-Form, High-Quality Captions and Crawl-Free Access
par: Yang, Timing, et autres
Publié: (2025)
par: Yang, Timing, et autres
Publié: (2025)
Customized Generation Reimagined: Fidelity and Editability Harmonized
par: Jin, Jian, et autres
Publié: (2024)
par: Jin, Jian, et autres
Publié: (2024)
RefDrop: Controllable Consistency in Image or Video Generation via Reference Feature Guidance
par: Fan, Jiaojiao, et autres
Publié: (2024)
par: Fan, Jiaojiao, et autres
Publié: (2024)
VideoTetris: Towards Compositional Text-to-Video Generation
par: Tian, Ye, et autres
Publié: (2024)
par: Tian, Ye, et autres
Publié: (2024)
EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions
par: Chen, Zhiyuan, et autres
Publié: (2024)
par: Chen, Zhiyuan, et autres
Publié: (2024)
Computer Vision and Its Relationship to Cognitive Science: A perspective from Bayes Decision Theory
par: Yuille, Alan, et autres
Publié: (2026)
par: Yuille, Alan, et autres
Publié: (2026)
Adventurer: Optimizing Vision Mamba Architecture Designs for Efficiency
par: Wang, Feng, et autres
Publié: (2024)
par: Wang, Feng, et autres
Publié: (2024)
Long-RVOS: A Comprehensive Benchmark for Long-term Referring Video Object Segmentation
par: Liang, Tianming, et autres
Publié: (2025)
par: Liang, Tianming, et autres
Publié: (2025)
Documents similaires
-
TGT: Text-Grounded Trajectories for Locally Controlled Video Generation
par: Zhang, Guofeng, et autres
Publié: (2025) -
NOVUM: Neural Object Volumes for Robust Object Classification
par: Jesslen, Artur, et autres
Publié: (2023) -
ATI: Any Trajectory Instruction for Controllable Video Generation
par: Wang, Angtian, et autres
Publié: (2025) -
MAGREF: Masked Guidance for Any-Reference Video Generation with Subject Disentanglement
par: Deng, Yufan, et autres
Publié: (2025) -
Compositional 4D Dynamic Scenes Understanding with Physics Priors for Video Question Answering
par: Wang, Xingrui, et autres
Publié: (2024)