Unified and Dynamic Graph for Temporal Character Grouping in Long Videos
Fuente:
arXiv
Guardado en:
| Autores principales: | Shu, Xiujun, Wen, Wei, Xu, Liangsheng, Qiao, Ruizhi, Guo, Taian, Li, Hanjun, Gan, Bei, Wang, Xiao, Sun, Xing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Multimodal Label Relevance Ranking via Reinforcement Learning
por: Guo, Taian, et al.
Publicado: (2024)
por: Guo, Taian, et al.
Publicado: (2024)
Unified Static and Dynamic Network: Efficient Temporal Filtering for Video Grounding
por: Hu, Jingjing, et al.
Publicado: (2024)
por: Hu, Jingjing, et al.
Publicado: (2024)
Dynamic Group Detection using VLM-augmented Temporal Groupness Graph
por: Yokoyama, Kaname, et al.
Publicado: (2025)
por: Yokoyama, Kaname, et al.
Publicado: (2025)
VTok: A Unified Video Tokenizer with Decoupled Spatial-Temporal Latents
por: Wang, Feng, et al.
Publicado: (2026)
por: Wang, Feng, et al.
Publicado: (2026)
Representing Long Volumetric Video with Temporal Gaussian Hierarchy
por: Xu, Zhen, et al.
Publicado: (2024)
por: Xu, Zhen, et al.
Publicado: (2024)
Graph2Video: Leveraging Video Models to Model Dynamic Graph Evolution
por: Liu, Hua, et al.
Publicado: (2026)
por: Liu, Hua, et al.
Publicado: (2026)
TSPO: Temporal Sampling Policy Optimization for Long-form Video Language Understanding
por: Tang, Canhui, et al.
Publicado: (2025)
por: Tang, Canhui, et al.
Publicado: (2025)
UniMo: Unifying 2D Video and 3D Human Motion with an Autoregressive Framework
por: Pang, Youxin, et al.
Publicado: (2025)
por: Pang, Youxin, et al.
Publicado: (2025)
Gloria: Consistent Character Video Generation via Content Anchors
por: Yang, Yuhang, et al.
Publicado: (2026)
por: Yang, Yuhang, et al.
Publicado: (2026)
VideoCoF: Unified Video Editing with Temporal Reasoner
por: Yang, Xiangpeng, et al.
Publicado: (2025)
por: Yang, Xiangpeng, et al.
Publicado: (2025)
Wan-Animate: Unified Character Animation and Replacement with Holistic Replication
por: Cheng, Gang, et al.
Publicado: (2025)
por: Cheng, Gang, et al.
Publicado: (2025)
MovieCharacter: A Tuning-Free Framework for Controllable Character Video Synthesis
por: Qiu, Di, et al.
Publicado: (2024)
por: Qiu, Di, et al.
Publicado: (2024)
Generative Frame Sampler for Long Video Understanding
por: Yao, Linli, et al.
Publicado: (2025)
por: Yao, Linli, et al.
Publicado: (2025)
TemporalVLM: Video LLMs for Temporal Reasoning in Long Videos
por: Fateh, Fawad Javed, et al.
Publicado: (2024)
por: Fateh, Fawad Javed, et al.
Publicado: (2024)
EgoGraph: Temporal Knowledge Graph for Egocentric Video Understanding
por: Sun, Shitong, et al.
Publicado: (2026)
por: Sun, Shitong, et al.
Publicado: (2026)
Static and Dynamic Graph Alignment Network for Temporal Video Grounding
por: Hu, Zhanjie, et al.
Publicado: (2026)
por: Hu, Zhanjie, et al.
Publicado: (2026)
AnimationBench: Are Video Models Good at Character-Centric Animation?
por: Wu, Leyi, et al.
Publicado: (2026)
por: Wu, Leyi, et al.
Publicado: (2026)
Semi-Supervised State-Space Model with Dynamic Stacking Filter for Real-World Video Deraining
por: Sun, Shangquan, et al.
Publicado: (2025)
por: Sun, Shangquan, et al.
Publicado: (2025)
Unified Spatial-Temporal Edge-Enhanced Graph Networks for Pedestrian Trajectory Prediction
por: Li, Ruochen, et al.
Publicado: (2025)
por: Li, Ruochen, et al.
Publicado: (2025)
LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding
por: Wu, Haoning, et al.
Publicado: (2024)
por: Wu, Haoning, et al.
Publicado: (2024)
Video-Language Alignment via Spatio-Temporal Graph Transformer
por: Zhang, Shi-Xue, et al.
Publicado: (2024)
por: Zhang, Shi-Xue, et al.
Publicado: (2024)
Mask as Supervision: Leveraging Unified Mask Information for Unsupervised 3D Pose Estimation
por: Yang, Yuchen, et al.
Publicado: (2023)
por: Yang, Yuchen, et al.
Publicado: (2023)
Low-Light Video Enhancement via Spatial-Temporal Consistent Decomposition
por: Xu, Xiaogang, et al.
Publicado: (2024)
por: Xu, Xiaogang, et al.
Publicado: (2024)
Low-Light Video Enhancement with An Effective Spatial-Temporal Decomposition Paradigm
por: Xu, Xiaogang, et al.
Publicado: (2026)
por: Xu, Xiaogang, et al.
Publicado: (2026)
TUMTraffic-VideoQA: A Benchmark for Unified Spatio-Temporal Video Understanding in Traffic Scenes
por: Zhou, Xingcheng, et al.
Publicado: (2025)
por: Zhou, Xingcheng, et al.
Publicado: (2025)
VISA: Group-wise Visual Token Selection and Aggregation via Graph Summarization for Efficient MLLMs Inference
por: Jiang, Pengfei, et al.
Publicado: (2025)
por: Jiang, Pengfei, et al.
Publicado: (2025)
Character Mixing for Video Generation
por: Liao, Tingting, et al.
Publicado: (2025)
por: Liao, Tingting, et al.
Publicado: (2025)
Multi-Scale Temporal Difference Transformer for Video-Text Retrieval
por: Wang, Ni, et al.
Publicado: (2024)
por: Wang, Ni, et al.
Publicado: (2024)
TimeScope: Towards Task-Oriented Temporal Grounding In Long Videos
por: Liu, Xiangrui, et al.
Publicado: (2025)
por: Liu, Xiangrui, et al.
Publicado: (2025)
ContextFlow: Training-Free Video Object Editing via Adaptive Context Enrichment
por: Chen, Yiyang, et al.
Publicado: (2025)
por: Chen, Yiyang, et al.
Publicado: (2025)
Rotate Your Character: Revisiting Video Diffusion Models for High-Quality 3D Character Generation
por: Wang, Jin, et al.
Publicado: (2026)
por: Wang, Jin, et al.
Publicado: (2026)
FiLA-Video: Spatio-Temporal Compression for Fine-Grained Long Video Understanding
por: Guo, Yanan, et al.
Publicado: (2025)
por: Guo, Yanan, et al.
Publicado: (2025)
UVE: Are MLLMs Unified Evaluators for AI-Generated Videos?
por: Liu, Yuanxin, et al.
Publicado: (2025)
por: Liu, Yuanxin, et al.
Publicado: (2025)
GraphThinker: Reinforcing Temporally Grounded Video Reasoning with Event Graph Thinking
por: Cheng, Zixu, et al.
Publicado: (2026)
por: Cheng, Zixu, et al.
Publicado: (2026)
Temporal2Seq: A Unified Framework for Temporal Video Understanding Tasks
por: Yang, Min, et al.
Publicado: (2024)
por: Yang, Min, et al.
Publicado: (2024)
Long-Tail Temporal Action Segmentation with Group-wise Temporal Logit Adjustment
por: Pang, Zhanzhong, et al.
Publicado: (2024)
por: Pang, Zhanzhong, et al.
Publicado: (2024)
Multimodal Long Video Modeling Based on Temporal Dynamic Context
por: Hao, Haoran, et al.
Publicado: (2025)
por: Hao, Haoran, et al.
Publicado: (2025)
STOP: Integrated Spatial-Temporal Dynamic Prompting for Video Understanding
por: Liu, Zichen, et al.
Publicado: (2025)
por: Liu, Zichen, et al.
Publicado: (2025)
T*: Re-thinking Temporal Search for Long-Form Video Understanding
por: Ye, Jinhui, et al.
Publicado: (2025)
por: Ye, Jinhui, et al.
Publicado: (2025)
Dynamic-Aware Video Distillation: Optimizing Temporal Resolution Based on Video Semantics
por: Zhao, Yinjie, et al.
Publicado: (2025)
por: Zhao, Yinjie, et al.
Publicado: (2025)
Ejemplares similares
-
Multimodal Label Relevance Ranking via Reinforcement Learning
por: Guo, Taian, et al.
Publicado: (2024) -
Unified Static and Dynamic Network: Efficient Temporal Filtering for Video Grounding
por: Hu, Jingjing, et al.
Publicado: (2024) -
Dynamic Group Detection using VLM-augmented Temporal Groupness Graph
por: Yokoyama, Kaname, et al.
Publicado: (2025) -
VTok: A Unified Video Tokenizer with Decoupled Spatial-Temporal Latents
por: Wang, Feng, et al.
Publicado: (2026) -
Representing Long Volumetric Video with Temporal Gaussian Hierarchy
por: Xu, Zhen, et al.
Publicado: (2024)