THFM: A Unified Video Foundation Model for 4D Human Perception and Beyond
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Letian, Zanfir, Andrei, Bazavan, Eduard Gabriel, Andriluka, Misha, Sminchisescu, Cristian |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VLOGGER: Multimodal Diffusion for Embodied Avatar Synthesis
di: Corona, Enric, et al.
Pubblicazione: (2024)
di: Corona, Enric, et al.
Pubblicazione: (2024)
Instant 3D Human Avatar Generation using Image Diffusion Models
di: Kolotouros, Nikos, et al.
Pubblicazione: (2024)
di: Kolotouros, Nikos, et al.
Pubblicazione: (2024)
DiffHuman: Probabilistic Photorealistic 3D Reconstruction of Humans
di: Sengupta, Akash, et al.
Pubblicazione: (2024)
di: Sengupta, Akash, et al.
Pubblicazione: (2024)
Learned Neural Physics Simulation for Articulated 3D Human Pose Reconstruction
di: Andriluka, Mykhaylo, et al.
Pubblicazione: (2024)
di: Andriluka, Mykhaylo, et al.
Pubblicazione: (2024)
Score Distillation Sampling with Learned Manifold Corrective
di: Alldieck, Thiemo, et al.
Pubblicazione: (2024)
di: Alldieck, Thiemo, et al.
Pubblicazione: (2024)
UniVBench: Towards Unified Evaluation for Video Foundation Models
di: Wei, Jianhui, et al.
Pubblicazione: (2026)
di: Wei, Jianhui, et al.
Pubblicazione: (2026)
3D Human Pose Perception from Egocentric Stereo Videos
di: Akada, Hiroyasu, et al.
Pubblicazione: (2023)
di: Akada, Hiroyasu, et al.
Pubblicazione: (2023)
Uni4D: Unifying Visual Foundation Models for 4D Modeling from a Single Video
di: Yao, David Yifan, et al.
Pubblicazione: (2025)
di: Yao, David Yifan, et al.
Pubblicazione: (2025)
Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation
di: Wang, Xinshun, et al.
Pubblicazione: (2026)
di: Wang, Xinshun, et al.
Pubblicazione: (2026)
Percept, Chat, and then Adapt: Multimodal Knowledge Transfer of Foundation Models for Open-World Video Recognition
di: Chen, Boyu, et al.
Pubblicazione: (2024)
di: Chen, Boyu, et al.
Pubblicazione: (2024)
RefHCM: A Unified Model for Referring Perceptions in Human-Centric Scenarios
di: Huang, Jie, et al.
Pubblicazione: (2024)
di: Huang, Jie, et al.
Pubblicazione: (2024)
L4P: Towards Unified Low-Level 4D Vision Perception
di: Badki, Abhishek, et al.
Pubblicazione: (2025)
di: Badki, Abhishek, et al.
Pubblicazione: (2025)
Video Perception Models for 3D Scene Synthesis
di: Huang, Rui, et al.
Pubblicazione: (2025)
di: Huang, Rui, et al.
Pubblicazione: (2025)
UniAnimate: Taming Unified Video Diffusion Models for Consistent Human Image Animation
di: Wang, Xiang, et al.
Pubblicazione: (2024)
di: Wang, Xiang, et al.
Pubblicazione: (2024)
Behavioral Geometric Supervision Aligns Video Foundation Models with Human Social Perception
di: Garcia, Kathy, et al.
Pubblicazione: (2025)
di: Garcia, Kathy, et al.
Pubblicazione: (2025)
UniMo: Unifying 2D Video and 3D Human Motion with an Autoregressive Framework
di: Pang, Youxin, et al.
Pubblicazione: (2025)
di: Pang, Youxin, et al.
Pubblicazione: (2025)
UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video
di: Sur, Tanuj, et al.
Pubblicazione: (2026)
di: Sur, Tanuj, et al.
Pubblicazione: (2026)
Perception of Visual Content: Differences Between Humans and Foundation Models
di: Pratama, Nardiena A., et al.
Pubblicazione: (2024)
di: Pratama, Nardiena A., et al.
Pubblicazione: (2024)
Advancing Human Action Recognition with Foundation Models trained on Unlabeled Public Videos
di: Qian, Yang, et al.
Pubblicazione: (2024)
di: Qian, Yang, et al.
Pubblicazione: (2024)
PointNet4D: A Lightweight 4D Point Cloud Video Backbone for Online and Offline Perception in Robotic Applications
di: Liu, Yunze, et al.
Pubblicazione: (2025)
di: Liu, Yunze, et al.
Pubblicazione: (2025)
VISTA3D: A Unified Segmentation Foundation Model For 3D Medical Imaging
di: He, Yufan, et al.
Pubblicazione: (2024)
di: He, Yufan, et al.
Pubblicazione: (2024)
Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models
di: Jin, Yudong, et al.
Pubblicazione: (2025)
di: Jin, Yudong, et al.
Pubblicazione: (2025)
Human4DiT: 360-degree Human Video Generation with 4D Diffusion Transformer
di: Shao, Ruizhi, et al.
Pubblicazione: (2024)
di: Shao, Ruizhi, et al.
Pubblicazione: (2024)
Uni3C: Unifying Precisely 3D-Enhanced Camera and Human Motion Controls for Video Generation
di: Cao, Chenjie, et al.
Pubblicazione: (2025)
di: Cao, Chenjie, et al.
Pubblicazione: (2025)
InternVideo2: Scaling Foundation Models for Multimodal Video Understanding
di: Wang, Yi, et al.
Pubblicazione: (2024)
di: Wang, Yi, et al.
Pubblicazione: (2024)
UNIV: Unified Foundation Model for Infrared and Visible Modalities
di: Mao, Fangyuan, et al.
Pubblicazione: (2025)
di: Mao, Fangyuan, et al.
Pubblicazione: (2025)
3DMedAgent: Unified Perception-to-Understanding for 3D Medical Analysis
di: Wang, Ziyue, et al.
Pubblicazione: (2026)
di: Wang, Ziyue, et al.
Pubblicazione: (2026)
InternVideo-Next: Towards General Video Foundation Models without Video-Text Supervision
di: Wang, Chenting, et al.
Pubblicazione: (2025)
di: Wang, Chenting, et al.
Pubblicazione: (2025)
DrivePI: Spatial-aware 4D MLLM for Unified Autonomous Driving Understanding, Perception, Prediction and Planning
di: Liu, Zhe, et al.
Pubblicazione: (2025)
di: Liu, Zhe, et al.
Pubblicazione: (2025)
PolypSegTrack: Unified Foundation Model for Colonoscopy Video Analysis
di: Choudhuri, Anwesa, et al.
Pubblicazione: (2025)
di: Choudhuri, Anwesa, et al.
Pubblicazione: (2025)
One for All: Toward Unified Foundation Models for Earth Vision
di: Xiong, Zhitong, et al.
Pubblicazione: (2024)
di: Xiong, Zhitong, et al.
Pubblicazione: (2024)
Interspatial Attention for Efficient 4D Human Video Generation
di: Shao, Ruizhi, et al.
Pubblicazione: (2025)
di: Shao, Ruizhi, et al.
Pubblicazione: (2025)
CoDA: From Text-to-Image Diffusion Models to Training-Free Dataset Distillation
di: Zhou, Letian, et al.
Pubblicazione: (2025)
di: Zhou, Letian, et al.
Pubblicazione: (2025)
Human-in-Context: Unified Cross-Domain 3D Human Motion Modeling via In-Context Learning
di: Liu, Mengyuan, et al.
Pubblicazione: (2025)
di: Liu, Mengyuan, et al.
Pubblicazione: (2025)
UniE2F: A Unified Diffusion Framework for Event-to-Frame Reconstruction with Video Foundation Models
di: Xu, Gang, et al.
Pubblicazione: (2026)
di: Xu, Gang, et al.
Pubblicazione: (2026)
Cutup and Detect: Human Fall Detection on Cutup Untrimmed Videos Using a Large Foundational Video Understanding Model
di: Grutschus, Till, et al.
Pubblicazione: (2024)
di: Grutschus, Till, et al.
Pubblicazione: (2024)
VideoGLUE: Video General Understanding Evaluation of Foundation Models
di: Yuan, Liangzhe, et al.
Pubblicazione: (2023)
di: Yuan, Liangzhe, et al.
Pubblicazione: (2023)
Foundation Model for Skeleton-Based Human Action Understanding
di: Wang, Hongsong, et al.
Pubblicazione: (2025)
di: Wang, Hongsong, et al.
Pubblicazione: (2025)
Human-Centric Foundation Models: Perception, Generation and Agentic Modeling
di: Tang, Shixiang, et al.
Pubblicazione: (2025)
di: Tang, Shixiang, et al.
Pubblicazione: (2025)
Unified Coding for Both Human Perception and Generalized Machine Analytics with CLIP Supervision
di: Yin, Kangsheng, et al.
Pubblicazione: (2025)
di: Yin, Kangsheng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
VLOGGER: Multimodal Diffusion for Embodied Avatar Synthesis
di: Corona, Enric, et al.
Pubblicazione: (2024) -
Instant 3D Human Avatar Generation using Image Diffusion Models
di: Kolotouros, Nikos, et al.
Pubblicazione: (2024) -
DiffHuman: Probabilistic Photorealistic 3D Reconstruction of Humans
di: Sengupta, Akash, et al.
Pubblicazione: (2024) -
Learned Neural Physics Simulation for Articulated 3D Human Pose Reconstruction
di: Andriluka, Mykhaylo, et al.
Pubblicazione: (2024) -
Score Distillation Sampling with Learned Manifold Corrective
di: Alldieck, Thiemo, et al.
Pubblicazione: (2024)