ViPro-2: Unsupervised State Estimation via Integrated Dynamics for Guiding Video Prediction
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Takenaka, Patrick, Maucher, Johannes, Huber, Marco F. |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ViPro: Enabling and Controlling Video Prediction for Complex Dynamical Scenarios using Procedural Knowledge
par: Takenaka, Patrick, et autres
Publié: (2024)
par: Takenaka, Patrick, et autres
Publié: (2024)
Guiding Video Prediction with Explicit Procedural Knowledge
par: Takenaka, Patrick, et autres
Publié: (2024)
par: Takenaka, Patrick, et autres
Publié: (2024)
Anonymization of Documents for Law Enforcement with Machine Learning
par: Eberhardinger, Manuel, et autres
Publié: (2025)
par: Eberhardinger, Manuel, et autres
Publié: (2025)
Classification of Inkjet Printers based on Droplet Statistics
par: Takenaka, Patrick, et autres
Publié: (2024)
par: Takenaka, Patrick, et autres
Publié: (2024)
Automatic Odometry-Less OpenDRIVE Generation From Sparse Point Clouds
par: Eisemann, Leon, et autres
Publié: (2024)
par: Eisemann, Leon, et autres
Publié: (2024)
ViSMaP: Unsupervised Hour-long Video Summarisation by Meta-Prompting
par: Hu, Jian, et autres
Publié: (2025)
par: Hu, Jian, et autres
Publié: (2025)
Unsupervised Object Localization in the Era of Self-Supervised ViTs: A Survey
par: Siméoni, Oriane, et autres
Publié: (2023)
par: Siméoni, Oriane, et autres
Publié: (2023)
Integrating Disparity Confidence Estimation into Relative Depth Prior-Guided Unsupervised Stereo Matching
par: Liu, Chuang-Wei, et autres
Publié: (2025)
par: Liu, Chuang-Wei, et autres
Publié: (2025)
ViASNet: A Video Ad Saliency Network for Predicting Dynamic Saliency and Viewer Engagement
par: Ye, Jianping, et autres
Publié: (2026)
par: Ye, Jianping, et autres
Publié: (2026)
ViSAGE @ NTIRE 2026 Challenge on Video Saliency Prediction
par: Wang, Kun, et autres
Publié: (2026)
par: Wang, Kun, et autres
Publié: (2026)
ConViS-Bench: Estimating Video Similarity Through Semantic Concepts
par: Liberatori, Benedetta, et autres
Publié: (2025)
par: Liberatori, Benedetta, et autres
Publié: (2025)
Guided Slot Attention for Unsupervised Video Object Segmentation
par: Lee, Minhyeok, et autres
Publié: (2023)
par: Lee, Minhyeok, et autres
Publié: (2023)
DiViD: Disentangled Video Diffusion for Static-Dynamic Factorization
par: Gheisari, Marzieh, et autres
Publié: (2025)
par: Gheisari, Marzieh, et autres
Publié: (2025)
CoProU-VO: Combining Projected Uncertainty for End-to-End Unsupervised Monocular Visual Odometry
par: Xie, Jingchao, et autres
Publié: (2025)
par: Xie, Jingchao, et autres
Publié: (2025)
OCK: Unsupervised Dynamic Video Prediction with Object-Centric Kinematics
par: Song, Yeon-Ji, et autres
Publié: (2024)
par: Song, Yeon-Ji, et autres
Publié: (2024)
ViViD: Video Virtual Try-on using Diffusion Models
par: Fang, Zixun, et autres
Publié: (2024)
par: Fang, Zixun, et autres
Publié: (2024)
Learning Physics From Video: Unsupervised Physical Parameter Estimation for Continuous Dynamical Systems
par: Garcia, Alejandro Castañeda, et autres
Publié: (2024)
par: Garcia, Alejandro Castañeda, et autres
Publié: (2024)
Exploring Plain ViT Reconstruction for Multi-class Unsupervised Anomaly Detection
par: Zhang, Jiangning, et autres
Publié: (2023)
par: Zhang, Jiangning, et autres
Publié: (2023)
ViKey: Enhancing Temporal Understanding in Videos via Visual Prompting
par: Lee, Yeonkyung, et autres
Publié: (2026)
par: Lee, Yeonkyung, et autres
Publié: (2026)
ProDyG: Progressive Dynamic Scene Reconstruction via Gaussian Splatting from Monocular Videos
par: Chen, Shi, et autres
Publié: (2025)
par: Chen, Shi, et autres
Publié: (2025)
Unsupervised Monocular Depth Estimation Based on Hierarchical Feature-Guided Diffusion
par: Liu, Runze, et autres
Publié: (2024)
par: Liu, Runze, et autres
Publié: (2024)
Future Slot Prediction for Unsupervised Object Discovery in Surgical Video
par: Liao, Guiqiu, et autres
Publié: (2025)
par: Liao, Guiqiu, et autres
Publié: (2025)
VersaViT: Enhancing MLLM Vision Backbones via Task-Guided Optimization
par: Liu, Yikun, et autres
Publié: (2026)
par: Liu, Yikun, et autres
Publié: (2026)
Boosting Unsupervised Video Instance Segmentation with Automatic Quality-Guided Self-Training
par: Lu, Kaixuan, et autres
Publié: (2025)
par: Lu, Kaixuan, et autres
Publié: (2025)
Unsupervised Cross-Domain 3D Human Pose Estimation via Pseudo-Label-Guided Global Transforms
par: Liu, Jingjing, et autres
Publié: (2025)
par: Liu, Jingjing, et autres
Publié: (2025)
AdaViPro: Region-based Adaptive Visual Prompt for Large-Scale Models Adapting
par: Yang, Mengyu, et autres
Publié: (2024)
par: Yang, Mengyu, et autres
Publié: (2024)
ViDiC: Video Difference Captioning
par: Wu, Jiangtao, et autres
Publié: (2025)
par: Wu, Jiangtao, et autres
Publié: (2025)
DDLP: Unsupervised Object-Centric Video Prediction with Deep Dynamic Latent Particles
par: Daniel, Tal, et autres
Publié: (2023)
par: Daniel, Tal, et autres
Publié: (2023)
Vid2Avatar-Pro: Authentic Avatar from Videos in the Wild via Universal Prior
par: Guo, Chen, et autres
Publié: (2025)
par: Guo, Chen, et autres
Publié: (2025)
ViLA: Efficient Video-Language Alignment for Video Question Answering
par: Wang, Xijun, et autres
Publié: (2023)
par: Wang, Xijun, et autres
Publié: (2023)
ViSpeak: Visual Instruction Feedback in Streaming Videos
par: Fu, Shenghao, et autres
Publié: (2025)
par: Fu, Shenghao, et autres
Publié: (2025)
ViLL-E: Video LLM Embeddings for Retrieval
par: Gupta, Rohit, et autres
Publié: (2026)
par: Gupta, Rohit, et autres
Publié: (2026)
MoViE: Mobile Diffusion for Video Editing
par: Karjauv, Adil, et autres
Publié: (2024)
par: Karjauv, Adil, et autres
Publié: (2024)
LAMM-ViT: AI Face Detection via Layer-Aware Modulation of Region-Guided Attention
par: Zhang, Jiangling, et autres
Publié: (2025)
par: Zhang, Jiangling, et autres
Publié: (2025)
Self-supervised Optimization of Hand Pose Estimation using Anatomical Features and Iterative Learning
par: Jauch, Christian, et autres
Publié: (2023)
par: Jauch, Christian, et autres
Publié: (2023)
TiViBench: Benchmarking Think-in-Video Reasoning for Video Generative Models
par: Chen, Harold Haodong, et autres
Publié: (2025)
par: Chen, Harold Haodong, et autres
Publié: (2025)
VideoPro: Adaptive Program Reasoning for Long Video Understanding
par: Li, Chenglin, et autres
Publié: (2025)
par: Li, Chenglin, et autres
Publié: (2025)
DynaGuide: A Generalizable Dynamic Guidance Framework for Unsupervised Semantic Segmentation
par: Guermazi, Boujemaa, et autres
Publié: (2026)
par: Guermazi, Boujemaa, et autres
Publié: (2026)
ViThinker: Active Vision-Language Reasoning via Dynamic Perceptual Querying
par: You, Weihang, et autres
Publié: (2026)
par: You, Weihang, et autres
Publié: (2026)
ViMU: Benchmarking Video Metaphorical Understanding
par: Li, Qi, et autres
Publié: (2026)
par: Li, Qi, et autres
Publié: (2026)
Documents similaires
-
ViPro: Enabling and Controlling Video Prediction for Complex Dynamical Scenarios using Procedural Knowledge
par: Takenaka, Patrick, et autres
Publié: (2024) -
Guiding Video Prediction with Explicit Procedural Knowledge
par: Takenaka, Patrick, et autres
Publié: (2024) -
Anonymization of Documents for Law Enforcement with Machine Learning
par: Eberhardinger, Manuel, et autres
Publié: (2025) -
Classification of Inkjet Printers based on Droplet Statistics
par: Takenaka, Patrick, et autres
Publié: (2024) -
Automatic Odometry-Less OpenDRIVE Generation From Sparse Point Clouds
par: Eisemann, Leon, et autres
Publié: (2024)