Extrapolating and Decoupling Image-to-Video Generation Models: Motion Modeling is Easier Than You Think
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tian, Jie, Qu, Xiaoye, Lu, Zhenyi, Wei, Wei, Liu, Sichen, Cheng, Yu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VA-$π$: Variational Policy Alignment for Pixel-Aware Autoregressive Generation
par: Liao, Xinyao, et autres
Publié: (2025)
par: Liao, Xinyao, et autres
Publié: (2025)
Sequence Matters: Harnessing Video Models in 3D Super-Resolution
par: Ko, Hyun-kyu, et autres
Publié: (2024)
par: Ko, Hyun-kyu, et autres
Publié: (2024)
DOD-SA: Infrared-Visible Decoupled Object Detection with Single-Modality Annotations
par: Jin, Hang, et autres
Publié: (2025)
par: Jin, Hang, et autres
Publié: (2025)
Surg$Σ$: A Spectrum of Large-Scale Multimodal Data and Foundation Models for Surgical Intelligence
par: Zeng, Zhitao, et autres
Publié: (2026)
par: Zeng, Zhitao, et autres
Publié: (2026)
Force-Aware 3D Contact Modeling for Stable Grasp Generation
par: Chen, Zhuo, et autres
Publié: (2025)
par: Chen, Zhuo, et autres
Publié: (2025)
Meaning over Motion: A Semantic-First Approach to 360° Viewport Prediction
par: Khah, Arman Nik, et autres
Publié: (2026)
par: Khah, Arman Nik, et autres
Publié: (2026)
PlaneSAM: Multimodal Plane Instance Segmentation Using the Segment Anything Model
par: Deng, Zhongchen, et autres
Publié: (2024)
par: Deng, Zhongchen, et autres
Publié: (2024)
Video-CoE: Reinforcing Video Event Prediction via Chain of Events
par: Su, Qile, et autres
Publié: (2026)
par: Su, Qile, et autres
Publié: (2026)
Image Reconstruction as a Tool for Feature Analysis
par: Allakhverdov, Eduard, et autres
Publié: (2025)
par: Allakhverdov, Eduard, et autres
Publié: (2025)
When Less is Enough: Adaptive Token Reduction for Efficient Image Representation
par: Allakhverdov, Eduard, et autres
Publié: (2025)
par: Allakhverdov, Eduard, et autres
Publié: (2025)
Deep Learning Approaches for Human Action Recognition in Video Data
par: Xie, Yufei
Publié: (2024)
par: Xie, Yufei
Publié: (2024)
DiffYOLO: Object Detection for Anti-Noise via YOLO and Diffusion Models
par: Liu, Yichen, et autres
Publié: (2024)
par: Liu, Yichen, et autres
Publié: (2024)
Predicting Pedestrian Crossing Behavior in Germany and Japan: Insights into Model Transferability
par: Zhang, Chi, et autres
Publié: (2024)
par: Zhang, Chi, et autres
Publié: (2024)
SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence
par: Zeng, Zhitao, et autres
Publié: (2025)
par: Zeng, Zhitao, et autres
Publié: (2025)
Visual-Text Cross Alignment: Refining the Similarity Score in Vision-Language Models
par: Li, Jinhao, et autres
Publié: (2024)
par: Li, Jinhao, et autres
Publié: (2024)
VLM-NCD:Novel Class Discovery with Vision-Based Large Language Models
par: Su, Yuetong, et autres
Publié: (2025)
par: Su, Yuetong, et autres
Publié: (2025)
Hierarchical Spatial Algorithms for High-Resolution Image Quantization and Feature Extraction
par: Mohammad, Noor Islam S.
Publié: (2025)
par: Mohammad, Noor Islam S.
Publié: (2025)
3DreamBooth: High-Fidelity 3D Subject-Driven Video Generation Model
par: Ko, Hyun-kyu, et autres
Publié: (2026)
par: Ko, Hyun-kyu, et autres
Publié: (2026)
From Gaze to Insight: Bridging Human Visual Attention and Vision Language Model Explanation for Weakly-Supervised Medical Image Segmentation
par: Chen, Jingkun, et autres
Publié: (2025)
par: Chen, Jingkun, et autres
Publié: (2025)
Multi-scale Temporal Prediction via Incremental Generation and Multi-agent Collaboration
par: Zeng, Zhitao, et autres
Publié: (2025)
par: Zeng, Zhitao, et autres
Publié: (2025)
Evaluating Visual Mathematics in Multimodal LLMs: A Multilingual Benchmark Based on the Kangaroo Tests
par: Sáez, Arnau Igualde, et autres
Publié: (2025)
par: Sáez, Arnau Igualde, et autres
Publié: (2025)
Revisiting Energy-Based Model for Out-of-Distribution Detection
par: Wu, Yifan, et autres
Publié: (2024)
par: Wu, Yifan, et autres
Publié: (2024)
Tricks and Plug-ins for Gradient Boosting in Image Classification
par: Fang, Biyi, et autres
Publié: (2025)
par: Fang, Biyi, et autres
Publié: (2025)
VDPP: Video Depth Post-Processing for Speed and Scalability
par: Yoon, Daewon, et autres
Publié: (2026)
par: Yoon, Daewon, et autres
Publié: (2026)
FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models
par: Fu, Tianyu, et autres
Publié: (2024)
par: Fu, Tianyu, et autres
Publié: (2024)
Learning Association via Track-Detection Matching for Multi-Object Tracking
par: Adžemović, Momir
Publié: (2025)
par: Adžemović, Momir
Publié: (2025)
Learning Discriminative Spatio-temporal Representations for Semi-supervised Action Recognition
par: Wang, Yu, et autres
Publié: (2024)
par: Wang, Yu, et autres
Publié: (2024)
DeepFusionNet: Autoencoder-Based Low-Light Image Enhancement and Super-Resolution
par: Çalışkan, Halil Hüseyin, et autres
Publié: (2025)
par: Çalışkan, Halil Hüseyin, et autres
Publié: (2025)
Do Generative Metrics Predict YOLO Performance? An Evaluation Across Models, Augmentation Ratios, and Dataset Complexity
par: Marian, Vasile, et autres
Publié: (2026)
par: Marian, Vasile, et autres
Publié: (2026)
Smelly, dense, and spreaded: The Object Detection for Olfactory References (ODOR) dataset
par: Zinnen, Mathias, et autres
Publié: (2025)
par: Zinnen, Mathias, et autres
Publié: (2025)
RefineFormer3D: Efficient 3D Medical Image Segmentation via Adaptive Multi-Scale Transformer with Cross Attention Fusion
par: Tyagi, Kavyansh, et autres
Publié: (2026)
par: Tyagi, Kavyansh, et autres
Publié: (2026)
Point, Detect, Count: Multi-Task Medical Image Understanding with Instruction-Tuned Vision-Language Models
par: Gautam, Sushant, et autres
Publié: (2025)
par: Gautam, Sushant, et autres
Publié: (2025)
Training a Student Expert via Semi-Supervised Foundation Model Distillation
par: Taghavi, Pardis, et autres
Publié: (2026)
par: Taghavi, Pardis, et autres
Publié: (2026)
ClustViT: Clustering-based Token Merging for Semantic Segmentation
par: Montello, Fabio, et autres
Publié: (2025)
par: Montello, Fabio, et autres
Publié: (2025)
LatentForensics: Towards frugal deepfake detection in the StyleGAN latent space
par: Delmas, Matthieu, et autres
Publié: (2023)
par: Delmas, Matthieu, et autres
Publié: (2023)
Synthetic Industrial Object Detection: GenAI vs. Feature-Based Methods
par: Araya-Martinez, Jose Moises, et autres
Publié: (2025)
par: Araya-Martinez, Jose Moises, et autres
Publié: (2025)
One-to-Normal: Anomaly Personalization for Few-shot Anomaly Detection
par: Li, Yiyue, et autres
Publié: (2025)
par: Li, Yiyue, et autres
Publié: (2025)
Zero-Shot Multi-Criteria Visual Quality Inspection for Semi-Controlled Industrial Environments via Real-Time 3D Digital Twin Simulation
par: Araya-Martinez, Jose Moises, et autres
Publié: (2025)
par: Araya-Martinez, Jose Moises, et autres
Publié: (2025)
UrbanAlign: Post-hoc Semantic Calibration for VLM-Human Preference Alignment
par: Zhang, Yecheng, et autres
Publié: (2026)
par: Zhang, Yecheng, et autres
Publié: (2026)
SynthRender and IRIS: Open-Source Framework and Dataset for Bidirectional Sim-Real Transfer in Industrial Object Perception
par: Araya-Martinez, Jose Moises, et autres
Publié: (2026)
par: Araya-Martinez, Jose Moises, et autres
Publié: (2026)
Documents similaires
-
VA-$π$: Variational Policy Alignment for Pixel-Aware Autoregressive Generation
par: Liao, Xinyao, et autres
Publié: (2025) -
Sequence Matters: Harnessing Video Models in 3D Super-Resolution
par: Ko, Hyun-kyu, et autres
Publié: (2024) -
DOD-SA: Infrared-Visible Decoupled Object Detection with Single-Modality Annotations
par: Jin, Hang, et autres
Publié: (2025) -
Surg$Σ$: A Spectrum of Large-Scale Multimodal Data and Foundation Models for Surgical Intelligence
par: Zeng, Zhitao, et autres
Publié: (2026) -
Force-Aware 3D Contact Modeling for Stable Grasp Generation
par: Chen, Zhuo, et autres
Publié: (2025)