Flow4Agent: Long-form Video Understanding via Motion Prior from Optical Flow
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Ruyang, Sun, Shangkun, Tang, Haoran, Li, Ge, Gao, Wei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance
par: Sun, Shangkun, et autres
Publié: (2024)
par: Sun, Shangkun, et autres
Publié: (2024)
Content-Rich AIGC Video Quality Assessment via Intricate Text Alignment and Motion-Aware Consistency
par: Sun, Shangkun, et autres
Publié: (2025)
par: Sun, Shangkun, et autres
Publié: (2025)
Video Spatial Reasoning with Object-Centric 3D Rollout
par: Tang, Haoran, et autres
Publié: (2025)
par: Tang, Haoran, et autres
Publié: (2025)
ST-LLM: Large Language Models Are Effective Temporal Learners
par: Liu, Ruyang, et autres
Publié: (2024)
par: Liu, Ruyang, et autres
Publié: (2024)
Order from Chaos: Physical World Understanding from Glitchy Gameplay Videos
par: Cao, Meng, et autres
Publié: (2026)
par: Cao, Meng, et autres
Publié: (2026)
LumosFlow: Motion-Guided Long Video Generation
par: Chen, Jiahao, et autres
Publié: (2025)
par: Chen, Jiahao, et autres
Publié: (2025)
BT-Adapter: Video Conversation is Feasible Without Video Instruction Tuning
par: Liu, Ruyang, et autres
Publié: (2023)
par: Liu, Ruyang, et autres
Publié: (2023)
Exploring AIGC Video Quality: A Focus on Visual Harmony, Video-Text Consistency and Domain Distribution Gap
par: Qu, Bowen, et autres
Publié: (2024)
par: Qu, Bowen, et autres
Publié: (2024)
PhysGame: Uncovering Physical Commonsense Violations in Gameplay Videos
par: Cao, Meng, et autres
Publié: (2024)
par: Cao, Meng, et autres
Publié: (2024)
MOOSE: Pay Attention to Temporal Dynamics for Video Understanding via Optical Flows
par: Nguyen, Hong, et autres
Publié: (2025)
par: Nguyen, Hong, et autres
Publié: (2025)
Progressive Video Condensation with MLLM Agent for Long-form Video Understanding
par: Yin, Yufei, et autres
Publié: (2026)
par: Yin, Yufei, et autres
Publié: (2026)
SplatFlow: Learning Multi-frame Optical Flow via Splatting
par: Wang, Bo, et autres
Publié: (2023)
par: Wang, Bo, et autres
Publié: (2023)
RAP: Efficient Text-Video Retrieval with Sparse-and-Correlated Adapter
par: Cao, Meng, et autres
Publié: (2024)
par: Cao, Meng, et autres
Publié: (2024)
TSPO: Temporal Sampling Policy Optimization for Long-form Video Language Understanding
par: Tang, Canhui, et autres
Publié: (2025)
par: Tang, Canhui, et autres
Publié: (2025)
MUSE: Mamba is Efficient Multi-scale Learner for Text-video Retrieval
par: Tang, Haoran, et autres
Publié: (2024)
par: Tang, Haoran, et autres
Publié: (2024)
FlowMotion: Training-Free Flow Guidance for Video Motion Transfer
par: Wang, Zhen, et autres
Publié: (2026)
par: Wang, Zhen, et autres
Publié: (2026)
Learning Long-form Video Prior via Generative Pre-Training
par: Xie, Jinheng, et autres
Publié: (2024)
par: Xie, Jinheng, et autres
Publié: (2024)
VE-Bench: Subjective-Aligned Benchmark Suite for Text-Driven Video Editing Quality Assessment
par: Sun, Shangkun, et autres
Publié: (2024)
par: Sun, Shangkun, et autres
Publié: (2024)
Training-Free Video Editing via Optical Flow-Enhanced Score Distillation
par: Zhu, Lianghan, et autres
Publié: (2024)
par: Zhu, Lianghan, et autres
Publié: (2024)
DeepSeek-OCR 2: Visual Causal Flow
par: Wei, Haoran, et autres
Publié: (2026)
par: Wei, Haoran, et autres
Publié: (2026)
Video Token Merging for Long-form Video Understanding
par: Lee, Seon-Ho, et autres
Publié: (2024)
par: Lee, Seon-Ho, et autres
Publié: (2024)
Motion Semantics Guided Normalizing Flow for Privacy-Preserving Video Anomaly Detection
par: Liu, Yang, et autres
Publié: (2026)
par: Liu, Yang, et autres
Publié: (2026)
Aligning Latent Spaces with Flow Priors
par: Li, Yizhuo, et autres
Publié: (2025)
par: Li, Yizhuo, et autres
Publié: (2025)
MotionFlow:Learning Implicit Motion Flow for Complex Camera Trajectory Control in Video Generation
par: Lei, Guojun, et autres
Publié: (2025)
par: Lei, Guojun, et autres
Publié: (2025)
Unsupervised 4D Cardiac Motion Tracking with Spatiotemporal Optical Flow Networks
par: Teng, Long, et autres
Publié: (2024)
par: Teng, Long, et autres
Publié: (2024)
Think, Then Verify: A Hypothesis-Verification Multi-Agent Framework for Long Video Understanding
par: Wang, Zheng, et autres
Publié: (2026)
par: Wang, Zheng, et autres
Publié: (2026)
OpFlowTalker: Realistic and Natural Talking Face Generation via Optical Flow Guidance
par: Ge, Shuheng, et autres
Publié: (2024)
par: Ge, Shuheng, et autres
Publié: (2024)
Spacewalk-18: A Benchmark for Multimodal and Long-form Procedural Video Understanding in Novel Domains
par: Tang, Zitian, et autres
Publié: (2023)
par: Tang, Zitian, et autres
Publié: (2023)
VideoGen-Eval: Agent-based System for Video Generation Evaluation
par: Yang, Yuhang, et autres
Publié: (2025)
par: Yang, Yuhang, et autres
Publié: (2025)
Long-Term TalkingFace Generation via Motion-Prior Conditional Diffusion Model
par: Shen, Fei, et autres
Publié: (2025)
par: Shen, Fei, et autres
Publié: (2025)
iMOVE: Instance-Motion-Aware Video Understanding
par: Li, Jiaze, et autres
Publié: (2025)
par: Li, Jiaze, et autres
Publié: (2025)
FlowVid: Taming Imperfect Optical Flows for Consistent Video-to-Video Synthesis
par: Liang, Feng, et autres
Publié: (2023)
par: Liang, Feng, et autres
Publié: (2023)
ScaleFlow++: Robust and Accurate Estimation of 3D Motion from Video
par: Ling, Han, et autres
Publié: (2024)
par: Ling, Han, et autres
Publié: (2024)
FlowSeek: Optical Flow Made Easier with Depth Foundation Models and Motion Bases
par: Poggi, Matteo, et autres
Publié: (2025)
par: Poggi, Matteo, et autres
Publié: (2025)
CacheFlow: Compressive Streaming Memory for Efficient Long-Form Video Understanding
par: Patel, Shrenik, et autres
Publié: (2025)
par: Patel, Shrenik, et autres
Publié: (2025)
ScaleFlow++: Robust and Accurate Estimation of 3D Motion from Video
par: Ling, Han, et autres
Publié: (2024)
par: Ling, Han, et autres
Publié: (2024)
FlowMo: Variance-Based Flow Guidance for Coherent Motion in Video Generation
par: Shaulov, Ariel, et autres
Publié: (2025)
par: Shaulov, Ariel, et autres
Publié: (2025)
AdaFlow: Efficient Long Video Editing via Adaptive Attention Slimming And Keyframe Selection
par: Zhang, Shuheng, et autres
Publié: (2025)
par: Zhang, Shuheng, et autres
Publié: (2025)
Motion4D: Learning 3D-Consistent Motion and Semantics for 4D Scene Understanding
par: Zhou, Haoran, et autres
Publié: (2025)
par: Zhou, Haoran, et autres
Publié: (2025)
HMAFlow: Learning More Accurate Optical Flow via Hierarchical Motion Field Alignment
par: Ma, Dianbo, et autres
Publié: (2024)
par: Ma, Dianbo, et autres
Publié: (2024)
Documents similaires
-
PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance
par: Sun, Shangkun, et autres
Publié: (2024) -
Content-Rich AIGC Video Quality Assessment via Intricate Text Alignment and Motion-Aware Consistency
par: Sun, Shangkun, et autres
Publié: (2025) -
Video Spatial Reasoning with Object-Centric 3D Rollout
par: Tang, Haoran, et autres
Publié: (2025) -
ST-LLM: Large Language Models Are Effective Temporal Learners
par: Liu, Ruyang, et autres
Publié: (2024) -
Order from Chaos: Physical World Understanding from Glitchy Gameplay Videos
par: Cao, Meng, et autres
Publié: (2026)