Flow4Agent: Long-form Video Understanding via Motion Prior from Optical Flow
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Ruyang, Sun, Shangkun, Tang, Haoran, Li, Ge, Gao, Wei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance
di: Sun, Shangkun, et al.
Pubblicazione: (2024)
di: Sun, Shangkun, et al.
Pubblicazione: (2024)
Content-Rich AIGC Video Quality Assessment via Intricate Text Alignment and Motion-Aware Consistency
di: Sun, Shangkun, et al.
Pubblicazione: (2025)
di: Sun, Shangkun, et al.
Pubblicazione: (2025)
Video Spatial Reasoning with Object-Centric 3D Rollout
di: Tang, Haoran, et al.
Pubblicazione: (2025)
di: Tang, Haoran, et al.
Pubblicazione: (2025)
ST-LLM: Large Language Models Are Effective Temporal Learners
di: Liu, Ruyang, et al.
Pubblicazione: (2024)
di: Liu, Ruyang, et al.
Pubblicazione: (2024)
Order from Chaos: Physical World Understanding from Glitchy Gameplay Videos
di: Cao, Meng, et al.
Pubblicazione: (2026)
di: Cao, Meng, et al.
Pubblicazione: (2026)
LumosFlow: Motion-Guided Long Video Generation
di: Chen, Jiahao, et al.
Pubblicazione: (2025)
di: Chen, Jiahao, et al.
Pubblicazione: (2025)
BT-Adapter: Video Conversation is Feasible Without Video Instruction Tuning
di: Liu, Ruyang, et al.
Pubblicazione: (2023)
di: Liu, Ruyang, et al.
Pubblicazione: (2023)
Exploring AIGC Video Quality: A Focus on Visual Harmony, Video-Text Consistency and Domain Distribution Gap
di: Qu, Bowen, et al.
Pubblicazione: (2024)
di: Qu, Bowen, et al.
Pubblicazione: (2024)
PhysGame: Uncovering Physical Commonsense Violations in Gameplay Videos
di: Cao, Meng, et al.
Pubblicazione: (2024)
di: Cao, Meng, et al.
Pubblicazione: (2024)
MOOSE: Pay Attention to Temporal Dynamics for Video Understanding via Optical Flows
di: Nguyen, Hong, et al.
Pubblicazione: (2025)
di: Nguyen, Hong, et al.
Pubblicazione: (2025)
Progressive Video Condensation with MLLM Agent for Long-form Video Understanding
di: Yin, Yufei, et al.
Pubblicazione: (2026)
di: Yin, Yufei, et al.
Pubblicazione: (2026)
SplatFlow: Learning Multi-frame Optical Flow via Splatting
di: Wang, Bo, et al.
Pubblicazione: (2023)
di: Wang, Bo, et al.
Pubblicazione: (2023)
RAP: Efficient Text-Video Retrieval with Sparse-and-Correlated Adapter
di: Cao, Meng, et al.
Pubblicazione: (2024)
di: Cao, Meng, et al.
Pubblicazione: (2024)
TSPO: Temporal Sampling Policy Optimization for Long-form Video Language Understanding
di: Tang, Canhui, et al.
Pubblicazione: (2025)
di: Tang, Canhui, et al.
Pubblicazione: (2025)
MUSE: Mamba is Efficient Multi-scale Learner for Text-video Retrieval
di: Tang, Haoran, et al.
Pubblicazione: (2024)
di: Tang, Haoran, et al.
Pubblicazione: (2024)
FlowMotion: Training-Free Flow Guidance for Video Motion Transfer
di: Wang, Zhen, et al.
Pubblicazione: (2026)
di: Wang, Zhen, et al.
Pubblicazione: (2026)
Learning Long-form Video Prior via Generative Pre-Training
di: Xie, Jinheng, et al.
Pubblicazione: (2024)
di: Xie, Jinheng, et al.
Pubblicazione: (2024)
VE-Bench: Subjective-Aligned Benchmark Suite for Text-Driven Video Editing Quality Assessment
di: Sun, Shangkun, et al.
Pubblicazione: (2024)
di: Sun, Shangkun, et al.
Pubblicazione: (2024)
Training-Free Video Editing via Optical Flow-Enhanced Score Distillation
di: Zhu, Lianghan, et al.
Pubblicazione: (2024)
di: Zhu, Lianghan, et al.
Pubblicazione: (2024)
DeepSeek-OCR 2: Visual Causal Flow
di: Wei, Haoran, et al.
Pubblicazione: (2026)
di: Wei, Haoran, et al.
Pubblicazione: (2026)
Video Token Merging for Long-form Video Understanding
di: Lee, Seon-Ho, et al.
Pubblicazione: (2024)
di: Lee, Seon-Ho, et al.
Pubblicazione: (2024)
Motion Semantics Guided Normalizing Flow for Privacy-Preserving Video Anomaly Detection
di: Liu, Yang, et al.
Pubblicazione: (2026)
di: Liu, Yang, et al.
Pubblicazione: (2026)
Aligning Latent Spaces with Flow Priors
di: Li, Yizhuo, et al.
Pubblicazione: (2025)
di: Li, Yizhuo, et al.
Pubblicazione: (2025)
MotionFlow:Learning Implicit Motion Flow for Complex Camera Trajectory Control in Video Generation
di: Lei, Guojun, et al.
Pubblicazione: (2025)
di: Lei, Guojun, et al.
Pubblicazione: (2025)
Unsupervised 4D Cardiac Motion Tracking with Spatiotemporal Optical Flow Networks
di: Teng, Long, et al.
Pubblicazione: (2024)
di: Teng, Long, et al.
Pubblicazione: (2024)
Think, Then Verify: A Hypothesis-Verification Multi-Agent Framework for Long Video Understanding
di: Wang, Zheng, et al.
Pubblicazione: (2026)
di: Wang, Zheng, et al.
Pubblicazione: (2026)
OpFlowTalker: Realistic and Natural Talking Face Generation via Optical Flow Guidance
di: Ge, Shuheng, et al.
Pubblicazione: (2024)
di: Ge, Shuheng, et al.
Pubblicazione: (2024)
Spacewalk-18: A Benchmark for Multimodal and Long-form Procedural Video Understanding in Novel Domains
di: Tang, Zitian, et al.
Pubblicazione: (2023)
di: Tang, Zitian, et al.
Pubblicazione: (2023)
VideoGen-Eval: Agent-based System for Video Generation Evaluation
di: Yang, Yuhang, et al.
Pubblicazione: (2025)
di: Yang, Yuhang, et al.
Pubblicazione: (2025)
Long-Term TalkingFace Generation via Motion-Prior Conditional Diffusion Model
di: Shen, Fei, et al.
Pubblicazione: (2025)
di: Shen, Fei, et al.
Pubblicazione: (2025)
iMOVE: Instance-Motion-Aware Video Understanding
di: Li, Jiaze, et al.
Pubblicazione: (2025)
di: Li, Jiaze, et al.
Pubblicazione: (2025)
FlowVid: Taming Imperfect Optical Flows for Consistent Video-to-Video Synthesis
di: Liang, Feng, et al.
Pubblicazione: (2023)
di: Liang, Feng, et al.
Pubblicazione: (2023)
ScaleFlow++: Robust and Accurate Estimation of 3D Motion from Video
di: Ling, Han, et al.
Pubblicazione: (2024)
di: Ling, Han, et al.
Pubblicazione: (2024)
FlowSeek: Optical Flow Made Easier with Depth Foundation Models and Motion Bases
di: Poggi, Matteo, et al.
Pubblicazione: (2025)
di: Poggi, Matteo, et al.
Pubblicazione: (2025)
CacheFlow: Compressive Streaming Memory for Efficient Long-Form Video Understanding
di: Patel, Shrenik, et al.
Pubblicazione: (2025)
di: Patel, Shrenik, et al.
Pubblicazione: (2025)
ScaleFlow++: Robust and Accurate Estimation of 3D Motion from Video
di: Ling, Han, et al.
Pubblicazione: (2024)
di: Ling, Han, et al.
Pubblicazione: (2024)
FlowMo: Variance-Based Flow Guidance for Coherent Motion in Video Generation
di: Shaulov, Ariel, et al.
Pubblicazione: (2025)
di: Shaulov, Ariel, et al.
Pubblicazione: (2025)
AdaFlow: Efficient Long Video Editing via Adaptive Attention Slimming And Keyframe Selection
di: Zhang, Shuheng, et al.
Pubblicazione: (2025)
di: Zhang, Shuheng, et al.
Pubblicazione: (2025)
Motion4D: Learning 3D-Consistent Motion and Semantics for 4D Scene Understanding
di: Zhou, Haoran, et al.
Pubblicazione: (2025)
di: Zhou, Haoran, et al.
Pubblicazione: (2025)
HMAFlow: Learning More Accurate Optical Flow via Hierarchical Motion Field Alignment
di: Ma, Dianbo, et al.
Pubblicazione: (2024)
di: Ma, Dianbo, et al.
Pubblicazione: (2024)
Documenti analoghi
-
PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance
di: Sun, Shangkun, et al.
Pubblicazione: (2024) -
Content-Rich AIGC Video Quality Assessment via Intricate Text Alignment and Motion-Aware Consistency
di: Sun, Shangkun, et al.
Pubblicazione: (2025) -
Video Spatial Reasoning with Object-Centric 3D Rollout
di: Tang, Haoran, et al.
Pubblicazione: (2025) -
ST-LLM: Large Language Models Are Effective Temporal Learners
di: Liu, Ruyang, et al.
Pubblicazione: (2024) -
Order from Chaos: Physical World Understanding from Glitchy Gameplay Videos
di: Cao, Meng, et al.
Pubblicazione: (2026)