LocoMotion: Learning Motion-Focused Video-Language Representations
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Doughty, Hazel, Thoker, Fida Mohammad, Snoek, Cees G. M. |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Beyond Coarse-Grained Matching in Video-Text Retrieval
par: Chen, Aozhu, et autres
Publié: (2024)
par: Chen, Aozhu, et autres
Publié: (2024)
SEVERE++: Evaluating Benchmark Sensitivity in Generalization of Video Representation Learning
par: Thoker, Fida Mohammad, et autres
Publié: (2025)
par: Thoker, Fida Mohammad, et autres
Publié: (2025)
SMILE: Infusing Spatial and Motion Semantics in Masked Video Learning
par: Thoker, Fida Mohammad, et autres
Publié: (2025)
par: Thoker, Fida Mohammad, et autres
Publié: (2025)
Low-Resource Vision Challenges for Foundation Models
par: Zhang, Yunhua, et autres
Publié: (2024)
par: Zhang, Yunhua, et autres
Publié: (2024)
SIGMA: Sinkhorn-Guided Masked Video Modeling
par: Salehi, Mohammadreza, et autres
Publié: (2024)
par: Salehi, Mohammadreza, et autres
Publié: (2024)
MotionPro: A Precise Motion Controller for Image-to-Video Generation
par: Zhang, Zhongwei, et autres
Publié: (2025)
par: Zhang, Zhongwei, et autres
Publié: (2025)
Human Motion Video Generation: A Survey
par: Xue, Haiwei, et autres
Publié: (2025)
par: Xue, Haiwei, et autres
Publié: (2025)
RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language
par: Biswas, Subrata, et autres
Publié: (2025)
par: Biswas, Subrata, et autres
Publié: (2025)
Towards Understanding Camera Motions in Any Video
par: Lin, Zhiqiu, et autres
Publié: (2025)
par: Lin, Zhiqiu, et autres
Publié: (2025)
Enhancing the Learning Experience: Using Vision-Language Models to Generate Questions for Educational Videos
par: Stamatakis, Markos, et autres
Publié: (2025)
par: Stamatakis, Markos, et autres
Publié: (2025)
L-LBVC: Long-Term Motion Estimation and Prediction for Learned Bi-Directional Video Compression
par: Zhai, Yongqi, et autres
Publié: (2025)
par: Zhai, Yongqi, et autres
Publié: (2025)
Improving Gloss-free Sign Language Translation by Reducing Representation Density
par: Ye, Jinhui, et autres
Publié: (2024)
par: Ye, Jinhui, et autres
Publié: (2024)
The Sound of Water: Inferring Physical Properties from Pouring Liquids
par: Bagad, Piyush, et autres
Publié: (2024)
par: Bagad, Piyush, et autres
Publié: (2024)
COM Kitchens: An Unedited Overhead-view Video Dataset as a Vision-Language Benchmark
par: Maeda, Koki, et autres
Publié: (2024)
par: Maeda, Koki, et autres
Publié: (2024)
PP-Motion: Physical-Perceptual Fidelity Evaluation for Human Motion Generation
par: Zhao, Sihan, et autres
Publié: (2025)
par: Zhao, Sihan, et autres
Publié: (2025)
Controllable Complex Human Motion Video Generation via Text-to-Skeleton Cascades
par: Taghipour, Ashkan, et autres
Publié: (2026)
par: Taghipour, Ashkan, et autres
Publié: (2026)
MoAlign: Motion-Centric Representation Alignment for Video Diffusion Models
par: Bhowmik, Aritra, et autres
Publié: (2025)
par: Bhowmik, Aritra, et autres
Publié: (2025)
Text-controlled Motion Mamba: Text-Instructed Temporal Grounding of Human Motion
par: Wang, Xinghan, et autres
Publié: (2024)
par: Wang, Xinghan, et autres
Publié: (2024)
MuLTI: Efficient Video-and-Language Understanding with Text-Guided MultiWay-Sampler and Multiple Choice Modeling
par: Xu, Jiaqi, et autres
Publié: (2023)
par: Xu, Jiaqi, et autres
Publié: (2023)
KeyVideoLLM: Towards Large-scale Video Keyframe Selection
par: Liang, Hao, et autres
Publié: (2024)
par: Liang, Hao, et autres
Publié: (2024)
Factorized Learning for Temporally Grounded Video-Language Models
par: Zeng, Wenzheng, et autres
Publié: (2025)
par: Zeng, Wenzheng, et autres
Publié: (2025)
TrackMAE: Video Representation Learning via Track Mask and Predict
par: Vandeghen, Renaud, et autres
Publié: (2026)
par: Vandeghen, Renaud, et autres
Publié: (2026)
VideoCLIP-XL: Advancing Long Description Understanding for Video CLIP Models
par: Wang, Jiapeng, et autres
Publié: (2024)
par: Wang, Jiapeng, et autres
Publié: (2024)
FAST-ME: Foundation-aware Adaptive Stopping for Motion Estimation for Efficient IoT Video Analysis
par: Panagidi, Kakia, et autres
Publié: (2026)
par: Panagidi, Kakia, et autres
Publié: (2026)
Dynamic Self-adaptive Multiscale Distillation from Pre-trained Multimodal Large Model for Efficient Cross-modal Representation Learning
par: Liang, Zhengyang, et autres
Publié: (2024)
par: Liang, Zhengyang, et autres
Publié: (2024)
Prompt-A-Video: Prompt Your Video Diffusion Model via Preference-Aligned LLM
par: Ji, Yatai, et autres
Publié: (2024)
par: Ji, Yatai, et autres
Publié: (2024)
Video2Roleplay: A Multimodal Dataset and Framework for Video-Guided Role-playing Agents
par: Zhang, Xueqiao, et autres
Publié: (2025)
par: Zhang, Xueqiao, et autres
Publié: (2025)
Towards Event-oriented Long Video Understanding
par: Du, Yifan, et autres
Publié: (2024)
par: Du, Yifan, et autres
Publié: (2024)
Recipe Generation from Unsegmented Cooking Videos
par: Nishimura, Taichi, et autres
Publié: (2022)
par: Nishimura, Taichi, et autres
Publié: (2022)
MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance
par: Zhang, Yuang, et autres
Publié: (2024)
par: Zhang, Yuang, et autres
Publié: (2024)
MotionScape: A Large-Scale Real-World Highly Dynamic UAV Video Dataset for World Models
par: Guo, Zile, et autres
Publié: (2026)
par: Guo, Zile, et autres
Publié: (2026)
HFS: Holistic Query-Aware Frame Selection for Efficient Video Reasoning
par: Yang, Yiqing, et autres
Publié: (2025)
par: Yang, Yiqing, et autres
Publié: (2025)
ReTaKe: Reducing Temporal and Knowledge Redundancy for Long Video Understanding
par: Wang, Xiao, et autres
Publié: (2024)
par: Wang, Xiao, et autres
Publié: (2024)
Lighthouse: A User-Friendly Library for Reproducible Video Moment Retrieval and Highlight Detection
par: Nishimura, Taichi, et autres
Publié: (2024)
par: Nishimura, Taichi, et autres
Publié: (2024)
FinCap: Topic-Aligned Captions for Short-Form Financial YouTube Videos
par: Sukhani, Siddhant, et autres
Publié: (2025)
par: Sukhani, Siddhant, et autres
Publié: (2025)
ViMo: Generating Motions from Casual Videos
par: Qiu, Liangdong, et autres
Publié: (2024)
par: Qiu, Liangdong, et autres
Publié: (2024)
EasyAnimate: High-Performance Video Generation Framework with Hybrid Windows Attention and Reward Backpropagation
par: Xu, Jiaqi, et autres
Publié: (2024)
par: Xu, Jiaqi, et autres
Publié: (2024)
Anim-Director: A Large Multimodal Model Powered Agent for Controllable Animation Video Generation
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
AdaReTaKe: Adaptive Redundancy Reduction to Perceive Longer for Video-language Understanding
par: Wang, Xiao, et autres
Publié: (2025)
par: Wang, Xiao, et autres
Publié: (2025)
Video DataFlywheel: Resolving the Impossible Data Trinity in Video-Language Understanding
par: Wang, Xiao, et autres
Publié: (2024)
par: Wang, Xiao, et autres
Publié: (2024)
Documents similaires
-
Beyond Coarse-Grained Matching in Video-Text Retrieval
par: Chen, Aozhu, et autres
Publié: (2024) -
SEVERE++: Evaluating Benchmark Sensitivity in Generalization of Video Representation Learning
par: Thoker, Fida Mohammad, et autres
Publié: (2025) -
SMILE: Infusing Spatial and Motion Semantics in Masked Video Learning
par: Thoker, Fida Mohammad, et autres
Publié: (2025) -
Low-Resource Vision Challenges for Foundation Models
par: Zhang, Yunhua, et autres
Publié: (2024) -
SIGMA: Sinkhorn-Guided Masked Video Modeling
par: Salehi, Mohammadreza, et autres
Publié: (2024)