Harvest Video Foundation Models via Efficient Post-Pretraining
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Yizhuo, Li, Kunchang, He, Yinan, Wang, Yi, Wang, Yali, Wang, Limin, Qiao, Yu, Luo, Ping |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Unmasked Teacher: Towards Training-Efficient Video Foundation Models
di: Li, Kunchang, et al.
Pubblicazione: (2023)
di: Li, Kunchang, et al.
Pubblicazione: (2023)
VideoMamba: State Space Model for Efficient Video Understanding
di: Li, Kunchang, et al.
Pubblicazione: (2024)
di: Li, Kunchang, et al.
Pubblicazione: (2024)
MVBench: A Comprehensive Multi-modal Video Understanding Benchmark
di: Li, Kunchang, et al.
Pubblicazione: (2023)
di: Li, Kunchang, et al.
Pubblicazione: (2023)
VideoChat: Chat-Centric Video Understanding
di: Li, KunChang, et al.
Pubblicazione: (2023)
di: Li, KunChang, et al.
Pubblicazione: (2023)
InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation
di: Wang, Yi, et al.
Pubblicazione: (2023)
di: Wang, Yi, et al.
Pubblicazione: (2023)
VideoEval: Comprehensive Benchmark Suite for Low-Cost Evaluation of Video Foundation Model
di: Li, Xinhao, et al.
Pubblicazione: (2024)
di: Li, Xinhao, et al.
Pubblicazione: (2024)
Percept, Chat, and then Adapt: Multimodal Knowledge Transfer of Foundation Models for Open-World Video Recognition
di: Chen, Boyu, et al.
Pubblicazione: (2024)
di: Chen, Boyu, et al.
Pubblicazione: (2024)
TransAgent: Transfer Vision-Language Foundation Models with Heterogeneous Agent Collaboration
di: Guo, Yiwei, et al.
Pubblicazione: (2024)
di: Guo, Yiwei, et al.
Pubblicazione: (2024)
VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling
di: Li, Xinhao, et al.
Pubblicazione: (2024)
di: Li, Xinhao, et al.
Pubblicazione: (2024)
InternVideo2: Scaling Foundation Models for Multimodal Video Understanding
di: Wang, Yi, et al.
Pubblicazione: (2024)
di: Wang, Yi, et al.
Pubblicazione: (2024)
Make Your Training Flexible: Towards Deployment-Efficient Video Models
di: Wang, Chenting, et al.
Pubblicazione: (2025)
di: Wang, Chenting, et al.
Pubblicazione: (2025)
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment
di: Yan, Ziang, et al.
Pubblicazione: (2024)
di: Yan, Ziang, et al.
Pubblicazione: (2024)
VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning
di: Li, Xinhao, et al.
Pubblicazione: (2025)
di: Li, Xinhao, et al.
Pubblicazione: (2025)
VideoChat-R1.5: Visual Test-Time Scaling to Reinforce Multimodal Reasoning by Iterative Perception
di: Yan, Ziang, et al.
Pubblicazione: (2025)
di: Yan, Ziang, et al.
Pubblicazione: (2025)
Super Encoding Network: Recursive Association of Multi-Modal Encoders for Video Understanding
di: Chen, Boyu, et al.
Pubblicazione: (2025)
di: Chen, Boyu, et al.
Pubblicazione: (2025)
TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning
di: Zeng, Xiangyu, et al.
Pubblicazione: (2024)
di: Zeng, Xiangyu, et al.
Pubblicazione: (2024)
VideoChat-A1: Thinking with Long Videos by Chain-of-Shot Reasoning
di: Wang, Zikang, et al.
Pubblicazione: (2025)
di: Wang, Zikang, et al.
Pubblicazione: (2025)
V-Stylist: Video Stylization via Collaboration and Reflection of MLLM Agents
di: Yue, Zhengrong, et al.
Pubblicazione: (2025)
di: Yue, Zhengrong, et al.
Pubblicazione: (2025)
InternVideo-Next: Towards General Video Foundation Models without Video-Text Supervision
di: Wang, Chenting, et al.
Pubblicazione: (2025)
di: Wang, Chenting, et al.
Pubblicazione: (2025)
EgoVideo: Exploring Egocentric Foundation Model and Downstream Adaptation
di: Pei, Baoqi, et al.
Pubblicazione: (2024)
di: Pei, Baoqi, et al.
Pubblicazione: (2024)
InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling
di: Wang, Yi, et al.
Pubblicazione: (2025)
di: Wang, Yi, et al.
Pubblicazione: (2025)
MUSES: 3D-Controllable Image Generation via Multi-Modal Agent Collaboration
di: Ding, Yanbo, et al.
Pubblicazione: (2024)
di: Ding, Yanbo, et al.
Pubblicazione: (2024)
Bootstrapping Language-Guided Navigation Learning with Self-Refining Data Flywheel
di: Wang, Zun, et al.
Pubblicazione: (2024)
di: Wang, Zun, et al.
Pubblicazione: (2024)
LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering
di: Zhang, Hongjie, et al.
Pubblicazione: (2023)
di: Zhang, Hongjie, et al.
Pubblicazione: (2023)
VideoMAP: Toward Scalable Mamba-based Video Autoregressive Pretraining
di: Liu, Yunze, et al.
Pubblicazione: (2025)
di: Liu, Yunze, et al.
Pubblicazione: (2025)
Video Mamba Suite: State Space Model as a Versatile Alternative for Video Understanding
di: Chen, Guo, et al.
Pubblicazione: (2024)
di: Chen, Guo, et al.
Pubblicazione: (2024)
UniFormer: Unifying Convolution and Self-attention for Visual Recognition
di: Li, Kunchang, et al.
Pubblicazione: (2022)
di: Li, Kunchang, et al.
Pubblicazione: (2022)
TimeStep Master: Asymmetrical Mixture of Timestep LoRA Experts for Versatile and Efficient Diffusion Models in Vision
di: Zhuang, Shaobin, et al.
Pubblicazione: (2025)
di: Zhuang, Shaobin, et al.
Pubblicazione: (2025)
Modeling Fine-Grained Hand-Object Dynamics for Egocentric Video Representation Learning
di: Pei, Baoqi, et al.
Pubblicazione: (2025)
di: Pei, Baoqi, et al.
Pubblicazione: (2025)
VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos
di: Yu, Jiashuo, et al.
Pubblicazione: (2025)
di: Yu, Jiashuo, et al.
Pubblicazione: (2025)
DiCoDe: Diffusion-Compressed Deep Tokens for Autoregressive Video Generation with Language Models
di: Li, Yizhuo, et al.
Pubblicazione: (2024)
di: Li, Yizhuo, et al.
Pubblicazione: (2024)
ExpVid: A Benchmark for Experiment Video Understanding & Reasoning
di: Xu, Yicheng, et al.
Pubblicazione: (2025)
di: Xu, Yicheng, et al.
Pubblicazione: (2025)
Vlogger: Make Your Dream A Vlog
di: Zhuang, Shaobin, et al.
Pubblicazione: (2024)
di: Zhuang, Shaobin, et al.
Pubblicazione: (2024)
Asymmetric Masked Distillation for Pre-Training Small Foundation Models
di: Zhao, Zhiyu, et al.
Pubblicazione: (2023)
di: Zhao, Zhiyu, et al.
Pubblicazione: (2023)
Emerging Properties in Unified Multimodal Pretraining
di: Deng, Chaorui, et al.
Pubblicazione: (2025)
di: Deng, Chaorui, et al.
Pubblicazione: (2025)
Weakly Supervised Temporal Sentence Grounding via Positive Sample Mining
di: Dong, Lu, et al.
Pubblicazione: (2025)
di: Dong, Lu, et al.
Pubblicazione: (2025)
VideoTG-R1: Boosting Video Temporal Grounding via Curriculum Reinforcement Learning on Reflected Boundary Annotations
di: Dong, Lu, et al.
Pubblicazione: (2025)
di: Dong, Lu, et al.
Pubblicazione: (2025)
Scaling Video Pretraining for Surgical Foundation Models
di: Lu, Sicheng, et al.
Pubblicazione: (2026)
di: Lu, Sicheng, et al.
Pubblicazione: (2026)
H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving
di: Chen, Siran, et al.
Pubblicazione: (2025)
di: Chen, Siran, et al.
Pubblicazione: (2025)
DiffVSR: Revealing an Effective Recipe for Taming Robust Video Super-Resolution Against Complex Degradations
di: Li, Xiaohui, et al.
Pubblicazione: (2025)
di: Li, Xiaohui, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Unmasked Teacher: Towards Training-Efficient Video Foundation Models
di: Li, Kunchang, et al.
Pubblicazione: (2023) -
VideoMamba: State Space Model for Efficient Video Understanding
di: Li, Kunchang, et al.
Pubblicazione: (2024) -
MVBench: A Comprehensive Multi-modal Video Understanding Benchmark
di: Li, Kunchang, et al.
Pubblicazione: (2023) -
VideoChat: Chat-Centric Video Understanding
di: Li, KunChang, et al.
Pubblicazione: (2023) -
InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation
di: Wang, Yi, et al.
Pubblicazione: (2023)