Percept, Chat, and then Adapt: Multimodal Knowledge Transfer of Foundation Models for Open-World Video Recognition
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Boyu, Chen, Siran, Li, Kunchang, Xu, Qinglin, Qiao, Yu, Wang, Yali |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Super Encoding Network: Recursive Association of Multi-Modal Encoders for Video Understanding
von: Chen, Boyu, et al.
Veröffentlicht: (2025)
von: Chen, Boyu, et al.
Veröffentlicht: (2025)
TransAgent: Transfer Vision-Language Foundation Models with Heterogeneous Agent Collaboration
von: Guo, Yiwei, et al.
Veröffentlicht: (2024)
von: Guo, Yiwei, et al.
Veröffentlicht: (2024)
Unmasked Teacher: Towards Training-Efficient Video Foundation Models
von: Li, Kunchang, et al.
Veröffentlicht: (2023)
von: Li, Kunchang, et al.
Veröffentlicht: (2023)
Low-Resolution Action Recognition for Tiny Actions Challenge
von: Chen, Boyu, et al.
Veröffentlicht: (2022)
von: Chen, Boyu, et al.
Veröffentlicht: (2022)
Harvest Video Foundation Models via Efficient Post-Pretraining
von: Li, Yizhuo, et al.
Veröffentlicht: (2023)
von: Li, Yizhuo, et al.
Veröffentlicht: (2023)
VideoChat-A1: Thinking with Long Videos by Chain-of-Shot Reasoning
von: Wang, Zikang, et al.
Veröffentlicht: (2025)
von: Wang, Zikang, et al.
Veröffentlicht: (2025)
InternVideo2: Scaling Foundation Models for Multimodal Video Understanding
von: Wang, Yi, et al.
Veröffentlicht: (2024)
von: Wang, Yi, et al.
Veröffentlicht: (2024)
VideoMamba: State Space Model for Efficient Video Understanding
von: Li, Kunchang, et al.
Veröffentlicht: (2024)
von: Li, Kunchang, et al.
Veröffentlicht: (2024)
VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling
von: Li, Xinhao, et al.
Veröffentlicht: (2024)
von: Li, Xinhao, et al.
Veröffentlicht: (2024)
LVAgent: Long Video Understanding by Multi-Round Dynamical Collaboration of MLLM Agents
von: Chen, Boyu, et al.
Veröffentlicht: (2025)
von: Chen, Boyu, et al.
Veröffentlicht: (2025)
VideoChat-R1.5: Visual Test-Time Scaling to Reinforce Multimodal Reasoning by Iterative Perception
von: Yan, Ziang, et al.
Veröffentlicht: (2025)
von: Yan, Ziang, et al.
Veröffentlicht: (2025)
H-MBA: Hierarchical MamBa Adaptation for Multi-Modal Video Understanding in Autonomous Driving
von: Chen, Siran, et al.
Veröffentlicht: (2025)
von: Chen, Siran, et al.
Veröffentlicht: (2025)
UniFormer: Unifying Convolution and Self-attention for Visual Recognition
von: Li, Kunchang, et al.
Veröffentlicht: (2022)
von: Li, Kunchang, et al.
Veröffentlicht: (2022)
VideoEval: Comprehensive Benchmark Suite for Low-Cost Evaluation of Video Foundation Model
von: Li, Xinhao, et al.
Veröffentlicht: (2024)
von: Li, Xinhao, et al.
Veröffentlicht: (2024)
VideoChat: Chat-Centric Video Understanding
von: Li, KunChang, et al.
Veröffentlicht: (2023)
von: Li, KunChang, et al.
Veröffentlicht: (2023)
VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning
von: Li, Xinhao, et al.
Veröffentlicht: (2025)
von: Li, Xinhao, et al.
Veröffentlicht: (2025)
InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation
von: Wang, Yi, et al.
Veröffentlicht: (2023)
von: Wang, Yi, et al.
Veröffentlicht: (2023)
MVBench: A Comprehensive Multi-modal Video Understanding Benchmark
von: Li, Kunchang, et al.
Veröffentlicht: (2023)
von: Li, Kunchang, et al.
Veröffentlicht: (2023)
V-Stylist: Video Stylization via Collaboration and Reflection of MLLM Agents
von: Yue, Zhengrong, et al.
Veröffentlicht: (2025)
von: Yue, Zhengrong, et al.
Veröffentlicht: (2025)
EgoVideo: Exploring Egocentric Foundation Model and Downstream Adaptation
von: Pei, Baoqi, et al.
Veröffentlicht: (2024)
von: Pei, Baoqi, et al.
Veröffentlicht: (2024)
MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition
von: Yang, Yuhuan, et al.
Veröffentlicht: (2025)
von: Yang, Yuhuan, et al.
Veröffentlicht: (2025)
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment
von: Yan, Ziang, et al.
Veröffentlicht: (2024)
von: Yan, Ziang, et al.
Veröffentlicht: (2024)
MUSES: 3D-Controllable Image Generation via Multi-Modal Agent Collaboration
von: Ding, Yanbo, et al.
Veröffentlicht: (2024)
von: Ding, Yanbo, et al.
Veröffentlicht: (2024)
VideoChat-M1: Collaborative Policy Planning for Video Understanding via Multi-Agent Reinforcement Learning
von: Chen, Boyu, et al.
Veröffentlicht: (2025)
von: Chen, Boyu, et al.
Veröffentlicht: (2025)
LongVie 2: Multimodal Controllable Ultra-Long Video World Model
von: Gao, Jianxiong, et al.
Veröffentlicht: (2025)
von: Gao, Jianxiong, et al.
Veröffentlicht: (2025)
Efficient Transfer Learning for Video-language Foundation Models
von: Chen, Haoxing, et al.
Veröffentlicht: (2024)
von: Chen, Haoxing, et al.
Veröffentlicht: (2024)
M2-CLIP: A Multimodal, Multi-task Adapting Framework for Video Action Recognition
von: Wang, Mengmeng, et al.
Veröffentlicht: (2024)
von: Wang, Mengmeng, et al.
Veröffentlicht: (2024)
Video Mamba Suite: State Space Model as a Versatile Alternative for Video Understanding
von: Chen, Guo, et al.
Veröffentlicht: (2024)
von: Chen, Guo, et al.
Veröffentlicht: (2024)
Sampling to Distill: Knowledge Transfer from Open-World Data
von: Wang, Yuzheng, et al.
Veröffentlicht: (2023)
von: Wang, Yuzheng, et al.
Veröffentlicht: (2023)
Video Emotion Open-vocabulary Recognition Based on Multimodal Large Language Model
von: Ge, Mengying, et al.
Veröffentlicht: (2024)
von: Ge, Mengying, et al.
Veröffentlicht: (2024)
From Static to Dynamic: Adapting Landmark-Aware Image Models for Facial Expression Recognition in Videos
von: Chen, Yin, et al.
Veröffentlicht: (2023)
von: Chen, Yin, et al.
Veröffentlicht: (2023)
Vlogger: Make Your Dream A Vlog
von: Zhuang, Shaobin, et al.
Veröffentlicht: (2024)
von: Zhuang, Shaobin, et al.
Veröffentlicht: (2024)
WeGen: A Unified Model for Interactive Multimodal Generation as We Chat
von: Huang, Zhipeng, et al.
Veröffentlicht: (2025)
von: Huang, Zhipeng, et al.
Veröffentlicht: (2025)
ChatTracker: Enhancing Visual Tracking Performance via Chatting with Multimodal Large Language Model
von: Sun, Yiming, et al.
Veröffentlicht: (2024)
von: Sun, Yiming, et al.
Veröffentlicht: (2024)
Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks
von: Ren, Tianhe, et al.
Veröffentlicht: (2024)
von: Ren, Tianhe, et al.
Veröffentlicht: (2024)
VideoWorld 2: Learning Transferable Knowledge from Real-world Videos
von: Ren, Zhongwei, et al.
Veröffentlicht: (2026)
von: Ren, Zhongwei, et al.
Veröffentlicht: (2026)
ChatRex: Taming Multimodal LLM for Joint Perception and Understanding
von: Jiang, Qing, et al.
Veröffentlicht: (2024)
von: Jiang, Qing, et al.
Veröffentlicht: (2024)
OST: Refining Text Knowledge with Optimal Spatio-Temporal Descriptor for General Video Recognition
von: Chen, Tongjia, et al.
Veröffentlicht: (2023)
von: Chen, Tongjia, et al.
Veröffentlicht: (2023)
Align then Adapt: Rethinking Parameter-Efficient Transfer Learning in 4D Perception
von: Sun, Yiding, et al.
Veröffentlicht: (2026)
von: Sun, Yiding, et al.
Veröffentlicht: (2026)
Bridging Modalities and Transferring Knowledge: Enhanced Multimodal Understanding and Recognition
von: Radevski, Gorjan
Veröffentlicht: (2025)
von: Radevski, Gorjan
Veröffentlicht: (2025)
Ähnliche Einträge
-
Super Encoding Network: Recursive Association of Multi-Modal Encoders for Video Understanding
von: Chen, Boyu, et al.
Veröffentlicht: (2025) -
TransAgent: Transfer Vision-Language Foundation Models with Heterogeneous Agent Collaboration
von: Guo, Yiwei, et al.
Veröffentlicht: (2024) -
Unmasked Teacher: Towards Training-Efficient Video Foundation Models
von: Li, Kunchang, et al.
Veröffentlicht: (2023) -
Low-Resolution Action Recognition for Tiny Actions Challenge
von: Chen, Boyu, et al.
Veröffentlicht: (2022) -
Harvest Video Foundation Models via Efficient Post-Pretraining
von: Li, Yizhuo, et al.
Veröffentlicht: (2023)