InternVideo-Next: Towards General Video Foundation Models without Video-Text Supervision
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Chenting, Zhu, Yuhan, Xu, Yicheng, Yang, Jiange, Lin, Lang, Yan, Ziang, Wang, Yali, Wang, Yi, Wang, Limin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
InternVideo2: Scaling Foundation Models for Multimodal Video Understanding
par: Wang, Yi, et autres
Publié: (2024)
par: Wang, Yi, et autres
Publié: (2024)
InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling
par: Wang, Yi, et autres
Publié: (2025)
par: Wang, Yi, et autres
Publié: (2025)
Make Your Training Flexible: Towards Deployment-Efficient Video Models
par: Wang, Chenting, et autres
Publié: (2025)
par: Wang, Chenting, et autres
Publié: (2025)
VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling
par: Li, Xinhao, et autres
Publié: (2024)
par: Li, Xinhao, et autres
Publié: (2024)
InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation
par: Wang, Yi, et autres
Publié: (2023)
par: Wang, Yi, et autres
Publié: (2023)
Unmasked Teacher: Towards Training-Efficient Video Foundation Models
par: Li, Kunchang, et autres
Publié: (2023)
par: Li, Kunchang, et autres
Publié: (2023)
FreeRet: MLLMs as Training-Free Retrievers
par: Zhu, Yuhan, et autres
Publié: (2025)
par: Zhu, Yuhan, et autres
Publié: (2025)
TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning
par: Zeng, Xiangyu, et autres
Publié: (2024)
par: Zeng, Xiangyu, et autres
Publié: (2024)
Video-o3: Native Interleaved Clue Seeking for Long Video Multi-Hop Reasoning
par: Zeng, Xiangyu, et autres
Publié: (2026)
par: Zeng, Xiangyu, et autres
Publié: (2026)
VideoMamba: State Space Model for Efficient Video Understanding
par: Li, Kunchang, et autres
Publié: (2024)
par: Li, Kunchang, et autres
Publié: (2024)
Harvest Video Foundation Models via Efficient Post-Pretraining
par: Li, Yizhuo, et autres
Publié: (2023)
par: Li, Yizhuo, et autres
Publié: (2023)
VideoChat-A1: Thinking with Long Videos by Chain-of-Shot Reasoning
par: Wang, Zikang, et autres
Publié: (2025)
par: Wang, Zikang, et autres
Publié: (2025)
VideoTG-R1: Boosting Video Temporal Grounding via Curriculum Reinforcement Learning on Reflected Boundary Annotations
par: Dong, Lu, et autres
Publié: (2025)
par: Dong, Lu, et autres
Publié: (2025)
EgoVideo: Exploring Egocentric Foundation Model and Downstream Adaptation
par: Pei, Baoqi, et autres
Publié: (2024)
par: Pei, Baoqi, et autres
Publié: (2024)
VideoChat: Chat-Centric Video Understanding
par: Li, KunChang, et autres
Publié: (2023)
par: Li, KunChang, et autres
Publié: (2023)
VideoChat-R1.5: Visual Test-Time Scaling to Reinforce Multimodal Reasoning by Iterative Perception
par: Yan, Ziang, et autres
Publié: (2025)
par: Yan, Ziang, et autres
Publié: (2025)
VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning
par: Li, Xinhao, et autres
Publié: (2025)
par: Li, Xinhao, et autres
Publié: (2025)
ZeroI2V: Zero-Cost Adaptation of Pre-trained Transformers from Image to Video
par: Li, Xinhao, et autres
Publié: (2023)
par: Li, Xinhao, et autres
Publié: (2023)
Towards Realistic and Consistent Orbital Video Generation via 3D Foundation Priors
par: Wang, Rong, et autres
Publié: (2026)
par: Wang, Rong, et autres
Publié: (2026)
VideoUFO: A Million-Scale User-Focused Dataset for Text-to-Video Generation
par: Wang, Wenhao, et autres
Publié: (2025)
par: Wang, Wenhao, et autres
Publié: (2025)
Towards Scalable Video Anomaly Retrieval: A Synthetic Video-Text Benchmark
par: Yang, Shuyu, et autres
Publié: (2025)
par: Yang, Shuyu, et autres
Publié: (2025)
ExpVid: A Benchmark for Experiment Video Understanding & Reasoning
par: Xu, Yicheng, et autres
Publié: (2025)
par: Xu, Yicheng, et autres
Publié: (2025)
VideoEval: Comprehensive Benchmark Suite for Low-Cost Evaluation of Video Foundation Model
par: Li, Xinhao, et autres
Publié: (2024)
par: Li, Xinhao, et autres
Publié: (2024)
CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning
par: Yang, Jiange, et autres
Publié: (2025)
par: Yang, Jiange, et autres
Publié: (2025)
NextAds: Towards Next-generation Personalized Video Advertising
par: Xu, Yiyan, et autres
Publié: (2026)
par: Xu, Yiyan, et autres
Publié: (2026)
CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding
par: Chen, Guo, et autres
Publié: (2024)
par: Chen, Guo, et autres
Publié: (2024)
VideoTetris: Towards Compositional Text-to-Video Generation
par: Tian, Ye, et autres
Publié: (2024)
par: Tian, Ye, et autres
Publié: (2024)
VideoMAP: Toward Scalable Mamba-based Video Autoregressive Pretraining
par: Liu, Yunze, et autres
Publié: (2025)
par: Liu, Yunze, et autres
Publié: (2025)
Video-GPT via Next Clip Diffusion
par: Zhuang, Shaobin, et autres
Publié: (2025)
par: Zhuang, Shaobin, et autres
Publié: (2025)
Arbitrary Generative Video Interpolation
par: Zhang, Guozhen, et autres
Publié: (2025)
par: Zhang, Guozhen, et autres
Publié: (2025)
LOVE: Benchmarking and Evaluating Text-to-Video Generation and Video-to-Text Interpretation
par: Wang, Jiarui, et autres
Publié: (2025)
par: Wang, Jiarui, et autres
Publié: (2025)
VideoDreamer: Customized Multi-Subject Text-to-Video Generation with Disen-Mix Finetuning on Language-Video Foundation Models
par: Chen, Hong, et autres
Publié: (2023)
par: Chen, Hong, et autres
Publié: (2023)
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment
par: Yan, Ziang, et autres
Publié: (2024)
par: Yan, Ziang, et autres
Publié: (2024)
Towards Understanding Unsafe Video Generation
par: Pang, Yan, et autres
Publié: (2024)
par: Pang, Yan, et autres
Publié: (2024)
MotionRAG: Motion Retrieval-Augmented Image-to-Video Generation
par: Zhu, Chenhui, et autres
Publié: (2025)
par: Zhu, Chenhui, et autres
Publié: (2025)
MVBench: A Comprehensive Multi-modal Video Understanding Benchmark
par: Li, Kunchang, et autres
Publié: (2023)
par: Li, Kunchang, et autres
Publié: (2023)
VideoDirector: Precise Video Editing via Text-to-Video Models
par: Wang, Yukun, et autres
Publié: (2024)
par: Wang, Yukun, et autres
Publié: (2024)
VideoAR: Autoregressive Video Generation via Next-Frame & Scale Prediction
par: Ji, Longbin, et autres
Publié: (2026)
par: Ji, Longbin, et autres
Publié: (2026)
CustomVideo: Customizing Text-to-Video Generation with Multiple Subjects
par: Wang, Zhao, et autres
Publié: (2024)
par: Wang, Zhao, et autres
Publié: (2024)
LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering
par: Zhang, Hongjie, et autres
Publié: (2023)
par: Zhang, Hongjie, et autres
Publié: (2023)
Documents similaires
-
InternVideo2: Scaling Foundation Models for Multimodal Video Understanding
par: Wang, Yi, et autres
Publié: (2024) -
InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling
par: Wang, Yi, et autres
Publié: (2025) -
Make Your Training Flexible: Towards Deployment-Efficient Video Models
par: Wang, Chenting, et autres
Publié: (2025) -
VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling
par: Li, Xinhao, et autres
Publié: (2024) -
InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation
par: Wang, Yi, et autres
Publié: (2023)