Video-STaR: Self-Training Enables Video Instruction Tuning with Any Supervision
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zohar, Orr, Wang, Xiaohan, Bitton, Yonatan, Szpektor, Idan, Yeung-Levy, Serena |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VideoAgent: Long-form Video Understanding with Large Language Model as Agent
par: Wang, Xiaohan, et autres
Publié: (2024)
par: Wang, Xiaohan, et autres
Publié: (2024)
Contrastive Sequential-Diffusion Learning: Non-linear and Multi-Scene Instructional Video Synthesis
par: Ramos, Vasco, et autres
Publié: (2024)
par: Ramos, Vasco, et autres
Publié: (2024)
TALC: Time-Aligned Captions for Multi-Scene Text-to-Video Generation
par: Bansal, Hritik, et autres
Publié: (2024)
par: Bansal, Hritik, et autres
Publié: (2024)
Temporal Preference Optimization for Long-Form Video Understanding
par: Li, Rui, et autres
Publié: (2025)
par: Li, Rui, et autres
Publié: (2025)
V-STaR: Benchmarking Video-LLMs on Video Spatio-Temporal Reasoning
par: Cheng, Zixu, et autres
Publié: (2025)
par: Cheng, Zixu, et autres
Publié: (2025)
Seeing Isn't Knowing: Do VLMs Know When Not to Answer Spatial Questions (and Why)?
par: Zhang, Yue, et autres
Publié: (2026)
par: Zhang, Yue, et autres
Publié: (2026)
Bridging the Visual Gap: Fine-Tuning Multimodal Models with Knowledge-Adapted Captions
par: Yanuka, Moran, et autres
Publié: (2024)
par: Yanuka, Moran, et autres
Publié: (2024)
Apollo: An Exploration of Video Understanding in Large Multimodal Models
par: Zohar, Orr, et autres
Publié: (2024)
par: Zohar, Orr, et autres
Publié: (2024)
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
par: Deng, Andong, et autres
Publié: (2025)
par: Deng, Andong, et autres
Publié: (2025)
STaR-KV: Spatio-Temporal Adaptive Re-weighting for KV Cache Compression in GUI Vision-Language Models
par: Han, Yuhang, et autres
Publié: (2026)
par: Han, Yuhang, et autres
Publié: (2026)
Error-Driven Scene Editing for 3D Grounding in Large Language Models
par: Zhang, Yue, et autres
Publié: (2025)
par: Zhang, Yue, et autres
Publié: (2025)
Video Action Differencing
par: Burgess, James, et autres
Publié: (2025)
par: Burgess, James, et autres
Publié: (2025)
Just Shift It: Test-Time Prototype Shifting for Zero-Shot Generalization with Vision-Language Models
par: Sui, Elaine, et autres
Publié: (2024)
par: Sui, Elaine, et autres
Publié: (2024)
STaR: Seamless Spatial-Temporal Aware Motion Retargeting with Penetration and Consistency Constraints
par: Yang, Xiaohang, et autres
Publié: (2025)
par: Yang, Xiaohang, et autres
Publié: (2025)
Mismatch Quest: Visual and Textual Feedback for Image-Text Misalignment
par: Gordon, Brian, et autres
Publié: (2023)
par: Gordon, Brian, et autres
Publié: (2023)
Unblocking Fine-Grained Evaluation of Detailed Captions: An Explaining AutoRater and Critic-and-Revise Pipeline
par: Gordon, Brian, et autres
Publié: (2025)
par: Gordon, Brian, et autres
Publié: (2025)
ATI: Any Trajectory Instruction for Controllable Video Generation
par: Wang, Angtian, et autres
Publié: (2025)
par: Wang, Angtian, et autres
Publié: (2025)
The Impact of Image Resolution on Biomedical Multimodal Large Language Models
par: Chen, Liangyu, et autres
Publié: (2025)
par: Chen, Liangyu, et autres
Publié: (2025)
RefVNLI: Towards Scalable Evaluation of Subject-driven Text-to-image Generation
par: Slobodkin, Aviv, et autres
Publié: (2025)
par: Slobodkin, Aviv, et autres
Publié: (2025)
Visual Riddles: a Commonsense and World Knowledge Challenge for Large Vision and Language Models
par: Bitton-Guetta, Nitzan, et autres
Publié: (2024)
par: Bitton-Guetta, Nitzan, et autres
Publié: (2024)
AnyV2V: A Tuning-Free Framework For Any Video-to-Video Editing Tasks
par: Ku, Max, et autres
Publié: (2024)
par: Ku, Max, et autres
Publié: (2024)
Generating Coherent Sequences of Visual Illustrations for Real-World Manual Tasks
par: Bordalo, João, et autres
Publié: (2024)
par: Bordalo, João, et autres
Publié: (2024)
Zero-shot Action Localization via the Confidence of Large Vision-Language Models
par: Aklilu, Josiah, et autres
Publié: (2024)
par: Aklilu, Josiah, et autres
Publié: (2024)
Feather the Throttle: Revisiting Visual Token Pruning for Vision-Language Model Acceleration
par: Endo, Mark, et autres
Publié: (2024)
par: Endo, Mark, et autres
Publié: (2024)
Depth-guided NeRF Training via Earth Mover's Distance
par: Rau, Anita, et autres
Publié: (2024)
par: Rau, Anita, et autres
Publié: (2024)
3DLLM-Mem: Long-Term Spatial-Temporal Memory for Embodied 3D Large Language Model
par: Hu, Wenbo, et autres
Publié: (2025)
par: Hu, Wenbo, et autres
Publié: (2025)
VideoPhy: Evaluating Physical Commonsense for Video Generation
par: Bansal, Hritik, et autres
Publié: (2024)
par: Bansal, Hritik, et autres
Publié: (2024)
VideoPhy-2: A Challenging Action-Centric Physical Commonsense Evaluation in Video Generation
par: Bansal, Hritik, et autres
Publié: (2025)
par: Bansal, Hritik, et autres
Publié: (2025)
Transductive Visual Programming: Evolving Tool Libraries from Experience for Spatial Reasoning
par: Wu, Shengguang, et autres
Publié: (2025)
par: Wu, Shengguang, et autres
Publié: (2025)
Self-Supervised Learning for Endoscopic Video Analysis
par: Hirsch, Roy, et autres
Publié: (2023)
par: Hirsch, Roy, et autres
Publié: (2023)
Any-to-Bokeh: Arbitrary-Subject Video Refocusing with Video Diffusion Model
par: Yang, Yang, et autres
Publié: (2025)
par: Yang, Yang, et autres
Publié: (2025)
Any2Caption:Interpreting Any Condition to Caption for Controllable Video Generation
par: Wu, Shengqiong, et autres
Publié: (2025)
par: Wu, Shengqiong, et autres
Publié: (2025)
Depth Any Video with Scalable Synthetic Data
par: Yang, Honghui, et autres
Publié: (2024)
par: Yang, Honghui, et autres
Publié: (2024)
InteractiveVideo: User-Centric Controllable Video Generation with Synergistic Multimodal Instructions
par: Zhang, Yiyuan, et autres
Publié: (2024)
par: Zhang, Yiyuan, et autres
Publié: (2024)
EditInspector: A Benchmark for Evaluation of Text-Guided Image Edits
par: Yosef, Ron, et autres
Publié: (2025)
par: Yosef, Ron, et autres
Publié: (2025)
AnyFlow: Any-Step Video Diffusion Model with On-Policy Flow Map Distillation
par: Gu, Yuchao, et autres
Publié: (2026)
par: Gu, Yuchao, et autres
Publié: (2026)
UnSAMv2: Self-Supervised Learning Enables Segment Anything at Any Granularity
par: Yu, Junwei, et autres
Publié: (2025)
par: Yu, Junwei, et autres
Publié: (2025)
Downscaling Intelligence: Exploring Perception and Reasoning Bottlenecks in Small Multimodal Models
par: Endo, Mark, et autres
Publié: (2025)
par: Endo, Mark, et autres
Publié: (2025)
Viewpoint Textual Inversion: Discovering Scene Representations and 3D View Control in 2D Diffusion Models
par: Burgess, James, et autres
Publié: (2023)
par: Burgess, James, et autres
Publié: (2023)
X2SAM: Any Segmentation in Images and Videos
par: Wang, Hao, et autres
Publié: (2026)
par: Wang, Hao, et autres
Publié: (2026)
Documents similaires
-
VideoAgent: Long-form Video Understanding with Large Language Model as Agent
par: Wang, Xiaohan, et autres
Publié: (2024) -
Contrastive Sequential-Diffusion Learning: Non-linear and Multi-Scene Instructional Video Synthesis
par: Ramos, Vasco, et autres
Publié: (2024) -
TALC: Time-Aligned Captions for Multi-Scene Text-to-Video Generation
par: Bansal, Hritik, et autres
Publié: (2024) -
Temporal Preference Optimization for Long-Form Video Understanding
par: Li, Rui, et autres
Publié: (2025) -
V-STaR: Benchmarking Video-LLMs on Video Spatio-Temporal Reasoning
par: Cheng, Zixu, et autres
Publié: (2025)