Streaming Video Instruction Tuning
Fuente:
arXiv
Salvato in:
| Autori principali: | Xia, Jiaer, Chen, Peixian, Zhang, Mengdan, Sun, Xing, Zhou, Kaiyang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Mitigating Hallucination in Multimodal LLMs with Layer Contrastive Decoding
di: Tong, Bingkui, et al.
Pubblicazione: (2025)
di: Tong, Bingkui, et al.
Pubblicazione: (2025)
Measuring Epistemic Humility in Multimodal Large Language Models
di: Tong, Bingkui, et al.
Pubblicazione: (2025)
di: Tong, Bingkui, et al.
Pubblicazione: (2025)
Visionary-R1: Mitigating Shortcuts in Visual Reasoning with Reinforcement Learning
di: Xia, Jiaer, et al.
Pubblicazione: (2025)
di: Xia, Jiaer, et al.
Pubblicazione: (2025)
Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation
di: Xia, Jiaer, et al.
Pubblicazione: (2025)
di: Xia, Jiaer, et al.
Pubblicazione: (2025)
VEGA: Learning Interleaved Image-Text Comprehension in Vision-Language Large Models
di: Zhou, Chenyu, et al.
Pubblicazione: (2024)
di: Zhou, Chenyu, et al.
Pubblicazione: (2024)
Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs
di: Li, Xudong, et al.
Pubblicazione: (2025)
di: Li, Xudong, et al.
Pubblicazione: (2025)
ViSpeak: Visual Instruction Feedback in Streaming Videos
di: Fu, Shenghao, et al.
Pubblicazione: (2025)
di: Fu, Shenghao, et al.
Pubblicazione: (2025)
Cantor: Inspiring Multimodal Chain-of-Thought of MLLM
di: Gao, Timin, et al.
Pubblicazione: (2024)
di: Gao, Timin, et al.
Pubblicazione: (2024)
VideoOdyssey: A Benchmark for Ultra-Long-Context and Omni-Modal Video Understanding
di: He, Haichen, et al.
Pubblicazione: (2026)
di: He, Haichen, et al.
Pubblicazione: (2026)
Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
di: Fu, Chaoyou, et al.
Pubblicazione: (2024)
di: Fu, Chaoyou, et al.
Pubblicazione: (2024)
BT-Adapter: Video Conversation is Feasible Without Video Instruction Tuning
di: Liu, Ruyang, et al.
Pubblicazione: (2023)
di: Liu, Ruyang, et al.
Pubblicazione: (2023)
LLaVA-Video: Video Instruction Tuning With Synthetic Data
di: Zhang, Yuanhan, et al.
Pubblicazione: (2024)
di: Zhang, Yuanhan, et al.
Pubblicazione: (2024)
SneakPeek: Future-Guided Instructional Streaming Video Generation
di: Hong, Cheeun, et al.
Pubblicazione: (2025)
di: Hong, Cheeun, et al.
Pubblicazione: (2025)
MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
di: Fu, Chaoyou, et al.
Pubblicazione: (2023)
di: Fu, Chaoyou, et al.
Pubblicazione: (2023)
Attention Disturbance and Dual-Path Constraint Network for Occluded Person Re-identification
di: Xia, Jiaer, et al.
Pubblicazione: (2023)
di: Xia, Jiaer, et al.
Pubblicazione: (2023)
A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation
di: Zhou, Shijie, et al.
Pubblicazione: (2024)
di: Zhou, Shijie, et al.
Pubblicazione: (2024)
TIME: Temporal-Sensitive Multi-Dimensional Instruction Tuning and Robust Benchmarking for Video-LLMs
di: Wang, Yunxiao, et al.
Pubblicazione: (2025)
di: Wang, Yunxiao, et al.
Pubblicazione: (2025)
On the Evaluation and Refinement of Vision-Language Instruction Tuning Datasets
di: Liao, Ning, et al.
Pubblicazione: (2023)
di: Liao, Ning, et al.
Pubblicazione: (2023)
Deep Instruction Tuning for Segment Anything Model
di: Huang, Xiaorui, et al.
Pubblicazione: (2024)
di: Huang, Xiaorui, et al.
Pubblicazione: (2024)
DeformStream: Deformation-based Adaptive Volumetric Video Streaming
di: Li, Boyan, et al.
Pubblicazione: (2024)
di: Li, Boyan, et al.
Pubblicazione: (2024)
Long-VITA: Scaling Large Multi-modal Models to 1 Million Tokens with Leading Short-Context Accuracy
di: Shen, Yunhang, et al.
Pubblicazione: (2025)
di: Shen, Yunhang, et al.
Pubblicazione: (2025)
SIMS-V: Simulated Instruction-Tuning for Spatial Video Understanding
di: Brown, Ellis, et al.
Pubblicazione: (2025)
di: Brown, Ellis, et al.
Pubblicazione: (2025)
RISE-Video: Can Video Generators Decode Implicit World Rules?
di: Liu, Mingxin, et al.
Pubblicazione: (2026)
di: Liu, Mingxin, et al.
Pubblicazione: (2026)
Facial Dynamics in Video: Instruction Tuning for Improved Facial Expression Perception and Contextual Awareness
di: Zhao, Jiaxing, et al.
Pubblicazione: (2025)
di: Zhao, Jiaxing, et al.
Pubblicazione: (2025)
Personalized Visual Instruction Tuning
di: Pi, Renjie, et al.
Pubblicazione: (2024)
di: Pi, Renjie, et al.
Pubblicazione: (2024)
Visual Instruction Tuning with Chain of Region-of-Interest
di: Chen, Yixin, et al.
Pubblicazione: (2025)
di: Chen, Yixin, et al.
Pubblicazione: (2025)
3DGStream: On-the-Fly Training of 3D Gaussians for Efficient Streaming of Photo-Realistic Free-Viewpoint Videos
di: Sun, Jiakai, et al.
Pubblicazione: (2024)
di: Sun, Jiakai, et al.
Pubblicazione: (2024)
Streaming Dense Video Captioning
di: Zhou, Xingyi, et al.
Pubblicazione: (2024)
di: Zhou, Xingyi, et al.
Pubblicazione: (2024)
StreamGVE: Training-Free Video Editing via Few-Step Streaming Video Generation
di: Jiao, Guanlong, et al.
Pubblicazione: (2026)
di: Jiao, Guanlong, et al.
Pubblicazione: (2026)
GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest
di: Zhang, Shilong, et al.
Pubblicazione: (2023)
di: Zhang, Shilong, et al.
Pubblicazione: (2023)
LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding
di: Zhang, Yanzhe, et al.
Pubblicazione: (2023)
di: Zhang, Yanzhe, et al.
Pubblicazione: (2023)
DAPE: Dual-Stage Parameter-Efficient Fine-Tuning for Consistent Video Editing with Diffusion Models
di: Xia, Junhao, et al.
Pubblicazione: (2025)
di: Xia, Junhao, et al.
Pubblicazione: (2025)
StreamChat: Chatting with Streaming Video
di: Liu, Jihao, et al.
Pubblicazione: (2024)
di: Liu, Jihao, et al.
Pubblicazione: (2024)
Multimodal Instruction Tuning with Hybrid State Space Models
di: Zhou, Jianing, et al.
Pubblicazione: (2024)
di: Zhou, Jianing, et al.
Pubblicazione: (2024)
StrLoRA: Towards Streaming Continual Visual Instruction Tuning for MLLMs
di: Che, Chang, et al.
Pubblicazione: (2026)
di: Che, Chang, et al.
Pubblicazione: (2026)
HiVid: LLM-Guided Video Saliency For Content-Aware VOD And Live Streaming
di: Chen, Jiahui, et al.
Pubblicazione: (2026)
di: Chen, Jiahui, et al.
Pubblicazione: (2026)
Streaming Drag-Oriented Interactive Video Manipulation: Drag Anything, Anytime!
di: Zhou, Junbao, et al.
Pubblicazione: (2025)
di: Zhou, Junbao, et al.
Pubblicazione: (2025)
StreamMeCo: Long-Term Agent Memory Compression for Efficient Streaming Video Understanding
di: Wang, Junxi, et al.
Pubblicazione: (2026)
di: Wang, Junxi, et al.
Pubblicazione: (2026)
Online Anomaly Detection over Live Social Video Streaming
di: He, Chengkun, et al.
Pubblicazione: (2023)
di: He, Chengkun, et al.
Pubblicazione: (2023)
CoTasks: Chain-of-Thought based Video Instruction Tuning Tasks
di: Wang, Yanan, et al.
Pubblicazione: (2025)
di: Wang, Yanan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Mitigating Hallucination in Multimodal LLMs with Layer Contrastive Decoding
di: Tong, Bingkui, et al.
Pubblicazione: (2025) -
Measuring Epistemic Humility in Multimodal Large Language Models
di: Tong, Bingkui, et al.
Pubblicazione: (2025) -
Visionary-R1: Mitigating Shortcuts in Visual Reasoning with Reinforcement Learning
di: Xia, Jiaer, et al.
Pubblicazione: (2025) -
Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation
di: Xia, Jiaer, et al.
Pubblicazione: (2025) -
VEGA: Learning Interleaved Image-Text Comprehension in Vision-Language Large Models
di: Zhou, Chenyu, et al.
Pubblicazione: (2024)