Streaming Video Instruction Tuning
Fuente:
arXiv
Guardado en:
| Autores principales: | Xia, Jiaer, Chen, Peixian, Zhang, Mengdan, Sun, Xing, Zhou, Kaiyang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Mitigating Hallucination in Multimodal LLMs with Layer Contrastive Decoding
por: Tong, Bingkui, et al.
Publicado: (2025)
por: Tong, Bingkui, et al.
Publicado: (2025)
Measuring Epistemic Humility in Multimodal Large Language Models
por: Tong, Bingkui, et al.
Publicado: (2025)
por: Tong, Bingkui, et al.
Publicado: (2025)
Visionary-R1: Mitigating Shortcuts in Visual Reasoning with Reinforcement Learning
por: Xia, Jiaer, et al.
Publicado: (2025)
por: Xia, Jiaer, et al.
Publicado: (2025)
Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation
por: Xia, Jiaer, et al.
Publicado: (2025)
por: Xia, Jiaer, et al.
Publicado: (2025)
VEGA: Learning Interleaved Image-Text Comprehension in Vision-Language Large Models
por: Zhou, Chenyu, et al.
Publicado: (2024)
por: Zhou, Chenyu, et al.
Publicado: (2024)
Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs
por: Li, Xudong, et al.
Publicado: (2025)
por: Li, Xudong, et al.
Publicado: (2025)
ViSpeak: Visual Instruction Feedback in Streaming Videos
por: Fu, Shenghao, et al.
Publicado: (2025)
por: Fu, Shenghao, et al.
Publicado: (2025)
Cantor: Inspiring Multimodal Chain-of-Thought of MLLM
por: Gao, Timin, et al.
Publicado: (2024)
por: Gao, Timin, et al.
Publicado: (2024)
VideoOdyssey: A Benchmark for Ultra-Long-Context and Omni-Modal Video Understanding
por: He, Haichen, et al.
Publicado: (2026)
por: He, Haichen, et al.
Publicado: (2026)
Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
por: Fu, Chaoyou, et al.
Publicado: (2024)
por: Fu, Chaoyou, et al.
Publicado: (2024)
BT-Adapter: Video Conversation is Feasible Without Video Instruction Tuning
por: Liu, Ruyang, et al.
Publicado: (2023)
por: Liu, Ruyang, et al.
Publicado: (2023)
LLaVA-Video: Video Instruction Tuning With Synthetic Data
por: Zhang, Yuanhan, et al.
Publicado: (2024)
por: Zhang, Yuanhan, et al.
Publicado: (2024)
SneakPeek: Future-Guided Instructional Streaming Video Generation
por: Hong, Cheeun, et al.
Publicado: (2025)
por: Hong, Cheeun, et al.
Publicado: (2025)
MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
por: Fu, Chaoyou, et al.
Publicado: (2023)
por: Fu, Chaoyou, et al.
Publicado: (2023)
Attention Disturbance and Dual-Path Constraint Network for Occluded Person Re-identification
por: Xia, Jiaer, et al.
Publicado: (2023)
por: Xia, Jiaer, et al.
Publicado: (2023)
A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation
por: Zhou, Shijie, et al.
Publicado: (2024)
por: Zhou, Shijie, et al.
Publicado: (2024)
TIME: Temporal-Sensitive Multi-Dimensional Instruction Tuning and Robust Benchmarking for Video-LLMs
por: Wang, Yunxiao, et al.
Publicado: (2025)
por: Wang, Yunxiao, et al.
Publicado: (2025)
On the Evaluation and Refinement of Vision-Language Instruction Tuning Datasets
por: Liao, Ning, et al.
Publicado: (2023)
por: Liao, Ning, et al.
Publicado: (2023)
Deep Instruction Tuning for Segment Anything Model
por: Huang, Xiaorui, et al.
Publicado: (2024)
por: Huang, Xiaorui, et al.
Publicado: (2024)
DeformStream: Deformation-based Adaptive Volumetric Video Streaming
por: Li, Boyan, et al.
Publicado: (2024)
por: Li, Boyan, et al.
Publicado: (2024)
Long-VITA: Scaling Large Multi-modal Models to 1 Million Tokens with Leading Short-Context Accuracy
por: Shen, Yunhang, et al.
Publicado: (2025)
por: Shen, Yunhang, et al.
Publicado: (2025)
SIMS-V: Simulated Instruction-Tuning for Spatial Video Understanding
por: Brown, Ellis, et al.
Publicado: (2025)
por: Brown, Ellis, et al.
Publicado: (2025)
RISE-Video: Can Video Generators Decode Implicit World Rules?
por: Liu, Mingxin, et al.
Publicado: (2026)
por: Liu, Mingxin, et al.
Publicado: (2026)
Facial Dynamics in Video: Instruction Tuning for Improved Facial Expression Perception and Contextual Awareness
por: Zhao, Jiaxing, et al.
Publicado: (2025)
por: Zhao, Jiaxing, et al.
Publicado: (2025)
Personalized Visual Instruction Tuning
por: Pi, Renjie, et al.
Publicado: (2024)
por: Pi, Renjie, et al.
Publicado: (2024)
Visual Instruction Tuning with Chain of Region-of-Interest
por: Chen, Yixin, et al.
Publicado: (2025)
por: Chen, Yixin, et al.
Publicado: (2025)
3DGStream: On-the-Fly Training of 3D Gaussians for Efficient Streaming of Photo-Realistic Free-Viewpoint Videos
por: Sun, Jiakai, et al.
Publicado: (2024)
por: Sun, Jiakai, et al.
Publicado: (2024)
Streaming Dense Video Captioning
por: Zhou, Xingyi, et al.
Publicado: (2024)
por: Zhou, Xingyi, et al.
Publicado: (2024)
StreamGVE: Training-Free Video Editing via Few-Step Streaming Video Generation
por: Jiao, Guanlong, et al.
Publicado: (2026)
por: Jiao, Guanlong, et al.
Publicado: (2026)
GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest
por: Zhang, Shilong, et al.
Publicado: (2023)
por: Zhang, Shilong, et al.
Publicado: (2023)
LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding
por: Zhang, Yanzhe, et al.
Publicado: (2023)
por: Zhang, Yanzhe, et al.
Publicado: (2023)
DAPE: Dual-Stage Parameter-Efficient Fine-Tuning for Consistent Video Editing with Diffusion Models
por: Xia, Junhao, et al.
Publicado: (2025)
por: Xia, Junhao, et al.
Publicado: (2025)
StreamChat: Chatting with Streaming Video
por: Liu, Jihao, et al.
Publicado: (2024)
por: Liu, Jihao, et al.
Publicado: (2024)
Multimodal Instruction Tuning with Hybrid State Space Models
por: Zhou, Jianing, et al.
Publicado: (2024)
por: Zhou, Jianing, et al.
Publicado: (2024)
StrLoRA: Towards Streaming Continual Visual Instruction Tuning for MLLMs
por: Che, Chang, et al.
Publicado: (2026)
por: Che, Chang, et al.
Publicado: (2026)
HiVid: LLM-Guided Video Saliency For Content-Aware VOD And Live Streaming
por: Chen, Jiahui, et al.
Publicado: (2026)
por: Chen, Jiahui, et al.
Publicado: (2026)
Streaming Drag-Oriented Interactive Video Manipulation: Drag Anything, Anytime!
por: Zhou, Junbao, et al.
Publicado: (2025)
por: Zhou, Junbao, et al.
Publicado: (2025)
StreamMeCo: Long-Term Agent Memory Compression for Efficient Streaming Video Understanding
por: Wang, Junxi, et al.
Publicado: (2026)
por: Wang, Junxi, et al.
Publicado: (2026)
Online Anomaly Detection over Live Social Video Streaming
por: He, Chengkun, et al.
Publicado: (2023)
por: He, Chengkun, et al.
Publicado: (2023)
CoTasks: Chain-of-Thought based Video Instruction Tuning Tasks
por: Wang, Yanan, et al.
Publicado: (2025)
por: Wang, Yanan, et al.
Publicado: (2025)
Ejemplares similares
-
Mitigating Hallucination in Multimodal LLMs with Layer Contrastive Decoding
por: Tong, Bingkui, et al.
Publicado: (2025) -
Measuring Epistemic Humility in Multimodal Large Language Models
por: Tong, Bingkui, et al.
Publicado: (2025) -
Visionary-R1: Mitigating Shortcuts in Visual Reasoning with Reinforcement Learning
por: Xia, Jiaer, et al.
Publicado: (2025) -
Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation
por: Xia, Jiaer, et al.
Publicado: (2025) -
VEGA: Learning Interleaved Image-Text Comprehension in Vision-Language Large Models
por: Zhou, Chenyu, et al.
Publicado: (2024)