TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Xingjian, Weng, Xi, Yue, Yihao, Fan, Zhaoxin, Wu, Wenjun, Huang, Lei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
TinyLLaVA-Video-R1: Towards Smaller LMMs for Video Reasoning
por: Zhang, Xingjian, et al.
Publicado: (2025)
por: Zhang, Xingjian, et al.
Publicado: (2025)
LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge Distillation
por: Shu, Fangxun, et al.
Publicado: (2024)
por: Shu, Fangxun, et al.
Publicado: (2024)
Q-Bench-Video: Benchmarking the Video Quality Understanding of LMMs
por: Zhang, Zicheng, et al.
Publicado: (2024)
por: Zhang, Zicheng, et al.
Publicado: (2024)
EventMemAgent: Hierarchical Event-Centric Memory for Online Video Understanding with Adaptive Tool Use
por: Wen, Siwei, et al.
Publicado: (2026)
por: Wen, Siwei, et al.
Publicado: (2026)
3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer
por: Deng, Jiajun, et al.
Publicado: (2025)
por: Deng, Jiajun, et al.
Publicado: (2025)
LLaVA-4D: Embedding SpatioTemporal Prompt into LMMs for 4D Scene Understanding
por: Zhou, Hanyu, et al.
Publicado: (2025)
por: Zhou, Hanyu, et al.
Publicado: (2025)
Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos
por: Yuan, Haobo, et al.
Publicado: (2025)
por: Yuan, Haobo, et al.
Publicado: (2025)
TinyLLaVA: A Framework of Small-scale Large Multimodal Models
por: Zhou, Baichuan, et al.
Publicado: (2024)
por: Zhou, Baichuan, et al.
Publicado: (2024)
LLaVA-Video: Video Instruction Tuning With Synthetic Data
por: Zhang, Yuanhan, et al.
Publicado: (2024)
por: Zhang, Yuanhan, et al.
Publicado: (2024)
TC-LLaVA: Rethinking the Transfer from Image to Video Understanding with Temporal Considerations
por: Gao, Mingze, et al.
Publicado: (2024)
por: Gao, Mingze, et al.
Publicado: (2024)
TinyLLaVA Factory: A Modularized Codebase for Small-scale Large Multimodal Models
por: Jia, Junlong, et al.
Publicado: (2024)
por: Jia, Junlong, et al.
Publicado: (2024)
Text-Conditioned Resampler For Long Form Video Understanding
por: Korbar, Bruno, et al.
Publicado: (2023)
por: Korbar, Bruno, et al.
Publicado: (2023)
PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning
por: Xu, Lin, et al.
Publicado: (2024)
por: Xu, Lin, et al.
Publicado: (2024)
LLaFEA: Frame-Event Complementary Fusion for Fine-Grained Spatiotemporal Understanding in LMMs
por: Zhou, Hanyu, et al.
Publicado: (2025)
por: Zhou, Hanyu, et al.
Publicado: (2025)
LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness
por: Zhu, Chenming, et al.
Publicado: (2024)
por: Zhu, Chenming, et al.
Publicado: (2024)
LLaVA-MLB: Mitigating and Leveraging Attention Bias for Training-Free Video LLMs
por: Shen, Leqi, et al.
Publicado: (2025)
por: Shen, Leqi, et al.
Publicado: (2025)
LLaVA-Octopus: Unlocking Instruction-Driven Adaptive Projector Fusion for Video Understanding
por: Sun, Boyuan, et al.
Publicado: (2025)
por: Sun, Boyuan, et al.
Publicado: (2025)
VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding
por: Zhang, Boqiang, et al.
Publicado: (2025)
por: Zhang, Boqiang, et al.
Publicado: (2025)
SlowFast-LLaVA-1.5: A Family of Token-Efficient Video Large Language Models for Long-Form Video Understanding
por: Xu, Mingze, et al.
Publicado: (2025)
por: Xu, Mingze, et al.
Publicado: (2025)
Video-LLaVA: Learning United Visual Representation by Alignment Before Projection
por: Lin, Bin, et al.
Publicado: (2023)
por: Lin, Bin, et al.
Publicado: (2023)
LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval
por: Lu, Weiheng, et al.
Publicado: (2024)
por: Lu, Weiheng, et al.
Publicado: (2024)
LLaVA-Surg: Towards Multimodal Surgical Assistant via Structured Surgical Video Learning
por: Li, Jiajie, et al.
Publicado: (2024)
por: Li, Jiajie, et al.
Publicado: (2024)
IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs
por: Yamao, Sosuke, et al.
Publicado: (2024)
por: Yamao, Sosuke, et al.
Publicado: (2024)
TennisExpert: Towards Expert-Level Analytical Sports Video Understanding
por: Liu, Zhaoyu, et al.
Publicado: (2026)
por: Liu, Zhaoyu, et al.
Publicado: (2026)
How Good is my Video LMM? Complex Video Reasoning and Robustness Evaluation Suite for Video-LMMs
por: Khattak, Muhammad Uzair, et al.
Publicado: (2024)
por: Khattak, Muhammad Uzair, et al.
Publicado: (2024)
CityLLaVA: Efficient Fine-Tuning for VLMs in City Scenario
por: Duan, Zhizhao, et al.
Publicado: (2024)
por: Duan, Zhizhao, et al.
Publicado: (2024)
VANE-Bench: Video Anomaly Evaluation Benchmark for Conversational LMMs
por: Bharadwaj, Rohit, et al.
Publicado: (2024)
por: Bharadwaj, Rohit, et al.
Publicado: (2024)
Embodied VideoAgent: Persistent Memory from Egocentric Videos and Embodied Sensors Enables Dynamic Scene Understanding
por: Fan, Yue, et al.
Publicado: (2024)
por: Fan, Yue, et al.
Publicado: (2024)
VideoLLaMB: Long Streaming Video Understanding with Recurrent Memory Bridges
por: Wang, Yuxuan, et al.
Publicado: (2024)
por: Wang, Yuxuan, et al.
Publicado: (2024)
ViLLa: Video Reasoning Segmentation with Large Language Model
por: Zheng, Rongkun, et al.
Publicado: (2024)
por: Zheng, Rongkun, et al.
Publicado: (2024)
MG-LLaVA: Towards Multi-Granularity Visual Instruction Tuning
por: Zhao, Xiangyu, et al.
Publicado: (2024)
por: Zhao, Xiangyu, et al.
Publicado: (2024)
End-to-End Training for Autoregressive Video Diffusion via Self-Resampling
por: Guo, Yuwei, et al.
Publicado: (2025)
por: Guo, Yuwei, et al.
Publicado: (2025)
VideoAgent: A Memory-augmented Multimodal Agent for Video Understanding
por: Fan, Yue, et al.
Publicado: (2024)
por: Fan, Yue, et al.
Publicado: (2024)
SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models
por: Xu, Mingze, et al.
Publicado: (2024)
por: Xu, Mingze, et al.
Publicado: (2024)
VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs
por: Cheng, Zesen, et al.
Publicado: (2024)
por: Cheng, Zesen, et al.
Publicado: (2024)
TDVE-Assessor: Benchmarking and Evaluating the Quality of Text-Driven Video Editing with LMMs
por: Wang, Juntong, et al.
Publicado: (2025)
por: Wang, Juntong, et al.
Publicado: (2025)
LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs
por: Lou, Haoran, et al.
Publicado: (2025)
por: Lou, Haoran, et al.
Publicado: (2025)
Towards Universal Soccer Video Understanding
por: Rao, Jiayuan, et al.
Publicado: (2024)
por: Rao, Jiayuan, et al.
Publicado: (2024)
OMG-LLaVA: Bridging Image-level, Object-level, Pixel-level Reasoning and Understanding
por: Zhang, Tao, et al.
Publicado: (2024)
por: Zhang, Tao, et al.
Publicado: (2024)
AVFakeBench: A Comprehensive Audio-Video Forgery Detection Benchmark for AV-LMMs
por: Xia, Shuhan, et al.
Publicado: (2025)
por: Xia, Shuhan, et al.
Publicado: (2025)
Ejemplares similares
-
TinyLLaVA-Video-R1: Towards Smaller LMMs for Video Reasoning
por: Zhang, Xingjian, et al.
Publicado: (2025) -
LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge Distillation
por: Shu, Fangxun, et al.
Publicado: (2024) -
Q-Bench-Video: Benchmarking the Video Quality Understanding of LMMs
por: Zhang, Zicheng, et al.
Publicado: (2024) -
EventMemAgent: Hierarchical Event-Centric Memory for Online Video Understanding with Adaptive Tool Use
por: Wen, Siwei, et al.
Publicado: (2026) -
3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer
por: Deng, Jiajun, et al.
Publicado: (2025)