VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Cheng, Zesen, Leng, Sicong, Zhang, Hang, Xin, Yifei, Li, Xin, Chen, Guanzheng, Zhu, Yongxin, Zhang, Wenqi, Luo, Ziyang, Zhao, Deli, Bing, Lidong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding
por: Zhang, Boqiang, et al.
Publicado: (2025)
por: Zhang, Boqiang, et al.
Publicado: (2025)
VideoRefer Suite: Advancing Spatial-Temporal Object Understanding with Video LLM
por: Yuan, Yuqian, et al.
Publicado: (2024)
por: Yuan, Yuqian, et al.
Publicado: (2024)
The Curse of Multi-Modalities: Evaluating Hallucinations of Large Multimodal Models across Language, Visual, and Audio
por: Leng, Sicong, et al.
Publicado: (2024)
por: Leng, Sicong, et al.
Publicado: (2024)
Breaking the Memory Barrier: Near Infinite Batch Size Scaling for Contrastive Loss
por: Cheng, Zesen, et al.
Publicado: (2024)
por: Cheng, Zesen, et al.
Publicado: (2024)
LongPO: Long Context Self-Evolution of Large Language Models through Short-to-Long Preference Optimization
por: Chen, Guanzheng, et al.
Publicado: (2025)
por: Chen, Guanzheng, et al.
Publicado: (2025)
2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining
por: Zhang, Wenqi, et al.
Publicado: (2025)
por: Zhang, Wenqi, et al.
Publicado: (2025)
CLEX: Continuous Length Extrapolation for Large Language Models
por: Chen, Guanzheng, et al.
Publicado: (2023)
por: Chen, Guanzheng, et al.
Publicado: (2023)
Empowering LLMs with Pseudo-Untrimmed Videos for Audio-Visual Temporal Understanding
por: Tang, Yolo Yunlong, et al.
Publicado: (2024)
por: Tang, Yolo Yunlong, et al.
Publicado: (2024)
LongRLVR: Long-Context Reinforcement Learning Requires Verifiable Context Rewards
por: Chen, Guanzheng, et al.
Publicado: (2026)
por: Chen, Guanzheng, et al.
Publicado: (2026)
Stabilize the Latent Space for Image Autoregressive Modeling: A Unified Perspective
por: Zhu, Yongxin, et al.
Publicado: (2024)
por: Zhu, Yongxin, et al.
Publicado: (2024)
Adapting LLaMA Decoder to Vision Transformer
por: Wang, Jiahao, et al.
Publicado: (2024)
por: Wang, Jiahao, et al.
Publicado: (2024)
LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Calling
por: Yang, Zuhao, et al.
Publicado: (2025)
por: Yang, Zuhao, et al.
Publicado: (2025)
VideoINSTA: Zero-shot Long Video Understanding via Informative Spatial-Temporal Reasoning with LLMs
por: Liao, Ruotong, et al.
Publicado: (2024)
por: Liao, Ruotong, et al.
Publicado: (2024)
Efficient and Effective Text Encoding for Chinese LLaMA and Alpaca
por: Cui, Yiming, et al.
Publicado: (2023)
por: Cui, Yiming, et al.
Publicado: (2023)
ECBench: Can Multi-modal Foundation Models Understand the Egocentric World? A Holistic Embodied Cognition Benchmark
por: Dang, Ronghao, et al.
Publicado: (2025)
por: Dang, Ronghao, et al.
Publicado: (2025)
LLaMA based Punctuation Restoration With Forward Pass Only Decoding
por: Pang, Yutong, et al.
Publicado: (2024)
por: Pang, Yutong, et al.
Publicado: (2024)
STOP: Integrated Spatial-Temporal Dynamic Prompting for Video Understanding
por: Liu, Zichen, et al.
Publicado: (2025)
por: Liu, Zichen, et al.
Publicado: (2025)
EMO-LLaMA: Enhancing Facial Emotion Understanding with Instruction Tuning
por: Xing, Bohao, et al.
Publicado: (2024)
por: Xing, Bohao, et al.
Publicado: (2024)
VisionLLaMA: A Unified LLaMA Backbone for Vision Tasks
por: Chu, Xiangxiang, et al.
Publicado: (2024)
por: Chu, Xiangxiang, et al.
Publicado: (2024)
VideoLLaMB: Long Streaming Video Understanding with Recurrent Memory Bridges
por: Wang, Yuxuan, et al.
Publicado: (2024)
por: Wang, Yuxuan, et al.
Publicado: (2024)
Amharic LLaMA and LLaVA: Multimodal LLMs for Low Resource Languages
por: Andersland, Michael
Publicado: (2024)
por: Andersland, Michael
Publicado: (2024)
MMR1: Enhancing Multimodal Reasoning with Variance-Aware Sampling and Open Resources
por: Leng, Sicong, et al.
Publicado: (2025)
por: Leng, Sicong, et al.
Publicado: (2025)
LLaMA Pro: Progressive LLaMA with Block Expansion
por: Wu, Chengyue, et al.
Publicado: (2024)
por: Wu, Chengyue, et al.
Publicado: (2024)
TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler
por: Zhang, Xingjian, et al.
Publicado: (2025)
por: Zhang, Xingjian, et al.
Publicado: (2025)
LVOmniBench: Pioneering Long Audio-Video Understanding Evaluation for Omnimodal LLMs
por: Tao, Keda, et al.
Publicado: (2026)
por: Tao, Keda, et al.
Publicado: (2026)
LLaVA-Video: Video Instruction Tuning With Synthetic Data
por: Zhang, Yuanhan, et al.
Publicado: (2024)
por: Zhang, Yuanhan, et al.
Publicado: (2024)
FedSEA-LLaMA: A Secure, Efficient and Adaptive Federated Splitting Framework for Large Language Models
por: Zhang, Zishuai, et al.
Publicado: (2025)
por: Zhang, Zishuai, et al.
Publicado: (2025)
TC-LLaVA: Rethinking the Transfer from Image to Video Understanding with Temporal Considerations
por: Gao, Mingze, et al.
Publicado: (2024)
por: Gao, Mingze, et al.
Publicado: (2024)
SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing
por: Biyyala, Varun, et al.
Publicado: (2025)
por: Biyyala, Varun, et al.
Publicado: (2025)
Towards Long-Form Spatio-Temporal Video Grounding
por: Gu, Xin, et al.
Publicado: (2026)
por: Gu, Xin, et al.
Publicado: (2026)
VideoCompressa: Data-Efficient Video Understanding via Joint Temporal Compression and Spatial Reconstruction
por: Wang, Shaobo, et al.
Publicado: (2025)
por: Wang, Shaobo, et al.
Publicado: (2025)
VTG-LLM: Integrating Timestamp Knowledge into Video LLMs for Enhanced Video Temporal Grounding
por: Guo, Yongxin, et al.
Publicado: (2024)
por: Guo, Yongxin, et al.
Publicado: (2024)
LogLLaMA: Transformer-based log anomaly detection with LLaMA
por: Yang, Zhuoyi, et al.
Publicado: (2025)
por: Yang, Zhuoyi, et al.
Publicado: (2025)
ECHO-LLaMA: Efficient Caching for High-Performance LLaMA Training
por: Dialameh, Maryam, et al.
Publicado: (2025)
por: Dialameh, Maryam, et al.
Publicado: (2025)
V-CORE: Temporally Consistent Video Understanding for Video-LLM
por: Kang, Zhengjian, et al.
Publicado: (2026)
por: Kang, Zhengjian, et al.
Publicado: (2026)
OVO-Bench: How Far is Your Video-LLMs from Real-World Online Video Understanding?
por: Li, Yifei, et al.
Publicado: (2025)
por: Li, Yifei, et al.
Publicado: (2025)
LLMs Meet Long Video: Advancing Long Video Question Answering with An Interactive Visual Adapter in LLMs
por: Li, Yunxin, et al.
Publicado: (2024)
por: Li, Yunxin, et al.
Publicado: (2024)
SmartSight: Mitigating Hallucination in Video-LLMs Without Compromising Video Understanding via Temporal Attention Collapse
por: Sun, Yiming, et al.
Publicado: (2025)
por: Sun, Yiming, et al.
Publicado: (2025)
LLaMA-Reg: Using LLaMA 2 for Unsupervised Medical Image Registration
por: Ma, Mingrui, et al.
Publicado: (2024)
por: Ma, Mingrui, et al.
Publicado: (2024)
AMR-Evol: Adaptive Modular Response Evolution Elicits Better Knowledge Distillation for Large Language Models in Code Generation
por: Luo, Ziyang, et al.
Publicado: (2024)
por: Luo, Ziyang, et al.
Publicado: (2024)
Ejemplares similares
-
VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding
por: Zhang, Boqiang, et al.
Publicado: (2025) -
VideoRefer Suite: Advancing Spatial-Temporal Object Understanding with Video LLM
por: Yuan, Yuqian, et al.
Publicado: (2024) -
The Curse of Multi-Modalities: Evaluating Hallucinations of Large Multimodal Models across Language, Visual, and Audio
por: Leng, Sicong, et al.
Publicado: (2024) -
Breaking the Memory Barrier: Near Infinite Batch Size Scaling for Contrastive Loss
por: Cheng, Zesen, et al.
Publicado: (2024) -
LongPO: Long Context Self-Evolution of Large Language Models through Short-to-Long Preference Optimization
por: Chen, Guanzheng, et al.
Publicado: (2025)