MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual Tokens
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ataallah, Kirolos, Shen, Xiaoqian, Abdelrahman, Eslam, Sleiman, Essam, Zhu, Deyao, Ding, Jian, Elhoseiny, Mohamed |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Goldfish: Vision-Language Understanding of Arbitrarily Long Videos
par: Ataallah, Kirolos, et autres
Publié: (2024)
par: Ataallah, Kirolos, et autres
Publié: (2024)
InfiniBench: A Benchmark for Large Multi-Modal Models in Long-Form Movies and TV Shows
par: Ataallah, Kirolos, et autres
Publié: (2024)
par: Ataallah, Kirolos, et autres
Publié: (2024)
MiniGPT-Med: Large Language Model as a General Interface for Radiology Diagnosis
par: Alkhaldi, Asma, et autres
Publié: (2024)
par: Alkhaldi, Asma, et autres
Publié: (2024)
M-MiniGPT4: Multilingual VLLM Alignment via Translated Data
par: Han, Seung Hun, et autres
Publié: (2026)
par: Han, Seung Hun, et autres
Publié: (2026)
StoryGPT-V: Large Language Models as Consistent Story Visualizers
par: Shen, Xiaoqian, et autres
Publié: (2023)
par: Shen, Xiaoqian, et autres
Publié: (2023)
MiniGPT-Reverse-Designing: Predicting Image Adjustments Utilizing MiniGPT-4
par: Azizi, Vahid, et autres
Publié: (2024)
par: Azizi, Vahid, et autres
Publié: (2024)
MiniGPT-5: Interleaved Vision-and-Language Generation via Generative Vokens
par: Zheng, Kaizhi, et autres
Publié: (2023)
par: Zheng, Kaizhi, et autres
Publié: (2023)
iMotion-LLM: Instruction-Conditioned Trajectory Generation
par: Felemban, Abdulwahab, et autres
Publié: (2024)
par: Felemban, Abdulwahab, et autres
Publié: (2024)
Vgent: Graph-based Retrieval-Reasoning-Augmented Generation For Long Video Understanding
par: Shen, Xiaoqian, et autres
Publié: (2025)
par: Shen, Xiaoqian, et autres
Publié: (2025)
MiniGPT: Rebuilding GPT from First Principles
par: Joseph, Jibin
Publié: (2026)
par: Joseph, Jibin
Publié: (2026)
CoT3DRef: Chain-of-Thoughts Data-Efficient 3D Visual Grounding
par: Abdelrahman, Eslam, et autres
Publié: (2023)
par: Abdelrahman, Eslam, et autres
Publié: (2023)
MiniGPT-Pancreas: Multimodal Large Language Model for Pancreas Cancer Classification and Detection
par: Moglia, Andrea, et autres
Publié: (2024)
par: Moglia, Andrea, et autres
Publié: (2024)
Kestrel: 3D Multimodal LLM for Part-Aware Grounded Description
par: Ahmed, Mahmoud, et autres
Publié: (2024)
par: Ahmed, Mahmoud, et autres
Publié: (2024)
Zoom-Zero: Reinforced Coarse-to-Fine Video Understanding via Temporal Zoom-in
par: Shen, Xiaoqian, et autres
Publié: (2025)
par: Shen, Xiaoqian, et autres
Publié: (2025)
VRSBench: A Versatile Vision-Language Benchmark Dataset for Remote Sensing Image Understanding
par: Li, Xiang, et autres
Publié: (2024)
par: Li, Xiang, et autres
Publié: (2024)
STORM: Token-Efficient Long Video Understanding for Multimodal LLMs
par: Jiang, Jindong, et autres
Publié: (2025)
par: Jiang, Jindong, et autres
Publié: (2025)
Mobile-VideoGPT: Fast and Accurate Model for Mobile Video Understanding
par: Shaker, Abdelrahman, et autres
Publié: (2025)
par: Shaker, Abdelrahman, et autres
Publié: (2025)
ToddlerDiffusion: Interactive Structured Image Generation with Cascaded Schrödinger Bridge
par: Abdelrahman, Eslam, et autres
Publié: (2023)
par: Abdelrahman, Eslam, et autres
Publié: (2023)
Time Blindness: Why Video-Language Models Can't See What Humans Can?
par: Upadhyay, Ujjwal, et autres
Publié: (2025)
par: Upadhyay, Ujjwal, et autres
Publié: (2025)
MiniGPT-3D: Efficiently Aligning 3D Point Clouds with Large Language Models using 2D Priors
par: Tang, Yuan, et autres
Publié: (2024)
par: Tang, Yuan, et autres
Publié: (2024)
Learning Video Context as Interleaved Multimodal Sequences
par: Lin, Kevin Qinghong, et autres
Publié: (2024)
par: Lin, Kevin Qinghong, et autres
Publié: (2024)
Principles of Visual Tokens for Efficient Video Understanding
par: Hao, Xinyue, et autres
Publié: (2024)
par: Hao, Xinyue, et autres
Publié: (2024)
Affective Visual Dialog: A Large-Scale Benchmark for Emotional Reasoning Based on Visually Grounded Conversations
par: Haydarov, Kilichbek, et autres
Publié: (2023)
par: Haydarov, Kilichbek, et autres
Publié: (2023)
VideoMathQA: Benchmarking Mathematical Reasoning via Multimodal Understanding in Videos
par: Rasheed, Hanoona, et autres
Publié: (2025)
par: Rasheed, Hanoona, et autres
Publié: (2025)
REVISOR: Beyond Textual Reflection, Towards Multimodal Introspective Reasoning in Long-Form Video Understanding
par: Li, Jiaze, et autres
Publié: (2025)
par: Li, Jiaze, et autres
Publié: (2025)
Mixup Helps Understanding Multimodal Video Better
par: Ma, Xiaoyu, et autres
Publié: (2025)
par: Ma, Xiaoyu, et autres
Publié: (2025)
FishNet++: Analyzing the capabilities of Multimodal Large Language Models in marine biology
par: Khan, Faizan Farooq, et autres
Publié: (2025)
par: Khan, Faizan Farooq, et autres
Publié: (2025)
LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token
par: Zhang, Shaolei, et autres
Publié: (2025)
par: Zhang, Shaolei, et autres
Publié: (2025)
Benchmarking the Trustworthiness in Multimodal LLMs for Video Understanding
par: Wang, Youze, et autres
Publié: (2025)
par: Wang, Youze, et autres
Publié: (2025)
Sink-Token-Aware Pruning for Fine-Grained Video Understanding in Efficient Video LLMs
par: Kim, Kibum, et autres
Publié: (2026)
par: Kim, Kibum, et autres
Publié: (2026)
TapToTab : Video-Based Guitar Tabs Generation using AI and Audio Analysis
par: Ghaleb, Ali, et autres
Publié: (2024)
par: Ghaleb, Ali, et autres
Publié: (2024)
LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding
par: Shen, Xiaoqian, et autres
Publié: (2024)
par: Shen, Xiaoqian, et autres
Publié: (2024)
LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding
par: Wu, Haoning, et autres
Publié: (2024)
par: Wu, Haoning, et autres
Publié: (2024)
Video Token Sparsification for Efficient Multimodal LLMs in Autonomous Driving
par: Ma, Yunsheng, et autres
Publié: (2024)
par: Ma, Yunsheng, et autres
Publié: (2024)
Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning
par: Ghazanfari, Sara, et autres
Publié: (2025)
par: Ghazanfari, Sara, et autres
Publié: (2025)
StreamingAssistant: Efficient Visual Token Pruning for Accelerating Online Video Understanding
par: Jin, Xinqi, et autres
Publié: (2025)
par: Jin, Xinqi, et autres
Publié: (2025)
The Cost of Context: Mitigating Textual Bias in Multimodal Retrieval-Augmented Generation
par: Jung, Hoin, et autres
Publié: (2026)
par: Jung, Hoin, et autres
Publié: (2026)
VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding
par: Kim, Younggun, et autres
Publié: (2025)
par: Kim, Younggun, et autres
Publié: (2025)
Token Activation Map to Visually Explain Multimodal LLMs
par: Li, Yi, et autres
Publié: (2025)
par: Li, Yi, et autres
Publié: (2025)
Liquid biopsy in genitourinary oncology: Current clinical applications and future prospects across prostate, bladder, and renal cancers
par: Kirolos Eskandar
Publié: (2025)
par: Kirolos Eskandar
Publié: (2025)
Documents similaires
-
Goldfish: Vision-Language Understanding of Arbitrarily Long Videos
par: Ataallah, Kirolos, et autres
Publié: (2024) -
InfiniBench: A Benchmark for Large Multi-Modal Models in Long-Form Movies and TV Shows
par: Ataallah, Kirolos, et autres
Publié: (2024) -
MiniGPT-Med: Large Language Model as a General Interface for Radiology Diagnosis
par: Alkhaldi, Asma, et autres
Publié: (2024) -
M-MiniGPT4: Multilingual VLLM Alignment via Translated Data
par: Han, Seung Hun, et autres
Publié: (2026) -
StoryGPT-V: Large Language Models as Consistent Story Visualizers
par: Shen, Xiaoqian, et autres
Publié: (2023)