VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Maaz, Muhammad, Rasheed, Hanoona, Khan, Salman, Khan, Fahad |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models
par: Maaz, Muhammad, et autres
Publié: (2023)
par: Maaz, Muhammad, et autres
Publié: (2023)
Mobile-VideoGPT: Fast and Accurate Model for Mobile Video Understanding
par: Shaker, Abdelrahman, et autres
Publié: (2025)
par: Shaker, Abdelrahman, et autres
Publié: (2025)
Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models
par: Maaz, Muhammad, et autres
Publié: (2025)
par: Maaz, Muhammad, et autres
Publié: (2025)
VideoMathQA: Benchmarking Mathematical Reasoning via Multimodal Understanding in Videos
par: Rasheed, Hanoona, et autres
Publié: (2025)
par: Rasheed, Hanoona, et autres
Publié: (2025)
Video-CoM: Interactive Video Reasoning via Chain of Manipulations
par: Rasheed, Hanoona, et autres
Publié: (2025)
par: Rasheed, Hanoona, et autres
Publié: (2025)
UNETR++: Delving into Efficient and Accurate 3D Medical Image Segmentation
par: Shaker, Abdelrahman, et autres
Publié: (2022)
par: Shaker, Abdelrahman, et autres
Publié: (2022)
PALO: A Polyglot Large Multimodal Model for 5B People
par: Maaz, Muhammad, et autres
Publié: (2024)
par: Maaz, Muhammad, et autres
Publié: (2024)
iVideoGPT: Interactive VideoGPTs are Scalable World Models
par: Wu, Jialong, et autres
Publié: (2024)
par: Wu, Jialong, et autres
Publié: (2024)
How Good is my Video LMM? Complex Video Reasoning and Robustness Evaluation Suite for Video-LMMs
par: Khattak, Muhammad Uzair, et autres
Publié: (2024)
par: Khattak, Muhammad Uzair, et autres
Publié: (2024)
VURF: A General-purpose Reasoning and Self-refinement Framework for Video Understanding
par: Mahmood, Ahmad, et autres
Publié: (2024)
par: Mahmood, Ahmad, et autres
Publié: (2024)
Video-GroundingDINO: Towards Open-Vocabulary Spatio-Temporal Video Grounding
par: Wasim, Syed Talal, et autres
Publié: (2023)
par: Wasim, Syed Talal, et autres
Publié: (2023)
VANE-Bench: Video Anomaly Evaluation Benchmark for Conversational LMMs
par: Bharadwaj, Rohit, et autres
Publié: (2024)
par: Bharadwaj, Rohit, et autres
Publié: (2024)
GLaMM: Pixel Grounding Large Multimodal Model
par: Rasheed, Hanoona, et autres
Publié: (2023)
par: Rasheed, Hanoona, et autres
Publié: (2023)
VideoGLaMM: A Large Multimodal Model for Pixel-Level Visual Grounding in Videos
par: Munasinghe, Shehan, et autres
Publié: (2024)
par: Munasinghe, Shehan, et autres
Publié: (2024)
Composed Video Retrieval via Enriched Context and Discriminative Embeddings
par: Thawakar, Omkar, et autres
Publié: (2024)
par: Thawakar, Omkar, et autres
Publié: (2024)
Beyond Simple Edits: Composed Video Retrieval with Dense Modifications
par: Thawakar, Omkar, et autres
Publié: (2025)
par: Thawakar, Omkar, et autres
Publié: (2025)
Robust-LLaVA: On the Effectiveness of Large-Scale Robust Image Encoders for Multi-modal Large Language Models
par: Malik, Hashmat Shadab, et autres
Publié: (2025)
par: Malik, Hashmat Shadab, et autres
Publié: (2025)
VideoMolmo: Spatio-Temporal Grounding Meets Pointing
par: Ahmad, Ghazi Shazan, et autres
Publié: (2025)
par: Ahmad, Ghazi Shazan, et autres
Publié: (2025)
Efficient Video Object Segmentation via Modulated Cross-Attention Memory
par: Shaker, Abdelrahman, et autres
Publié: (2024)
par: Shaker, Abdelrahman, et autres
Publié: (2024)
C-Drag: Chain-of-Thought Driven Motion Controller for Video Generation
par: Li, Yuhao, et autres
Publié: (2025)
par: Li, Yuhao, et autres
Publié: (2025)
Hierarchical Visual Prompt Learning for Continual Video Instance Segmentation
par: Dong, Jiahua, et autres
Publié: (2025)
par: Dong, Jiahua, et autres
Publié: (2025)
WorldCache: Content-Aware Caching for Accelerated Video World Models
par: Nawaz, Umair, et autres
Publié: (2026)
par: Nawaz, Umair, et autres
Publié: (2026)
Not All Modalities Are Equal: Instruction-Aware Gating for Multimodal Videos
par: Ding, Bonan, et autres
Publié: (2026)
par: Ding, Bonan, et autres
Publié: (2026)
Bring Your Dreams to Life: Continual Text-to-Video Customization
par: Dong, Jiahua, et autres
Publié: (2025)
par: Dong, Jiahua, et autres
Publié: (2025)
A Culturally-diverse Multilingual Multimodal Video Benchmark & Model
par: Shafique, Bhuiyan Sanjid, et autres
Publié: (2025)
par: Shafique, Bhuiyan Sanjid, et autres
Publié: (2025)
UniMed-CLIP: Towards a Unified Image-Text Pretraining Paradigm for Diverse Medical Imaging Modalities
par: Khattak, Muhammad Uzair, et autres
Publié: (2024)
par: Khattak, Muhammad Uzair, et autres
Publié: (2024)
Self-Distilled Masked Auto-Encoders are Efficient Video Anomaly Detectors
par: Ristea, Nicolae-Catalin, et autres
Publié: (2023)
par: Ristea, Nicolae-Catalin, et autres
Publié: (2023)
Language Guided Domain Generalized Medical Image Segmentation
par: Kunhimon, Shahina, et autres
Publié: (2024)
par: Kunhimon, Shahina, et autres
Publié: (2024)
Cross-Modal Self-Training: Aligning Images and Pointclouds to Learn Classification without Labels
par: Dharmasiri, Amaya, et autres
Publié: (2024)
par: Dharmasiri, Amaya, et autres
Publié: (2024)
EoCD: Encoder only Remote Sensing Change Detection
par: Noman, Mubashir, et autres
Publié: (2026)
par: Noman, Mubashir, et autres
Publié: (2026)
Enhanced Multimodal Content Moderation of Children's Videos using Audiovisual Fusion
par: Ahmed, Syed Hammad, et autres
Publié: (2024)
par: Ahmed, Syed Hammad, et autres
Publié: (2024)
CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders
par: Ahamed, Shihab Aaqil, et autres
Publié: (2025)
par: Ahamed, Shihab Aaqil, et autres
Publié: (2025)
CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning
par: Deria, Ankan, et autres
Publié: (2026)
par: Deria, Ankan, et autres
Publié: (2026)
VideoPrism: A Foundational Visual Encoder for Video Understanding
par: Zhao, Long, et autres
Publié: (2024)
par: Zhao, Long, et autres
Publié: (2024)
Tracking Meets Large Multimodal Models for Driving Scenario Understanding
par: Ishaq, Ayesha, et autres
Publié: (2025)
par: Ishaq, Ayesha, et autres
Publié: (2025)
DEFT: Decompositional Efficient Fine-Tuning for Text-to-Image Models
par: Kumar, Komal, et autres
Publié: (2025)
par: Kumar, Komal, et autres
Publié: (2025)
Noise Crystallization and Liquid Noise: Zero-shot Video Generation using Image Diffusion Models
par: Khan, Muhammad Haaris, et autres
Publié: (2024)
par: Khan, Muhammad Haaris, et autres
Publié: (2024)
Breaking the Encoder Barrier for Seamless Video-Language Understanding
par: Li, Handong, et autres
Publié: (2025)
par: Li, Handong, et autres
Publié: (2025)
ShareGPT4Video: Improving Video Understanding and Generation with Better Captions
par: Chen, Lin, et autres
Publié: (2024)
par: Chen, Lin, et autres
Publié: (2024)
XrayGPT: Chest Radiographs Summarization using Medical Vision-Language Models
par: Thawakar, Omkar, et autres
Publié: (2023)
par: Thawakar, Omkar, et autres
Publié: (2023)
Documents similaires
-
Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models
par: Maaz, Muhammad, et autres
Publié: (2023) -
Mobile-VideoGPT: Fast and Accurate Model for Mobile Video Understanding
par: Shaker, Abdelrahman, et autres
Publié: (2025) -
Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models
par: Maaz, Muhammad, et autres
Publié: (2025) -
VideoMathQA: Benchmarking Mathematical Reasoning via Multimodal Understanding in Videos
par: Rasheed, Hanoona, et autres
Publié: (2025) -
Video-CoM: Interactive Video Reasoning via Chain of Manipulations
par: Rasheed, Hanoona, et autres
Publié: (2025)