VURF: A General-purpose Reasoning and Self-refinement Framework for Video Understanding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Mahmood, Ahmad, Vayani, Ashmal, Naseer, Muzammal, Khan, Salman, Khan, Fahad Shahbaz |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Cross-Modal Self-Training: Aligning Images and Pointclouds to Learn Classification without Labels
par: Dharmasiri, Amaya, et autres
Publié: (2024)
par: Dharmasiri, Amaya, et autres
Publié: (2024)
Language Guided Domain Generalized Medical Image Segmentation
par: Kunhimon, Shahina, et autres
Publié: (2024)
par: Kunhimon, Shahina, et autres
Publié: (2024)
Hierarchical Text-to-Vision Self Supervised Alignment for Improved Histopathology Representation Learning
par: Watawana, Hasindri, et autres
Publié: (2024)
par: Watawana, Hasindri, et autres
Publié: (2024)
VANE-Bench: Video Anomaly Evaluation Benchmark for Conversational LMMs
par: Bharadwaj, Rohit, et autres
Publié: (2024)
par: Bharadwaj, Rohit, et autres
Publié: (2024)
Hierarchical Self-Supervised Adversarial Training for Robust Vision Models in Histopathology
par: Malik, Hashmat Shadab, et autres
Publié: (2025)
par: Malik, Hashmat Shadab, et autres
Publié: (2025)
Video-GroundingDINO: Towards Open-Vocabulary Spatio-Temporal Video Grounding
par: Wasim, Syed Talal, et autres
Publié: (2023)
par: Wasim, Syed Talal, et autres
Publié: (2023)
Enhancing Novel Object Detection via Cooperative Foundational Models
par: Bharadwaj, Rohit, et autres
Publié: (2023)
par: Bharadwaj, Rohit, et autres
Publié: (2023)
How Good is my Video LMM? Complex Video Reasoning and Robustness Evaluation Suite for Video-LMMs
par: Khattak, Muhammad Uzair, et autres
Publié: (2024)
par: Khattak, Muhammad Uzair, et autres
Publié: (2024)
UniMed-CLIP: Towards a Unified Image-Text Pretraining Paradigm for Diverse Medical Imaging Modalities
par: Khattak, Muhammad Uzair, et autres
Publié: (2024)
par: Khattak, Muhammad Uzair, et autres
Publié: (2024)
Towards Evaluating the Robustness of Visual State Space Models
par: Malik, Hashmat Shadab, et autres
Publié: (2024)
par: Malik, Hashmat Shadab, et autres
Publié: (2024)
Learnable Weight Initialization for Volumetric Medical Image Segmentation
par: Kunhimon, Shahina, et autres
Publié: (2023)
par: Kunhimon, Shahina, et autres
Publié: (2023)
ObjectCompose: Evaluating Resilience of Vision-Based Models on Object-to-Background Compositional Changes
par: Malik, Hashmat Shadab, et autres
Publié: (2024)
par: Malik, Hashmat Shadab, et autres
Publié: (2024)
Composed Video Retrieval via Enriched Context and Discriminative Embeddings
par: Thawakar, Omkar, et autres
Publié: (2024)
par: Thawakar, Omkar, et autres
Publié: (2024)
MedContext: Learning Contextual Cues for Efficient Volumetric Medical Segmentation
par: Gani, Hanan, et autres
Publié: (2024)
par: Gani, Hanan, et autres
Publié: (2024)
Rethinking Transformers Pre-training for Multi-Spectral Satellite Imagery
par: Noman, Mubashir, et autres
Publié: (2024)
par: Noman, Mubashir, et autres
Publié: (2024)
Align Your Prompts: Test-Time Prompting with Distribution Alignment for Zero-Shot Generalization
par: Hassan, Jameel, et autres
Publié: (2023)
par: Hassan, Jameel, et autres
Publié: (2023)
Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models
par: Maaz, Muhammad, et autres
Publié: (2023)
par: Maaz, Muhammad, et autres
Publié: (2023)
CDChat: A Large Multimodal Model for Remote Sensing Change Description
par: Noman, Mubashir, et autres
Publié: (2024)
par: Noman, Mubashir, et autres
Publié: (2024)
Robust-LLaVA: On the Effectiveness of Large-Scale Robust Image Encoders for Multi-modal Large Language Models
par: Malik, Hashmat Shadab, et autres
Publié: (2025)
par: Malik, Hashmat Shadab, et autres
Publié: (2025)
Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models
par: Maaz, Muhammad, et autres
Publié: (2025)
par: Maaz, Muhammad, et autres
Publié: (2025)
BAPLe: Backdoor Attacks on Medical Foundational Models using Prompt Learning
par: Hanif, Asif, et autres
Publié: (2024)
par: Hanif, Asif, et autres
Publié: (2024)
VideoMathQA: Benchmarking Mathematical Reasoning via Multimodal Understanding in Videos
par: Rasheed, Hanoona, et autres
Publié: (2025)
par: Rasheed, Hanoona, et autres
Publié: (2025)
Mobile-VideoGPT: Fast and Accurate Model for Mobile Video Understanding
par: Shaker, Abdelrahman, et autres
Publié: (2025)
par: Shaker, Abdelrahman, et autres
Publié: (2025)
On Evaluating Adversarial Robustness of Volumetric Medical Segmentation Models
par: Malik, Hashmat Shadab, et autres
Publié: (2024)
par: Malik, Hashmat Shadab, et autres
Publié: (2024)
Video-CoM: Interactive Video Reasoning via Chain of Manipulations
par: Rasheed, Hanoona, et autres
Publié: (2025)
par: Rasheed, Hanoona, et autres
Publié: (2025)
VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding
par: Maaz, Muhammad, et autres
Publié: (2024)
par: Maaz, Muhammad, et autres
Publié: (2024)
AgriCLIP: Adapting CLIP for Agriculture and Livestock via Domain-Specialized Cross-Model Alignment
par: Nawaz, Umair, et autres
Publié: (2024)
par: Nawaz, Umair, et autres
Publié: (2024)
LLM Blueprint: Enabling Text-to-Image Generation with Complex and Detailed Prompts
par: Gani, Hanan, et autres
Publié: (2023)
par: Gani, Hanan, et autres
Publié: (2023)
Multi-Granularity Language-Guided Training for Multi-Object Tracking
par: Li, Yuhao, et autres
Publié: (2024)
par: Li, Yuhao, et autres
Publié: (2024)
How Good is my Histopathology Vision-Language Foundation Model? A Holistic Benchmark
par: Majzoub, Roba Al, et autres
Publié: (2025)
par: Majzoub, Roba Al, et autres
Publié: (2025)
GenZSL: Generative Zero-Shot Learning Via Inductive Variational Autoencoder
par: Chen, Shiming, et autres
Publié: (2025)
par: Chen, Shiming, et autres
Publié: (2025)
Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model
par: Chen, Shiming, et autres
Publié: (2025)
par: Chen, Shiming, et autres
Publié: (2025)
VideoMolmo: Spatio-Temporal Grounding Meets Pointing
par: Ahmad, Ghazi Shazan, et autres
Publié: (2025)
par: Ahmad, Ghazi Shazan, et autres
Publié: (2025)
VideoGLaMM: A Large Multimodal Model for Pixel-Level Visual Grounding in Videos
par: Munasinghe, Shehan, et autres
Publié: (2024)
par: Munasinghe, Shehan, et autres
Publié: (2024)
Multi-modal Generation via Cross-Modal In-Context Learning
par: Kumar, Amandeep, et autres
Publié: (2024)
par: Kumar, Amandeep, et autres
Publié: (2024)
C-Drag: Chain-of-Thought Driven Motion Controller for Video Generation
par: Li, Yuhao, et autres
Publié: (2025)
par: Li, Yuhao, et autres
Publié: (2025)
AURORA:Augmented Understanding via Structured Reasoning and Reinforcement Learning for Reference Audio-Visual Segmentation
par: Luo, Ziyang, et autres
Publié: (2025)
par: Luo, Ziyang, et autres
Publié: (2025)
Progressive Semantic-Guided Vision Transformer for Zero-Shot Learning
par: Chen, Shiming, et autres
Publié: (2024)
par: Chen, Shiming, et autres
Publié: (2024)
Makeup-Guided Facial Privacy Protection via Untrained Neural Network Priors
par: Shamshad, Fahad, et autres
Publié: (2024)
par: Shamshad, Fahad, et autres
Publié: (2024)
ELGC-Net: Efficient Local-Global Context Aggregation for Remote Sensing Change Detection
par: Noman, Mubashir, et autres
Publié: (2024)
par: Noman, Mubashir, et autres
Publié: (2024)
Documents similaires
-
Cross-Modal Self-Training: Aligning Images and Pointclouds to Learn Classification without Labels
par: Dharmasiri, Amaya, et autres
Publié: (2024) -
Language Guided Domain Generalized Medical Image Segmentation
par: Kunhimon, Shahina, et autres
Publié: (2024) -
Hierarchical Text-to-Vision Self Supervised Alignment for Improved Histopathology Representation Learning
par: Watawana, Hasindri, et autres
Publié: (2024) -
VANE-Bench: Video Anomaly Evaluation Benchmark for Conversational LMMs
par: Bharadwaj, Rohit, et autres
Publié: (2024) -
Hierarchical Self-Supervised Adversarial Training for Robust Vision Models in Histopathology
par: Malik, Hashmat Shadab, et autres
Publié: (2025)