Effectiveness Assessment of Recent Large Vision-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jiang, Yao, Yan, Xinyu, Ji, Ge-Peng, Fu, Keren, Sun, Meijun, Xiong, Huan, Fan, Deng-Ping, Khan, Fahad Shahbaz |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LawDIS: Language-Window-based Controllable Dichotomous Image Segmentation
par: Yan, Xinyu, et autres
Publié: (2025)
par: Yan, Xinyu, et autres
Publié: (2025)
Frontiers in Intelligent Colonoscopy
par: Ji, Ge-Peng, et autres
Publié: (2024)
par: Ji, Ge-Peng, et autres
Publié: (2024)
Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models
par: Maaz, Muhammad, et autres
Publié: (2023)
par: Maaz, Muhammad, et autres
Publié: (2023)
Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model
par: Chen, Shiming, et autres
Publié: (2025)
par: Chen, Shiming, et autres
Publié: (2025)
Progressive Semantic-Guided Vision Transformer for Zero-Shot Learning
par: Chen, Shiming, et autres
Publié: (2024)
par: Chen, Shiming, et autres
Publié: (2024)
Vocabulary-free Fine-grained Visual Recognition via Enriched Contextually Grounded Vision-Language Model
par: Demidov, Dmitry, et autres
Publié: (2025)
par: Demidov, Dmitry, et autres
Publié: (2025)
Connecting Dreams with Visual Brainstorming Instruction
par: Sun, Yasheng, et autres
Publié: (2024)
par: Sun, Yasheng, et autres
Publié: (2024)
Full-Duplex Strategy for Video Object Segmentation
par: Ji, Ge-Peng, et autres
Publié: (2021)
par: Ji, Ge-Peng, et autres
Publié: (2021)
GenZSL: Generative Zero-Shot Learning Via Inductive Variational Autoencoder
par: Chen, Shiming, et autres
Publié: (2025)
par: Chen, Shiming, et autres
Publié: (2025)
Language Guided Domain Generalized Medical Image Segmentation
par: Kunhimon, Shahina, et autres
Publié: (2024)
par: Kunhimon, Shahina, et autres
Publié: (2024)
Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models
par: Maaz, Muhammad, et autres
Publié: (2025)
par: Maaz, Muhammad, et autres
Publié: (2025)
Deep Learning in Concealed Dense Prediction
par: Zhao, Pancheng, et autres
Publié: (2025)
par: Zhao, Pancheng, et autres
Publié: (2025)
Mask Factory: Towards High-quality Synthetic Data Generation for Dichotomous Image Segmentation
par: Qian, Haotian, et autres
Publié: (2024)
par: Qian, Haotian, et autres
Publié: (2024)
Robust-LLaVA: On the Effectiveness of Large-Scale Robust Image Encoders for Multi-modal Large Language Models
par: Malik, Hashmat Shadab, et autres
Publié: (2025)
par: Malik, Hashmat Shadab, et autres
Publié: (2025)
CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning
par: Deria, Ankan, et autres
Publié: (2026)
par: Deria, Ankan, et autres
Publié: (2026)
Hierarchical Self-Supervised Adversarial Training for Robust Vision Models in Histopathology
par: Malik, Hashmat Shadab, et autres
Publié: (2025)
par: Malik, Hashmat Shadab, et autres
Publié: (2025)
ObjectCompose: Evaluating Resilience of Vision-Based Models on Object-to-Background Compositional Changes
par: Malik, Hashmat Shadab, et autres
Publié: (2024)
par: Malik, Hashmat Shadab, et autres
Publié: (2024)
Efficient Localized Adaptation of Neural Weather Forecasting: A Case Study in the MENA Region
par: Munir, Muhammad Akhtar, et autres
Publié: (2024)
par: Munir, Muhammad Akhtar, et autres
Publié: (2024)
Hierarchical Text-to-Vision Self Supervised Alignment for Improved Histopathology Representation Learning
par: Watawana, Hasindri, et autres
Publié: (2024)
par: Watawana, Hasindri, et autres
Publié: (2024)
Salient Mask-Guided Vision Transformer for Fine-Grained Classification
par: Demidov, Dmitry, et autres
Publié: (2023)
par: Demidov, Dmitry, et autres
Publié: (2023)
Cross-Modal Self-Training: Aligning Images and Pointclouds to Learn Classification without Labels
par: Dharmasiri, Amaya, et autres
Publié: (2024)
par: Dharmasiri, Amaya, et autres
Publié: (2024)
Enhancing Novel Object Detection via Cooperative Foundational Models
par: Bharadwaj, Rohit, et autres
Publié: (2023)
par: Bharadwaj, Rohit, et autres
Publié: (2023)
Fast Camouflaged Object Detection via Edge-based Reversible Re-calibration Network
par: Ji, Ge-Peng, et autres
Publié: (2021)
par: Ji, Ge-Peng, et autres
Publié: (2021)
XrayGPT: Chest Radiographs Summarization using Medical Vision-Language Models
par: Thawakar, Omkar, et autres
Publié: (2023)
par: Thawakar, Omkar, et autres
Publié: (2023)
GEOBench-VLM: Benchmarking Vision-Language Models for Geospatial Tasks
par: Danish, Muhammad Sohail, et autres
Publié: (2024)
par: Danish, Muhammad Sohail, et autres
Publié: (2024)
Tracking Meets Large Multimodal Models for Driving Scenario Understanding
par: Ishaq, Ayesha, et autres
Publié: (2025)
par: Ishaq, Ayesha, et autres
Publié: (2025)
Towards Evaluating the Robustness of Visual State Space Models
par: Malik, Hashmat Shadab, et autres
Publié: (2024)
par: Malik, Hashmat Shadab, et autres
Publié: (2024)
Colon-X: Advancing Intelligent Colonoscopy toward Clinical Reasoning
par: Ji, Ge-Peng, et autres
Publié: (2025)
par: Ji, Ge-Peng, et autres
Publié: (2025)
iSeg: An Iterative Refinement-based Framework for Training-free Segmentation
par: Sun, Lin, et autres
Publié: (2024)
par: Sun, Lin, et autres
Publié: (2024)
DB-SAM: Delving into High Quality Universal Medical Image Segmentation
par: Qin, Chao, et autres
Publié: (2024)
par: Qin, Chao, et autres
Publié: (2024)
AURORA:Augmented Understanding via Structured Reasoning and Reinforcement Learning for Reference Audio-Visual Segmentation
par: Luo, Ziyang, et autres
Publié: (2025)
par: Luo, Ziyang, et autres
Publié: (2025)
Multi-Granularity Language-Guided Training for Multi-Object Tracking
par: Li, Yuhao, et autres
Publié: (2024)
par: Li, Yuhao, et autres
Publié: (2024)
VURF: A General-purpose Reasoning and Self-refinement Framework for Video Understanding
par: Mahmood, Ahmad, et autres
Publié: (2024)
par: Mahmood, Ahmad, et autres
Publié: (2024)
Learnable Weight Initialization for Volumetric Medical Image Segmentation
par: Kunhimon, Shahina, et autres
Publié: (2023)
par: Kunhimon, Shahina, et autres
Publié: (2023)
VANE-Bench: Video Anomaly Evaluation Benchmark for Conversational LMMs
par: Bharadwaj, Rohit, et autres
Publié: (2024)
par: Bharadwaj, Rohit, et autres
Publié: (2024)
ELGC-Net: Efficient Local-Global Context Aggregation for Remote Sensing Change Detection
par: Noman, Mubashir, et autres
Publié: (2024)
par: Noman, Mubashir, et autres
Publié: (2024)
Paper Circle: An Open-source Multi-agent Research Discovery and Analysis Framework
par: Kumar, Komal, et autres
Publié: (2026)
par: Kumar, Komal, et autres
Publié: (2026)
AIN: The Arabic INclusive Large Multimodal Model
par: Heakl, Ahmed, et autres
Publié: (2025)
par: Heakl, Ahmed, et autres
Publié: (2025)
Good water governance through cultural evolution along river basins: The role of UNESCO heritage sites and intangible cultural heritage
par: Shahbaz Khan
Publié: (2024)
par: Shahbaz Khan
Publié: (2024)
Portrayal of Women in Chetan Bhagat’s Novels
par: Shahbaz Khan
Publié: (2020)
par: Shahbaz Khan
Publié: (2020)
Documents similaires
-
LawDIS: Language-Window-based Controllable Dichotomous Image Segmentation
par: Yan, Xinyu, et autres
Publié: (2025) -
Frontiers in Intelligent Colonoscopy
par: Ji, Ge-Peng, et autres
Publié: (2024) -
Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models
par: Maaz, Muhammad, et autres
Publié: (2023) -
Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model
par: Chen, Shiming, et autres
Publié: (2025) -
Progressive Semantic-Guided Vision Transformer for Zero-Shot Learning
par: Chen, Shiming, et autres
Publié: (2024)