Scaling Large Vision-Language Models for Enhanced Multimodal Comprehension In Biomedical Image Analysis
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Umeike, Robinson, Getty, Neil, Xia, Fangfang, Stevens, Rick |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Chat-Driven Text Generation and Interaction for Person Retrieval
par: Xie, Zequn, et autres
Publié: (2025)
par: Xie, Zequn, et autres
Publié: (2025)
Cytoarchitecture in Words: Weakly Supervised Vision-Language Modeling for Human Brain Microscopy
par: Sutton, Matthew, et autres
Publié: (2026)
par: Sutton, Matthew, et autres
Publié: (2026)
Accelerating Post-Tornado Disaster Assessment Using Advanced Deep Learning Models
par: Umeike, Robinson, et autres
Publié: (2024)
par: Umeike, Robinson, et autres
Publié: (2024)
MOVE: A Mixture-of-Vision-Encoders Approach for Domain-Focused Vision-Language Processing
par: Skripkin, Matvey, et autres
Publié: (2025)
par: Skripkin, Matvey, et autres
Publié: (2025)
KidsNanny: A Two-Stage Multimodal Content Moderation Pipeline Integrating Visual Classification, Object Detection, OCR, and Contextual Reasoning for Child Safety
par: Panchal, Viraj, et autres
Publié: (2026)
par: Panchal, Viraj, et autres
Publié: (2026)
Optimizing Multi-Scale Representations to Detect Effect Heterogeneity Using Earth Observation and Computer Vision: Applications to Two Anti-Poverty RCTs
par: Zhu, Fucheng Warren, et autres
Publié: (2024)
par: Zhu, Fucheng Warren, et autres
Publié: (2024)
Unified Modeling Language Code Generation from Diagram Images Using Multimodal Large Language Models
par: Bates, Averi, et autres
Publié: (2025)
par: Bates, Averi, et autres
Publié: (2025)
From Rule-Based Models to Deep Learning Transformers Architectures for Natural Language Processing and Sign Language Translation Systems: Survey, Taxonomy and Performance Evaluation
par: Shahin, Nada, et autres
Publié: (2024)
par: Shahin, Nada, et autres
Publié: (2024)
WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation
par: Niu, Yuwei, et autres
Publié: (2025)
par: Niu, Yuwei, et autres
Publié: (2025)
Semantic Similarity is a Spurious Measure of Comic Understanding: Lessons Learned from Hallucinations in a Benchmarking Experiment
par: Driggers-Ellis, Christopher, et autres
Publié: (2026)
par: Driggers-Ellis, Christopher, et autres
Publié: (2026)
GLoT: A Novel Gated-Logarithmic Transformer for Efficient Sign Language Translation
par: Shahin, Nada, et autres
Publié: (2025)
par: Shahin, Nada, et autres
Publié: (2025)
FlexDoc: Parameterized Sampling for Diverse Multilingual Synthetic Documents for Training Document Understanding Models
par: Dua, Karan, et autres
Publié: (2025)
par: Dua, Karan, et autres
Publié: (2025)
DocShield: Towards AI Document Safety via Evidence-Grounded Agentic Reasoning
par: Zeng, Fanwei, et autres
Publié: (2026)
par: Zeng, Fanwei, et autres
Publié: (2026)
Motion-Based Sign Language Video Summarization using Curvature and Torsion
par: Sartinas, Evangelos G., et autres
Publié: (2023)
par: Sartinas, Evangelos G., et autres
Publié: (2023)
Fixed-Budget Parameter-Efficient Training with Frozen Encoders Improves Multimodal Chest X-Ray Classification
par: Khan, Md Ashik, et autres
Publié: (2025)
par: Khan, Md Ashik, et autres
Publié: (2025)
ADAT: Time-Series-Aware Adaptive Transformer Architecture for Sign Language Translation
par: Shahin, Nada, et autres
Publié: (2025)
par: Shahin, Nada, et autres
Publié: (2025)
Training-Free Diffusion Priors for Text-to-Image Generation via Optimization-based Visual Inversion
par: Dell'Erba, Samuele, et autres
Publié: (2025)
par: Dell'Erba, Samuele, et autres
Publié: (2025)
Visual Aesthetic Benchmark: Can Frontier Models Judge Beauty?
par: Feng, Yichen, et autres
Publié: (2026)
par: Feng, Yichen, et autres
Publié: (2026)
Deep Learning based Key Information Extraction from Business Documents: Systematic Literature Review
par: Rombach, Alexander Michael, et autres
Publié: (2024)
par: Rombach, Alexander Michael, et autres
Publié: (2024)
Optimal Blackjack Strategy Recommender: A Comprehensive Study on Computer Vision Integration for Enhanced Gameplay
par: Gupta, Krishnanshu, et autres
Publié: (2024)
par: Gupta, Krishnanshu, et autres
Publié: (2024)
Vision transformers in domain adaptation and domain generalization: a study of robustness
par: Alijani, Shadi, et autres
Publié: (2024)
par: Alijani, Shadi, et autres
Publié: (2024)
YETI (YET to Intervene) Proactive Interventions by Multimodal AI Agents in Augmented Reality Tasks
par: Bandyopadhyay, Saptarashmi, et autres
Publié: (2025)
par: Bandyopadhyay, Saptarashmi, et autres
Publié: (2025)
PTB-XL-Image-17K: A Large-Scale Synthetic ECG Image Dataset with Comprehensive Ground Truth for Deep Learning-Based Digitization
par: Mehdi, Naqcho Ali, et autres
Publié: (2026)
par: Mehdi, Naqcho Ali, et autres
Publié: (2026)
Vision Transformer-based Model for Severity Quantification of Lung Pneumonia Using Chest X-ray Images
par: Slika, Bouthaina, et autres
Publié: (2023)
par: Slika, Bouthaina, et autres
Publié: (2023)
HATL: Hierarchical Adaptive-Transfer Learning Framework for Sign Language Machine Translation
par: Shahin, Nada, et autres
Publié: (2026)
par: Shahin, Nada, et autres
Publié: (2026)
A method for supervoxel-wise association studies of age and other non-imaging variables from coronary computed tomography angiograms
par: Öfverstedt, Johan, et autres
Publié: (2024)
par: Öfverstedt, Johan, et autres
Publié: (2024)
MdaIF: Robust One-Stop Multi-Degradation-Aware Image Fusion with Language-Driven Semantics
par: Li, Jing, et autres
Publié: (2025)
par: Li, Jing, et autres
Publié: (2025)
Defect Detection in Tire X-Ray Images: Conventional Methods Meet Deep Structures
par: Cozma, Andrei, et autres
Publié: (2024)
par: Cozma, Andrei, et autres
Publié: (2024)
Skeletonization-Based Adversarial Perturbations on Large Vision Language Model's Mathematical Text Recognition
par: Yoshida, Masatomo, et autres
Publié: (2026)
par: Yoshida, Masatomo, et autres
Publié: (2026)
DVGBench: Implicit-to-Explicit Visual Grounding Benchmark in UAV Imagery with Large Vision-Language Models
par: Zhou, Yue, et autres
Publié: (2026)
par: Zhou, Yue, et autres
Publié: (2026)
OmniFusion Technical Report
par: Goncharova, Elizaveta, et autres
Publié: (2024)
par: Goncharova, Elizaveta, et autres
Publié: (2024)
Multimodal Approaches for Visually-Rich Document Type Classification: A Comparative Analysis
par: Heyne, Catyana, et autres
Publié: (2026)
par: Heyne, Catyana, et autres
Publié: (2026)
MERIT: Modular Framework for Multimodal Misinformation Detection with Web-Grounded Reasoning
par: Shopnil, Mir Nafis Sharear, et autres
Publié: (2025)
par: Shopnil, Mir Nafis Sharear, et autres
Publié: (2025)
DisasterM3: A Remote Sensing Vision-Language Dataset for Disaster Damage Assessment and Response
par: Wang, Junjue, et autres
Publié: (2025)
par: Wang, Junjue, et autres
Publié: (2025)
Surrealistic-like Image Generation with Vision-Language Models
par: Ayten, Elif, et autres
Publié: (2024)
par: Ayten, Elif, et autres
Publié: (2024)
DIsoN: Decentralized Isolation Networks for Out-of-Distribution Detection in Medical Imaging
par: Wagner, Felix, et autres
Publié: (2025)
par: Wagner, Felix, et autres
Publié: (2025)
Synthetic Image Detection with CLIP: Understanding and Assessing Predictive Cues
par: Willi, Marco, et autres
Publié: (2026)
par: Willi, Marco, et autres
Publié: (2026)
Robust Multi-Source Covid-19 Detection in CT Images
par: Pritha, Asmita Yuki, et autres
Publié: (2026)
par: Pritha, Asmita Yuki, et autres
Publié: (2026)
TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models
par: Wang, Zeqing, et autres
Publié: (2025)
par: Wang, Zeqing, et autres
Publié: (2025)
EarthVL: A Progressive Earth Vision-Language Understanding and Generation Framework
par: Wang, Junjue, et autres
Publié: (2026)
par: Wang, Junjue, et autres
Publié: (2026)
Documents similaires
-
Chat-Driven Text Generation and Interaction for Person Retrieval
par: Xie, Zequn, et autres
Publié: (2025) -
Cytoarchitecture in Words: Weakly Supervised Vision-Language Modeling for Human Brain Microscopy
par: Sutton, Matthew, et autres
Publié: (2026) -
Accelerating Post-Tornado Disaster Assessment Using Advanced Deep Learning Models
par: Umeike, Robinson, et autres
Publié: (2024) -
MOVE: A Mixture-of-Vision-Encoders Approach for Domain-Focused Vision-Language Processing
par: Skripkin, Matvey, et autres
Publié: (2025) -
KidsNanny: A Two-Stage Multimodal Content Moderation Pipeline Integrating Visual Classification, Object Detection, OCR, and Contextual Reasoning for Child Safety
par: Panchal, Viraj, et autres
Publié: (2026)