BIOMEDICA: An Open Biomedical Image-Caption Archive, Dataset, and Vision-Language Models Derived from Scientific Literature
Fuente:
arXiv
Salvato in:
| Autori principali: | Lozano, Alejandro, Sun, Min Woo, Burgess, James, Chen, Liangyu, Nirschl, Jeffrey J, Gu, Jeffrey, Lopez, Ivan, Aklilu, Josiah, Katzer, Austin Wolfgang, Chiu, Collin, Rau, Anita, Wang, Xiaohan, Zhang, Yuhui, Song, Alfred Seunghoon, Tibshirani, Robert, Yeung-Levy, Serena |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Large-Scale Vision-Language Dataset Derived from Open Scientific Literature to Advance Biomedical Generalist AI
di: Lozano, Alejandro, et al.
Pubblicazione: (2025)
di: Lozano, Alejandro, et al.
Pubblicazione: (2025)
The Impact of Image Resolution on Biomedical Multimodal Large Language Models
di: Chen, Liangyu, et al.
Pubblicazione: (2025)
di: Chen, Liangyu, et al.
Pubblicazione: (2025)
Revisiting Active Learning in the Era of Vision Foundation Models
di: Gupte, Sanket Rajan, et al.
Pubblicazione: (2024)
di: Gupte, Sanket Rajan, et al.
Pubblicazione: (2024)
Zero-shot Action Localization via the Confidence of Large Vision-Language Models
di: Aklilu, Josiah, et al.
Pubblicazione: (2024)
di: Aklilu, Josiah, et al.
Pubblicazione: (2024)
Depth-guided NeRF Training via Earth Mover's Distance
di: Rau, Anita, et al.
Pubblicazione: (2024)
di: Rau, Anita, et al.
Pubblicazione: (2024)
μ-Bench: A Vision-Language Benchmark for Microscopy Understanding
di: Lozano, Alejandro, et al.
Pubblicazione: (2024)
di: Lozano, Alejandro, et al.
Pubblicazione: (2024)
Systematic Evaluation of Large Vision-Language Models for Surgical Artificial Intelligence
di: Rau, Anita, et al.
Pubblicazione: (2025)
di: Rau, Anita, et al.
Pubblicazione: (2025)
Video Action Differencing
di: Burgess, James, et al.
Pubblicazione: (2025)
di: Burgess, James, et al.
Pubblicazione: (2025)
Uncertainty-Aware Image Classification In Biomedical Imaging Using Spectral-normalized Neural Gaussian Processes
di: Meleti, Uma, et al.
Pubblicazione: (2026)
di: Meleti, Uma, et al.
Pubblicazione: (2026)
Automated Generation of Challenging Multiple-Choice Questions for Vision Language Model Evaluation
di: Zhang, Yuhui, et al.
Pubblicazione: (2025)
di: Zhang, Yuhui, et al.
Pubblicazione: (2025)
Foundation Models Secretly Understand Neural Network Weights: Enhancing Hypernetwork Architectures with Foundation Models
di: Gu, Jeffrey, et al.
Pubblicazione: (2025)
di: Gu, Jeffrey, et al.
Pubblicazione: (2025)
CellFlux: Simulating Cellular Morphology Changes via Flow Matching
di: Zhang, Yuhui, et al.
Pubblicazione: (2025)
di: Zhang, Yuhui, et al.
Pubblicazione: (2025)
VideoAgent: Long-form Video Understanding with Large Language Model as Agent
di: Wang, Xiaohan, et al.
Pubblicazione: (2024)
di: Wang, Xiaohan, et al.
Pubblicazione: (2024)
No Tokens Wasted: Leveraging Long Context in Biomedical Vision-Language Models
di: Sun, Min Woo, et al.
Pubblicazione: (2025)
di: Sun, Min Woo, et al.
Pubblicazione: (2025)
The Evaluation of Libraries: Considerations from a Research Perspective.
di: Katzer, Jeffrey
Pubblicazione: (1977)
di: Katzer, Jeffrey
Pubblicazione: (1977)
Fine-tuning MLLMs Without Forgetting Is Easier Than You Think
di: Li, He, et al.
Pubblicazione: (2026)
di: Li, He, et al.
Pubblicazione: (2026)
Transductive Visual Programming: Evolving Tool Libraries from Experience for Spatial Reasoning
di: Wu, Shengguang, et al.
Pubblicazione: (2025)
di: Wu, Shengguang, et al.
Pubblicazione: (2025)
Uncertainty-Aware Distribution-to-Distribution Flow Matching for Scientific Imaging
di: Wu, Dongxia, et al.
Pubblicazione: (2026)
di: Wu, Dongxia, et al.
Pubblicazione: (2026)
Connect, Collapse, Corrupt: Learning Cross-Modal Tasks with Uni-Modal Data
di: Zhang, Yuhui, et al.
Pubblicazione: (2024)
di: Zhang, Yuhui, et al.
Pubblicazione: (2024)
PaperSearchQA: Learning to Search and Reason over Scientific Papers with RLVR
di: Burgess, James, et al.
Pubblicazione: (2026)
di: Burgess, James, et al.
Pubblicazione: (2026)
Viewpoint Textual Inversion: Discovering Scene Representations and 3D View Control in 2D Diffusion Models
di: Burgess, James, et al.
Pubblicazione: (2023)
di: Burgess, James, et al.
Pubblicazione: (2023)
Just Shift It: Test-Time Prototype Shifting for Zero-Shot Generalization with Vision-Language Models
di: Sui, Elaine, et al.
Pubblicazione: (2024)
di: Sui, Elaine, et al.
Pubblicazione: (2024)
Feather the Throttle: Revisiting Visual Token Pruning for Vision-Language Model Acceleration
di: Endo, Mark, et al.
Pubblicazione: (2024)
di: Endo, Mark, et al.
Pubblicazione: (2024)
V-GRPO: Online Reinforcement Learning for Denoising Generative Models Is Easier than You Think
di: Tang, Bingda, et al.
Pubblicazione: (2026)
di: Tang, Bingda, et al.
Pubblicazione: (2026)
Closing the Modality Gap for Mixed Modality Search
di: Li, Binxu, et al.
Pubblicazione: (2025)
di: Li, Binxu, et al.
Pubblicazione: (2025)
Temporal Preference Optimization for Long-Form Video Understanding
di: Li, Rui, et al.
Pubblicazione: (2025)
di: Li, Rui, et al.
Pubblicazione: (2025)
NegVQA: Can Vision Language Models Understand Negation?
di: Zhang, Yuhui, et al.
Pubblicazione: (2025)
di: Zhang, Yuhui, et al.
Pubblicazione: (2025)
Why Don't They Ask Questions?
di: Swope, Mary Jane, et al.
Pubblicazione: (1972)
di: Swope, Mary Jane, et al.
Pubblicazione: (1972)
Can Large Language Models Match the Conclusions of Systematic Reviews?
di: Polzak, Christopher, et al.
Pubblicazione: (2025)
di: Polzak, Christopher, et al.
Pubblicazione: (2025)
Why are Visually-Grounded Language Models Bad at Image Classification?
di: Zhang, Yuhui, et al.
Pubblicazione: (2024)
di: Zhang, Yuhui, et al.
Pubblicazione: (2024)
Tool Verification for Test-Time Reinforcement Learning
di: Liao, Ruotong, et al.
Pubblicazione: (2026)
di: Liao, Ruotong, et al.
Pubblicazione: (2026)
MicroVQA: A Multimodal Reasoning Benchmark for Microscopy-Based Scientific Research
di: Burgess, James, et al.
Pubblicazione: (2025)
di: Burgess, James, et al.
Pubblicazione: (2025)
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
di: Deng, Andong, et al.
Pubblicazione: (2025)
di: Deng, Andong, et al.
Pubblicazione: (2025)
From Panel to Pixel: Zoom-In Vision-Language Pretraining from Biomedical Scientific Literature
di: Yuan, Kun, et al.
Pubblicazione: (2025)
di: Yuan, Kun, et al.
Pubblicazione: (2025)
Downscaling Intelligence: Exploring Perception and Reasoning Bottlenecks in Small Multimodal Models
di: Endo, Mark, et al.
Pubblicazione: (2025)
di: Endo, Mark, et al.
Pubblicazione: (2025)
CryoHype: Reconstructing a thousand cryo-EM structures with transformer-based hypernetworks
di: Gu, Jeffrey, et al.
Pubblicazione: (2025)
di: Gu, Jeffrey, et al.
Pubblicazione: (2025)
Three Forms of Stochastic Injection for Improved Distribution-to-Distribution Generative Modeling
di: Su, Shiye, et al.
Pubblicazione: (2025)
di: Su, Shiye, et al.
Pubblicazione: (2025)
Data or Language Supervision: What Makes CLIP Better than DINO?
di: Liu, Yiming, et al.
Pubblicazione: (2025)
di: Liu, Yiming, et al.
Pubblicazione: (2025)
Integral Probability Metrics Meet Neural Networks: The Radon-Kolmogorov-Smirnov Test
di: Paik, Seunghoon, et al.
Pubblicazione: (2023)
di: Paik, Seunghoon, et al.
Pubblicazione: (2023)
Basic Inequalities for First-Order Optimization with Applications to Statistical Risk Analysis
di: Paik, Seunghoon, et al.
Pubblicazione: (2025)
di: Paik, Seunghoon, et al.
Pubblicazione: (2025)
Documenti analoghi
-
A Large-Scale Vision-Language Dataset Derived from Open Scientific Literature to Advance Biomedical Generalist AI
di: Lozano, Alejandro, et al.
Pubblicazione: (2025) -
The Impact of Image Resolution on Biomedical Multimodal Large Language Models
di: Chen, Liangyu, et al.
Pubblicazione: (2025) -
Revisiting Active Learning in the Era of Vision Foundation Models
di: Gupte, Sanket Rajan, et al.
Pubblicazione: (2024) -
Zero-shot Action Localization via the Confidence of Large Vision-Language Models
di: Aklilu, Josiah, et al.
Pubblicazione: (2024) -
Depth-guided NeRF Training via Earth Mover's Distance
di: Rau, Anita, et al.
Pubblicazione: (2024)