Guardado en:
| Autores principales: | Felfeliyan, Banafshe, Zhou, Yuyue, Ghosh, Shrimanti, Kupper, Jessica, Liu, Shaobo, Hareendranathan, Abhilash, Jaremko, Jacob L. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2401.06331 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
FlexICL: A Flexible Visual In-context Learning Framework for Elbow and Wrist Ultrasound Segmentation
por: Zhou, Yuyue, et al.
Publicado: (2025)
por: Zhou, Yuyue, et al.
Publicado: (2025)
A Simple Framework Uniting Visual In-context Learning with Masked Image Modeling to Improve Ultrasound Segmentation
por: Zhou, Yuyue, et al.
Publicado: (2024)
por: Zhou, Yuyue, et al.
Publicado: (2024)
Sam2Rad: A Segmentation Model for Medical Images with Learnable Prompts
por: Wahd, Assefa Seyoum, et al.
Publicado: (2024)
por: Wahd, Assefa Seyoum, et al.
Publicado: (2024)
Robust Cross-Domain Generalization Using Unlabeled Target Data with Source-Domain Supervision
por: Zhou, Yuyue, et al.
Publicado: (2026)
por: Zhou, Yuyue, et al.
Publicado: (2026)
Time-Contrastive Pretraining for In-Context Image and Video Segmentation
por: Wahd, Assefa, et al.
Publicado: (2025)
por: Wahd, Assefa, et al.
Publicado: (2025)
Reinforcement Learning for Ultrasound Image Analysis A Comprehensive Review of Advances and Applications
por: Ezzelarab, Maha, et al.
Publicado: (2025)
por: Ezzelarab, Maha, et al.
Publicado: (2025)
Retuve: Automated Multi-Modality Analysis of Hip Dysplasia with Open Source AI
por: McArthur, Adam, et al.
Publicado: (2025)
por: McArthur, Adam, et al.
Publicado: (2025)
$\left|\,\circlearrowright\,\boxed{\text{BUS}}\,\right|$: A Large and Diverse Multimodal Benchmark for evaluating the ability of Vision-Language Models to understand Rebus Puzzles
por: Das, Trishanu, et al.
Publicado: (2025)
por: Das, Trishanu, et al.
Publicado: (2025)
Knee Osteoarthritis Severity Prediction using an Attentive Multi-Scale Deep Convolutional Neural Network
por: Jain, Rohit Kumar, et al.
Publicado: (2021)
por: Jain, Rohit Kumar, et al.
Publicado: (2021)
Assessing and Learning Alignment of Unimodal Vision and Language Models
por: Zhang, Le, et al.
Publicado: (2024)
por: Zhang, Le, et al.
Publicado: (2024)
Diversity Matters: Revisiting Test-Time Compute in Vision-Language Models
por: Tong, Yijie, et al.
Publicado: (2026)
por: Tong, Yijie, et al.
Publicado: (2026)
Bridging Hidden States in Vision-Language Models
por: Fein-Ashley, Benjamin, et al.
Publicado: (2025)
por: Fein-Ashley, Benjamin, et al.
Publicado: (2025)
Real Time Emotion Analysis Using Deep Learning for Education, Entertainment, and Beyond
por: Khuntia, Abhilash, et al.
Publicado: (2024)
por: Khuntia, Abhilash, et al.
Publicado: (2024)
Disease-informed Adaptation of Vision-Language Models
por: Zhang, Jiajin, et al.
Publicado: (2024)
por: Zhang, Jiajin, et al.
Publicado: (2024)
Do Vision Language Models Need to Process Image Tokens?
por: Ghosh, Sambit, et al.
Publicado: (2026)
por: Ghosh, Sambit, et al.
Publicado: (2026)
VL-OrdinalFormer: Vision Language Guided Ordinal Transformers for Interpretable Knee Osteoarthritis Grading
por: Ullah, Zahid, et al.
Publicado: (2025)
por: Ullah, Zahid, et al.
Publicado: (2025)
Bridging Visual Representation and Reinforcement Learning from Verifiable Rewards in Large Vision-Language Models
por: Han, Yuhang, et al.
Publicado: (2026)
por: Han, Yuhang, et al.
Publicado: (2026)
H-SemiS: Hierarchical Fusion of Semi and Self-Supervised Learning for Knee Osteoarthritis Severity Grading
por: Raghaw, Chandravardhan Singh, et al.
Publicado: (2026)
por: Raghaw, Chandravardhan Singh, et al.
Publicado: (2026)
Open World Scene Graph Generation using Vision Language Models
por: Dutta, Amartya, et al.
Publicado: (2025)
por: Dutta, Amartya, et al.
Publicado: (2025)
MarineEval: Assessing the Marine Intelligence of Vision-Language Models
por: Wong, YuK-Kwan, et al.
Publicado: (2025)
por: Wong, YuK-Kwan, et al.
Publicado: (2025)
FETAL-GAUGE: A Benchmark for Assessing Vision-Language Models in Fetal Ultrasound
por: Alasmawi, Hussain, et al.
Publicado: (2025)
por: Alasmawi, Hussain, et al.
Publicado: (2025)
Assessing the Geolocation Capabilities, Limitations and Societal Risks of Generative Vision-Language Models
por: Grainge, Oliver, et al.
Publicado: (2025)
por: Grainge, Oliver, et al.
Publicado: (2025)
When Background Matters: Breaking Medical Vision Language Models by Transferable Attack
por: Ghosh, Akash, et al.
Publicado: (2026)
por: Ghosh, Akash, et al.
Publicado: (2026)
What and Where to Adapt: Structure-Semantics Co-Tuning for Machine Vision Compression via Synergistic Adapters
por: Liu, Shaobo, et al.
Publicado: (2026)
por: Liu, Shaobo, et al.
Publicado: (2026)
A Vision-Language Foundation Model for Leaf Disease Identification
por: Quoc, Khang Nguyen, et al.
Publicado: (2025)
por: Quoc, Khang Nguyen, et al.
Publicado: (2025)
Benchmarking Skeleton-based Motion Encoder Models for Clinical Applications: Estimating Parkinson's Disease Severity in Walking Sequences
por: Adeli, Vida, et al.
Publicado: (2024)
por: Adeli, Vida, et al.
Publicado: (2024)
Advanced Smart City Monitoring: Real-Time Identification of Indian Citizen Attributes
por: Kale, Shubham, et al.
Publicado: (2024)
por: Kale, Shubham, et al.
Publicado: (2024)
Assessing Privacy Preservation and Utility in Online Vision-Language Models
por: Chaudhari, Karmesh Siddharam, et al.
Publicado: (2026)
por: Chaudhari, Karmesh Siddharam, et al.
Publicado: (2026)
Shifting Focus: From Global Semantics to Local Prominent Features in Swin-Transformer for Knee Osteoarthritis Severity Assessment
por: Sekhri, Aymen, et al.
Publicado: (2024)
por: Sekhri, Aymen, et al.
Publicado: (2024)
Transforming Precision: A Comparative Analysis of Vision Transformers, CNNs, and Traditional ML for Knee Osteoarthritis Severity Diagnosis
por: Apon, Tasnim Sakib, et al.
Publicado: (2024)
por: Apon, Tasnim Sakib, et al.
Publicado: (2024)
Rethinking Overlooked Aspects in Vision-Language Models
por: Liu, Yuan, et al.
Publicado: (2024)
por: Liu, Yuan, et al.
Publicado: (2024)
Knowledge-Driven Vision-Language Model for Plexus Detection in Hirschsprung's Disease
por: Megahed, Youssef, et al.
Publicado: (2025)
por: Megahed, Youssef, et al.
Publicado: (2025)
Do Vision-Language Models Understand Compound Nouns?
por: Kumar, Sonal, et al.
Publicado: (2024)
por: Kumar, Sonal, et al.
Publicado: (2024)
Stacked Ensemble of Fine-Tuned CNNs for Knee Osteoarthritis Severity Grading
por: Gupta, Adarsh, et al.
Publicado: (2025)
por: Gupta, Adarsh, et al.
Publicado: (2025)
Uncertainty-Aware Knowledge Distillation for Multimodal Large Language Models
por: Sun, Jingchen, et al.
Publicado: (2026)
por: Sun, Jingchen, et al.
Publicado: (2026)
POINTS1.5: Building a Vision-Language Model towards Real World Applications
por: Liu, Yuan, et al.
Publicado: (2024)
por: Liu, Yuan, et al.
Publicado: (2024)
Visual Cues of Gender and Race are Associated with Stereotyping in Vision-Language Models
por: Lee, Messi H. J., et al.
Publicado: (2025)
por: Lee, Messi H. J., et al.
Publicado: (2025)
ChronusOmni: Improving Time Awareness of Omni Large Language Models
por: Chen, Yijing, et al.
Publicado: (2025)
por: Chen, Yijing, et al.
Publicado: (2025)
YesBut: A High-Quality Annotated Multimodal Dataset for evaluating Satire Comprehension capability of Vision-Language Models
por: Nandy, Abhilash, et al.
Publicado: (2024)
por: Nandy, Abhilash, et al.
Publicado: (2024)
Ocean-OCR: Towards General OCR Application via a Vision-Language Model
por: Chen, Song, et al.
Publicado: (2025)
por: Chen, Song, et al.
Publicado: (2025)
Ejemplares similares
-
FlexICL: A Flexible Visual In-context Learning Framework for Elbow and Wrist Ultrasound Segmentation
por: Zhou, Yuyue, et al.
Publicado: (2025) -
A Simple Framework Uniting Visual In-context Learning with Masked Image Modeling to Improve Ultrasound Segmentation
por: Zhou, Yuyue, et al.
Publicado: (2024) -
Sam2Rad: A Segmentation Model for Medical Images with Learnable Prompts
por: Wahd, Assefa Seyoum, et al.
Publicado: (2024) -
Robust Cross-Domain Generalization Using Unlabeled Target Data with Source-Domain Supervision
por: Zhou, Yuyue, et al.
Publicado: (2026) -
Time-Contrastive Pretraining for In-Context Image and Video Segmentation
por: Wahd, Assefa, et al.
Publicado: (2025)