LLaDA-MedV: Exploring Large Language Diffusion Models for Biomedical Image Understanding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dong, Xuanzhao, Zhu, Wenhui, Chen, Xiwen, Wang, Zhipeng, Qiu, Peijie, Tang, Shao, Li, Xin, Wang, Yalin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
STA-Unet: Rethink the semantic redundant for Medical Imaging Segmentation
par: Vasa, Vamsi Krishna, et autres
Publié: (2024)
par: Vasa, Vamsi Krishna, et autres
Publié: (2024)
Your Agent is More Brittle Than You Think: Uncovering Indirect Injection Vulnerabilities in Agentic LLMs
par: Zhu, Wenhui, et autres
Publié: (2026)
par: Zhu, Wenhui, et autres
Publié: (2026)
EVTP-IVS: Effective Visual Token Pruning For Unifying Instruction Visual Segmentation In Multi-Modal Large Language Models
par: Zhu, Wenhui, et autres
Publié: (2025)
par: Zhu, Wenhui, et autres
Publié: (2025)
Talk Before You Retrieve: Agent-Led Discussions for Better RAG in Medical QA
par: Dong, Xuanzhao, et autres
Publié: (2025)
par: Dong, Xuanzhao, et autres
Publié: (2025)
DGR-MIL: Exploring Diverse Global Representation in Multiple Instance Learning for Whole Slide Image Classification
par: Zhu, Wenhui, et autres
Publié: (2024)
par: Zhu, Wenhui, et autres
Publié: (2024)
AHA: Aligning Large Audio-Language Models for Reasoning Hallucinations via Counterfactual Hard Negatives
par: Chen, Yanxi, et autres
Publié: (2025)
par: Chen, Yanxi, et autres
Publié: (2025)
SODA: Semi On-Policy Black-Box Distillation for Large Language Models
par: Chen, Xiwen, et autres
Publié: (2026)
par: Chen, Xiwen, et autres
Publié: (2026)
Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models
par: Zhu, Wenhui, et autres
Publié: (2025)
par: Zhu, Wenhui, et autres
Publié: (2025)
OTPrune: Distribution-Aligned Visual Token Pruning via Optimal Transport
par: Chen, Xiwen, et autres
Publié: (2026)
par: Chen, Xiwen, et autres
Publié: (2026)
LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning
par: You, Zebin, et autres
Publié: (2025)
par: You, Zebin, et autres
Publié: (2025)
LLaDA2.0-Uni: Unifying Multimodal Understanding and Generation with Diffusion Large Language Model
par: AI, Inclusion, et autres
Publié: (2026)
par: AI, Inclusion, et autres
Publié: (2026)
Efficient Token Pruning for LLaDA-V
par: Wan, Zhewen, et autres
Publié: (2026)
par: Wan, Zhewen, et autres
Publié: (2026)
Mags-RL: Wearing Multimodal LLMs a Magnifying Glass via Agentic Reinforcement Learning For Complex Scene Reasoning
par: Dong, Xuanzhao, et autres
Publié: (2026)
par: Dong, Xuanzhao, et autres
Publié: (2026)
LLaDA-VLA: Vision Language Diffusion Action Models
par: Wen, Yuqing, et autres
Publié: (2025)
par: Wen, Yuqing, et autres
Publié: (2025)
CUNSB-RFIE: Context-aware Unpaired Neural Schrödinger Bridge in Retinal Fundus Image Enhancement
par: Dong, Xuanzhao, et autres
Publié: (2024)
par: Dong, Xuanzhao, et autres
Publié: (2024)
PDL: Regularizing Multiple Instance Learning with Progressive Dropout Layers
par: Zhu, Wenhui, et autres
Publié: (2023)
par: Zhu, Wenhui, et autres
Publié: (2023)
EyeBench: A Call for More Rigorous Evaluation of Retinal Image Enhancement
par: Zhu, Wenhui, et autres
Publié: (2025)
par: Zhu, Wenhui, et autres
Publié: (2025)
Cracking Instance Jigsaw Puzzles: An Alternative to Multiple Instance Learning for Whole Slide Image Analysis
par: Chen, Xiwen, et autres
Publié: (2025)
par: Chen, Xiwen, et autres
Publié: (2025)
RetinalGPT: A Retinal Clinical Preference Conversational Assistant Powered by Large Vision-Language Models
par: Zhu, Wenhui, et autres
Publié: (2025)
par: Zhu, Wenhui, et autres
Publié: (2025)
DRA-GRPO: Your GRPO Needs to Know Diverse Reasoning Paths for Mathematical Reasoning
par: Chen, Xiwen, et autres
Publié: (2025)
par: Chen, Xiwen, et autres
Publié: (2025)
EZBlender: Efficient 3D Editing with Plan-and-ReAct Agent
par: Wang, Hao, et autres
Publié: (2026)
par: Wang, Hao, et autres
Publié: (2026)
Bridging Restoration and Diagnosis: A Comprehensive Benchmark for Retinal Fundus Enhancement
par: Dong, Xuanzhao, et autres
Publié: (2026)
par: Dong, Xuanzhao, et autres
Publié: (2026)
VAOT: Vessel-Aware Optimal Transport for Retinal Fundus Enhancement
par: Dong, Xuanzhao, et autres
Publié: (2025)
par: Dong, Xuanzhao, et autres
Publié: (2025)
EViT-Unet: U-Net Like Efficient Vision Transformer for Medical Image Segmentation on Mobile and Edge Devices
par: Li, Xin, et autres
Publié: (2024)
par: Li, Xin, et autres
Publié: (2024)
SelfReg-UNet: Self-Regularized UNet for Medical Image Segmentation
par: Zhu, Wenhui, et autres
Publié: (2024)
par: Zhu, Wenhui, et autres
Publié: (2024)
LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion Models
par: Zhu, Fengqi, et autres
Publié: (2025)
par: Zhu, Fengqi, et autres
Publié: (2025)
SGW-GAN: Sliced Gromov-Wasserstein Guided GANs for Retinal Fundus Image Enhancement
par: Xiong, Yujian, et autres
Publié: (2026)
par: Xiong, Yujian, et autres
Publié: (2026)
Imaging Signal Recovery Using Neural Network Priors Under Uncertain Forward Model Parameters
par: Chen, Xiwen, et autres
Publié: (2024)
par: Chen, Xiwen, et autres
Publié: (2024)
LLaDA-MoE: A Sparse MoE Diffusion Language Model
par: Zhu, Fengqi, et autres
Publié: (2025)
par: Zhu, Fengqi, et autres
Publié: (2025)
Prompt Compression in Diffusion Large Language Models: Evaluating LLMLingua-2 on LLaDA
par: Huang, Sterling, et autres
Publié: (2026)
par: Huang, Sterling, et autres
Publié: (2026)
LLaDA-o: An Effective and Length-Adaptive Omni Diffusion Model
par: You, Zebin, et autres
Publié: (2026)
par: You, Zebin, et autres
Publié: (2026)
nnMobileNet: Rethinking CNN for Retinopathy Research
par: Zhu, Wenhui, et autres
Publié: (2023)
par: Zhu, Wenhui, et autres
Publié: (2023)
SC-MIL: Sparsely Coded Multiple Instance Learning for Whole Slide Image Classification
par: Qiu, Peijie, et autres
Publié: (2023)
par: Qiu, Peijie, et autres
Publié: (2023)
nnMobileNet++: Towards Efficient Hybrid Networks for Retinal Image Analysis
par: Li, Xin, et autres
Publié: (2025)
par: Li, Xin, et autres
Publié: (2025)
DSL-LLaDA: Scaling Continuous Denoising to 8B Masked Diffusion LMs
par: Yu, Longxuan, et autres
Publié: (2026)
par: Yu, Longxuan, et autres
Publié: (2026)
LLaDA2.1: Speeding Up Text Diffusion via Token Editing
par: Bie, Tiwei, et autres
Publié: (2026)
par: Bie, Tiwei, et autres
Publié: (2026)
How Effective Can Dropout Be in Multiple Instance Learning ?
par: Zhu, Wenhui, et autres
Publié: (2025)
par: Zhu, Wenhui, et autres
Publié: (2025)
AriadneMem: Threading the Maze of Lifelong Memory for LLM Agents
par: Zhu, Wenhui, et autres
Publié: (2026)
par: Zhu, Wenhui, et autres
Publié: (2026)
Many-MobileNet: Multi-Model Augmentation for Robust Retinal Disease Classification
par: Wang, Hao, et autres
Publié: (2024)
par: Wang, Hao, et autres
Publié: (2024)
LLaDA2.0: Scaling Up Diffusion Language Models to 100B
par: Bie, Tiwei, et autres
Publié: (2025)
par: Bie, Tiwei, et autres
Publié: (2025)
Documents similaires
-
STA-Unet: Rethink the semantic redundant for Medical Imaging Segmentation
par: Vasa, Vamsi Krishna, et autres
Publié: (2024) -
Your Agent is More Brittle Than You Think: Uncovering Indirect Injection Vulnerabilities in Agentic LLMs
par: Zhu, Wenhui, et autres
Publié: (2026) -
EVTP-IVS: Effective Visual Token Pruning For Unifying Instruction Visual Segmentation In Multi-Modal Large Language Models
par: Zhu, Wenhui, et autres
Publié: (2025) -
Talk Before You Retrieve: Agent-Led Discussions for Better RAG in Medical QA
par: Dong, Xuanzhao, et autres
Publié: (2025) -
DGR-MIL: Exploring Diverse Global Representation in Multiple Instance Learning for Whole Slide Image Classification
par: Zhu, Wenhui, et autres
Publié: (2024)