OTPrune: Distribution-Aligned Visual Token Pruning via Optimal Transport
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Xiwen, Zhu, Wenhui, Li, Gen, Dong, Xuanzhao, Xiong, Yujian, Wang, Hao, Qiu, Peijie, Song, Qingquan, Wang, Zhipeng, Tang, Shao, Wang, Yalin, Razi, Abolfazl |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
EVTP-IVS: Effective Visual Token Pruning For Unifying Instruction Visual Segmentation In Multi-Modal Large Language Models
por: Zhu, Wenhui, et al.
Publicado: (2025)
por: Zhu, Wenhui, et al.
Publicado: (2025)
VAOT: Vessel-Aware Optimal Transport for Retinal Fundus Enhancement
por: Dong, Xuanzhao, et al.
Publicado: (2025)
por: Dong, Xuanzhao, et al.
Publicado: (2025)
LLaDA-MedV: Exploring Large Language Diffusion Models for Biomedical Image Understanding
por: Dong, Xuanzhao, et al.
Publicado: (2025)
por: Dong, Xuanzhao, et al.
Publicado: (2025)
DGR-MIL: Exploring Diverse Global Representation in Multiple Instance Learning for Whole Slide Image Classification
por: Zhu, Wenhui, et al.
Publicado: (2024)
por: Zhu, Wenhui, et al.
Publicado: (2024)
Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models
por: Zhu, Wenhui, et al.
Publicado: (2025)
por: Zhu, Wenhui, et al.
Publicado: (2025)
AHA: Aligning Large Audio-Language Models for Reasoning Hallucinations via Counterfactual Hard Negatives
por: Chen, Yanxi, et al.
Publicado: (2025)
por: Chen, Yanxi, et al.
Publicado: (2025)
Prompt-OT: An Optimal Transport Regularization Paradigm for Knowledge Preservation in Vision-Language Model Adaptation
por: Chen, Xiwen, et al.
Publicado: (2025)
por: Chen, Xiwen, et al.
Publicado: (2025)
Imaging Signal Recovery Using Neural Network Priors Under Uncertain Forward Model Parameters
por: Chen, Xiwen, et al.
Publicado: (2024)
por: Chen, Xiwen, et al.
Publicado: (2024)
DRA-GRPO: Your GRPO Needs to Know Diverse Reasoning Paths for Mathematical Reasoning
por: Chen, Xiwen, et al.
Publicado: (2025)
por: Chen, Xiwen, et al.
Publicado: (2025)
Many-MobileNet: Multi-Model Augmentation for Robust Retinal Disease Classification
por: Wang, Hao, et al.
Publicado: (2024)
por: Wang, Hao, et al.
Publicado: (2024)
Mags-RL: Wearing Multimodal LLMs a Magnifying Glass via Agentic Reinforcement Learning For Complex Scene Reasoning
por: Dong, Xuanzhao, et al.
Publicado: (2026)
por: Dong, Xuanzhao, et al.
Publicado: (2026)
Context-Aware Optimal Transport Learning for Retinal Fundus Image Enhancement
por: Vasa, Vamsi Krishna, et al.
Publicado: (2024)
por: Vasa, Vamsi Krishna, et al.
Publicado: (2024)
SelfReg-UNet: Self-Regularized UNet for Medical Image Segmentation
por: Zhu, Wenhui, et al.
Publicado: (2024)
por: Zhu, Wenhui, et al.
Publicado: (2024)
How Effective Can Dropout Be in Multiple Instance Learning ?
por: Zhu, Wenhui, et al.
Publicado: (2025)
por: Zhu, Wenhui, et al.
Publicado: (2025)
EZBlender: Efficient 3D Editing with Plan-and-ReAct Agent
por: Wang, Hao, et al.
Publicado: (2026)
por: Wang, Hao, et al.
Publicado: (2026)
STA-Unet: Rethink the semantic redundant for Medical Imaging Segmentation
por: Vasa, Vamsi Krishna, et al.
Publicado: (2024)
por: Vasa, Vamsi Krishna, et al.
Publicado: (2024)
Cracking Instance Jigsaw Puzzles: An Alternative to Multiple Instance Learning for Whole Slide Image Analysis
por: Chen, Xiwen, et al.
Publicado: (2025)
por: Chen, Xiwen, et al.
Publicado: (2025)
Your Agent is More Brittle Than You Think: Uncovering Indirect Injection Vulnerabilities in Agentic LLMs
por: Zhu, Wenhui, et al.
Publicado: (2026)
por: Zhu, Wenhui, et al.
Publicado: (2026)
TimeMIL: Advancing Multivariate Time Series Classification via a Time-aware Multiple Instance Learning
por: Chen, Xiwen, et al.
Publicado: (2024)
por: Chen, Xiwen, et al.
Publicado: (2024)
Sequence Complementor: Complementing Transformers For Time Series Forecasting with Learnable Sequences
por: Chen, Xiwen, et al.
Publicado: (2025)
por: Chen, Xiwen, et al.
Publicado: (2025)
Bridging Restoration and Diagnosis: A Comprehensive Benchmark for Retinal Fundus Enhancement
por: Dong, Xuanzhao, et al.
Publicado: (2026)
por: Dong, Xuanzhao, et al.
Publicado: (2026)
CUNSB-RFIE: Context-aware Unpaired Neural Schrödinger Bridge in Retinal Fundus Image Enhancement
por: Dong, Xuanzhao, et al.
Publicado: (2024)
por: Dong, Xuanzhao, et al.
Publicado: (2024)
Talk Before You Retrieve: Agent-Led Discussions for Better RAG in Medical QA
por: Dong, Xuanzhao, et al.
Publicado: (2025)
por: Dong, Xuanzhao, et al.
Publicado: (2025)
FIC-TSC: Learning Time Series Classification with Fisher Information Constraint
por: Chen, Xiwen, et al.
Publicado: (2025)
por: Chen, Xiwen, et al.
Publicado: (2025)
SGW-GAN: Sliced Gromov-Wasserstein Guided GANs for Retinal Fundus Image Enhancement
por: Xiong, Yujian, et al.
Publicado: (2026)
por: Xiong, Yujian, et al.
Publicado: (2026)
Multimodal Variational Autoencoder: a Barycentric View
por: Qiu, Peijie, et al.
Publicado: (2024)
por: Qiu, Peijie, et al.
Publicado: (2024)
EyeBench: A Call for More Rigorous Evaluation of Retinal Image Enhancement
por: Zhu, Wenhui, et al.
Publicado: (2025)
por: Zhu, Wenhui, et al.
Publicado: (2025)
nnMobileNet++: Towards Efficient Hybrid Networks for Retinal Image Analysis
por: Li, Xin, et al.
Publicado: (2025)
por: Li, Xin, et al.
Publicado: (2025)
Fast 2DGS: Efficient Image Representation with Deep Gaussian Prior
por: Wang, Hao, et al.
Publicado: (2025)
por: Wang, Hao, et al.
Publicado: (2025)
SODA: Semi On-Policy Black-Box Distillation for Large Language Models
por: Chen, Xiwen, et al.
Publicado: (2026)
por: Chen, Xiwen, et al.
Publicado: (2026)
OphIn-500K: Curating Web-Scale Visual Instructions for Scaling Ophthalmic Multimodal Large Language Models
por: Dong, Xuanzhao, et al.
Publicado: (2026)
por: Dong, Xuanzhao, et al.
Publicado: (2026)
RBAD: A Dataset and Benchmark for Retinal Vessels Branching Angle Detection
por: Wang, Hao, et al.
Publicado: (2024)
por: Wang, Hao, et al.
Publicado: (2024)
PDL: Regularizing Multiple Instance Learning with Progressive Dropout Layers
por: Zhu, Wenhui, et al.
Publicado: (2023)
por: Zhu, Wenhui, et al.
Publicado: (2023)
Schrödinger Diffusion Driven Signal Recovery in 3T BOLD fMRI Using Unmatched 7T Observations
por: Xiong, Yujian, et al.
Publicado: (2025)
por: Xiong, Yujian, et al.
Publicado: (2025)
Reconstructing Retinal Visual Images from 3T fMRI Data Enhanced by Unsupervised Learning
por: Xiong, Yujian, et al.
Publicado: (2024)
por: Xiong, Yujian, et al.
Publicado: (2024)
TPOT: Topology Preserving Optimal Transport in Retinal Fundus Image Enhancement
por: Dong, Xuanzhao, et al.
Publicado: (2024)
por: Dong, Xuanzhao, et al.
Publicado: (2024)
AriadneMem: Threading the Maze of Lifelong Memory for LLM Agents
por: Zhu, Wenhui, et al.
Publicado: (2026)
por: Zhu, Wenhui, et al.
Publicado: (2026)
RetinalGPT: A Retinal Clinical Preference Conversational Assistant Powered by Large Vision-Language Models
por: Zhu, Wenhui, et al.
Publicado: (2025)
por: Zhu, Wenhui, et al.
Publicado: (2025)
FedMIL: Federated-Multiple Instance Learning for Video Analysis with Optimized DPP Scheduling
por: Bastola, Ashish, et al.
Publicado: (2024)
por: Bastola, Ashish, et al.
Publicado: (2024)
Geographical Information Alignment Boosts Traffic Analysis via Transpose Cross-attention
por: Jiang, Xiangyu, et al.
Publicado: (2024)
por: Jiang, Xiangyu, et al.
Publicado: (2024)
Ejemplares similares
-
EVTP-IVS: Effective Visual Token Pruning For Unifying Instruction Visual Segmentation In Multi-Modal Large Language Models
por: Zhu, Wenhui, et al.
Publicado: (2025) -
VAOT: Vessel-Aware Optimal Transport for Retinal Fundus Enhancement
por: Dong, Xuanzhao, et al.
Publicado: (2025) -
LLaDA-MedV: Exploring Large Language Diffusion Models for Biomedical Image Understanding
por: Dong, Xuanzhao, et al.
Publicado: (2025) -
DGR-MIL: Exploring Diverse Global Representation in Multiple Instance Learning for Whole Slide Image Classification
por: Zhu, Wenhui, et al.
Publicado: (2024) -
Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models
por: Zhu, Wenhui, et al.
Publicado: (2025)