EVTP-IVS: Effective Visual Token Pruning For Unifying Instruction Visual Segmentation In Multi-Modal Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Zhu, Wenhui, Chen, Xiwen, Wang, Zhipeng, Tang, Shao, Ghosh, Sayan, Dong, Xuanzhao, Koner, Rajat, Wang, Yalin |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
STA-Unet: Rethink the semantic redundant for Medical Imaging Segmentation
by: Vasa, Vamsi Krishna, et al.
Published: (2024)
by: Vasa, Vamsi Krishna, et al.
Published: (2024)
EViT-Unet: U-Net Like Efficient Vision Transformer for Medical Image Segmentation on Mobile and Edge Devices
by: Li, Xin, et al.
Published: (2024)
by: Li, Xin, et al.
Published: (2024)
SelfReg-UNet: Self-Regularized UNet for Medical Image Segmentation
by: Zhu, Wenhui, et al.
Published: (2024)
by: Zhu, Wenhui, et al.
Published: (2024)
Cracking Instance Jigsaw Puzzles: An Alternative to Multiple Instance Learning for Whole Slide Image Analysis
by: Chen, Xiwen, et al.
Published: (2025)
by: Chen, Xiwen, et al.
Published: (2025)
CUNSB-RFIE: Context-aware Unpaired Neural Schrödinger Bridge in Retinal Fundus Image Enhancement
by: Dong, Xuanzhao, et al.
Published: (2024)
by: Dong, Xuanzhao, et al.
Published: (2024)
DGR-MIL: Exploring Diverse Global Representation in Multiple Instance Learning for Whole Slide Image Classification
by: Zhu, Wenhui, et al.
Published: (2024)
by: Zhu, Wenhui, et al.
Published: (2024)
TPOT: Topology Preserving Optimal Transport in Retinal Fundus Image Enhancement
by: Dong, Xuanzhao, et al.
Published: (2024)
by: Dong, Xuanzhao, et al.
Published: (2024)
Modality Exchange Network for Retinogeniculate Visual Pathway Segmentation
by: Han, Hua, et al.
Published: (2024)
by: Han, Hua, et al.
Published: (2024)
How Effective Can Dropout Be in Multiple Instance Learning ?
by: Zhu, Wenhui, et al.
Published: (2025)
by: Zhu, Wenhui, et al.
Published: (2025)
nnMobileNet: Rethinking CNN for Retinopathy Research
by: Zhu, Wenhui, et al.
Published: (2023)
by: Zhu, Wenhui, et al.
Published: (2023)
EyeBench: A Call for More Rigorous Evaluation of Retinal Image Enhancement
by: Zhu, Wenhui, et al.
Published: (2025)
by: Zhu, Wenhui, et al.
Published: (2025)
OTPrune: Distribution-Aligned Visual Token Pruning via Optimal Transport
by: Chen, Xiwen, et al.
Published: (2026)
by: Chen, Xiwen, et al.
Published: (2026)
PVPUFormer: Probabilistic Visual Prompt Unified Transformer for Interactive Image Segmentation
by: Zhang, Xu, et al.
Published: (2023)
by: Zhang, Xu, et al.
Published: (2023)
Unifying Image Processing as Visual Prompting Question Answering
by: Liu, Yihao, et al.
Published: (2023)
by: Liu, Yihao, et al.
Published: (2023)
MedM2G: Unifying Medical Multi-Modal Generation via Cross-Guided Diffusion with Visual Invariant
by: Zhan, Chenlu, et al.
Published: (2024)
by: Zhan, Chenlu, et al.
Published: (2024)
An Efficient Token Compression Framework for Visual Object Tracking
by: Wu, Weijing, et al.
Published: (2026)
by: Wu, Weijing, et al.
Published: (2026)
Visual Language Model as a Judge for Object Detection in Industrial Diagrams
by: Ghosh, Sanjukta
Published: (2025)
by: Ghosh, Sanjukta
Published: (2025)
Unified Multi-Modal Image Synthesis for Missing Modality Imputation
by: Zhang, Yue, et al.
Published: (2023)
by: Zhang, Yue, et al.
Published: (2023)
Context-Aware Optimal Transport Learning for Retinal Fundus Image Enhancement
by: Vasa, Vamsi Krishna, et al.
Published: (2024)
by: Vasa, Vamsi Krishna, et al.
Published: (2024)
Beyond GFVC: A Progressive Face Video Compression Framework with Adaptive Visual Tokens
by: Chen, Bolin, et al.
Published: (2024)
by: Chen, Bolin, et al.
Published: (2024)
Graph-Based Multi-Modal Light-weight Network for Adaptive Brain Tumor Segmentation
by: Huo, Guohao, et al.
Published: (2025)
by: Huo, Guohao, et al.
Published: (2025)
Mamba-UNet: UNet-Like Pure Visual Mamba for Medical Image Segmentation
by: Wang, Ziyang, et al.
Published: (2024)
by: Wang, Ziyang, et al.
Published: (2024)
RBAD: A Dataset and Benchmark for Retinal Vessels Branching Angle Detection
by: Wang, Hao, et al.
Published: (2024)
by: Wang, Hao, et al.
Published: (2024)
Weak-Mamba-UNet: Visual Mamba Makes CNN and ViT Work Better for Scribble-based Medical Image Segmentation
by: Wang, Ziyang, et al.
Published: (2024)
by: Wang, Ziyang, et al.
Published: (2024)
Unified Medical Image Tokenizer for Autoregressive Synthesis and Understanding
by: Ma, Chenglong, et al.
Published: (2025)
by: Ma, Chenglong, et al.
Published: (2025)
DAMM-Diffusion: Learning Divergence-Aware Multi-Modal Diffusion Model for Nanoparticles Distribution Prediction
by: Zhou, Junjie, et al.
Published: (2025)
by: Zhou, Junjie, et al.
Published: (2025)
Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation
by: Schmidt, Tanner, et al.
Published: (2025)
by: Schmidt, Tanner, et al.
Published: (2025)
Toward Zero-Shot Learning for Visual Dehazing of Urological Surgical Robots
by: Wu, Renkai, et al.
Published: (2024)
by: Wu, Renkai, et al.
Published: (2024)
$μ^2$Tokenizer: Differentiable Multi-Scale Multi-Modal Tokenizer for Radiology Report Generation
by: Li, Siyou, et al.
Published: (2025)
by: Li, Siyou, et al.
Published: (2025)
Semi-Mamba-UNet: Pixel-Level Contrastive and Pixel-Level Cross-Supervised Visual Mamba-based UNet for Semi-Supervised Medical Image Segmentation
by: Ma, Chao, et al.
Published: (2024)
by: Ma, Chao, et al.
Published: (2024)
Cross-Modal Interactive Perception Network with Mamba for Lung Tumor Segmentation in PET-CT Images
by: Mei, Jie, et al.
Published: (2025)
by: Mei, Jie, et al.
Published: (2025)
AMGFormer: Adaptive Multi-Granular Transformer for Brain Tumor Segmentation with Missing Modalities
by: Guo, Chengxiang, et al.
Published: (2026)
by: Guo, Chengxiang, et al.
Published: (2026)
Generative Visual Compression: A Review
by: Chen, Bolin, et al.
Published: (2024)
by: Chen, Bolin, et al.
Published: (2024)
Interactive Segmentation and Report Generation for CT Images
by: Gu, Yannian, et al.
Published: (2025)
by: Gu, Yannian, et al.
Published: (2025)
LF-PGVIO: A Visual-Inertial-Odometry Framework for Large Field-of-View Cameras using Points and Geodesic Segments
by: Wang, Ze, et al.
Published: (2023)
by: Wang, Ze, et al.
Published: (2023)
FCNR: Fast Compressive Neural Representation of Visualization Images
by: Lu, Yunfei, et al.
Published: (2024)
by: Lu, Yunfei, et al.
Published: (2024)
Robust Divergence Learning for Missing-Modality Segmentation
by: Cheng, Runze, et al.
Published: (2024)
by: Cheng, Runze, et al.
Published: (2024)
On The Robustness of Foundational 3D Medical Image Segmentation Models Against Imprecise Visual Prompts
by: Chattopadhyay, Soumitri, et al.
Published: (2026)
by: Chattopadhyay, Soumitri, et al.
Published: (2026)
Yuan: Yielding Unblemished Aesthetics Through A Unified Network for Visual Imperfections Removal in Generated Images
by: Yu, Zhenyu, et al.
Published: (2025)
by: Yu, Zhenyu, et al.
Published: (2025)
Universal Vessel Segmentation for Multi-Modality Retinal Images
by: Wen, Bo, et al.
Published: (2025)
by: Wen, Bo, et al.
Published: (2025)
Similar Items
-
STA-Unet: Rethink the semantic redundant for Medical Imaging Segmentation
by: Vasa, Vamsi Krishna, et al.
Published: (2024) -
EViT-Unet: U-Net Like Efficient Vision Transformer for Medical Image Segmentation on Mobile and Edge Devices
by: Li, Xin, et al.
Published: (2024) -
SelfReg-UNet: Self-Regularized UNet for Medical Image Segmentation
by: Zhu, Wenhui, et al.
Published: (2024) -
Cracking Instance Jigsaw Puzzles: An Alternative to Multiple Instance Learning for Whole Slide Image Analysis
by: Chen, Xiwen, et al.
Published: (2025) -
CUNSB-RFIE: Context-aware Unpaired Neural Schrödinger Bridge in Retinal Fundus Image Enhancement
by: Dong, Xuanzhao, et al.
Published: (2024)