EVTP-IVS: Effective Visual Token Pruning For Unifying Instruction Visual Segmentation In Multi-Modal Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhu, Wenhui, Chen, Xiwen, Wang, Zhipeng, Tang, Shao, Ghosh, Sayan, Dong, Xuanzhao, Koner, Rajat, Wang, Yalin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
STA-Unet: Rethink the semantic redundant for Medical Imaging Segmentation
di: Vasa, Vamsi Krishna, et al.
Pubblicazione: (2024)
di: Vasa, Vamsi Krishna, et al.
Pubblicazione: (2024)
EViT-Unet: U-Net Like Efficient Vision Transformer for Medical Image Segmentation on Mobile and Edge Devices
di: Li, Xin, et al.
Pubblicazione: (2024)
di: Li, Xin, et al.
Pubblicazione: (2024)
SelfReg-UNet: Self-Regularized UNet for Medical Image Segmentation
di: Zhu, Wenhui, et al.
Pubblicazione: (2024)
di: Zhu, Wenhui, et al.
Pubblicazione: (2024)
Cracking Instance Jigsaw Puzzles: An Alternative to Multiple Instance Learning for Whole Slide Image Analysis
di: Chen, Xiwen, et al.
Pubblicazione: (2025)
di: Chen, Xiwen, et al.
Pubblicazione: (2025)
CUNSB-RFIE: Context-aware Unpaired Neural Schrödinger Bridge in Retinal Fundus Image Enhancement
di: Dong, Xuanzhao, et al.
Pubblicazione: (2024)
di: Dong, Xuanzhao, et al.
Pubblicazione: (2024)
DGR-MIL: Exploring Diverse Global Representation in Multiple Instance Learning for Whole Slide Image Classification
di: Zhu, Wenhui, et al.
Pubblicazione: (2024)
di: Zhu, Wenhui, et al.
Pubblicazione: (2024)
TPOT: Topology Preserving Optimal Transport in Retinal Fundus Image Enhancement
di: Dong, Xuanzhao, et al.
Pubblicazione: (2024)
di: Dong, Xuanzhao, et al.
Pubblicazione: (2024)
Modality Exchange Network for Retinogeniculate Visual Pathway Segmentation
di: Han, Hua, et al.
Pubblicazione: (2024)
di: Han, Hua, et al.
Pubblicazione: (2024)
How Effective Can Dropout Be in Multiple Instance Learning ?
di: Zhu, Wenhui, et al.
Pubblicazione: (2025)
di: Zhu, Wenhui, et al.
Pubblicazione: (2025)
nnMobileNet: Rethinking CNN for Retinopathy Research
di: Zhu, Wenhui, et al.
Pubblicazione: (2023)
di: Zhu, Wenhui, et al.
Pubblicazione: (2023)
EyeBench: A Call for More Rigorous Evaluation of Retinal Image Enhancement
di: Zhu, Wenhui, et al.
Pubblicazione: (2025)
di: Zhu, Wenhui, et al.
Pubblicazione: (2025)
OTPrune: Distribution-Aligned Visual Token Pruning via Optimal Transport
di: Chen, Xiwen, et al.
Pubblicazione: (2026)
di: Chen, Xiwen, et al.
Pubblicazione: (2026)
PVPUFormer: Probabilistic Visual Prompt Unified Transformer for Interactive Image Segmentation
di: Zhang, Xu, et al.
Pubblicazione: (2023)
di: Zhang, Xu, et al.
Pubblicazione: (2023)
Unifying Image Processing as Visual Prompting Question Answering
di: Liu, Yihao, et al.
Pubblicazione: (2023)
di: Liu, Yihao, et al.
Pubblicazione: (2023)
MedM2G: Unifying Medical Multi-Modal Generation via Cross-Guided Diffusion with Visual Invariant
di: Zhan, Chenlu, et al.
Pubblicazione: (2024)
di: Zhan, Chenlu, et al.
Pubblicazione: (2024)
An Efficient Token Compression Framework for Visual Object Tracking
di: Wu, Weijing, et al.
Pubblicazione: (2026)
di: Wu, Weijing, et al.
Pubblicazione: (2026)
Visual Language Model as a Judge for Object Detection in Industrial Diagrams
di: Ghosh, Sanjukta
Pubblicazione: (2025)
di: Ghosh, Sanjukta
Pubblicazione: (2025)
Unified Multi-Modal Image Synthesis for Missing Modality Imputation
di: Zhang, Yue, et al.
Pubblicazione: (2023)
di: Zhang, Yue, et al.
Pubblicazione: (2023)
Context-Aware Optimal Transport Learning for Retinal Fundus Image Enhancement
di: Vasa, Vamsi Krishna, et al.
Pubblicazione: (2024)
di: Vasa, Vamsi Krishna, et al.
Pubblicazione: (2024)
Beyond GFVC: A Progressive Face Video Compression Framework with Adaptive Visual Tokens
di: Chen, Bolin, et al.
Pubblicazione: (2024)
di: Chen, Bolin, et al.
Pubblicazione: (2024)
Graph-Based Multi-Modal Light-weight Network for Adaptive Brain Tumor Segmentation
di: Huo, Guohao, et al.
Pubblicazione: (2025)
di: Huo, Guohao, et al.
Pubblicazione: (2025)
Mamba-UNet: UNet-Like Pure Visual Mamba for Medical Image Segmentation
di: Wang, Ziyang, et al.
Pubblicazione: (2024)
di: Wang, Ziyang, et al.
Pubblicazione: (2024)
RBAD: A Dataset and Benchmark for Retinal Vessels Branching Angle Detection
di: Wang, Hao, et al.
Pubblicazione: (2024)
di: Wang, Hao, et al.
Pubblicazione: (2024)
Weak-Mamba-UNet: Visual Mamba Makes CNN and ViT Work Better for Scribble-based Medical Image Segmentation
di: Wang, Ziyang, et al.
Pubblicazione: (2024)
di: Wang, Ziyang, et al.
Pubblicazione: (2024)
Unified Medical Image Tokenizer for Autoregressive Synthesis and Understanding
di: Ma, Chenglong, et al.
Pubblicazione: (2025)
di: Ma, Chenglong, et al.
Pubblicazione: (2025)
DAMM-Diffusion: Learning Divergence-Aware Multi-Modal Diffusion Model for Nanoparticles Distribution Prediction
di: Zhou, Junjie, et al.
Pubblicazione: (2025)
di: Zhou, Junjie, et al.
Pubblicazione: (2025)
Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation
di: Schmidt, Tanner, et al.
Pubblicazione: (2025)
di: Schmidt, Tanner, et al.
Pubblicazione: (2025)
Toward Zero-Shot Learning for Visual Dehazing of Urological Surgical Robots
di: Wu, Renkai, et al.
Pubblicazione: (2024)
di: Wu, Renkai, et al.
Pubblicazione: (2024)
$μ^2$Tokenizer: Differentiable Multi-Scale Multi-Modal Tokenizer for Radiology Report Generation
di: Li, Siyou, et al.
Pubblicazione: (2025)
di: Li, Siyou, et al.
Pubblicazione: (2025)
Semi-Mamba-UNet: Pixel-Level Contrastive and Pixel-Level Cross-Supervised Visual Mamba-based UNet for Semi-Supervised Medical Image Segmentation
di: Ma, Chao, et al.
Pubblicazione: (2024)
di: Ma, Chao, et al.
Pubblicazione: (2024)
Cross-Modal Interactive Perception Network with Mamba for Lung Tumor Segmentation in PET-CT Images
di: Mei, Jie, et al.
Pubblicazione: (2025)
di: Mei, Jie, et al.
Pubblicazione: (2025)
AMGFormer: Adaptive Multi-Granular Transformer for Brain Tumor Segmentation with Missing Modalities
di: Guo, Chengxiang, et al.
Pubblicazione: (2026)
di: Guo, Chengxiang, et al.
Pubblicazione: (2026)
Generative Visual Compression: A Review
di: Chen, Bolin, et al.
Pubblicazione: (2024)
di: Chen, Bolin, et al.
Pubblicazione: (2024)
Interactive Segmentation and Report Generation for CT Images
di: Gu, Yannian, et al.
Pubblicazione: (2025)
di: Gu, Yannian, et al.
Pubblicazione: (2025)
LF-PGVIO: A Visual-Inertial-Odometry Framework for Large Field-of-View Cameras using Points and Geodesic Segments
di: Wang, Ze, et al.
Pubblicazione: (2023)
di: Wang, Ze, et al.
Pubblicazione: (2023)
FCNR: Fast Compressive Neural Representation of Visualization Images
di: Lu, Yunfei, et al.
Pubblicazione: (2024)
di: Lu, Yunfei, et al.
Pubblicazione: (2024)
Robust Divergence Learning for Missing-Modality Segmentation
di: Cheng, Runze, et al.
Pubblicazione: (2024)
di: Cheng, Runze, et al.
Pubblicazione: (2024)
On The Robustness of Foundational 3D Medical Image Segmentation Models Against Imprecise Visual Prompts
di: Chattopadhyay, Soumitri, et al.
Pubblicazione: (2026)
di: Chattopadhyay, Soumitri, et al.
Pubblicazione: (2026)
Yuan: Yielding Unblemished Aesthetics Through A Unified Network for Visual Imperfections Removal in Generated Images
di: Yu, Zhenyu, et al.
Pubblicazione: (2025)
di: Yu, Zhenyu, et al.
Pubblicazione: (2025)
Universal Vessel Segmentation for Multi-Modality Retinal Images
di: Wen, Bo, et al.
Pubblicazione: (2025)
di: Wen, Bo, et al.
Pubblicazione: (2025)
Documenti analoghi
-
STA-Unet: Rethink the semantic redundant for Medical Imaging Segmentation
di: Vasa, Vamsi Krishna, et al.
Pubblicazione: (2024) -
EViT-Unet: U-Net Like Efficient Vision Transformer for Medical Image Segmentation on Mobile and Edge Devices
di: Li, Xin, et al.
Pubblicazione: (2024) -
SelfReg-UNet: Self-Regularized UNet for Medical Image Segmentation
di: Zhu, Wenhui, et al.
Pubblicazione: (2024) -
Cracking Instance Jigsaw Puzzles: An Alternative to Multiple Instance Learning for Whole Slide Image Analysis
di: Chen, Xiwen, et al.
Pubblicazione: (2025) -
CUNSB-RFIE: Context-aware Unpaired Neural Schrödinger Bridge in Retinal Fundus Image Enhancement
di: Dong, Xuanzhao, et al.
Pubblicazione: (2024)