EVTP-IVS: Effective Visual Token Pruning For Unifying Instruction Visual Segmentation In Multi-Modal Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhu, Wenhui, Chen, Xiwen, Wang, Zhipeng, Tang, Shao, Ghosh, Sayan, Dong, Xuanzhao, Koner, Rajat, Wang, Yalin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
STA-Unet: Rethink the semantic redundant for Medical Imaging Segmentation
por: Vasa, Vamsi Krishna, et al.
Publicado: (2024)
por: Vasa, Vamsi Krishna, et al.
Publicado: (2024)
EViT-Unet: U-Net Like Efficient Vision Transformer for Medical Image Segmentation on Mobile and Edge Devices
por: Li, Xin, et al.
Publicado: (2024)
por: Li, Xin, et al.
Publicado: (2024)
SelfReg-UNet: Self-Regularized UNet for Medical Image Segmentation
por: Zhu, Wenhui, et al.
Publicado: (2024)
por: Zhu, Wenhui, et al.
Publicado: (2024)
Cracking Instance Jigsaw Puzzles: An Alternative to Multiple Instance Learning for Whole Slide Image Analysis
por: Chen, Xiwen, et al.
Publicado: (2025)
por: Chen, Xiwen, et al.
Publicado: (2025)
CUNSB-RFIE: Context-aware Unpaired Neural Schrödinger Bridge in Retinal Fundus Image Enhancement
por: Dong, Xuanzhao, et al.
Publicado: (2024)
por: Dong, Xuanzhao, et al.
Publicado: (2024)
DGR-MIL: Exploring Diverse Global Representation in Multiple Instance Learning for Whole Slide Image Classification
por: Zhu, Wenhui, et al.
Publicado: (2024)
por: Zhu, Wenhui, et al.
Publicado: (2024)
TPOT: Topology Preserving Optimal Transport in Retinal Fundus Image Enhancement
por: Dong, Xuanzhao, et al.
Publicado: (2024)
por: Dong, Xuanzhao, et al.
Publicado: (2024)
Modality Exchange Network for Retinogeniculate Visual Pathway Segmentation
por: Han, Hua, et al.
Publicado: (2024)
por: Han, Hua, et al.
Publicado: (2024)
How Effective Can Dropout Be in Multiple Instance Learning ?
por: Zhu, Wenhui, et al.
Publicado: (2025)
por: Zhu, Wenhui, et al.
Publicado: (2025)
nnMobileNet: Rethinking CNN for Retinopathy Research
por: Zhu, Wenhui, et al.
Publicado: (2023)
por: Zhu, Wenhui, et al.
Publicado: (2023)
EyeBench: A Call for More Rigorous Evaluation of Retinal Image Enhancement
por: Zhu, Wenhui, et al.
Publicado: (2025)
por: Zhu, Wenhui, et al.
Publicado: (2025)
OTPrune: Distribution-Aligned Visual Token Pruning via Optimal Transport
por: Chen, Xiwen, et al.
Publicado: (2026)
por: Chen, Xiwen, et al.
Publicado: (2026)
PVPUFormer: Probabilistic Visual Prompt Unified Transformer for Interactive Image Segmentation
por: Zhang, Xu, et al.
Publicado: (2023)
por: Zhang, Xu, et al.
Publicado: (2023)
Unifying Image Processing as Visual Prompting Question Answering
por: Liu, Yihao, et al.
Publicado: (2023)
por: Liu, Yihao, et al.
Publicado: (2023)
MedM2G: Unifying Medical Multi-Modal Generation via Cross-Guided Diffusion with Visual Invariant
por: Zhan, Chenlu, et al.
Publicado: (2024)
por: Zhan, Chenlu, et al.
Publicado: (2024)
An Efficient Token Compression Framework for Visual Object Tracking
por: Wu, Weijing, et al.
Publicado: (2026)
por: Wu, Weijing, et al.
Publicado: (2026)
Visual Language Model as a Judge for Object Detection in Industrial Diagrams
por: Ghosh, Sanjukta
Publicado: (2025)
por: Ghosh, Sanjukta
Publicado: (2025)
Unified Multi-Modal Image Synthesis for Missing Modality Imputation
por: Zhang, Yue, et al.
Publicado: (2023)
por: Zhang, Yue, et al.
Publicado: (2023)
Context-Aware Optimal Transport Learning for Retinal Fundus Image Enhancement
por: Vasa, Vamsi Krishna, et al.
Publicado: (2024)
por: Vasa, Vamsi Krishna, et al.
Publicado: (2024)
Beyond GFVC: A Progressive Face Video Compression Framework with Adaptive Visual Tokens
por: Chen, Bolin, et al.
Publicado: (2024)
por: Chen, Bolin, et al.
Publicado: (2024)
Graph-Based Multi-Modal Light-weight Network for Adaptive Brain Tumor Segmentation
por: Huo, Guohao, et al.
Publicado: (2025)
por: Huo, Guohao, et al.
Publicado: (2025)
Mamba-UNet: UNet-Like Pure Visual Mamba for Medical Image Segmentation
por: Wang, Ziyang, et al.
Publicado: (2024)
por: Wang, Ziyang, et al.
Publicado: (2024)
RBAD: A Dataset and Benchmark for Retinal Vessels Branching Angle Detection
por: Wang, Hao, et al.
Publicado: (2024)
por: Wang, Hao, et al.
Publicado: (2024)
Weak-Mamba-UNet: Visual Mamba Makes CNN and ViT Work Better for Scribble-based Medical Image Segmentation
por: Wang, Ziyang, et al.
Publicado: (2024)
por: Wang, Ziyang, et al.
Publicado: (2024)
Unified Medical Image Tokenizer for Autoregressive Synthesis and Understanding
por: Ma, Chenglong, et al.
Publicado: (2025)
por: Ma, Chenglong, et al.
Publicado: (2025)
DAMM-Diffusion: Learning Divergence-Aware Multi-Modal Diffusion Model for Nanoparticles Distribution Prediction
por: Zhou, Junjie, et al.
Publicado: (2025)
por: Zhou, Junjie, et al.
Publicado: (2025)
Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation
por: Schmidt, Tanner, et al.
Publicado: (2025)
por: Schmidt, Tanner, et al.
Publicado: (2025)
Toward Zero-Shot Learning for Visual Dehazing of Urological Surgical Robots
por: Wu, Renkai, et al.
Publicado: (2024)
por: Wu, Renkai, et al.
Publicado: (2024)
$μ^2$Tokenizer: Differentiable Multi-Scale Multi-Modal Tokenizer for Radiology Report Generation
por: Li, Siyou, et al.
Publicado: (2025)
por: Li, Siyou, et al.
Publicado: (2025)
Semi-Mamba-UNet: Pixel-Level Contrastive and Pixel-Level Cross-Supervised Visual Mamba-based UNet for Semi-Supervised Medical Image Segmentation
por: Ma, Chao, et al.
Publicado: (2024)
por: Ma, Chao, et al.
Publicado: (2024)
Cross-Modal Interactive Perception Network with Mamba for Lung Tumor Segmentation in PET-CT Images
por: Mei, Jie, et al.
Publicado: (2025)
por: Mei, Jie, et al.
Publicado: (2025)
AMGFormer: Adaptive Multi-Granular Transformer for Brain Tumor Segmentation with Missing Modalities
por: Guo, Chengxiang, et al.
Publicado: (2026)
por: Guo, Chengxiang, et al.
Publicado: (2026)
Generative Visual Compression: A Review
por: Chen, Bolin, et al.
Publicado: (2024)
por: Chen, Bolin, et al.
Publicado: (2024)
Interactive Segmentation and Report Generation for CT Images
por: Gu, Yannian, et al.
Publicado: (2025)
por: Gu, Yannian, et al.
Publicado: (2025)
LF-PGVIO: A Visual-Inertial-Odometry Framework for Large Field-of-View Cameras using Points and Geodesic Segments
por: Wang, Ze, et al.
Publicado: (2023)
por: Wang, Ze, et al.
Publicado: (2023)
FCNR: Fast Compressive Neural Representation of Visualization Images
por: Lu, Yunfei, et al.
Publicado: (2024)
por: Lu, Yunfei, et al.
Publicado: (2024)
Robust Divergence Learning for Missing-Modality Segmentation
por: Cheng, Runze, et al.
Publicado: (2024)
por: Cheng, Runze, et al.
Publicado: (2024)
On The Robustness of Foundational 3D Medical Image Segmentation Models Against Imprecise Visual Prompts
por: Chattopadhyay, Soumitri, et al.
Publicado: (2026)
por: Chattopadhyay, Soumitri, et al.
Publicado: (2026)
Yuan: Yielding Unblemished Aesthetics Through A Unified Network for Visual Imperfections Removal in Generated Images
por: Yu, Zhenyu, et al.
Publicado: (2025)
por: Yu, Zhenyu, et al.
Publicado: (2025)
Universal Vessel Segmentation for Multi-Modality Retinal Images
por: Wen, Bo, et al.
Publicado: (2025)
por: Wen, Bo, et al.
Publicado: (2025)
Ejemplares similares
-
STA-Unet: Rethink the semantic redundant for Medical Imaging Segmentation
por: Vasa, Vamsi Krishna, et al.
Publicado: (2024) -
EViT-Unet: U-Net Like Efficient Vision Transformer for Medical Image Segmentation on Mobile and Edge Devices
por: Li, Xin, et al.
Publicado: (2024) -
SelfReg-UNet: Self-Regularized UNet for Medical Image Segmentation
por: Zhu, Wenhui, et al.
Publicado: (2024) -
Cracking Instance Jigsaw Puzzles: An Alternative to Multiple Instance Learning for Whole Slide Image Analysis
por: Chen, Xiwen, et al.
Publicado: (2025) -
CUNSB-RFIE: Context-aware Unpaired Neural Schrödinger Bridge in Retinal Fundus Image Enhancement
por: Dong, Xuanzhao, et al.
Publicado: (2024)