Video Patch Pruning: Efficient Video Instance Segmentation via Early Token Reduction
Fuente:
arXiv
Guardado en:
| Autores principales: | Glandorf, Patrick, Norrenbrock, Thomas, Rosenhahn, Bodo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Pruning by Block Benefit: Exploring the Properties of Vision Transformer Blocks during Domain Adaptation
por: Glandorf, Patrick, et al.
Publicado: (2025)
por: Glandorf, Patrick, et al.
Publicado: (2025)
UncertainSAM: Fast and Efficient Uncertainty Quantification of the Segment Anything Model
por: Kaiser, Timo, et al.
Publicado: (2025)
por: Kaiser, Timo, et al.
Publicado: (2025)
Q-SENN: Quantized Self-Explaining Neural Networks
por: Norrenbrock, Thomas, et al.
Publicado: (2023)
por: Norrenbrock, Thomas, et al.
Publicado: (2023)
DINO-QPM: Adapting Visual Foundation Models for Globally Interpretable Image Classification
por: Zimmermann, Robert, et al.
Publicado: (2026)
por: Zimmermann, Robert, et al.
Publicado: (2026)
QPM: Discrete Optimization for Globally Interpretable Image Classification
por: Norrenbrock, Thomas, et al.
Publicado: (2025)
por: Norrenbrock, Thomas, et al.
Publicado: (2025)
CHiQPM: Calibrated Hierarchical Interpretable Image Classification
por: Norrenbrock, Thomas, et al.
Publicado: (2025)
por: Norrenbrock, Thomas, et al.
Publicado: (2025)
Improving 3D Foot Motion Reconstruction in Markerless Monocular Human Motion Capture
por: Wehrbein, Tom, et al.
Publicado: (2026)
por: Wehrbein, Tom, et al.
Publicado: (2026)
PARSAC: Accelerating Robust Multi-Model Fitting with Parallel Sample Consensus
por: Kluger, Florian, et al.
Publicado: (2024)
por: Kluger, Florian, et al.
Publicado: (2024)
PruneVid: Visual Token Pruning for Efficient Video Large Language Models
por: Huang, Xiaohu, et al.
Publicado: (2024)
por: Huang, Xiaohu, et al.
Publicado: (2024)
Segment Any Object Model (SAOM): Real-to-Simulation Fine-Tuning Strategy for Multi-Class Multi-Instance Segmentation
por: Khan, Mariia, et al.
Publicado: (2024)
por: Khan, Mariia, et al.
Publicado: (2024)
False Negative Reduction in Video Instance Segmentation using Uncertainty Estimates
por: Maag, Kira
Publicado: (2021)
por: Maag, Kira
Publicado: (2021)
Multi-Flow: Multi-View-Enriched Normalizing Flows for Industrial Anomaly Detection
por: Kruse, Mathis, et al.
Publicado: (2025)
por: Kruse, Mathis, et al.
Publicado: (2025)
FastSTAR: Spatiotemporal Token Pruning for Efficient Autoregressive Video Synthesis
por: Yune, Sungwoong, et al.
Publicado: (2026)
por: Yune, Sungwoong, et al.
Publicado: (2026)
Language-Guided Temporal Token Pruning for Efficient VideoLLM Processing
por: Kumar, Yogesh
Publicado: (2025)
por: Kumar, Yogesh
Publicado: (2025)
UVIS: Unsupervised Video Instance Segmentation
por: Huang, Shuaiyi, et al.
Publicado: (2024)
por: Huang, Shuaiyi, et al.
Publicado: (2024)
EgoPrune: Efficient Token Pruning for Egomotion Video Reasoning in Embodied Agent
por: Li, Jiaao, et al.
Publicado: (2025)
por: Li, Jiaao, et al.
Publicado: (2025)
BUSSARD: Normalizing Flows for Bijective Universal Scene-Specific Anomalous Relationship Detection
por: Schween, Melissa, et al.
Publicado: (2026)
por: Schween, Melissa, et al.
Publicado: (2026)
Cell Tracking according to Biological Needs -- Strong Mitosis-aware Multi-Hypothesis Tracker with Aleatoric Uncertainty
por: Kaiser, Timo, et al.
Publicado: (2024)
por: Kaiser, Timo, et al.
Publicado: (2024)
HydraMix: Multi-Image Feature Mixing for Small Data Image Classification
por: Reinders, Christoph, et al.
Publicado: (2025)
por: Reinders, Christoph, et al.
Publicado: (2025)
CHOTA: A Higher Order Accuracy Metric for Cell Tracking
por: Kaiser, Timo, et al.
Publicado: (2024)
por: Kaiser, Timo, et al.
Publicado: (2024)
Efficient Video Sampling: Pruning Temporally Redundant Tokens for Faster VLM Inference
por: Bagrov, Natan, et al.
Publicado: (2025)
por: Bagrov, Natan, et al.
Publicado: (2025)
Less is More: Token-Efficient Video-QA via Adaptive Frame-Pruning and Semantic Graph Integration
por: Wang, Shaoguang, et al.
Publicado: (2025)
por: Wang, Shaoguang, et al.
Publicado: (2025)
Multi-Object Tracking Retrieval with LLaVA-Video: A Training-Free Solution to MOT25-StAG Challenge
por: Yang, Yi, et al.
Publicado: (2025)
por: Yang, Yi, et al.
Publicado: (2025)
SyncVIS: Synchronized Video Instance Segmentation
por: Zheng, Rongkun, et al.
Publicado: (2024)
por: Zheng, Rongkun, et al.
Publicado: (2024)
CAVIS: Context-Aware Video Instance Segmentation
por: Lee, Seunghun, et al.
Publicado: (2024)
por: Lee, Seunghun, et al.
Publicado: (2024)
Instance Brownian Bridge as Texts for Open-vocabulary Video Instance Segmentation
por: Cheng, Zesen, et al.
Publicado: (2024)
por: Cheng, Zesen, et al.
Publicado: (2024)
Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction
por: Jang, Huiwon, et al.
Publicado: (2024)
por: Jang, Huiwon, et al.
Publicado: (2024)
Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models
por: Li, Jinlong, et al.
Publicado: (2026)
por: Li, Jinlong, et al.
Publicado: (2026)
PM-VIS+: High-Performance Video Instance Segmentation without Video Annotation
por: Yang, Zhangjing, et al.
Publicado: (2024)
por: Yang, Zhangjing, et al.
Publicado: (2024)
A Temporal Modeling Framework for Video Pre-Training on Video Instance Segmentation
por: Zhong, Qing, et al.
Publicado: (2025)
por: Zhong, Qing, et al.
Publicado: (2025)
SDI-Paste: Synthetic Dynamic Instance Copy-Paste for Video Instance Segmentation
por: Shrestha, Sahir, et al.
Publicado: (2024)
por: Shrestha, Sahir, et al.
Publicado: (2024)
OpenVIS: Open-vocabulary Video Instance Segmentation
por: Guo, Pinxue, et al.
Publicado: (2023)
por: Guo, Pinxue, et al.
Publicado: (2023)
VISAGE: Video Instance Segmentation with Appearance-Guided Enhancement
por: Kim, Hanjung, et al.
Publicado: (2023)
por: Kim, Hanjung, et al.
Publicado: (2023)
What is Point Supervision Worth in Video Instance Segmentation?
por: Huang, Shuaiyi, et al.
Publicado: (2024)
por: Huang, Shuaiyi, et al.
Publicado: (2024)
Interpretable Decision-Making for End-to-End Autonomous Driving
por: Mirzaie, Mona, et al.
Publicado: (2025)
por: Mirzaie, Mona, et al.
Publicado: (2025)
FlowCut: Unsupervised Video Instance Segmentation via Temporal Mask Matching
por: Sari, Alp Eren, et al.
Publicado: (2025)
por: Sari, Alp Eren, et al.
Publicado: (2025)
StreamingAssistant: Efficient Visual Token Pruning for Accelerating Online Video Understanding
por: Jin, Xinqi, et al.
Publicado: (2025)
por: Jin, Xinqi, et al.
Publicado: (2025)
Utilizing Uncertainty in 2D Pose Detectors for Probabilistic 3D Human Mesh Recovery
por: Wehrbein, Tom, et al.
Publicado: (2024)
por: Wehrbein, Tom, et al.
Publicado: (2024)
Personalized 3D Human Pose and Shape Refinement
por: Wehrbein, Tom, et al.
Publicado: (2024)
por: Wehrbein, Tom, et al.
Publicado: (2024)
Prompt-based Dynamic Token Pruning for Efficient Segmentation of Medical Images
por: Dutta, Pallabi, et al.
Publicado: (2025)
por: Dutta, Pallabi, et al.
Publicado: (2025)
Ejemplares similares
-
Pruning by Block Benefit: Exploring the Properties of Vision Transformer Blocks during Domain Adaptation
por: Glandorf, Patrick, et al.
Publicado: (2025) -
UncertainSAM: Fast and Efficient Uncertainty Quantification of the Segment Anything Model
por: Kaiser, Timo, et al.
Publicado: (2025) -
Q-SENN: Quantized Self-Explaining Neural Networks
por: Norrenbrock, Thomas, et al.
Publicado: (2023) -
DINO-QPM: Adapting Visual Foundation Models for Globally Interpretable Image Classification
por: Zimmermann, Robert, et al.
Publicado: (2026) -
QPM: Discrete Optimization for Globally Interpretable Image Classification
por: Norrenbrock, Thomas, et al.
Publicado: (2025)