MaMe & MaRe: Matrix-Based Token Merging and Restoration for Efficient Visual Perception and Synthesis
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Huo, Simin, Li, Ning |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
TTF: Temporal Token Fusion for Efficient Video-Language Model
von: Huo, Simin, et al.
Veröffentlicht: (2026)
von: Huo, Simin, et al.
Veröffentlicht: (2026)
MaS-VQA: A Mask-and-Select Framework for Knowledge-Based Visual Question Answering
von: Mao, Xianwei, et al.
Veröffentlicht: (2026)
von: Mao, Xianwei, et al.
Veröffentlicht: (2026)
VideoMaMa: Mask-Guided Video Matting via Generative Prior
von: Lim, Sangbeom, et al.
Veröffentlicht: (2026)
von: Lim, Sangbeom, et al.
Veröffentlicht: (2026)
MergeVQ: A Unified Framework for Visual Generation and Representation with Disentangled Token Merging and Quantization
von: Li, Siyuan, et al.
Veröffentlicht: (2025)
von: Li, Siyuan, et al.
Veröffentlicht: (2025)
Token Merging for Training-Free Semantic Binding in Text-to-Image Synthesis
von: Hu, Taihang, et al.
Veröffentlicht: (2024)
von: Hu, Taihang, et al.
Veröffentlicht: (2024)
SegMaFormer: A Hybrid State-Space and Transformer Model for Efficient Segmentation
von: Nguyen, Duy D., et al.
Veröffentlicht: (2026)
von: Nguyen, Duy D., et al.
Veröffentlicht: (2026)
Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers
von: Lee, Dong Hoon, et al.
Veröffentlicht: (2024)
von: Lee, Dong Hoon, et al.
Veröffentlicht: (2024)
InternVL-X: Advancing and Accelerating InternVL Series with Efficient Visual Token Compression
von: Lu, Dongchen, et al.
Veröffentlicht: (2025)
von: Lu, Dongchen, et al.
Veröffentlicht: (2025)
CoMa: Contextual Massing Generation with Vision-Language Models
von: Maslov, Evgenii, et al.
Veröffentlicht: (2026)
von: Maslov, Evgenii, et al.
Veröffentlicht: (2026)
MaGGIe: Masked Guided Gradual Human Instance Matting
von: Huynh, Chuong, et al.
Veröffentlicht: (2024)
von: Huynh, Chuong, et al.
Veröffentlicht: (2024)
TMCIR: Token Merge Benefits Composed Image Retrieval
von: Wang, Chaoyang, et al.
Veröffentlicht: (2025)
von: Wang, Chaoyang, et al.
Veröffentlicht: (2025)
MaPPER: Multimodal Prior-guided Parameter Efficient Tuning for Referring Expression Comprehension
von: Liu, Ting, et al.
Veröffentlicht: (2024)
von: Liu, Ting, et al.
Veröffentlicht: (2024)
MaRVL-QA: A Benchmark for Mathematical Reasoning over Visual Landscapes
von: Pande, Nilay, et al.
Veröffentlicht: (2025)
von: Pande, Nilay, et al.
Veröffentlicht: (2025)
3rd Workshop on Maritime Computer Vision (MaCVi) 2025: Challenge Results
von: Kiefer, Benjamin, et al.
Veröffentlicht: (2025)
von: Kiefer, Benjamin, et al.
Veröffentlicht: (2025)
Local Representative Token Guided Merging for Text-to-Image Generation
von: Lee, Min-Jeong, et al.
Veröffentlicht: (2025)
von: Lee, Min-Jeong, et al.
Veröffentlicht: (2025)
LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models
von: Shang, Yuzhang, et al.
Veröffentlicht: (2024)
von: Shang, Yuzhang, et al.
Veröffentlicht: (2024)
Re-purposing SAM into Efficient Visual Projectors for MLLM-Based Referring Image Segmentation
von: Yang, Xiaobo, et al.
Veröffentlicht: (2025)
von: Yang, Xiaobo, et al.
Veröffentlicht: (2025)
PR-MaGIC: Prompt Refinement Via Mask Decoder Gradient Flow For In-Context Segmentation
von: Lee, Minjae, et al.
Veröffentlicht: (2026)
von: Lee, Minjae, et al.
Veröffentlicht: (2026)
K-MaT: Knowledge-Anchored Manifold Transport for Cross-Modal Prompt Learning in Medical Imaging
von: Zeng, Jiajun, et al.
Veröffentlicht: (2026)
von: Zeng, Jiajun, et al.
Veröffentlicht: (2026)
4th Workshop on Maritime Computer Vision (MaCVi): Challenge Overview
von: Kiefer, Benjamin, et al.
Veröffentlicht: (2026)
von: Kiefer, Benjamin, et al.
Veröffentlicht: (2026)
QMoP: Query Guided Mixture-of-Projector for Efficient Visual Token Compression
von: Li, Zhongyang, et al.
Veröffentlicht: (2026)
von: Li, Zhongyang, et al.
Veröffentlicht: (2026)
Segformer++: Efficient Token-Merging Strategies for High-Resolution Semantic Segmentation
von: Kienzle, Daniel, et al.
Veröffentlicht: (2024)
von: Kienzle, Daniel, et al.
Veröffentlicht: (2024)
FLoC: Facility Location-Based Efficient Visual Token Compression for Long Video Understanding
von: Cho, Janghoon, et al.
Veröffentlicht: (2025)
von: Cho, Janghoon, et al.
Veröffentlicht: (2025)
DeepMerge: Deep-Learning-Based Region-Merging for Image Segmentation
von: Lv, Xianwei, et al.
Veröffentlicht: (2023)
von: Lv, Xianwei, et al.
Veröffentlicht: (2023)
Perceptual Group Tokenizer: Building Perception with Iterative Grouping
von: Deng, Zhiwei, et al.
Veröffentlicht: (2023)
von: Deng, Zhiwei, et al.
Veröffentlicht: (2023)
Faster Vision Mamba is Rebuilt in Minutes via Merged Token Re-training
von: Shi, Mingjia, et al.
Veröffentlicht: (2024)
von: Shi, Mingjia, et al.
Veröffentlicht: (2024)
DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception
von: Li, Xiaotong, et al.
Veröffentlicht: (2024)
von: Li, Xiaotong, et al.
Veröffentlicht: (2024)
PanFoMa: A Lightweight Foundation Model and Benchmark for Pan-Cancer
von: Huang, Xiaoshui, et al.
Veröffentlicht: (2025)
von: Huang, Xiaoshui, et al.
Veröffentlicht: (2025)
What "Not" to Detect: Negation-Aware VLMs via Structured Reasoning and Token Merging
von: Kang, Inha, et al.
Veröffentlicht: (2025)
von: Kang, Inha, et al.
Veröffentlicht: (2025)
Decouple-Then-Merge: Finetune Diffusion Models as Multi-Task Learning
von: Ma, Qianli, et al.
Veröffentlicht: (2024)
von: Ma, Qianli, et al.
Veröffentlicht: (2024)
Beyond BEV: Optimizing Point-Level Tokens for Collaborative Perception
von: Li, Yang, et al.
Veröffentlicht: (2025)
von: Li, Yang, et al.
Veröffentlicht: (2025)
AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning
von: Zhong, Yiwu, et al.
Veröffentlicht: (2024)
von: Zhong, Yiwu, et al.
Veröffentlicht: (2024)
RestoreVAR: Visual Autoregressive Generation for All-in-One Image Restoration
von: Rajagopalan, Sudarshan, et al.
Veröffentlicht: (2025)
von: Rajagopalan, Sudarshan, et al.
Veröffentlicht: (2025)
Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs
von: Hyun, Jeongseok, et al.
Veröffentlicht: (2025)
von: Hyun, Jeongseok, et al.
Veröffentlicht: (2025)
Perception Tokens Enhance Visual Reasoning in Multimodal Language Models
von: Bigverdi, Mahtab, et al.
Veröffentlicht: (2024)
von: Bigverdi, Mahtab, et al.
Veröffentlicht: (2024)
Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models
von: He, Jialuo, et al.
Veröffentlicht: (2026)
von: He, Jialuo, et al.
Veröffentlicht: (2026)
StreamingAssistant: Efficient Visual Token Pruning for Accelerating Online Video Understanding
von: Jin, Xinqi, et al.
Veröffentlicht: (2025)
von: Jin, Xinqi, et al.
Veröffentlicht: (2025)
Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference
von: Liu, Ziyan, et al.
Veröffentlicht: (2025)
von: Liu, Ziyan, et al.
Veröffentlicht: (2025)
Homogeneous Tokenizer Matters: Homogeneous Visual Tokenizer for Remote Sensing Image Understanding
von: Shao, Run, et al.
Veröffentlicht: (2024)
von: Shao, Run, et al.
Veröffentlicht: (2024)
ProMerge: Prompt and Merge for Unsupervised Instance Segmentation
von: Li, Dylan, et al.
Veröffentlicht: (2024)
von: Li, Dylan, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
TTF: Temporal Token Fusion for Efficient Video-Language Model
von: Huo, Simin, et al.
Veröffentlicht: (2026) -
MaS-VQA: A Mask-and-Select Framework for Knowledge-Based Visual Question Answering
von: Mao, Xianwei, et al.
Veröffentlicht: (2026) -
VideoMaMa: Mask-Guided Video Matting via Generative Prior
von: Lim, Sangbeom, et al.
Veröffentlicht: (2026) -
MergeVQ: A Unified Framework for Visual Generation and Representation with Disentangled Token Merging and Quantization
von: Li, Siyuan, et al.
Veröffentlicht: (2025) -
Token Merging for Training-Free Semantic Binding in Text-to-Image Synthesis
von: Hu, Taihang, et al.
Veröffentlicht: (2024)