HiMTok: Learning Hierarchical Mask Tokens for Image Segmentation with Large Multimodal Model
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Tao, Cheng, Changxu, Wang, Lingfeng, Chen, Senda, Zhao, Wuyue |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
ALTo: Adaptive-Length Tokenizer for Autoregressive Mask Generation
von: Wang, Lingfeng, et al.
Veröffentlicht: (2025)
von: Wang, Lingfeng, et al.
Veröffentlicht: (2025)
HiDiff: Hybrid Diffusion Framework for Medical Image Segmentation
von: Chen, Tao, et al.
Veröffentlicht: (2024)
von: Chen, Tao, et al.
Veröffentlicht: (2024)
Hi-SAM: Marrying Segment Anything Model for Hierarchical Text Segmentation
von: Ye, Maoyuan, et al.
Veröffentlicht: (2024)
von: Ye, Maoyuan, et al.
Veröffentlicht: (2024)
HiPrune: Hierarchical Attention for Efficient Token Pruning in Vision-Language Models
von: Liu, Jizhihui, et al.
Veröffentlicht: (2025)
von: Liu, Jizhihui, et al.
Veröffentlicht: (2025)
SemHiTok: A Unified Image Tokenizer via Semantic-Guided Hierarchical Codebook for Multimodal Understanding and Generation
von: Chen, Zisheng, et al.
Veröffentlicht: (2025)
von: Chen, Zisheng, et al.
Veröffentlicht: (2025)
Medical Referring Image Segmentation via Next-Token Mask Prediction
von: Chen, Xinyu, et al.
Veröffentlicht: (2025)
von: Chen, Xinyu, et al.
Veröffentlicht: (2025)
Hierarchical Masked Autoregressive Models with Low-Resolution Token Pivots
von: Zheng, Guangting, et al.
Veröffentlicht: (2025)
von: Zheng, Guangting, et al.
Veröffentlicht: (2025)
RF-HiT: Rectified Flow Hierarchical Transformer for General Medical Image Segmentation
von: Djouama, Ahmed Marouane, et al.
Veröffentlicht: (2026)
von: Djouama, Ahmed Marouane, et al.
Veröffentlicht: (2026)
HiVG: Hierarchical Multimodal Fine-grained Modulation for Visual Grounding
von: Xiao, Linhui, et al.
Veröffentlicht: (2024)
von: Xiao, Linhui, et al.
Veröffentlicht: (2024)
HiCoGen: Hierarchical Compositional Text-to-Image Generation in Diffusion Models via Reinforcement Learning
von: Yang, Hongji, et al.
Veröffentlicht: (2025)
von: Yang, Hongji, et al.
Veröffentlicht: (2025)
HiTVideo: Hierarchical Tokenizers for Enhancing Text-to-Video Generation with Autoregressive Large Language Models
von: Zhou, Ziqin, et al.
Veröffentlicht: (2025)
von: Zhou, Ziqin, et al.
Veröffentlicht: (2025)
HiT: Building Mapping with Hierarchical Transformers
von: Zhang, Mingming, et al.
Veröffentlicht: (2023)
von: Zhang, Mingming, et al.
Veröffentlicht: (2023)
Beyond Next-Token Alignment: Distilling Multimodal Large Language Models via Token Interactions
von: Chen, Lin, et al.
Veröffentlicht: (2026)
von: Chen, Lin, et al.
Veröffentlicht: (2026)
Learning Mask Invariant Mutual Information for Masked Image Modeling
von: Huang, Tao, et al.
Veröffentlicht: (2025)
von: Huang, Tao, et al.
Veröffentlicht: (2025)
Grounding Everything in Tokens for Multimodal Large Language Models
von: Ren, Xiangxuan, et al.
Veröffentlicht: (2025)
von: Ren, Xiangxuan, et al.
Veröffentlicht: (2025)
TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models
von: Tan, Xudong, et al.
Veröffentlicht: (2025)
von: Tan, Xudong, et al.
Veröffentlicht: (2025)
HiLoRA: Hierarchical Low-Rank Adaptation for Personalized Federated Learning
von: Peng, Zihao, et al.
Veröffentlicht: (2026)
von: Peng, Zihao, et al.
Veröffentlicht: (2026)
Soil Image Segmentation Based on Mask R-CNN
von: Chen, Yida, et al.
Veröffentlicht: (2023)
von: Chen, Yida, et al.
Veröffentlicht: (2023)
HiMix: Hierarchical Artifact-aware Mixup for Generalized Synthetic Image Detection
von: Zhou, Shuchang, et al.
Veröffentlicht: (2026)
von: Zhou, Shuchang, et al.
Veröffentlicht: (2026)
HiRQA: Hierarchical Ranking and Quality Alignment for Opinion-Unaware Image Quality Assessment
von: Ramesh, Vaishnav, et al.
Veröffentlicht: (2025)
von: Ramesh, Vaishnav, et al.
Veröffentlicht: (2025)
Morphing Tokens Draw Strong Masked Image Models
von: Kim, Taekyung, et al.
Veröffentlicht: (2023)
von: Kim, Taekyung, et al.
Veröffentlicht: (2023)
Mask-Adapter: The Devil is in the Masks for Open-Vocabulary Segmentation
von: Li, Yongkang, et al.
Veröffentlicht: (2024)
von: Li, Yongkang, et al.
Veröffentlicht: (2024)
HiSem: Hierarchical Semantic Disentangling for Remote Sensing Image Change Captioning
von: Wang, Man, et al.
Veröffentlicht: (2026)
von: Wang, Man, et al.
Veröffentlicht: (2026)
CM-MaskSD: Cross-Modality Masked Self-Distillation for Referring Image Segmentation
von: Wang, Wenxuan, et al.
Veröffentlicht: (2023)
von: Wang, Wenxuan, et al.
Veröffentlicht: (2023)
HiDE: Hierarchical Dictionary-Based Entropy Modeling for Learned Image Compression
von: Xiong, Haoxuan, et al.
Veröffentlicht: (2026)
von: Xiong, Haoxuan, et al.
Veröffentlicht: (2026)
A Survey of Token Compression for Efficient Multimodal Large Language Models
von: Shao, Kele, et al.
Veröffentlicht: (2025)
von: Shao, Kele, et al.
Veröffentlicht: (2025)
HiTokSR: A Coarse-to-Fine Tokenizer with Hierarchical Codebooks for High-Fidelity Real-World Image Super-Resolution
von: Li, Mingxi
Veröffentlicht: (2026)
von: Li, Mingxi
Veröffentlicht: (2026)
Next Token Is Enough: Realistic Image Quality and Aesthetic Scoring with Multimodal Large Language Model
von: Li, Mingxing, et al.
Veröffentlicht: (2025)
von: Li, Mingxing, et al.
Veröffentlicht: (2025)
HiCD: Change Detection in Quality-Varied Images via Hierarchical Correlation Distillation
von: Pang, Chao, et al.
Veröffentlicht: (2024)
von: Pang, Chao, et al.
Veröffentlicht: (2024)
Hi-Mamba: Hierarchical Mamba for Efficient Image Super-Resolution
von: Qiao, Junbo, et al.
Veröffentlicht: (2024)
von: Qiao, Junbo, et al.
Veröffentlicht: (2024)
HiT-SR: Hierarchical Transformer for Efficient Image Super-Resolution
von: Zhang, Xiang, et al.
Veröffentlicht: (2024)
von: Zhang, Xiang, et al.
Veröffentlicht: (2024)
TokenSeg: Efficient 3D Medical Image Segmentation via Hierarchical Visual Token Compression
von: Zeng, Sen, et al.
Veröffentlicht: (2026)
von: Zeng, Sen, et al.
Veröffentlicht: (2026)
HiCo: Hierarchical Controllable Diffusion Model for Layout-to-image Generation
von: Cheng, Bo, et al.
Veröffentlicht: (2024)
von: Cheng, Bo, et al.
Veröffentlicht: (2024)
Accelerating Streaming Video Large Language Models via Hierarchical Token Compression
von: Wang, Yiyu, et al.
Veröffentlicht: (2025)
von: Wang, Yiyu, et al.
Veröffentlicht: (2025)
Synthetic Instance Segmentation from Semantic Image Segmentation Masks
von: Shen, Yuchen, et al.
Veröffentlicht: (2023)
von: Shen, Yuchen, et al.
Veröffentlicht: (2023)
Hi-Map: Hierarchical Factorized Radiance Field for High-Fidelity Monocular Dense Mapping
von: Hua, Tongyan, et al.
Veröffentlicht: (2024)
von: Hua, Tongyan, et al.
Veröffentlicht: (2024)
Token Painter: Training-Free Text-Guided Image Inpainting via Mask Autoregressive Models
von: Jiang, Longtao, et al.
Veröffentlicht: (2025)
von: Jiang, Longtao, et al.
Veröffentlicht: (2025)
HiPerformer: A High-Performance Global-Local Segmentation Model with Modular Hierarchical Fusion Strategy
von: Tan, Dayu, et al.
Veröffentlicht: (2025)
von: Tan, Dayu, et al.
Veröffentlicht: (2025)
Accelerating Multimodal Large Language Models by Searching Optimal Vision Token Reduction
von: Zhao, Shiyu, et al.
Veröffentlicht: (2024)
von: Zhao, Shiyu, et al.
Veröffentlicht: (2024)
Token-Space Mask Prediction for Efficient Vision Transformer Segmentation
von: Galagain, Calvin, et al.
Veröffentlicht: (2026)
von: Galagain, Calvin, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
ALTo: Adaptive-Length Tokenizer for Autoregressive Mask Generation
von: Wang, Lingfeng, et al.
Veröffentlicht: (2025) -
HiDiff: Hybrid Diffusion Framework for Medical Image Segmentation
von: Chen, Tao, et al.
Veröffentlicht: (2024) -
Hi-SAM: Marrying Segment Anything Model for Hierarchical Text Segmentation
von: Ye, Maoyuan, et al.
Veröffentlicht: (2024) -
HiPrune: Hierarchical Attention for Efficient Token Pruning in Vision-Language Models
von: Liu, Jizhihui, et al.
Veröffentlicht: (2025) -
SemHiTok: A Unified Image Tokenizer via Semantic-Guided Hierarchical Codebook for Multimodal Understanding and Generation
von: Chen, Zisheng, et al.
Veröffentlicht: (2025)