Better, Stronger, Faster: Tackling the Trilemma in MLLM-based Segmentation with Simultaneous Textual Mask Prediction
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Jiazhen, Feng, Mingkuan, Chen, Long |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Segmentation as A Plug-and-Play Capability for Frozen Multimodal LLMs
by: Liu, Jiazhen, et al.
Published: (2025)
by: Liu, Jiazhen, et al.
Published: (2025)
Better with Less: Tackling Heterogeneous Multi-Modal Image Joint Pretraining via Conditioned and Degraded Masked Autoencoder
by: Peng, Bowen, et al.
Published: (2026)
by: Peng, Bowen, et al.
Published: (2026)
Point Transformer V3: Simpler, Faster, Stronger
by: Wu, Xiaoyang, et al.
Published: (2023)
by: Wu, Xiaoyang, et al.
Published: (2023)
Contrastive Masked Autoencoders are Stronger Vision Learners
by: Huang, Zhicheng, et al.
Published: (2022)
by: Huang, Zhicheng, et al.
Published: (2022)
MLLM-based Textual Explanations for Face Comparison
by: Sony, Redwan, et al.
Published: (2026)
by: Sony, Redwan, et al.
Published: (2026)
Textual Query-Driven Mask Transformer for Domain Generalized Segmentation
by: Pak, Byeonghyun, et al.
Published: (2024)
by: Pak, Byeonghyun, et al.
Published: (2024)
MP-PolarMask: A Faster and Finer Instance Segmentation for Concave Images
by: Wang, Ke-Lei, et al.
Published: (2024)
by: Wang, Ke-Lei, et al.
Published: (2024)
Stronger is not better: Better Augmentations in Contrastive Learning for Medical Image Segmentation
by: Idris, Azeez, et al.
Published: (2025)
by: Idris, Azeez, et al.
Published: (2025)
Tracking Meets LoRA: Faster Training, Larger Model, Stronger Performance
by: Lin, Liting, et al.
Published: (2024)
by: Lin, Liting, et al.
Published: (2024)
Mask-Adapter: The Devil is in the Masks for Open-Vocabulary Segmentation
by: Li, Yongkang, et al.
Published: (2024)
by: Li, Yongkang, et al.
Published: (2024)
Empowering Small VLMs to Think with Dynamic Memorization and Exploration
by: Liu, Jiazhen, et al.
Published: (2025)
by: Liu, Jiazhen, et al.
Published: (2025)
Lumina-Next: Making Lumina-T2X Stronger and Faster with Next-DiT
by: Zhuo, Le, et al.
Published: (2024)
by: Zhuo, Le, et al.
Published: (2024)
Schedule On the Fly: Diffusion Time Prediction for Faster and Better Image Generation
by: Ye, Zilyu, et al.
Published: (2024)
by: Ye, Zilyu, et al.
Published: (2024)
Striving for Faster and Better: A One-Layer Architecture with Auto Re-parameterization for Low-Light Image Enhancement
by: An, Nan, et al.
Published: (2025)
by: An, Nan, et al.
Published: (2025)
Instance-aware Image Colorization with Controllable Textual Descriptions and Segmentation Masks
by: An, Yanru, et al.
Published: (2025)
by: An, Yanru, et al.
Published: (2025)
Rethinking MLLM Itself as a Segmenter with a Single Segmentation Token
by: Zhang, Anqi, et al.
Published: (2026)
by: Zhang, Anqi, et al.
Published: (2026)
Medal S: Spatio-Textual Prompt Model for Medical Segmentation
by: Shi, Pengcheng, et al.
Published: (2025)
by: Shi, Pengcheng, et al.
Published: (2025)
Stronger, Fewer, & Superior: Harnessing Vision Foundation Models for Domain Generalized Semantic Segmentation
by: Wei, Zhixiang, et al.
Published: (2023)
by: Wei, Zhixiang, et al.
Published: (2023)
Towards Better & Faster Autoregressive Image Generation: From the Perspective of Entropy
by: Ma, Xiaoxiao, et al.
Published: (2025)
by: Ma, Xiaoxiao, et al.
Published: (2025)
Augment to Segment: Tackling Pixel-Level Imbalance in Wheat Disease and Pest Segmentation
by: Wei, Tianqi, et al.
Published: (2025)
by: Wei, Tianqi, et al.
Published: (2025)
MaskMed: Decoupled Mask and Class Prediction for Medical Image Segmentation
by: Xie, Bin, et al.
Published: (2025)
by: Xie, Bin, et al.
Published: (2025)
Decoding by Perturbation: Mitigating MLLM Hallucinations via Dynamic Textual Perturbation
by: Jia, Sihang, et al.
Published: (2026)
by: Jia, Sihang, et al.
Published: (2026)
MobileVLM V2: Faster and Stronger Baseline for Vision Language Model
by: Chu, Xiangxiang, et al.
Published: (2024)
by: Chu, Xiangxiang, et al.
Published: (2024)
Fundus-R1: Training a Fundus-Reading MLLM with Knowledge-Aware Reasoning on Public Data
by: Deng, Yuchuan, et al.
Published: (2026)
by: Deng, Yuchuan, et al.
Published: (2026)
GMT: Guided Mask Transformer for Leaf Instance Segmentation
by: Chen, Feng, et al.
Published: (2024)
by: Chen, Feng, et al.
Published: (2024)
Faster Diffusion Action Segmentation
by: Wang, Shuaibing, et al.
Published: (2024)
by: Wang, Shuaibing, et al.
Published: (2024)
Faster and Stronger: When ANN-SNN Conversion Meets Parallel Spiking Calculation
by: Hao, Zecheng, et al.
Published: (2024)
by: Hao, Zecheng, et al.
Published: (2024)
SimGen: A Diffusion-Based Framework for Simultaneous Surgical Image and Segmentation Mask Generation
by: Bhat, Aditya, et al.
Published: (2025)
by: Bhat, Aditya, et al.
Published: (2025)
Faster and Better 3D Splatting via Group Training
by: Wang, Chengbo, et al.
Published: (2024)
by: Wang, Chengbo, et al.
Published: (2024)
Moment and Highlight Detection via MLLM Frame Segmentation
by: Jiwanta, I Putu Andika Bagas, et al.
Published: (2025)
by: Jiwanta, I Putu Andika Bagas, et al.
Published: (2025)
Medical Referring Image Segmentation via Next-Token Mask Prediction
by: Chen, Xinyu, et al.
Published: (2025)
by: Chen, Xinyu, et al.
Published: (2025)
Enhanced Generative Data Augmentation for Semantic Segmentation via Stronger Guidance
by: Che, Quang-Huy, et al.
Published: (2024)
by: Che, Quang-Huy, et al.
Published: (2024)
FlashMesh: Faster and Better Autoregressive Mesh Synthesis via Structured Speculation
by: Shen, Tingrui, et al.
Published: (2025)
by: Shen, Tingrui, et al.
Published: (2025)
Better Together: Leveraging Unpaired Multimodal Data for Stronger Unimodal Models
by: Gupta, Sharut, et al.
Published: (2025)
by: Gupta, Sharut, et al.
Published: (2025)
Towards Energy-Efficiency by Navigating the Trilemma of Energy, Latency, and Accuracy
by: Tian, Boyuan, et al.
Published: (2024)
by: Tian, Boyuan, et al.
Published: (2024)
ANTS: Adaptive Negative Textual Space Shaping for OOD Detection via Test-Time MLLM Understanding and Reasoning
by: Zhu, Wenjie, et al.
Published: (2025)
by: Zhu, Wenjie, et al.
Published: (2025)
CM-MaskSD: Cross-Modality Masked Self-Distillation for Referring Image Segmentation
by: Wang, Wenxuan, et al.
Published: (2023)
by: Wang, Wenxuan, et al.
Published: (2023)
FBRT-YOLO: Faster and Better for Real-Time Aerial Image Detection
by: Xiao, Yao, et al.
Published: (2025)
by: Xiao, Yao, et al.
Published: (2025)
CoRe^2: Collect, Reflect and Refine to Generate Better and Faster
by: Shao, Shitong, et al.
Published: (2025)
by: Shao, Shitong, et al.
Published: (2025)
Explore More, Learn Better: Parallel MLLM Embeddings under Mutual Information Minimization
by: Wang, Zhicheng, et al.
Published: (2025)
by: Wang, Zhicheng, et al.
Published: (2025)
Similar Items
-
Segmentation as A Plug-and-Play Capability for Frozen Multimodal LLMs
by: Liu, Jiazhen, et al.
Published: (2025) -
Better with Less: Tackling Heterogeneous Multi-Modal Image Joint Pretraining via Conditioned and Degraded Masked Autoencoder
by: Peng, Bowen, et al.
Published: (2026) -
Point Transformer V3: Simpler, Faster, Stronger
by: Wu, Xiaoyang, et al.
Published: (2023) -
Contrastive Masked Autoencoders are Stronger Vision Learners
by: Huang, Zhicheng, et al.
Published: (2022) -
MLLM-based Textual Explanations for Face Comparison
by: Sony, Redwan, et al.
Published: (2026)