SAM4MLLM: Enhance Multi-Modal Large Language Model for Referring Expression Segmentation
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Yi-Chia, Li, Wei-Hua, Sun, Cheng, Wang, Yu-Chiang Frank, Chen, Chu-Song |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval
by: Shen, Li-Cheng, et al.
Published: (2025)
by: Shen, Li-Cheng, et al.
Published: (2025)
Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models
by: Xu, Runsen, et al.
Published: (2025)
by: Xu, Runsen, et al.
Published: (2025)
UnifiedMLLM: Enabling Unified Representation for Multi-modal Multi-tasks With Large Language Model
by: Li, Zhaowei, et al.
Published: (2024)
by: Li, Zhaowei, et al.
Published: (2024)
Judge Anything: MLLM as a Judge Across Any Modality
by: Pu, Shu, et al.
Published: (2025)
by: Pu, Shu, et al.
Published: (2025)
Ref-Adv: Exploring MLLM Visual Reasoning in Referring Expression Tasks
by: Dong, Qihua, et al.
Published: (2026)
by: Dong, Qihua, et al.
Published: (2026)
MM-LLMs: Recent Advances in MultiModal Large Language Models
by: Zhang, Duzhen, et al.
Published: (2024)
by: Zhang, Duzhen, et al.
Published: (2024)
SSP-SAM: SAM with Semantic-Spatial Prompt for Referring Expression Segmentation
by: Tang, Wei, et al.
Published: (2026)
by: Tang, Wei, et al.
Published: (2026)
Enhancing Meme Emotion Understanding with Multi-Level Modality Enhancement and Dual-Stage Modal Fusion
by: Shi, Yi, et al.
Published: (2025)
by: Shi, Yi, et al.
Published: (2025)
Large Language Model as an Assignment Evaluator: Insights, Feedback, and Challenges in a 1000+ Student Course
by: Chiang, Cheng-Han, et al.
Published: (2024)
by: Chiang, Cheng-Han, et al.
Published: (2024)
Document-Level Numerical Reasoning across Single and Multiple Tables in Financial Reports
by: Wang, Yi-Cheng, et al.
Published: (2026)
by: Wang, Yi-Cheng, et al.
Published: (2026)
MV-SAM: Multi-view Promptable Segmentation using Pointmap Guidance
by: Jeong, Yoonwoo, et al.
Published: (2026)
by: Jeong, Yoonwoo, et al.
Published: (2026)
M2-omni: Advancing Omni-MLLM for Comprehensive Modality Support with Competitive Performance
by: Guo, Qingpei, et al.
Published: (2025)
by: Guo, Qingpei, et al.
Published: (2025)
ACCEPT: Adaptive Codebook for Composite and Efficient Prompt Tuning
by: Lin, Yu-Chen, et al.
Published: (2024)
by: Lin, Yu-Chen, et al.
Published: (2024)
ITFormer: Bridging Time Series and Natural Language for Multi-Modal QA with Large-Scale Multitask Dataset
by: Wang, Yilin, et al.
Published: (2025)
by: Wang, Yilin, et al.
Published: (2025)
Open-Vocabulary Panoptic Segmentation Using BERT Pre-Training of Vision-Language Multiway Transformer Model
by: Chen, Yi-Chia, et al.
Published: (2024)
by: Chen, Yi-Chia, et al.
Published: (2024)
A Spectrum Evaluation Benchmark for Medical Multi-Modal Large Language Models
by: Liu, Jie, et al.
Published: (2024)
by: Liu, Jie, et al.
Published: (2024)
Semantic Prompt Learning for Weakly-Supervised Semantic Segmentation
by: Lin, Ci-Siang, et al.
Published: (2024)
by: Lin, Ci-Siang, et al.
Published: (2024)
GenRecal: Generation after Recalibration from Large to Small Vision-Language Models
by: Lee, Byung-Kwan, et al.
Published: (2025)
by: Lee, Byung-Kwan, et al.
Published: (2025)
Over-Reasoning and Redundant Calculation of Large Language Models
by: Chiang, Cheng-Han, et al.
Published: (2024)
by: Chiang, Cheng-Han, et al.
Published: (2024)
ReMeREC: Relation-aware and Multi-entity Referring Expression Comprehension
by: Hu, Yizhi, et al.
Published: (2025)
by: Hu, Yizhi, et al.
Published: (2025)
Cohesive Conversations: Enhancing Authenticity in Multi-Agent Simulated Dialogues
by: Chu, KuanChao, et al.
Published: (2024)
by: Chu, KuanChao, et al.
Published: (2024)
Mitigating Social Bias in Large Language Models: A Multi-Objective Approach within a Multi-Agent Framework
by: Xu, Zhenjie, et al.
Published: (2024)
by: Xu, Zhenjie, et al.
Published: (2024)
PM4Bench: Benchmarking Large Vision-Language Models with Parallel Multilingual Multi-Modal Multi-task Corpus
by: Gao, Junyuan, et al.
Published: (2025)
by: Gao, Junyuan, et al.
Published: (2025)
Enhancing Confidence Expression in Large Language Models Through Learning from Past Experience
by: Han, Haixia, et al.
Published: (2024)
by: Han, Haixia, et al.
Published: (2024)
Intrinsic Task-based Evaluation for Referring Expression Generation
by: Chen, Guanyi, et al.
Published: (2024)
by: Chen, Guanyi, et al.
Published: (2024)
Watch Out Your Album! On the Inadvertent Privacy Memorization in Multi-Modal Large Language Models
by: Ju, Tianjie, et al.
Published: (2025)
by: Ju, Tianjie, et al.
Published: (2025)
Evaluating and Steering Modality Preferences in Multimodal Large Language Model
by: Zhang, Yu, et al.
Published: (2025)
by: Zhang, Yu, et al.
Published: (2025)
Personalized Graph-Empowered Large Language Model for Proactive Information Access
by: Chang, Chia Cheng, et al.
Published: (2026)
by: Chang, Chia Cheng, et al.
Published: (2026)
Multi-Modal Multi-Granularity Tokenizer for Chu Bamboo Slip Scripts
by: Chen, Yingfa, et al.
Published: (2024)
by: Chen, Yingfa, et al.
Published: (2024)
Scaffolding Coordinates to Promote Vision-Language Coordination in Large Multi-Modal Models
by: Lei, Xuanyu, et al.
Published: (2024)
by: Lei, Xuanyu, et al.
Published: (2024)
MLLM-LLaVA-FL: Multimodal Large Language Model Assisted Federated Learning
by: Zhang, Jianyi, et al.
Published: (2024)
by: Zhang, Jianyi, et al.
Published: (2024)
Causal-SAM-LLM: Large Language Models as Causal Reasoners for Robust Medical Segmentation
by: Tang, Tao, et al.
Published: (2025)
by: Tang, Tao, et al.
Published: (2025)
Thinking with Tables: Enhancing Multi-Modal Tabular Understanding via Neuro-Symbolic Reasoning
by: Yu, Kun-Yang, et al.
Published: (2026)
by: Yu, Kun-Yang, et al.
Published: (2026)
DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model with Self-Generated Cross-Modal Alignment
by: Lu, Ke-Han, et al.
Published: (2025)
by: Lu, Ke-Han, et al.
Published: (2025)
Tarot-SAM3: Training-free SAM3 for Any Referring Expression Segmentation
by: Zhang, Weiming, et al.
Published: (2026)
by: Zhang, Weiming, et al.
Published: (2026)
Uncertainty Quantification of Large Language Models through Multi-Dimensional Responses
by: Chen, Tiejin, et al.
Published: (2025)
by: Chen, Tiejin, et al.
Published: (2025)
Enhancing Knowledge Distillation of Large Language Models through Efficient Multi-Modal Distribution Alignment
by: Peng, Tianyu, et al.
Published: (2024)
by: Peng, Tianyu, et al.
Published: (2024)
The Curious Case of Nonverbal Abstract Reasoning with Multi-Modal Large Language Models
by: Ahrabian, Kian, et al.
Published: (2024)
by: Ahrabian, Kian, et al.
Published: (2024)
Grimoire is All You Need for Enhancing Large Language Models
by: Chen, Ding, et al.
Published: (2024)
by: Chen, Ding, et al.
Published: (2024)
MLLM-Bench: Evaluating Multimodal LLMs with Per-sample Criteria
by: Ge, Wentao, et al.
Published: (2023)
by: Ge, Wentao, et al.
Published: (2023)
Similar Items
-
Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval
by: Shen, Li-Cheng, et al.
Published: (2025) -
Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models
by: Xu, Runsen, et al.
Published: (2025) -
UnifiedMLLM: Enabling Unified Representation for Multi-modal Multi-tasks With Large Language Model
by: Li, Zhaowei, et al.
Published: (2024) -
Judge Anything: MLLM as a Judge Across Any Modality
by: Pu, Shu, et al.
Published: (2025) -
Ref-Adv: Exploring MLLM Visual Reasoning in Referring Expression Tasks
by: Dong, Qihua, et al.
Published: (2026)