Instruction-guided Multi-Granularity Segmentation and Captioning with Large Multimodal Model
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhou, Li, Yuan, Xu, Sun, Zenghui, Zhou, Zikun, Lan, Jingsong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Scene Graph-guided SegCaptioning Transformer with Fine-grained Alignment for Controllable Video Segmentation and Captioning
von: Zhang, Xu, et al.
Veröffentlicht: (2026)
von: Zhang, Xu, et al.
Veröffentlicht: (2026)
INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling
von: Dong, Xin, et al.
Veröffentlicht: (2025)
von: Dong, Xin, et al.
Veröffentlicht: (2025)
AVG-LLaVA: An Efficient Large Multimodal Model with Adaptive Visual Granularity
von: Lan, Zhibin, et al.
Veröffentlicht: (2024)
von: Lan, Zhibin, et al.
Veröffentlicht: (2024)
MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking
von: Liu, Xinqi, et al.
Veröffentlicht: (2024)
von: Liu, Xinqi, et al.
Veröffentlicht: (2024)
MGIMM: Multi-Granularity Instruction Multimodal Model for Attribute-Guided Remote Sensing Image Detailed Description
von: Yang, Cong, et al.
Veröffentlicht: (2024)
von: Yang, Cong, et al.
Veröffentlicht: (2024)
Harnessing Vision-Language Pretrained Models with Temporal-Aware Adaptation for Referring Video Object Segmentation
von: Zhou, Zikun, et al.
Veröffentlicht: (2024)
von: Zhou, Zikun, et al.
Veröffentlicht: (2024)
Universal Segmentation at Arbitrary Granularity with Language Instruction
von: Liu, Yong, et al.
Veröffentlicht: (2023)
von: Liu, Yong, et al.
Veröffentlicht: (2023)
IF-VidCap: Can Video Caption Models Follow Instructions?
von: Li, Shihao, et al.
Veröffentlicht: (2025)
von: Li, Shihao, et al.
Veröffentlicht: (2025)
Effectively Enhancing Vision Language Large Models by Prompt Augmentation and Caption Utilization
von: Zhao, Minyi, et al.
Veröffentlicht: (2024)
von: Zhao, Minyi, et al.
Veröffentlicht: (2024)
PMCE: Probabilistic Multi-Granularity Semantics with Caption-Guided Enhancement for Few-Shot Learning
von: Wu, Jiaying, et al.
Veröffentlicht: (2026)
von: Wu, Jiaying, et al.
Veröffentlicht: (2026)
SMC-NCA: Semantic-guided Multi-level Contrast for Semi-supervised Temporal Action Segmentation
von: Zhou, Feixiang, et al.
Veröffentlicht: (2023)
von: Zhou, Feixiang, et al.
Veröffentlicht: (2023)
LongCaptioning: Unlocking the Power of Long Video Caption Generation in Large Multimodal Models
von: Wei, Hongchen, et al.
Veröffentlicht: (2025)
von: Wei, Hongchen, et al.
Veröffentlicht: (2025)
MSP-MVS: Multi-Granularity Segmentation Prior Guided Multi-View Stereo
von: Yuan, Zhenlong, et al.
Veröffentlicht: (2024)
von: Yuan, Zhenlong, et al.
Veröffentlicht: (2024)
Depth-guided Texture Diffusion for Image Semantic Segmentation
von: Sun, Wei, et al.
Veröffentlicht: (2024)
von: Sun, Wei, et al.
Veröffentlicht: (2024)
BTCChat: Advancing Remote Sensing Bi-temporal Change Captioning with Multimodal Large Language Model
von: Li, Yujie, et al.
Veröffentlicht: (2025)
von: Li, Yujie, et al.
Veröffentlicht: (2025)
Multi-Granularity Video Object Segmentation
von: Lim, Sangbeom, et al.
Veröffentlicht: (2024)
von: Lim, Sangbeom, et al.
Veröffentlicht: (2024)
Deep Instruction Tuning for Segment Anything Model
von: Huang, Xiaorui, et al.
Veröffentlicht: (2024)
von: Huang, Xiaorui, et al.
Veröffentlicht: (2024)
MG-LLaVA: Towards Multi-Granularity Visual Instruction Tuning
von: Zhao, Xiangyu, et al.
Veröffentlicht: (2024)
von: Zhao, Xiangyu, et al.
Veröffentlicht: (2024)
GraCo: Granularity-Controllable Interactive Segmentation
von: Zhao, Yian, et al.
Veröffentlicht: (2024)
von: Zhao, Yian, et al.
Veröffentlicht: (2024)
Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search
von: Yu, Linhao, et al.
Veröffentlicht: (2025)
von: Yu, Linhao, et al.
Veröffentlicht: (2025)
Understanding Multi-Granularity for Open-Vocabulary Part Segmentation
von: Choi, Jiho, et al.
Veröffentlicht: (2024)
von: Choi, Jiho, et al.
Veröffentlicht: (2024)
Segment and Caption Anything
von: Huang, Xiaoke, et al.
Veröffentlicht: (2023)
von: Huang, Xiaoke, et al.
Veröffentlicht: (2023)
CG-MLLM: Captioning and Generating 3D content via Multi-modal Large Language Models
von: Huang, Junming, et al.
Veröffentlicht: (2026)
von: Huang, Junming, et al.
Veröffentlicht: (2026)
Multi-Granularity Feature Calibration via VFM for Domain Generalized Semantic Segmentation
von: Li, Xinhui, et al.
Veröffentlicht: (2025)
von: Li, Xinhui, et al.
Veröffentlicht: (2025)
Prototype Perturbation for Relaxing Alignment Constraints in Backward-Compatible Learning
von: Zhou, Zikun, et al.
Veröffentlicht: (2025)
von: Zhou, Zikun, et al.
Veröffentlicht: (2025)
Text-guided Visual Prompt DINO for Generic Segmentation
von: Guan, Yuchen, et al.
Veröffentlicht: (2025)
von: Guan, Yuchen, et al.
Veröffentlicht: (2025)
Enhancing Descriptive Captions with Visual Attributes for Multimodal Perception
von: Sun, Yanpeng, et al.
Veröffentlicht: (2024)
von: Sun, Yanpeng, et al.
Veröffentlicht: (2024)
Multimodal Instruction Tuning with Hybrid State Space Models
von: Zhou, Jianing, et al.
Veröffentlicht: (2024)
von: Zhou, Jianing, et al.
Veröffentlicht: (2024)
Player-Centric Multimodal Prompt Generation for Large Language Model Based Identity-Aware Basketball Video Captioning
von: Xi, Zeyu, et al.
Veröffentlicht: (2025)
von: Xi, Zeyu, et al.
Veröffentlicht: (2025)
UGC-VideoCaptioner: An Omni UGC Video Detail Caption Model and New Benchmarks
von: Wu, Peiran, et al.
Veröffentlicht: (2025)
von: Wu, Peiran, et al.
Veröffentlicht: (2025)
Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models
von: Miao, Yanting, et al.
Veröffentlicht: (2026)
von: Miao, Yanting, et al.
Veröffentlicht: (2026)
Towards Multimodal Video Paragraph Captioning Models Robust to Missing Modality
von: Chen, Sishuo, et al.
Veröffentlicht: (2024)
von: Chen, Sishuo, et al.
Veröffentlicht: (2024)
FINECAPTION: Compositional Image Captioning Focusing on Wherever You Want at Any Granularity
von: Hua, Hang, et al.
Veröffentlicht: (2024)
von: Hua, Hang, et al.
Veröffentlicht: (2024)
Learning Compatible Multi-Prize Subnetworks for Asymmetric Retrieval
von: Sun, Yushuai, et al.
Veröffentlicht: (2025)
von: Sun, Yushuai, et al.
Veröffentlicht: (2025)
VoCap: Video Object Captioning and Segmentation from Any Prompt
von: Uijlings, Jasper, et al.
Veröffentlicht: (2025)
von: Uijlings, Jasper, et al.
Veröffentlicht: (2025)
LLaVA-RE: Binary Image-Text Relevancy Evaluation with Multimodal Large Language Model
von: Sun, Tao, et al.
Veröffentlicht: (2025)
von: Sun, Tao, et al.
Veröffentlicht: (2025)
Dense Video Object Captioning from Disjoint Supervision
von: Zhou, Xingyi, et al.
Veröffentlicht: (2023)
von: Zhou, Xingyi, et al.
Veröffentlicht: (2023)
An Image Is Worth Ten Thousand Words: Verbose-Text Induction Attacks on VLMs
von: Luo, Zhi, et al.
Veröffentlicht: (2025)
von: Luo, Zhi, et al.
Veröffentlicht: (2025)
CaptionQA: Is Your Caption as Useful as the Image Itself?
von: Yang, Shijia, et al.
Veröffentlicht: (2025)
von: Yang, Shijia, et al.
Veröffentlicht: (2025)
Segmentation-guided Layer-wise Image Vectorization with Gradient Fills
von: Zhou, Hengyu, et al.
Veröffentlicht: (2024)
von: Zhou, Hengyu, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Scene Graph-guided SegCaptioning Transformer with Fine-grained Alignment for Controllable Video Segmentation and Captioning
von: Zhang, Xu, et al.
Veröffentlicht: (2026) -
INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling
von: Dong, Xin, et al.
Veröffentlicht: (2025) -
AVG-LLaVA: An Efficient Large Multimodal Model with Adaptive Visual Granularity
von: Lan, Zhibin, et al.
Veröffentlicht: (2024) -
MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking
von: Liu, Xinqi, et al.
Veröffentlicht: (2024) -
MGIMM: Multi-Granularity Instruction Multimodal Model for Attribute-Guided Remote Sensing Image Detailed Description
von: Yang, Cong, et al.
Veröffentlicht: (2024)