ExpVG: Investigating the Design Space of Visual Grounding in Multimodal Large Language Model
Fuente:
arXiv
Salvato in:
| Autori principali: | Kang, Weitai, Zhuang, Weiming, Li, Zhizhong, Yan, Yan, Lyu, Lingjuan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SegVG: Transferring Object Bounding Box to Segmentation for Visual Grounding
di: Kang, Weitai, et al.
Pubblicazione: (2024)
di: Kang, Weitai, et al.
Pubblicazione: (2024)
Empirical Recipes for Efficient and Compact Vision-Language Models
di: Huang, Jiabo, et al.
Pubblicazione: (2026)
di: Huang, Jiabo, et al.
Pubblicazione: (2026)
Robin3D: Improving 3D Large Language Model via Robust Instruction Tuning
di: Kang, Weitai, et al.
Pubblicazione: (2024)
di: Kang, Weitai, et al.
Pubblicazione: (2024)
ACTRESS: Active Retraining for Semi-supervised Visual Grounding
di: Kang, Weitai, et al.
Pubblicazione: (2024)
di: Kang, Weitai, et al.
Pubblicazione: (2024)
VGent: Visual Grounding via Modular Design for Disentangling Reasoning and Prediction
di: Kang, Weitai, et al.
Pubblicazione: (2025)
di: Kang, Weitai, et al.
Pubblicazione: (2025)
On the Limits of Token Reduction for Efficient Unified Vision Language Training
di: Chen, Siyi, et al.
Pubblicazione: (2026)
di: Chen, Siyi, et al.
Pubblicazione: (2026)
Visual Grounding with Attention-Driven Constraint Balancing
di: Kang, Weitai, et al.
Pubblicazione: (2024)
di: Kang, Weitai, et al.
Pubblicazione: (2024)
Towards Fundamentally Scalable Model Selection: Asymptotically Fast Update and Selection
di: Wang, Wenxiao, et al.
Pubblicazione: (2024)
di: Wang, Wenxiao, et al.
Pubblicazione: (2024)
FedWon: Triumphing Multi-domain Federated Learning Without Normalization
di: Zhuang, Weiming, et al.
Pubblicazione: (2023)
di: Zhuang, Weiming, et al.
Pubblicazione: (2023)
CODIS: Benchmarking Context-Dependent Visual Comprehension for Multimodal Large Language Models
di: Luo, Fuwen, et al.
Pubblicazione: (2024)
di: Luo, Fuwen, et al.
Pubblicazione: (2024)
SwimVG: Step-wise Multimodal Fusion and Adaption for Visual Grounding
di: Shi, Liangtao, et al.
Pubblicazione: (2025)
di: Shi, Liangtao, et al.
Pubblicazione: (2025)
HiVG: Hierarchical Multimodal Fine-grained Modulation for Visual Grounding
di: Xiao, Linhui, et al.
Pubblicazione: (2024)
di: Xiao, Linhui, et al.
Pubblicazione: (2024)
GeM-VG: Towards Generalized Multi-image Visual Grounding with Multimodal Large Language Models
di: Zheng, Shurong, et al.
Pubblicazione: (2026)
di: Zheng, Shurong, et al.
Pubblicazione: (2026)
CLIP-VG: Self-paced Curriculum Adapting of CLIP for Visual Grounding
di: Xiao, Linhui, et al.
Pubblicazione: (2023)
di: Xiao, Linhui, et al.
Pubblicazione: (2023)
Plug-and-Play Grounding of Reasoning in Multimodal Large Language Models
di: Chen, Jiaxing, et al.
Pubblicazione: (2024)
di: Chen, Jiaxing, et al.
Pubblicazione: (2024)
LLM4VG: Large Language Models Evaluation for Video Grounding
di: Feng, Wei, et al.
Pubblicazione: (2023)
di: Feng, Wei, et al.
Pubblicazione: (2023)
VG3S: Visual Geometry Grounded Gaussian Splatting for Semantic Occupancy Prediction
di: Yan, Xiaoyang, et al.
Pubblicazione: (2026)
di: Yan, Xiaoyang, et al.
Pubblicazione: (2026)
Towards Visual Text Grounding of Multimodal Large Language Model
di: Li, Ming, et al.
Pubblicazione: (2025)
di: Li, Ming, et al.
Pubblicazione: (2025)
Efficient Temporal Extrapolation of Multimodal Large Language Models with Temporal Grounding Bridge
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
Quantifying and Mitigating Unimodal Biases in Multimodal Large Language Models: A Causal Perspective
di: Chen, Meiqi, et al.
Pubblicazione: (2024)
di: Chen, Meiqi, et al.
Pubblicazione: (2024)
Groma: Localized Visual Tokenization for Grounding Multimodal Large Language Models
di: Ma, Chuofan, et al.
Pubblicazione: (2024)
di: Ma, Chuofan, et al.
Pubblicazione: (2024)
Training-Free Layout-to-Image Generation with Marginal Attention Constraints
di: Chen, Huancheng, et al.
Pubblicazione: (2024)
di: Chen, Huancheng, et al.
Pubblicazione: (2024)
Grounding Language Models for Visual Entity Recognition
di: Xiao, Zilin, et al.
Pubblicazione: (2024)
di: Xiao, Zilin, et al.
Pubblicazione: (2024)
MaVEn: An Effective Multi-granularity Hybrid Visual Encoding Framework for Multimodal Large Language Model
di: Jiang, Chaoya, et al.
Pubblicazione: (2024)
di: Jiang, Chaoya, et al.
Pubblicazione: (2024)
UNIFORM: Unifying Knowledge from Large-scale and Diverse Pre-trained Models
di: Wang, Yimu, et al.
Pubblicazione: (2025)
di: Wang, Yimu, et al.
Pubblicazione: (2025)
Prismatic VLMs: Investigating the Design Space of Visually-Conditioned Language Models
di: Karamcheti, Siddharth, et al.
Pubblicazione: (2024)
di: Karamcheti, Siddharth, et al.
Pubblicazione: (2024)
VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting
di: Ilaslan, Muhammet Furkan, et al.
Pubblicazione: (2024)
di: Ilaslan, Muhammet Furkan, et al.
Pubblicazione: (2024)
ProVG: Progressive Visual Grounding via Language Decoupling for Remote Sensing Imagery
di: Li, Ke, et al.
Pubblicazione: (2026)
di: Li, Ke, et al.
Pubblicazione: (2026)
AlignMMBench: Evaluating Chinese Multimodal Alignment in Large Vision-Language Models
di: Wu, Yuhang, et al.
Pubblicazione: (2024)
di: Wu, Yuhang, et al.
Pubblicazione: (2024)
A Simple Background Augmentation Method for Object Detection with Diffusion Model
di: Li, Yuhang, et al.
Pubblicazione: (2024)
di: Li, Yuhang, et al.
Pubblicazione: (2024)
Investigating Structural Pruning and Recovery Techniques for Compressing Multimodal Large Language Models: An Empirical Study
di: Huang, Yiran, et al.
Pubblicazione: (2025)
di: Huang, Yiran, et al.
Pubblicazione: (2025)
HyperLLaVA: Dynamic Visual and Language Expert Tuning for Multimodal Large Language Models
di: Zhang, Wenqiao, et al.
Pubblicazione: (2024)
di: Zhang, Wenqiao, et al.
Pubblicazione: (2024)
Visually Grounded Speech Models for Low-resource Languages and Cognitive Modelling
di: Nortje, Leanne
Pubblicazione: (2024)
di: Nortje, Leanne
Pubblicazione: (2024)
Finer: Investigating and Enhancing Fine-Grained Visual Concept Recognition in Large Vision Language Models
di: Kim, Jeonghwan, et al.
Pubblicazione: (2024)
di: Kim, Jeonghwan, et al.
Pubblicazione: (2024)
UniCompress: Token Compression for Unified Vision-Language Understanding and Generation
di: Wang, Ziyao, et al.
Pubblicazione: (2026)
di: Wang, Ziyao, et al.
Pubblicazione: (2026)
PathVG: A New Benchmark and Dataset for Pathology Visual Grounding
di: Zhong, Chunlin, et al.
Pubblicazione: (2025)
di: Zhong, Chunlin, et al.
Pubblicazione: (2025)
Imagine while Reasoning in Space: Multimodal Visualization-of-Thought
di: Li, Chengzu, et al.
Pubblicazione: (2025)
di: Li, Chengzu, et al.
Pubblicazione: (2025)
ShortV: Efficient Multimodal Large Language Models by Freezing Visual Tokens in Ineffective Layers
di: Yuan, Qianhao, et al.
Pubblicazione: (2025)
di: Yuan, Qianhao, et al.
Pubblicazione: (2025)
Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language Models
di: Li, Yifan, et al.
Pubblicazione: (2024)
di: Li, Yifan, et al.
Pubblicazione: (2024)
BlueLM-V-3B: Algorithm and System Co-Design for Multimodal Large Language Models on Mobile Devices
di: Lu, Xudong, et al.
Pubblicazione: (2024)
di: Lu, Xudong, et al.
Pubblicazione: (2024)
Documenti analoghi
-
SegVG: Transferring Object Bounding Box to Segmentation for Visual Grounding
di: Kang, Weitai, et al.
Pubblicazione: (2024) -
Empirical Recipes for Efficient and Compact Vision-Language Models
di: Huang, Jiabo, et al.
Pubblicazione: (2026) -
Robin3D: Improving 3D Large Language Model via Robust Instruction Tuning
di: Kang, Weitai, et al.
Pubblicazione: (2024) -
ACTRESS: Active Retraining for Semi-supervised Visual Grounding
di: Kang, Weitai, et al.
Pubblicazione: (2024) -
VGent: Visual Grounding via Modular Design for Disentangling Reasoning and Prediction
di: Kang, Weitai, et al.
Pubblicazione: (2025)