Contextual Object Detection with Multimodal Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zang, Yuhang, Li, Wei, Han, Jun, Zhou, Kaiyang, Loy, Chen Change |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MosaicFusion: Diffusion Models as Data Augmenters for Large Vocabulary Instance Segmentation
par: Xie, Jiahao, et autres
Publié: (2023)
par: Xie, Jiahao, et autres
Publié: (2023)
Can Multimodal Large Language Models Truly Understand Small Objects?
par: Han, Fujun, et autres
Publié: (2026)
par: Han, Fujun, et autres
Publié: (2026)
MEAT: Multiview Diffusion Model for Human Generation on Megapixels with Mesh Attention
par: Wang, Yuhan, et autres
Publié: (2025)
par: Wang, Yuhan, et autres
Publié: (2025)
GaussianAnything: Interactive Point Cloud Flow Matching For 3D Object Generation
par: Lan, Yushi, et autres
Publié: (2024)
par: Lan, Yushi, et autres
Publié: (2024)
Large Language Model Guided Progressive Feature Alignment for Multimodal UAV Object Detection
par: Wu, Wentao, et autres
Publié: (2025)
par: Wu, Wentao, et autres
Publié: (2025)
HippoCamp: Benchmarking Contextual Agents on Personal Computers
par: Yang, Zhe, et autres
Publié: (2026)
par: Yang, Zhe, et autres
Publié: (2026)
Overcoming the Pitfalls of Vision-Language Model Finetuning for OOD Generalization
par: Zang, Yuhang, et autres
Publié: (2024)
par: Zang, Yuhang, et autres
Publié: (2024)
Visual Funnel: Resolving Contextual Blindness in Multimodal Large Language Models
par: Jung, Woojun, et autres
Publié: (2025)
par: Jung, Woojun, et autres
Publié: (2025)
HOI-R1: Exploring the Potential of Multimodal Large Language Models for Human-Object Interaction Detection
par: Chen, Junwen, et autres
Publié: (2025)
par: Chen, Junwen, et autres
Publié: (2025)
A Simple Background Augmentation Method for Object Detection with Diffusion Model
par: Li, Yuhang, et autres
Publié: (2024)
par: Li, Yuhang, et autres
Publié: (2024)
Object Detection with Multimodal Large Vision-Language Models: An In-depth Review
par: Sapkota, Ranjan, et autres
Publié: (2025)
par: Sapkota, Ranjan, et autres
Publié: (2025)
LithoBench: Benchmarking Large Multimodal Models for Remote-Sensing Lithology Interpretation
par: Wang, Jun, et autres
Publié: (2026)
par: Wang, Jun, et autres
Publié: (2026)
A Structured Review of Underwater Object Detection Challenges and Solutions: From Traditional to Large Vision Language Models
par: Nabahirwa, Edwine, et autres
Publié: (2025)
par: Nabahirwa, Edwine, et autres
Publié: (2025)
MIA-DPO: Multi-Image Augmented Direct Preference Optimization For Large Vision-Language Models
par: Liu, Ziyu, et autres
Publié: (2024)
par: Liu, Ziyu, et autres
Publié: (2024)
Do Pre-trained Vision-Language Models Encode Object States?
par: Newman, Kaleb, et autres
Publié: (2024)
par: Newman, Kaleb, et autres
Publié: (2024)
The Paradigm Shift: A Comprehensive Survey on Large Vision Language Models for Multimodal Fake News Detection
par: Ai, Wei, et autres
Publié: (2026)
par: Ai, Wei, et autres
Publié: (2026)
Generalizable Implicit Motion Modeling for Video Frame Interpolation
par: Guo, Zujin, et autres
Publié: (2024)
par: Guo, Zujin, et autres
Publié: (2024)
MMAD: A Comprehensive Benchmark for Multimodal Large Language Models in Industrial Anomaly Detection
par: Jiang, Xi, et autres
Publié: (2024)
par: Jiang, Xi, et autres
Publié: (2024)
SketchJudge: A Diagnostic Benchmark for Grading Hand-drawn Diagrams with Multimodal Large Language Models
par: Su, Yuhang, et autres
Publié: (2026)
par: Su, Yuhang, et autres
Publié: (2026)
COUNTS: Benchmarking Object Detectors and Multimodal Large Language Models under Distribution Shifts
par: Li, Jiansheng, et autres
Publié: (2025)
par: Li, Jiansheng, et autres
Publié: (2025)
Uncertainty Aware Human-machine Collaboration in Camouflaged Object Detection
par: Yang, Ziyue, et autres
Publié: (2025)
par: Yang, Ziyue, et autres
Publié: (2025)
Innovator-VL: A Multimodal Large Language Model for Scientific Discovery
par: Wen, Zichen, et autres
Publié: (2026)
par: Wen, Zichen, et autres
Publié: (2026)
BoxTuning: Directly Injecting the Object Box for Multimodal Model Fine-Tuning
par: Qian, Zekun, et autres
Publié: (2026)
par: Qian, Zekun, et autres
Publié: (2026)
F-LMM: Grounding Frozen Large Multimodal Models
par: Wu, Size, et autres
Publié: (2024)
par: Wu, Size, et autres
Publié: (2024)
Temporal Insight Enhancement: Mitigating Temporal Hallucination in Multimodal Large Language Models
par: Sun, Li, et autres
Publié: (2024)
par: Sun, Li, et autres
Publié: (2024)
FileGram: Grounding Agent Personalization in File-System Behavioral Traces
par: Liu, Shuai, et autres
Publié: (2026)
par: Liu, Shuai, et autres
Publié: (2026)
Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models
par: Li, Hengzhuang, et autres
Publié: (2025)
par: Li, Hengzhuang, et autres
Publié: (2025)
Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation
par: Xia, Jiaer, et autres
Publié: (2025)
par: Xia, Jiaer, et autres
Publié: (2025)
Next Visual Granularity Generation
par: Wang, Yikai, et autres
Publié: (2025)
par: Wang, Yikai, et autres
Publié: (2025)
A Simple Aerial Detection Baseline of Multimodal Language Models
par: Li, Qingyun, et autres
Publié: (2025)
par: Li, Qingyun, et autres
Publié: (2025)
Dynamic Multimodal Activation Steering for Hallucination Mitigation in Large Vision-Language Models
par: Yin, Jianghao, et autres
Publié: (2026)
par: Yin, Jianghao, et autres
Publié: (2026)
ObjCtrl-2.5D: Training-free Object Control with Camera Poses
par: Wang, Zhouxia, et autres
Publié: (2024)
par: Wang, Zhouxia, et autres
Publié: (2024)
AgroNVILA: Perception-Reasoning Decoupling for Multi-view Agricultural Multimodal Large Language Models
par: Zhang, Jiarui, et autres
Publié: (2026)
par: Zhang, Jiarui, et autres
Publié: (2026)
VLANeXt: Recipes for Building Strong VLA Models
par: Wu, Xiao-Ming, et autres
Publié: (2026)
par: Wu, Xiao-Ming, et autres
Publié: (2026)
Single Image Unlearning: Efficient Machine Unlearning in Multimodal Large Language Models
par: Li, Jiaqi, et autres
Publié: (2024)
par: Li, Jiaqi, et autres
Publié: (2024)
Advancing Object Detection in Transportation with Multimodal Large Language Models (MLLMs): A Comprehensive Review and Empirical Testing
par: Ashqar, Huthaifa I., et autres
Publié: (2024)
par: Ashqar, Huthaifa I., et autres
Publié: (2024)
ArchiLense: A Framework for Quantitative Analysis of Architectural Styles Based on Vision Large Language Models
par: Zhong, Jing, et autres
Publié: (2025)
par: Zhong, Jing, et autres
Publié: (2025)
Advancing Complex Video Object Segmentation via Progressive Concept Construction
par: Zhang, Zhixiong, et autres
Publié: (2025)
par: Zhang, Zhixiong, et autres
Publié: (2025)
MMR-AD: A Large-Scale Multimodal Dataset for Benchmarking General Anomaly Detection with Multimodal Large Language Models
par: Yao, Xincheng, et autres
Publié: (2026)
par: Yao, Xincheng, et autres
Publié: (2026)
Towards Language-Driven Video Inpainting via Multimodal Large Language Models
par: Wu, Jianzong, et autres
Publié: (2024)
par: Wu, Jianzong, et autres
Publié: (2024)
Documents similaires
-
MosaicFusion: Diffusion Models as Data Augmenters for Large Vocabulary Instance Segmentation
par: Xie, Jiahao, et autres
Publié: (2023) -
Can Multimodal Large Language Models Truly Understand Small Objects?
par: Han, Fujun, et autres
Publié: (2026) -
MEAT: Multiview Diffusion Model for Human Generation on Megapixels with Mesh Attention
par: Wang, Yuhan, et autres
Publié: (2025) -
GaussianAnything: Interactive Point Cloud Flow Matching For 3D Object Generation
par: Lan, Yushi, et autres
Publié: (2024) -
Large Language Model Guided Progressive Feature Alignment for Multimodal UAV Object Detection
par: Wu, Wentao, et autres
Publié: (2025)