LMM-Det: Make Large Multimodal Models Excel in Object Detection
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Jincheng, Xie, Chunyu, Ao, Ji, Leng, Dawei, Yin, Yuhui |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
FG-CLIP 2: A Bilingual Fine-grained Vision-Language Alignment Model
by: Xie, Chunyu, et al.
Published: (2025)
by: Xie, Chunyu, et al.
Published: (2025)
RzenEmbed: Towards Comprehensive Multimodal Retrieval
by: Jian, Weijian, et al.
Published: (2025)
by: Jian, Weijian, et al.
Published: (2025)
FG-CLIP: Fine-Grained Visual and Textual Alignment
by: Xie, Chunyu, et al.
Published: (2025)
by: Xie, Chunyu, et al.
Published: (2025)
ConsistencyDet: A Few-step Denoising Framework for Object Detection Using the Consistency Model
by: Jiang, Lifan, et al.
Published: (2024)
by: Jiang, Lifan, et al.
Published: (2024)
GenDet: Painting Colored Bounding Boxes on Images via Diffusion Model for Object Detection
by: Min, Chen, et al.
Published: (2026)
by: Min, Chen, et al.
Published: (2026)
F-LMM: Grounding Frozen Large Multimodal Models
by: Wu, Size, et al.
Published: (2024)
by: Wu, Size, et al.
Published: (2024)
Qihoo-T2X: An Efficient Proxy-Tokenized Diffusion Transformer for Text-to-Any-Task
by: Wang, Jing, et al.
Published: (2024)
by: Wang, Jing, et al.
Published: (2024)
LMM-VQA: Advancing Video Quality Assessment with Large Multimodal Models
by: Ge, Qihang, et al.
Published: (2024)
by: Ge, Qihang, et al.
Published: (2024)
HiCo: Hierarchical Controllable Diffusion Model for Layout-to-image Generation
by: Cheng, Bo, et al.
Published: (2024)
by: Cheng, Bo, et al.
Published: (2024)
EvoLMM: Self-Evolving Large Multimodal Models with Continuous Rewards
by: Thawakar, Omkar, et al.
Published: (2025)
by: Thawakar, Omkar, et al.
Published: (2025)
RemDet: Rethinking Efficient Model Design for UAV Object Detection
by: Li, Chen, et al.
Published: (2024)
by: Li, Chen, et al.
Published: (2024)
FMG-Det: Foundation Model Guided Robust Object Detection
by: Hannan, Darryl, et al.
Published: (2025)
by: Hannan, Darryl, et al.
Published: (2025)
MA-LMM: Memory-Augmented Large Multimodal Model for Long-Term Video Understanding
by: He, Bo, et al.
Published: (2024)
by: He, Bo, et al.
Published: (2024)
Improving Multimodal Hateful Meme Detection Exploiting LMM-Generated Knowledge
by: Tzelepi, Maria, et al.
Published: (2025)
by: Tzelepi, Maria, et al.
Published: (2025)
AviationLMM: A Large Multimodal Foundation Model for Civil Aviation
by: Li, Wenbin, et al.
Published: (2026)
by: Li, Wenbin, et al.
Published: (2026)
GFreeDet: Exploiting Gaussian Splatting and Foundation Models for Model-free Unseen Object Detection in the BOP Challenge 2024
by: Liu, Xingyu, et al.
Published: (2024)
by: Liu, Xingyu, et al.
Published: (2024)
UniDet-D: A Unified Dynamic Spectral Attention Model for Object Detection under Adverse Weathers
by: Zhang, Wei, et al.
Published: (2025)
by: Zhang, Wei, et al.
Published: (2025)
RGBX-DiffusionDet: A Framework for Multi-Modal RGB-X Object Detection Using DiffusionDet
by: Orfaig, Eliraz, et al.
Published: (2025)
by: Orfaig, Eliraz, et al.
Published: (2025)
Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models
by: Tang, Yolo Y., et al.
Published: (2025)
by: Tang, Yolo Y., et al.
Published: (2025)
LMM4LMM: Benchmarking and Evaluating Large-multimodal Image Generation with LMMs
by: Wang, Jiarui, et al.
Published: (2025)
by: Wang, Jiarui, et al.
Published: (2025)
FlowDet: Unifying Object Detection and Generative Transport Flows
by: Baty, Enis, et al.
Published: (2025)
by: Baty, Enis, et al.
Published: (2025)
PatentLMM: Large Multimodal Model for Generating Descriptions for Patent Figures
by: Shukla, Shreya, et al.
Published: (2025)
by: Shukla, Shreya, et al.
Published: (2025)
PedDet: Adaptive Spectral Optimization for Multimodal Pedestrian Detection
by: Zhao, Rui, et al.
Published: (2025)
by: Zhao, Rui, et al.
Published: (2025)
DST-Det: Simple Dynamic Self-Training for Open-Vocabulary Object Detection
by: Xu, Shilin, et al.
Published: (2023)
by: Xu, Shilin, et al.
Published: (2023)
DetCLIPv3: Towards Versatile Generative Open-vocabulary Object Detection
by: Yao, Lewei, et al.
Published: (2024)
by: Yao, Lewei, et al.
Published: (2024)
AD-Det: Boosting Object Detection in UAV Images with Focused Small Objects and Balanced Tail Classes
by: Li, Zhenteng, et al.
Published: (2025)
by: Li, Zhenteng, et al.
Published: (2025)
PlanGen: Towards Unified Layout Planning and Image Generation in Auto-Regressive Vision Language Models
by: He, Runze, et al.
Published: (2025)
by: He, Runze, et al.
Published: (2025)
BioDet: Boosting Industrial Object Detection with Image Preprocessing Strategies
by: Hu, Jiaqi, et al.
Published: (2025)
by: Hu, Jiaqi, et al.
Published: (2025)
MatchDet: A Collaborative Framework for Image Matching and Object Detection
by: Lai, Jinxiang, et al.
Published: (2023)
by: Lai, Jinxiang, et al.
Published: (2023)
DenoDet V2: Phase-Amplitude Cross Denoising for SAR Object Detection
by: Ni, Kang, et al.
Published: (2025)
by: Ni, Kang, et al.
Published: (2025)
SM3Det: A Unified Model for Multi-Modal Remote Sensing Object Detection
by: Li, Yuxuan, et al.
Published: (2024)
by: Li, Yuxuan, et al.
Published: (2024)
FoodLMM: A Versatile Food Assistant using Large Multi-modal Model
by: Yin, Yuehao, et al.
Published: (2023)
by: Yin, Yuehao, et al.
Published: (2023)
U-StyDiT: Ultra-high Quality Artistic Style Transfer Using Diffusion Transformers
by: Zhang, Zhanjie, et al.
Published: (2025)
by: Zhang, Zhanjie, et al.
Published: (2025)
Enhanced Object Detection: A Study on Vast Vocabulary Object Detection Track for V3Det Challenge 2024
by: Wu, Peixi, et al.
Published: (2024)
by: Wu, Peixi, et al.
Published: (2024)
BadDet+: Robust Backdoor Attacks for Object Detection
by: Dunnett, Kealan, et al.
Published: (2026)
by: Dunnett, Kealan, et al.
Published: (2026)
InfoDet: A Dataset for Infographic Element Detection
by: Zhu, Jiangning, et al.
Published: (2025)
by: Zhu, Jiangning, et al.
Published: (2025)
Gaussian-Det: Learning Closed-Surface Gaussians for 3D Object Detection
by: Yan, Hongru, et al.
Published: (2024)
by: Yan, Hongru, et al.
Published: (2024)
MutDet: Mutually Optimizing Pre-training for Remote Sensing Object Detection
by: Huang, Ziyue, et al.
Published: (2024)
by: Huang, Ziyue, et al.
Published: (2024)
CascadeV-Det: Cascade Point Voting for 3D Object Detection
by: Liang, Yingping, et al.
Published: (2024)
by: Liang, Yingping, et al.
Published: (2024)
Surely Large Multimodal Models (Don't) Excel in Visual Species Recognition?
by: Liu, Tian, et al.
Published: (2025)
by: Liu, Tian, et al.
Published: (2025)
Similar Items
-
FG-CLIP 2: A Bilingual Fine-grained Vision-Language Alignment Model
by: Xie, Chunyu, et al.
Published: (2025) -
RzenEmbed: Towards Comprehensive Multimodal Retrieval
by: Jian, Weijian, et al.
Published: (2025) -
FG-CLIP: Fine-Grained Visual and Textual Alignment
by: Xie, Chunyu, et al.
Published: (2025) -
ConsistencyDet: A Few-step Denoising Framework for Object Detection Using the Consistency Model
by: Jiang, Lifan, et al.
Published: (2024) -
GenDet: Painting Colored Bounding Boxes on Images via Diffusion Model for Object Detection
by: Min, Chen, et al.
Published: (2026)