OmDet: Large-scale vision-language multi-dataset pre-training with multimodal detection network
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhao, Tiancheng, Liu, Peng, Lee, Kyusong |
|---|---|
| Format: | Preprint |
| Publié: |
2022
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
OmAgent: A Multi-modal Agent Framework for Complex Video Understanding with Task Divide-and-Conquer
par: Zhang, Lu, et autres
Publié: (2024)
par: Zhang, Lu, et autres
Publié: (2024)
OmChat: A Recipe to Train Multimodal Language Models with Strong Long Context and Video Understanding
par: Zhao, Tiancheng, et autres
Publié: (2024)
par: Zhao, Tiancheng, et autres
Publié: (2024)
Real-time Transformer-based Open-Vocabulary Detection with Efficient Fusion Head
par: Zhao, Tiancheng, et autres
Publié: (2024)
par: Zhao, Tiancheng, et autres
Publié: (2024)
Preserving Knowledge in Large Language Model with Model-Agnostic Self-Decompression
par: Zhang, Zilun, et autres
Publié: (2024)
par: Zhang, Zilun, et autres
Publié: (2024)
PubMed-Ophtha: An open resource for training ophthalmology vision-language models on scientific literature
par: Hallitschke, Verena Jasmin, et autres
Publié: (2026)
par: Hallitschke, Verena Jasmin, et autres
Publié: (2026)
When language and vision meet road safety: leveraging multimodal large language models for video-based traffic accident analysis
par: Zhang, Ruixuan, et autres
Publié: (2025)
par: Zhang, Ruixuan, et autres
Publié: (2025)
Assessing the alignment between infants' visual and linguistic experience using multimodal language models
par: Tan, Alvin Wei Ming, et autres
Publié: (2025)
par: Tan, Alvin Wei Ming, et autres
Publié: (2025)
A benchmark multimodal oro-dental dataset for large vision-language models
par: Lv, Haoxin, et autres
Publié: (2025)
par: Lv, Haoxin, et autres
Publié: (2025)
Automating construction safety inspections using a multi-modal vision-language RAG framework
par: Wang, Chenxin, et autres
Publié: (2025)
par: Wang, Chenxin, et autres
Publié: (2025)
VLM-FO1: Bridging the Gap Between High-Level Reasoning and Fine-Grained Perception in VLMs
par: Liu, Peng, et autres
Publié: (2025)
par: Liu, Peng, et autres
Publié: (2025)
Frame Sampling Strategies Matter: A Benchmark for small vision language models
par: Brkic, Marija, et autres
Publié: (2025)
par: Brkic, Marija, et autres
Publié: (2025)
OmViD: Omni-supervised active learning for video action detection
par: Rana, Aayush, et autres
Publié: (2025)
par: Rana, Aayush, et autres
Publié: (2025)
EnsemHalDet: Robust VLM Hallucination Detection via Ensemble of Internal State Detectors
par: Miyazato, Ryuhei, et autres
Publié: (2026)
par: Miyazato, Ryuhei, et autres
Publié: (2026)
VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model
par: Shen, Haozhan, et autres
Publié: (2025)
par: Shen, Haozhan, et autres
Publié: (2025)
A large-scale image-text dataset benchmark for farmland segmentation
par: Tao, Chao, et autres
Publié: (2025)
par: Tao, Chao, et autres
Publié: (2025)
More performant and scalable: Rethinking contrastive vision-language pre-training of radiology in the LLM era
par: Li, Yingtai, et autres
Publié: (2025)
par: Li, Yingtai, et autres
Publié: (2025)
DeViDe: Faceted medical knowledge for improved medical vision-language pre-training
par: Luo, Haozhe, et autres
Publié: (2024)
par: Luo, Haozhe, et autres
Publié: (2024)
Hidden flaws behind expert-level accuracy of multimodal GPT-4 vision in medicine
par: Jin, Qiao, et autres
Publié: (2024)
par: Jin, Qiao, et autres
Publié: (2024)
Interpreting the linear structure of vision-language model embedding spaces
par: Papadimitriou, Isabel, et autres
Publié: (2025)
par: Papadimitriou, Isabel, et autres
Publié: (2025)
synthocr-gen: A synthetic ocr dataset generator for low-resource languages- breaking the data barrier
par: Malik, Haq Nawaz, et autres
Publié: (2026)
par: Malik, Haq Nawaz, et autres
Publié: (2026)
InfoDet: A Dataset for Infographic Element Detection
par: Zhu, Jiangning, et autres
Publié: (2025)
par: Zhu, Jiangning, et autres
Publié: (2025)
RS5M and GeoRSCLIP: A Large Scale Vision-Language Dataset and A Large Vision-Language Model for Remote Sensing
par: Zhang, Zilun, et autres
Publié: (2023)
par: Zhang, Zilun, et autres
Publié: (2023)
Vibe-Eval: A hard evaluation suite for measuring progress of multimodal language models
par: Padlewski, Piotr, et autres
Publié: (2024)
par: Padlewski, Piotr, et autres
Publié: (2024)
ProfVLM: A lightweight video-language model for multi-view proficiency estimation
par: Bianchi, Edoardo, et autres
Publié: (2025)
par: Bianchi, Edoardo, et autres
Publié: (2025)
GlitchBench: Can large multimodal models detect video game glitches?
par: Taesiri, Mohammad Reza, et autres
Publié: (2023)
par: Taesiri, Mohammad Reza, et autres
Publié: (2023)
MIMO: A medical vision language model with visual referring multimodal input and pixel grounding multimodal output
par: Chen, Yanyuan, et autres
Publié: (2025)
par: Chen, Yanyuan, et autres
Publié: (2025)
600k-ks-ocr: a large-scale synthetic dataset for optical character recognition in kashmiri script
par: Malik, Haq Nawaz
Publié: (2026)
par: Malik, Haq Nawaz
Publié: (2026)
Generalizable Entity Grounding via Assistance of Large Language Model
par: Qi, Lu, et autres
Publié: (2024)
par: Qi, Lu, et autres
Publié: (2024)
LaPA: Latent Prompt Assist Model For Medical Visual Question Answering
par: Gu, Tiancheng, et autres
Publié: (2024)
par: Gu, Tiancheng, et autres
Publié: (2024)
The in-context inductive biases of vision-language models differ across modalities
par: Allen, Kelsey, et autres
Publié: (2025)
par: Allen, Kelsey, et autres
Publié: (2025)
Enhancing Biomedical Multi-modal Representation Learning with Multi-scale Pre-training and Perturbed Report Discrimination
par: Zhong, Xinliu, et autres
Publié: (2025)
par: Zhong, Xinliu, et autres
Publié: (2025)
Interpreting the structure of multi-object representations in vision encoders
par: Khajuria, Tarun, et autres
Publié: (2024)
par: Khajuria, Tarun, et autres
Publié: (2024)
Scaling medical imaging report generation with multimodal reinforcement learning
par: Liu, Qianchu, et autres
Publié: (2026)
par: Liu, Qianchu, et autres
Publié: (2026)
MULTIAQUA: A multimodal maritime dataset and robust training strategies for multimodal semantic segmentation
par: Muhovič, Jon, et autres
Publié: (2025)
par: Muhovič, Jon, et autres
Publié: (2025)
Owls are wise and foxes are unfaithful: Uncovering animal stereotypes in vision-language models
par: Aman, Tabinda, et autres
Publié: (2025)
par: Aman, Tabinda, et autres
Publié: (2025)
Uni$^2$Det: Unified and Universal Framework for Prompt-Guided Multi-dataset 3D Detection
par: Wang, Yubin, et autres
Publié: (2024)
par: Wang, Yubin, et autres
Publié: (2024)
Image captioning in different languages
par: van Miltenburg, Emiel
Publié: (2024)
par: van Miltenburg, Emiel
Publié: (2024)
mOSCAR: A Large-scale Multilingual and Multimodal Document-level Corpus
par: Futeral, Matthieu, et autres
Publié: (2024)
par: Futeral, Matthieu, et autres
Publié: (2024)
An Explainable Biomedical Foundation Model via Large-Scale Concept-Enhanced Vision-Language Pre-training
par: Nie, Yuxiang, et autres
Publié: (2025)
par: Nie, Yuxiang, et autres
Publié: (2025)
Hierarchical Multimodal Pre-training for Visually Rich Webpage Understanding
par: Xu, Hongshen, et autres
Publié: (2024)
par: Xu, Hongshen, et autres
Publié: (2024)
Documents similaires
-
OmAgent: A Multi-modal Agent Framework for Complex Video Understanding with Task Divide-and-Conquer
par: Zhang, Lu, et autres
Publié: (2024) -
OmChat: A Recipe to Train Multimodal Language Models with Strong Long Context and Video Understanding
par: Zhao, Tiancheng, et autres
Publié: (2024) -
Real-time Transformer-based Open-Vocabulary Detection with Efficient Fusion Head
par: Zhao, Tiancheng, et autres
Publié: (2024) -
Preserving Knowledge in Large Language Model with Model-Agnostic Self-Decompression
par: Zhang, Zilun, et autres
Publié: (2024) -
PubMed-Ophtha: An open resource for training ophthalmology vision-language models on scientific literature
par: Hallitschke, Verena Jasmin, et autres
Publié: (2026)