Open3DTrack: Towards Open-Vocabulary 3D Multi-Object Tracking
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ishaq, Ayesha, Boudjoghra, Mohamed El Amine, Lahoud, Jean, Khan, Fahad Shahbaz, Khan, Salman, Cholakkal, Hisham, Anwer, Rao Muhammad |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Open-YOLO 3D: Towards Fast and Accurate Open-Vocabulary 3D Instance Segmentation
par: Boudjoghra, Mohamed El Amine, et autres
Publié: (2024)
par: Boudjoghra, Mohamed El Amine, et autres
Publié: (2024)
Tracking Meets Large Multimodal Models for Driving Scenario Understanding
par: Ishaq, Ayesha, et autres
Publié: (2025)
par: Ishaq, Ayesha, et autres
Publié: (2025)
MedROV: Towards Real-Time Open-Vocabulary Detection Across Diverse Medical Imaging Modalities
par: Sheikh, Tooba Tehreem, et autres
Publié: (2025)
par: Sheikh, Tooba Tehreem, et autres
Publié: (2025)
DriveLMM-o1: A Step-by-Step Reasoning Dataset and Large Multimodal Model for Driving Scenario Understanding
par: Ishaq, Ayesha, et autres
Publié: (2025)
par: Ishaq, Ayesha, et autres
Publié: (2025)
Semi-supervised Open-World Object Detection
par: Mullappilly, Sahal Shaji, et autres
Publié: (2024)
par: Mullappilly, Sahal Shaji, et autres
Publié: (2024)
How Good are Foundation Models in Step-by-Step Embodied Reasoning?
par: Dissanayake, Dinura, et autres
Publié: (2025)
par: Dissanayake, Dinura, et autres
Publié: (2025)
DEFT: Decompositional Efficient Fine-Tuning for Text-to-Image Models
par: Kumar, Komal, et autres
Publié: (2025)
par: Kumar, Komal, et autres
Publié: (2025)
Paper Circle: An Open-source Multi-agent Research Discovery and Analysis Framework
par: Kumar, Komal, et autres
Publié: (2026)
par: Kumar, Komal, et autres
Publié: (2026)
CLIMB-3D: Continual Learning for Imbalanced 3D Instance Segmentation
par: Thengane, Vishal, et autres
Publié: (2025)
par: Thengane, Vishal, et autres
Publié: (2025)
AI in Agriculture: A Survey of Deep Learning Techniques for Crops, Fisheries and Livestock
par: Nawaz, Umair, et autres
Publié: (2025)
par: Nawaz, Umair, et autres
Publié: (2025)
MediX-R1: Open Ended Medical Reinforcement Learning
par: Mullappilly, Sahal Shaji, et autres
Publié: (2026)
par: Mullappilly, Sahal Shaji, et autres
Publié: (2026)
AIN: The Arabic INclusive Large Multimodal Model
par: Heakl, Ahmed, et autres
Publié: (2025)
par: Heakl, Ahmed, et autres
Publié: (2025)
CDChat: A Large Multimodal Model for Remote Sensing Change Description
par: Noman, Mubashir, et autres
Publié: (2024)
par: Noman, Mubashir, et autres
Publié: (2024)
LLMVoX: Autoregressive Streaming Text-to-Speech Model for Any LLM
par: Shikhar, Sambal, et autres
Publié: (2025)
par: Shikhar, Sambal, et autres
Publié: (2025)
BiMediX: Bilingual Medical Mixture of Experts LLM
par: Pieri, Sara, et autres
Publié: (2024)
par: Pieri, Sara, et autres
Publié: (2024)
CONDA: Condensed Deep Association Learning for Co-Salient Object Detection
par: Li, Long, et autres
Publié: (2024)
par: Li, Long, et autres
Publié: (2024)
TAViS: Text-bridged Audio-Visual Segmentation with Foundation Models
par: Luo, Ziyang, et autres
Publié: (2025)
par: Luo, Ziyang, et autres
Publié: (2025)
Rethinking Transformers Pre-training for Multi-Spectral Satellite Imagery
par: Noman, Mubashir, et autres
Publié: (2024)
par: Noman, Mubashir, et autres
Publié: (2024)
Efficient 3D-Aware Facial Image Editing via Attribute-Specific Prompt Learning
par: Kumar, Amandeep, et autres
Publié: (2024)
par: Kumar, Amandeep, et autres
Publié: (2024)
ELGC-Net: Efficient Local-Global Context Aggregation for Remote Sensing Change Detection
par: Noman, Mubashir, et autres
Publié: (2024)
par: Noman, Mubashir, et autres
Publié: (2024)
XrayGPT: Chest Radiographs Summarization using Medical Vision-Language Models
par: Thawakar, Omkar, et autres
Publié: (2023)
par: Thawakar, Omkar, et autres
Publié: (2023)
Sparse3DTrack: Monocular 3D Object Tracking Using Sparse Supervision
par: Gosala, Nikhil, et autres
Publié: (2026)
par: Gosala, Nikhil, et autres
Publié: (2026)
Video-GroundingDINO: Towards Open-Vocabulary Spatio-Temporal Video Grounding
par: Wasim, Syed Talal, et autres
Publié: (2023)
par: Wasim, Syed Talal, et autres
Publié: (2023)
Time Travel: A Comprehensive Benchmark to Evaluate LMMs on Historical and Cultural Artifacts
par: Ghaboura, Sara, et autres
Publié: (2025)
par: Ghaboura, Sara, et autres
Publié: (2025)
PARIS3D: Reasoning-based 3D Part Segmentation Using Large Multimodal Model
par: Kareem, Amrin, et autres
Publié: (2024)
par: Kareem, Amrin, et autres
Publié: (2024)
EvoLMM: Self-Evolving Large Multimodal Models with Continuous Rewards
par: Thawakar, Omkar, et autres
Publié: (2025)
par: Thawakar, Omkar, et autres
Publié: (2025)
Open-Vocabulary Temporal Action Localization using Multimodal Guidance
par: Gupta, Akshita, et autres
Publié: (2024)
par: Gupta, Akshita, et autres
Publié: (2024)
Multi-modal Generation via Cross-Modal In-Context Learning
par: Kumar, Amandeep, et autres
Publié: (2024)
par: Kumar, Amandeep, et autres
Publié: (2024)
Agent-X: Evaluating Deep Multimodal Reasoning in Vision-Centric Agentic Tasks
par: Ashraf, Tajamul, et autres
Publié: (2025)
par: Ashraf, Tajamul, et autres
Publié: (2025)
All in One: Visual-Description-Guided Unified Point Cloud Segmentation
par: Han, Zongyan, et autres
Publié: (2025)
par: Han, Zongyan, et autres
Publié: (2025)
LLM Post-Training: A Deep Dive into Reasoning Large Language Models
par: Kumar, Komal, et autres
Publié: (2025)
par: Kumar, Komal, et autres
Publié: (2025)
CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning
par: Deria, Ankan, et autres
Publié: (2026)
par: Deria, Ankan, et autres
Publié: (2026)
Salient Mask-Guided Vision Transformer for Fine-Grained Classification
par: Demidov, Dmitry, et autres
Publié: (2023)
par: Demidov, Dmitry, et autres
Publié: (2023)
LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs
par: Thawakar, Omkar, et autres
Publié: (2025)
par: Thawakar, Omkar, et autres
Publié: (2025)
MAviS: A Multimodal Conversational Assistant For Avian Species
par: Kryklyvets, Yevheniia, et autres
Publié: (2026)
par: Kryklyvets, Yevheniia, et autres
Publié: (2026)
OVExp: Open Vocabulary Exploration for Object-Oriented Navigation
par: Wei, Meng, et autres
Publié: (2024)
par: Wei, Meng, et autres
Publié: (2024)
BAPLe: Backdoor Attacks on Medical Foundational Models using Prompt Learning
par: Hanif, Asif, et autres
Publié: (2024)
par: Hanif, Asif, et autres
Publié: (2024)
Open-Set Semi-Supervised Learning for Long-Tailed Medical Datasets
par: Kareem, Daniya Najiha A., et autres
Publié: (2025)
par: Kareem, Daniya Najiha A., et autres
Publié: (2025)
MobiLlama: Towards Accurate and Lightweight Fully Transparent GPT
par: Thawakar, Omkar, et autres
Publié: (2024)
par: Thawakar, Omkar, et autres
Publié: (2024)
NOVA: Next-step Open-Vocabulary Autoregression for 3D Multi-Object Tracking in Autonomous Driving
par: Luo, Kai, et autres
Publié: (2026)
par: Luo, Kai, et autres
Publié: (2026)
Documents similaires
-
Open-YOLO 3D: Towards Fast and Accurate Open-Vocabulary 3D Instance Segmentation
par: Boudjoghra, Mohamed El Amine, et autres
Publié: (2024) -
Tracking Meets Large Multimodal Models for Driving Scenario Understanding
par: Ishaq, Ayesha, et autres
Publié: (2025) -
MedROV: Towards Real-Time Open-Vocabulary Detection Across Diverse Medical Imaging Modalities
par: Sheikh, Tooba Tehreem, et autres
Publié: (2025) -
DriveLMM-o1: A Step-by-Step Reasoning Dataset and Large Multimodal Model for Driving Scenario Understanding
par: Ishaq, Ayesha, et autres
Publié: (2025) -
Semi-supervised Open-World Object Detection
par: Mullappilly, Sahal Shaji, et autres
Publié: (2024)