A Review of 3D Object Detection with Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Sapkota, Ranjan, Roumeliotis, Konstantinos I, Cheppally, Rahul Harsha, Calero, Marco Flores, Karkee, Manoj |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
YOLO26: Key Architectural Enhancements and Performance Benchmarking for Real-Time Object Detection
por: Sapkota, Ranjan, et al.
Publicado: (2025)
por: Sapkota, Ranjan, et al.
Publicado: (2025)
RF-DETR Object Detection vs YOLOv12 : A Study of Transformer-based and CNN-based Architectures for Single-Class and Multi-Class Greenfruit Detection in Complex Orchard Environments Under Label Ambiguity
por: Sapkota, Ranjan, et al.
Publicado: (2025)
por: Sapkota, Ranjan, et al.
Publicado: (2025)
Vision-Language-Action (VLA) Models: Concepts, Progress, Applications and Challenges
por: Sapkota, Ranjan, et al.
Publicado: (2025)
por: Sapkota, Ranjan, et al.
Publicado: (2025)
Object Detection with Multimodal Large Vision-Language Models: An In-depth Review
por: Sapkota, Ranjan, et al.
Publicado: (2025)
por: Sapkota, Ranjan, et al.
Publicado: (2025)
The SAM2-to-SAM3 Gap in the Segment Anything Model Family: Why Prompt-Based Expertise Fails in Concept-Driven Image Segmentation
por: Sapkota, Ranjan, et al.
Publicado: (2025)
por: Sapkota, Ranjan, et al.
Publicado: (2025)
Generalization vs. Specialization: Evaluating Segment Anything Model (SAM3) Zero-Shot Segmentation Against Fine-Tuned YOLO Detectors
por: Sapkota, Ranjan, et al.
Publicado: (2025)
por: Sapkota, Ranjan, et al.
Publicado: (2025)
Plant Disease Detection through Multimodal Large Language Models and Convolutional Neural Networks
por: Roumeliotis, Konstantinos I., et al.
Publicado: (2025)
por: Roumeliotis, Konstantinos I., et al.
Publicado: (2025)
YOLO11 and Vision Transformers based 3D Pose Estimation of Immature Green Fruits in Commercial Apple Orchards for Robotic Thinning
por: Sapkota, Ranjan, et al.
Publicado: (2024)
por: Sapkota, Ranjan, et al.
Publicado: (2024)
Ultralytics YOLO Evolution: An Overview of YOLO26, YOLO11, YOLOv8 and YOLOv5 Object Detectors for Computer Vision and Pattern Recognition
por: Sapkota, Ranjan, et al.
Publicado: (2025)
por: Sapkota, Ranjan, et al.
Publicado: (2025)
Generative AI in Agriculture: Creating Image Datasets Using DALL.E's Advanced Large Language Model Capabilities
por: Sapkota, Ranjan, et al.
Publicado: (2023)
por: Sapkota, Ranjan, et al.
Publicado: (2023)
Improved YOLOv12 with LLM-Generated Synthetic Data for Enhanced Apple Detection and Benchmarking Against YOLOv11 and YOLOv10
por: Sapkota, Ranjan, et al.
Publicado: (2025)
por: Sapkota, Ranjan, et al.
Publicado: (2025)
Comparing YOLOv11 and YOLOv8 for instance segmentation of occluded and non-occluded immature green fruits in complex orchard environment
por: Sapkota, Ranjan, et al.
Publicado: (2024)
por: Sapkota, Ranjan, et al.
Publicado: (2024)
YOLOE-26: Integrating YOLO26 with YOLOE for Real-Time Open-Vocabulary Instance Segmentation
por: Sapkota, Ranjan, et al.
Publicado: (2026)
por: Sapkota, Ranjan, et al.
Publicado: (2026)
Integrating YOLO11 and Convolution Block Attention Module for Multi-Season Segmentation of Tree Trunks and Branches in Commercial Apple Orchards
por: Sapkota, Ranjan, et al.
Publicado: (2024)
por: Sapkota, Ranjan, et al.
Publicado: (2024)
Comparing YOLOv8 and Mask R-CNN for instance segmentation in complex orchard environments
por: Sapkota, Ranjan, et al.
Publicado: (2023)
por: Sapkota, Ranjan, et al.
Publicado: (2023)
Zero-Shot Automatic Annotation and Instance Segmentation using LLM-Generated Datasets: Eliminating Field Imaging and Manual Annotation for Deep Learning Model Development
por: Sapkota, Ranjan, et al.
Publicado: (2024)
por: Sapkota, Ranjan, et al.
Publicado: (2024)
Immature Green Apple Detection and Sizing in Commercial Orchards using YOLOv8 and Shape Fitting Techniques
por: Sapkota, Ranjan, et al.
Publicado: (2023)
por: Sapkota, Ranjan, et al.
Publicado: (2023)
RowDetr: End-to-End Crop Row Detection Using Polynomials
por: Cheppally, Rahul Harsha, et al.
Publicado: (2024)
por: Cheppally, Rahul Harsha, et al.
Publicado: (2024)
Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey
por: Sapkota, Ranjan, et al.
Publicado: (2025)
por: Sapkota, Ranjan, et al.
Publicado: (2025)
Axis-Aligned 3D Stalk Diameter Estimation from RGB-D Imagery
por: Vail, Benjamin, et al.
Publicado: (2025)
por: Vail, Benjamin, et al.
Publicado: (2025)
Vibe Coding vs. Agentic Coding: Fundamentals and Practical Implications of Agentic AI
por: Sapkota, Ranjan, et al.
Publicado: (2025)
por: Sapkota, Ranjan, et al.
Publicado: (2025)
3D Reconstruction and Information Fusion between Dormant and Canopy Seasons in Commercial Orchards Using Deep Learning and Fast GICP
por: Sapkota, Ranjan, et al.
Publicado: (2025)
por: Sapkota, Ranjan, et al.
Publicado: (2025)
Comprehensive Performance Evaluation of YOLOv12, YOLO11, YOLOv10, YOLOv9 and YOLOv8 on Detecting and Counting Fruitlet in Complex Orchard Environments
por: Sapkota, Ranjan, et al.
Publicado: (2024)
por: Sapkota, Ranjan, et al.
Publicado: (2024)
Computer Vision based Automated Quantification of Agricultural Sprayers Boom Displacement
por: Dalal, Aryan Singh, et al.
Publicado: (2025)
por: Dalal, Aryan Singh, et al.
Publicado: (2025)
FruitProm: Probabilistic Maturity Estimation and Detection of Fruits and Vegetables
por: Rai, Sidharth, et al.
Publicado: (2025)
por: Rai, Sidharth, et al.
Publicado: (2025)
AI Agents vs. Agentic AI: A Conceptual Taxonomy, Applications and Challenges
por: Sapkota, Ranjan, et al.
Publicado: (2025)
por: Sapkota, Ranjan, et al.
Publicado: (2025)
UAVs Meet Agentic AI: A Multidomain Survey of Autonomous Aerial Intelligence and Agentic UAVs
por: Sapkota, Ranjan, et al.
Publicado: (2025)
por: Sapkota, Ranjan, et al.
Publicado: (2025)
YOLO advances to its genesis: a decadal and comprehensive review of the You Only Look Once (YOLO) series
por: Sapkota, Ranjan, et al.
Publicado: (2024)
por: Sapkota, Ranjan, et al.
Publicado: (2024)
FruitProM-V2: Robust Probabilistic Maturity Estimation and Detection of Fruits and Vegetables
por: Cheppally, Rahul Harsha, et al.
Publicado: (2026)
por: Cheppally, Rahul Harsha, et al.
Publicado: (2026)
Agentic AI with Orchestrator-Agent Trust: A Modular Visual Classification Framework with Trust-Aware Orchestration and RAG-Based Reasoning
por: Roumeliotis, Konstantinos I., et al.
Publicado: (2025)
por: Roumeliotis, Konstantinos I., et al.
Publicado: (2025)
Site-specific weed management in corn using UAS imagery analysis and computer vision techniques
por: Sapkota, Ranjan, et al.
Publicado: (2022)
por: Sapkota, Ranjan, et al.
Publicado: (2022)
Vision-Language Guidance for LiDAR-based Unsupervised 3D Object Detection
por: Fruhwirth-Reisinger, Christian, et al.
Publicado: (2024)
por: Fruhwirth-Reisinger, Christian, et al.
Publicado: (2024)
Vision-Language Model for Object Detection and Segmentation: A Review and Evaluation
por: Feng, Yongchao, et al.
Publicado: (2025)
por: Feng, Yongchao, et al.
Publicado: (2025)
OriCon3D: Effective 3D Object Detection using Orientation and Confidence
por: Rajani, Dhyey Manish, et al.
Publicado: (2023)
por: Rajani, Dhyey Manish, et al.
Publicado: (2023)
AgRegNet: A Deep Regression Network for Flower and Fruit Density Estimation, Localization, and Counting in Orchards
por: Bhattarai, Uddhav, et al.
Publicado: (2024)
por: Bhattarai, Uddhav, et al.
Publicado: (2024)
Revisiting Few-Shot Object Detection with Vision-Language Models
por: Madan, Anish, et al.
Publicado: (2023)
por: Madan, Anish, et al.
Publicado: (2023)
VFMM3D: Releasing the Potential of Image by Vision Foundation Model for Monocular 3D Object Detection
por: Ding, Bonan, et al.
Publicado: (2024)
por: Ding, Bonan, et al.
Publicado: (2024)
Training an Open-Vocabulary Monocular 3D Object Detection Model without 3D Data
por: Huang, Rui, et al.
Publicado: (2024)
por: Huang, Rui, et al.
Publicado: (2024)
FOMO-3D: Using Vision Foundation Models for Long-Tailed 3D Object Detection
por: Yang, Anqi Joyce, et al.
Publicado: (2026)
por: Yang, Anqi Joyce, et al.
Publicado: (2026)
ClipGrader: Leveraging Vision-Language Models for Robust Label Quality Assessment in Object Detection
por: Lu, Hong, et al.
Publicado: (2025)
por: Lu, Hong, et al.
Publicado: (2025)
Ejemplares similares
-
YOLO26: Key Architectural Enhancements and Performance Benchmarking for Real-Time Object Detection
por: Sapkota, Ranjan, et al.
Publicado: (2025) -
RF-DETR Object Detection vs YOLOv12 : A Study of Transformer-based and CNN-based Architectures for Single-Class and Multi-Class Greenfruit Detection in Complex Orchard Environments Under Label Ambiguity
por: Sapkota, Ranjan, et al.
Publicado: (2025) -
Vision-Language-Action (VLA) Models: Concepts, Progress, Applications and Challenges
por: Sapkota, Ranjan, et al.
Publicado: (2025) -
Object Detection with Multimodal Large Vision-Language Models: An In-depth Review
por: Sapkota, Ranjan, et al.
Publicado: (2025) -
The SAM2-to-SAM3 Gap in the Segment Anything Model Family: Why Prompt-Based Expertise Fails in Concept-Driven Image Segmentation
por: Sapkota, Ranjan, et al.
Publicado: (2025)