Long-Tailed 3D Detection via Multi-Modal Fusion
Fuente:
arXiv
Saved in:
| Main Authors: | Ma, Yechi, Peri, Neehar, Dave, Achal, Hua, Wei, Ramanan, Deva, Kong, Shu |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Shelf-Supervised Cross-Modal Pre-Training for 3D Object Detection
by: Khurana, Mehar, et al.
Published: (2024)
by: Khurana, Mehar, et al.
Published: (2024)
RefAV: Towards Planning-Centric Scenario Mining
by: Davidson, Cainan, et al.
Published: (2025)
by: Davidson, Cainan, et al.
Published: (2025)
Revisiting Few-Shot Object Detection with Vision-Language Models
by: Madan, Anish, et al.
Published: (2023)
by: Madan, Anish, et al.
Published: (2023)
MonoFusion: Sparse-View 4D Reconstruction via Monocular Fusion
by: Wang, Zihan, et al.
Published: (2025)
by: Wang, Zihan, et al.
Published: (2025)
Better Call SAL: Towards Learning to Segment Anything in Lidar
by: Ošep, Aljoša, et al.
Published: (2024)
by: Ošep, Aljoša, et al.
Published: (2024)
DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection
by: Gare, Gautam Rajendrakumar, et al.
Published: (2026)
by: Gare, Gautam Rajendrakumar, et al.
Published: (2026)
RF-DETR: Neural Architecture Search for Real-Time Detection Transformers
by: Robinson, Isaac, et al.
Published: (2025)
by: Robinson, Isaac, et al.
Published: (2025)
Auto-Annotation with Expert-Crafted Guidelines: A Study through 3D LiDAR Detection Benchmark
by: Ma, Yechi, et al.
Published: (2025)
by: Ma, Yechi, et al.
Published: (2025)
I Can't Believe It's Not Scene Flow!
by: Khatri, Ishan, et al.
Published: (2024)
by: Khatri, Ishan, et al.
Published: (2024)
Roadside Monocular 3D Detection Prompted by 2D Detection
by: Ma, Yechi, et al.
Published: (2024)
by: Ma, Yechi, et al.
Published: (2024)
Roboflow100-VL: A Multi-Domain Object Detection Benchmark for Vision-Language Models
by: Robicheaux, Peter, et al.
Published: (2025)
by: Robicheaux, Peter, et al.
Published: (2025)
BEVDilation: LiDAR-Centric Multi-Modal Fusion for 3D Object Detection
by: Zhang, Guowen, et al.
Published: (2025)
by: Zhang, Guowen, et al.
Published: (2025)
UniFlow: Zero-Shot LiDAR Scene Flow for Autonomous Vehicles
by: Li, Siyi, et al.
Published: (2025)
by: Li, Siyi, et al.
Published: (2025)
FOMO-3D: Using Vision Foundation Models for Long-Tailed 3D Object Detection
by: Yang, Anqi Joyce, et al.
Published: (2026)
by: Yang, Anqi Joyce, et al.
Published: (2026)
SplaTAM: Splat, Track & Map 3D Gaussians for Dense RGB-D SLAM
by: Keetha, Nikhil, et al.
Published: (2023)
by: Keetha, Nikhil, et al.
Published: (2023)
Predicting Long-horizon Futures by Conditioning on Geometry and Time
by: Khurana, Tarasha, et al.
Published: (2024)
by: Khurana, Tarasha, et al.
Published: (2024)
OccCylindrical: Multi-Modal Fusion with Cylindrical Representation for 3D Semantic Occupancy Prediction
by: Ming, Zhenxing, et al.
Published: (2025)
by: Ming, Zhenxing, et al.
Published: (2025)
TAO-Amodal: A Benchmark for Tracking Any Object Amodally
by: Hsieh, Cheng-Yen, et al.
Published: (2023)
by: Hsieh, Cheng-Yen, et al.
Published: (2023)
Planning with Adaptive World Models for Autonomous Driving
by: Vasudevan, Arun Balajee, et al.
Published: (2024)
by: Vasudevan, Arun Balajee, et al.
Published: (2024)
LongTail Driving Scenarios with Reasoning Traces: The KITScenes LongTail Dataset
by: Wagner, Royden, et al.
Published: (2026)
by: Wagner, Royden, et al.
Published: (2026)
ZeroFlow: Scalable Scene Flow via Distillation
by: Vedder, Kyle, et al.
Published: (2023)
by: Vedder, Kyle, et al.
Published: (2023)
Dreamitate: Real-World Visuomotor Policy Learning via Video Generation
by: Liang, Junbang, et al.
Published: (2024)
by: Liang, Junbang, et al.
Published: (2024)
VoxAfford: Multi-Scale Voxel-Token Fusion for Open-Vocabulary 3D Affordance Detection
by: Sun, Haowen, et al.
Published: (2026)
by: Sun, Haowen, et al.
Published: (2026)
CRISP: Contact-Guided Real2Sim from Monocular Video with Planar Scene Primitives
by: Wang, Zihan, et al.
Published: (2025)
by: Wang, Zihan, et al.
Published: (2025)
Graph-Based Multi-Modal Sensor Fusion for Autonomous Driving
by: Sani, Depanshu, et al.
Published: (2024)
by: Sani, Depanshu, et al.
Published: (2024)
CoIn3D: Revisiting Configuration-Invariant Multi-Camera 3D Object Detection
by: Kuang, Zhaonian, et al.
Published: (2026)
by: Kuang, Zhaonian, et al.
Published: (2026)
Multi-Modal Data-Efficient 3D Scene Understanding for Autonomous Driving
by: Kong, Lingdong, et al.
Published: (2024)
by: Kong, Lingdong, et al.
Published: (2024)
M3: 3D-Spatial MultiModal Memory
by: Zou, Xueyan, et al.
Published: (2025)
by: Zou, Xueyan, et al.
Published: (2025)
Any4D: Unified Feed-Forward Metric 4D Reconstruction
by: Karhade, Jay, et al.
Published: (2025)
by: Karhade, Jay, et al.
Published: (2025)
Cross-Level Sensor Fusion with Object Lists via Transformer for 3D Object Detection
by: Liu, Xiangzhong, et al.
Published: (2025)
by: Liu, Xiangzhong, et al.
Published: (2025)
OccFusion: Multi-Sensor Fusion Framework for 3D Semantic Occupancy Prediction
by: Ming, Zhenxing, et al.
Published: (2024)
by: Ming, Zhenxing, et al.
Published: (2024)
Perspective-Invariant 3D Object Detection
by: Liang, Ao, et al.
Published: (2025)
by: Liang, Ao, et al.
Published: (2025)
Integrating Multi-Modal Sensors: A Review of Fusion Techniques for Intelligent Vehicles
by: Wei, Chuheng, et al.
Published: (2025)
by: Wei, Chuheng, et al.
Published: (2025)
Neural Eulerian Scene Flow Fields
by: Vedder, Kyle, et al.
Published: (2024)
by: Vedder, Kyle, et al.
Published: (2024)
LiRaFusion: Deep Adaptive LiDAR-Radar Fusion for 3D Object Detection
by: Song, Jingyu, et al.
Published: (2024)
by: Song, Jingyu, et al.
Published: (2024)
LuSeg: Efficient Negative and Positive Obstacles Segmentation via Contrast-Driven Multi-Modal Feature Fusion on the Lunar
by: Jiao, Shuaifeng, et al.
Published: (2025)
by: Jiao, Shuaifeng, et al.
Published: (2025)
MSSF: A 4D Radar and Camera Fusion Framework With Multi-Stage Sampling for 3D Object Detection in Autonomous Driving
by: Liu, Hongsi, et al.
Published: (2024)
by: Liu, Hongsi, et al.
Published: (2024)
VLMFusionOcc3D: VLM Assisted Multi-Modal 3D Semantic Occupancy Prediction
by: Doruk, A. Enes, et al.
Published: (2026)
by: Doruk, A. Enes, et al.
Published: (2026)
UniBEV: Multi-modal 3D Object Detection with Uniform BEV Encoders for Robustness against Missing Sensor Modalities
by: Wang, Shiming, et al.
Published: (2023)
by: Wang, Shiming, et al.
Published: (2023)
A Coarse-to-Fine Approach to Multi-Modality 3D Occupancy Grounding
by: Shi, Zhan, et al.
Published: (2025)
by: Shi, Zhan, et al.
Published: (2025)
Similar Items
-
Shelf-Supervised Cross-Modal Pre-Training for 3D Object Detection
by: Khurana, Mehar, et al.
Published: (2024) -
RefAV: Towards Planning-Centric Scenario Mining
by: Davidson, Cainan, et al.
Published: (2025) -
Revisiting Few-Shot Object Detection with Vision-Language Models
by: Madan, Anish, et al.
Published: (2023) -
MonoFusion: Sparse-View 4D Reconstruction via Monocular Fusion
by: Wang, Zihan, et al.
Published: (2025) -
Better Call SAL: Towards Learning to Segment Anything in Lidar
by: Ošep, Aljoša, et al.
Published: (2024)