Shelf-Supervised Cross-Modal Pre-Training for 3D Object Detection
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Khurana, Mehar, Peri, Neehar, Hays, James, Ramanan, Deva |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Long-Tailed 3D Detection via Multi-Modal Fusion
par: Ma, Yechi, et autres
Publié: (2023)
par: Ma, Yechi, et autres
Publié: (2023)
RefAV: Towards Planning-Centric Scenario Mining
par: Davidson, Cainan, et autres
Publié: (2025)
par: Davidson, Cainan, et autres
Publié: (2025)
Revisiting Few-Shot Object Detection with Vision-Language Models
par: Madan, Anish, et autres
Publié: (2023)
par: Madan, Anish, et autres
Publié: (2023)
MonoFusion: Sparse-View 4D Reconstruction via Monocular Fusion
par: Wang, Zihan, et autres
Publié: (2025)
par: Wang, Zihan, et autres
Publié: (2025)
Roboflow100-VL: A Multi-Domain Object Detection Benchmark for Vision-Language Models
par: Robicheaux, Peter, et autres
Publié: (2025)
par: Robicheaux, Peter, et autres
Publié: (2025)
I Can't Believe It's Not Scene Flow!
par: Khatri, Ishan, et autres
Publié: (2024)
par: Khatri, Ishan, et autres
Publié: (2024)
Better Call SAL: Towards Learning to Segment Anything in Lidar
par: Ošep, Aljoša, et autres
Publié: (2024)
par: Ošep, Aljoša, et autres
Publié: (2024)
ZeroFlow: Scalable Scene Flow via Distillation
par: Vedder, Kyle, et autres
Publié: (2023)
par: Vedder, Kyle, et autres
Publié: (2023)
DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection
par: Gare, Gautam Rajendrakumar, et autres
Publié: (2026)
par: Gare, Gautam Rajendrakumar, et autres
Publié: (2026)
Self-Supervised Modality-Agnostic Pre-Training of Swin Transformers
par: Talasila, Abhiroop, et autres
Publié: (2024)
par: Talasila, Abhiroop, et autres
Publié: (2024)
RF-DETR: Neural Architecture Search for Real-Time Detection Transformers
par: Robinson, Isaac, et autres
Publié: (2025)
par: Robinson, Isaac, et autres
Publié: (2025)
TraIL-Det: Transformation-Invariant Local Feature Networks for 3D LiDAR Object Detection with Unsupervised Pre-Training
par: Li, Li, et autres
Publié: (2024)
par: Li, Li, et autres
Publié: (2024)
TAO-Amodal: A Benchmark for Tracking Any Object Amodally
par: Hsieh, Cheng-Yen, et autres
Publié: (2023)
par: Hsieh, Cheng-Yen, et autres
Publié: (2023)
Planning with Adaptive World Models for Autonomous Driving
par: Vasudevan, Arun Balajee, et autres
Publié: (2024)
par: Vasudevan, Arun Balajee, et autres
Publié: (2024)
Any4D: Unified Feed-Forward Metric 4D Reconstruction
par: Karhade, Jay, et autres
Publié: (2025)
par: Karhade, Jay, et autres
Publié: (2025)
Learning Spatial Structure from Pre-Beamforming Per-Antenna Range-Doppler Radar Data via Visibility-Aware Cross-Modal Supervision
par: Sebastian, George, et autres
Publié: (2026)
par: Sebastian, George, et autres
Publié: (2026)
Large Pre-Trained Models for Bimanual Manipulation in 3D
par: Yurchyk, Hanna, et autres
Publié: (2025)
par: Yurchyk, Hanna, et autres
Publié: (2025)
Predicting Long-horizon Futures by Conditioning on Geometry and Time
par: Khurana, Tarasha, et autres
Publié: (2024)
par: Khurana, Tarasha, et autres
Publié: (2024)
Wild Visual Navigation: Fast Traversability Learning via Pre-Trained Models and Online Self-Supervision
par: Mattamala, Matías, et autres
Publié: (2024)
par: Mattamala, Matías, et autres
Publié: (2024)
TimePillars: Temporally-Recurrent 3D LiDAR Object Detection
par: Calvo, Ernesto Lozano, et autres
Publié: (2023)
par: Calvo, Ernesto Lozano, et autres
Publié: (2023)
Continuous Object State Recognition for Cooking Robots Using Pre-Trained Vision-Language Models and Black-box Optimization
par: Kawaharazuka, Kento, et autres
Publié: (2024)
par: Kawaharazuka, Kento, et autres
Publié: (2024)
Modular Quantization-Aware Training for 6D Object Pose Estimation
par: Javed, Saqib, et autres
Publié: (2023)
par: Javed, Saqib, et autres
Publié: (2023)
UFM: A Simple Path towards Unified Dense Correspondence with Flow
par: Zhang, Yuchen, et autres
Publié: (2025)
par: Zhang, Yuchen, et autres
Publié: (2025)
GrabS: Generative Embodied Agent for 3D Object Segmentation without Scene Supervision
par: Zhang, Zihui, et autres
Publié: (2025)
par: Zhang, Zihui, et autres
Publié: (2025)
Multi-Modal Data-Efficient 3D Scene Understanding for Autonomous Driving
par: Kong, Lingdong, et autres
Publié: (2024)
par: Kong, Lingdong, et autres
Publié: (2024)
Depth-supervised NeRF: Fewer Views and Faster Training for Free
par: Deng, Kangle, et autres
Publié: (2021)
par: Deng, Kangle, et autres
Publié: (2021)
Show, Don't Tell: Detecting Novel Objects by Watching Human Videos
par: Akl, James, et autres
Publié: (2026)
par: Akl, James, et autres
Publié: (2026)
Using Diffusion Priors for Video Amodal Segmentation
par: Chen, Kaihua, et autres
Publié: (2024)
par: Chen, Kaihua, et autres
Publié: (2024)
Reconstruct, Inpaint, Test-Time Finetune: Dynamic Novel-view Synthesis from Monocular Videos
par: Chen, Kaihua, et autres
Publié: (2025)
par: Chen, Kaihua, et autres
Publié: (2025)
MapAnything: Universal Feed-Forward Metric 3D Reconstruction
par: Keetha, Nikhil, et autres
Publié: (2025)
par: Keetha, Nikhil, et autres
Publié: (2025)
Composing Pre-Trained Object-Centric Representations for Robotics From "What" and "Where" Foundation Models
par: Shi, Junyao, et autres
Publié: (2024)
par: Shi, Junyao, et autres
Publié: (2024)
ViTaPEs: Visuotactile Position Encodings for Cross-Modal Alignment in Multimodal Transformers
par: Lygerakis, Fotios, et autres
Publié: (2025)
par: Lygerakis, Fotios, et autres
Publié: (2025)
Just Add Geometry: Gradient-Free Open-Vocabulary 3D Detection Without Human-in-the-Loop
par: Goel, Atharv, et autres
Publié: (2025)
par: Goel, Atharv, et autres
Publié: (2025)
Fast Post-Hoc Confidence Fusion for 3-Class Open-Set Aerial Object Detection
par: Loukovitis, Spyridon, et autres
Publié: (2025)
par: Loukovitis, Spyridon, et autres
Publié: (2025)
UniFlow: Zero-Shot LiDAR Scene Flow for Autonomous Vehicles
par: Li, Siyi, et autres
Publié: (2025)
par: Li, Siyi, et autres
Publié: (2025)
EvObj: Learning Evolving Object-centric Representations for 3D Instance Segmentation without Scene Supervision
par: Chen, Jiahao, et autres
Publié: (2026)
par: Chen, Jiahao, et autres
Publié: (2026)
Towards Training-Free Underwater 3D Object Detection from Sonar Point Clouds: A Comparison of Traditional and Deep Learning Approaches
par: Shaukat, M. Salman, et autres
Publié: (2025)
par: Shaukat, M. Salman, et autres
Publié: (2025)
Learning an Actionable Discrete Diffusion Policy via Large-Scale Actionless Video Pre-Training
par: He, Haoran, et autres
Publié: (2024)
par: He, Haoran, et autres
Publié: (2024)
Point Cloud Models Improve Visual Robustness in Robotic Learners
par: Peri, Skand, et autres
Publié: (2024)
par: Peri, Skand, et autres
Publié: (2024)
Dream2Real: Zero-Shot 3D Object Rearrangement with Vision-Language Models
par: Kapelyukh, Ivan, et autres
Publié: (2023)
par: Kapelyukh, Ivan, et autres
Publié: (2023)
Documents similaires
-
Long-Tailed 3D Detection via Multi-Modal Fusion
par: Ma, Yechi, et autres
Publié: (2023) -
RefAV: Towards Planning-Centric Scenario Mining
par: Davidson, Cainan, et autres
Publié: (2025) -
Revisiting Few-Shot Object Detection with Vision-Language Models
par: Madan, Anish, et autres
Publié: (2023) -
MonoFusion: Sparse-View 4D Reconstruction via Monocular Fusion
par: Wang, Zihan, et autres
Publié: (2025) -
Roboflow100-VL: A Multi-Domain Object Detection Benchmark for Vision-Language Models
par: Robicheaux, Peter, et autres
Publié: (2025)