HQ-OV3D: A High Box Quality Open-World 3D Detection Framework based on Diffision Model
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Qi, Li, Yabei, Wang, Hongsong, He, Lei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VLM-3D:End-to-End Vision-Language Models for Open-World 3D Perception
di: Chang, Fuhao, et al.
Pubblicazione: (2025)
di: Chang, Fuhao, et al.
Pubblicazione: (2025)
OV9D: Open-Vocabulary Category-Level 9D Object Pose and Size Estimation
di: Cai, Junhao, et al.
Pubblicazione: (2024)
di: Cai, Junhao, et al.
Pubblicazione: (2024)
3D-AffordanceLLM: Harnessing Large Language Models for Open-Vocabulary Affordance Detection in 3D Worlds
di: Chu, Hengshuo, et al.
Pubblicazione: (2025)
di: Chu, Hengshuo, et al.
Pubblicazione: (2025)
Voxel Mamba: Group-Free State Space Models for Point Cloud based 3D Object Detection
di: Zhang, Guowen, et al.
Pubblicazione: (2024)
di: Zhang, Guowen, et al.
Pubblicazione: (2024)
PointVLA: Injecting the 3D World into Vision-Language-Action Models
di: Li, Chengmeng, et al.
Pubblicazione: (2025)
di: Li, Chengmeng, et al.
Pubblicazione: (2025)
Query3D: LLM-Powered Open-Vocabulary Scene Segmentation with Language Embedded 3D Gaussian
di: Chahe, Amirhosein, et al.
Pubblicazione: (2024)
di: Chahe, Amirhosein, et al.
Pubblicazione: (2024)
Calib3D: Calibrating Model Preferences for Reliable 3D Scene Understanding
di: Kong, Lingdong, et al.
Pubblicazione: (2024)
di: Kong, Lingdong, et al.
Pubblicazione: (2024)
OpenSGA: Efficient 3D Scene Graph Alignment in the Open World
di: Chen, Gang, et al.
Pubblicazione: (2026)
di: Chen, Gang, et al.
Pubblicazione: (2026)
Learning 3D Persistent Embodied World Models
di: Zhou, Siyuan, et al.
Pubblicazione: (2025)
di: Zhou, Siyuan, et al.
Pubblicazione: (2025)
3D and 4D World Modeling: A Survey
di: Kong, Lingdong, et al.
Pubblicazione: (2025)
di: Kong, Lingdong, et al.
Pubblicazione: (2025)
3D-CDRGP: Towards Cross-Device Robotic Grasping Policy in 3D Open World
di: Zhao, Weiguang, et al.
Pubblicazione: (2024)
di: Zhao, Weiguang, et al.
Pubblicazione: (2024)
LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding
di: Wang, Shihao, et al.
Pubblicazione: (2026)
di: Wang, Shihao, et al.
Pubblicazione: (2026)
3DRot: Rediscovering the Missing Primitive for RGB-Based 3D Augmentation
di: Yang, Shitian, et al.
Pubblicazione: (2025)
di: Yang, Shitian, et al.
Pubblicazione: (2025)
TraceGen: World Modeling in 3D Trace Space Enables Learning from Cross-Embodiment Videos
di: Lee, Seungjae, et al.
Pubblicazione: (2025)
di: Lee, Seungjae, et al.
Pubblicazione: (2025)
Rethink 3D Object Detection from Physical World
di: Tanaka, Satoshi, et al.
Pubblicazione: (2025)
di: Tanaka, Satoshi, et al.
Pubblicazione: (2025)
LoRA3D: Low-Rank Self-Calibration of 3D Geometric Foundation Models
di: Lu, Ziqi, et al.
Pubblicazione: (2024)
di: Lu, Ziqi, et al.
Pubblicazione: (2024)
BEVDilation: LiDAR-Centric Multi-Modal Fusion for 3D Object Detection
di: Zhang, Guowen, et al.
Pubblicazione: (2025)
di: Zhang, Guowen, et al.
Pubblicazione: (2025)
4D Contrastive Superflows are Dense 3D Representation Learners
di: Xu, Xiang, et al.
Pubblicazione: (2024)
di: Xu, Xiang, et al.
Pubblicazione: (2024)
3DFlowAction: Learning Cross-Embodiment Manipulation from 3D Flow World Model
di: Zhi, Hongyan, et al.
Pubblicazione: (2025)
di: Zhi, Hongyan, et al.
Pubblicazione: (2025)
Online Signature Verification based on the Lagrange formulation with 2D and 3D robotic models
di: Diaz, Moises, et al.
Pubblicazione: (2025)
di: Diaz, Moises, et al.
Pubblicazione: (2025)
SceneFoundry: Generating Interactive Infinite 3D Worlds
di: Chen, ChunTeng, et al.
Pubblicazione: (2026)
di: Chen, ChunTeng, et al.
Pubblicazione: (2026)
Opening the Black Box of 3D Reconstruction Error Analysis with VECTOR
di: Fygenson, Racquel, et al.
Pubblicazione: (2024)
di: Fygenson, Racquel, et al.
Pubblicazione: (2024)
Shelf-Supervised Cross-Modal Pre-Training for 3D Object Detection
di: Khurana, Mehar, et al.
Pubblicazione: (2024)
di: Khurana, Mehar, et al.
Pubblicazione: (2024)
Unsupervised Change Detection for Space Habitats Using 3D Point Clouds
di: Santos, Jamie, et al.
Pubblicazione: (2023)
di: Santos, Jamie, et al.
Pubblicazione: (2023)
TimePillars: Temporally-Recurrent 3D LiDAR Object Detection
di: Calvo, Ernesto Lozano, et al.
Pubblicazione: (2023)
di: Calvo, Ernesto Lozano, et al.
Pubblicazione: (2023)
Generalizable Humanoid Manipulation with 3D Diffusion Policies
di: Ze, Yanjie, et al.
Pubblicazione: (2024)
di: Ze, Yanjie, et al.
Pubblicazione: (2024)
OpenLex3D: A Tiered Evaluation Benchmark for Open-Vocabulary 3D Scene Representations
di: Kassab, Christina, et al.
Pubblicazione: (2025)
di: Kassab, Christina, et al.
Pubblicazione: (2025)
OpenGaussian: Towards Point-Level 3D Gaussian-based Open Vocabulary Understanding
di: Wu, Yanmin, et al.
Pubblicazione: (2024)
di: Wu, Yanmin, et al.
Pubblicazione: (2024)
Large Pre-Trained Models for Bimanual Manipulation in 3D
di: Yurchyk, Hanna, et al.
Pubblicazione: (2025)
di: Yurchyk, Hanna, et al.
Pubblicazione: (2025)
D$^3$Fields: Dynamic 3D Descriptor Fields for Zero-Shot Generalizable Rearrangement
di: Wang, Yixuan, et al.
Pubblicazione: (2023)
di: Wang, Yixuan, et al.
Pubblicazione: (2023)
MSSF: A 4D Radar and Camera Fusion Framework With Multi-Stage Sampling for 3D Object Detection in Autonomous Driving
di: Liu, Hongsi, et al.
Pubblicazione: (2024)
di: Liu, Hongsi, et al.
Pubblicazione: (2024)
The 2nd Place Solution from the 3D Semantic Segmentation Track in the 2024 Waymo Open Dataset Challenge
di: Wu, Qing
Pubblicazione: (2025)
di: Wu, Qing
Pubblicazione: (2025)
3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
di: Ze, Yanjie, et al.
Pubblicazione: (2024)
di: Ze, Yanjie, et al.
Pubblicazione: (2024)
Open3DTrack: Towards Open-Vocabulary 3D Multi-Object Tracking
di: Ishaq, Ayesha, et al.
Pubblicazione: (2024)
di: Ishaq, Ayesha, et al.
Pubblicazione: (2024)
VoxAfford: Multi-Scale Voxel-Token Fusion for Open-Vocabulary 3D Affordance Detection
di: Sun, Haowen, et al.
Pubblicazione: (2026)
di: Sun, Haowen, et al.
Pubblicazione: (2026)
FOMO-3D: Using Vision Foundation Models for Long-Tailed 3D Object Detection
di: Yang, Anqi Joyce, et al.
Pubblicazione: (2026)
di: Yang, Anqi Joyce, et al.
Pubblicazione: (2026)
R3D2: Realistic 3D Asset Insertion via Diffusion for Autonomous Driving Simulation
di: Ljungbergh, William, et al.
Pubblicazione: (2025)
di: Ljungbergh, William, et al.
Pubblicazione: (2025)
VIGS SLAM: IMU-based Large-Scale 3D Gaussian Splatting SLAM
di: Pak, Gyuhyeon, et al.
Pubblicazione: (2025)
di: Pak, Gyuhyeon, et al.
Pubblicazione: (2025)
A Neural Representation Framework with LLM-Driven Spatial Reasoning for Open-Vocabulary 3D Visual Grounding
di: Liu, Zhenyang, et al.
Pubblicazione: (2025)
di: Liu, Zhenyang, et al.
Pubblicazione: (2025)
Articulated 3D Scene Graphs for Open-World Mobile Manipulation
di: Büchner, Martin, et al.
Pubblicazione: (2026)
di: Büchner, Martin, et al.
Pubblicazione: (2026)
Documenti analoghi
-
VLM-3D:End-to-End Vision-Language Models for Open-World 3D Perception
di: Chang, Fuhao, et al.
Pubblicazione: (2025) -
OV9D: Open-Vocabulary Category-Level 9D Object Pose and Size Estimation
di: Cai, Junhao, et al.
Pubblicazione: (2024) -
3D-AffordanceLLM: Harnessing Large Language Models for Open-Vocabulary Affordance Detection in 3D Worlds
di: Chu, Hengshuo, et al.
Pubblicazione: (2025) -
Voxel Mamba: Group-Free State Space Models for Point Cloud based 3D Object Detection
di: Zhang, Guowen, et al.
Pubblicazione: (2024) -
PointVLA: Injecting the 3D World into Vision-Language-Action Models
di: Li, Chengmeng, et al.
Pubblicazione: (2025)