Efficient Multi-Task Scene Analysis with RGB-D Transformers
Fuente:
arXiv
Saved in:
| Main Authors: | Fischedick, Söhnke Benedikt, Seichter, Daniel, Schmidt, Robin, Rabes, Leonard, Gross, Horst-Michael |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Efficient Prediction of Dense Visual Embeddings via Distillation and RGB-D Transformers
by: Fischedick, Söhnke Benedikt, et al.
Published: (2026)
by: Fischedick, Söhnke Benedikt, et al.
Published: (2026)
PanopticNDT: Efficient and Robust Panoptic Mapping
by: Seichter, Daniel, et al.
Published: (2023)
by: Seichter, Daniel, et al.
Published: (2023)
DiffPixelFormer: Differential Pixel-Aware Transformer for RGB-D Indoor Scene Segmentation
by: Gong, Yan, et al.
Published: (2025)
by: Gong, Yan, et al.
Published: (2025)
RoadFormer: Duplex Transformer for RGB-Normal Semantic Road Scene Parsing
by: Li, Jiahang, et al.
Published: (2023)
by: Li, Jiahang, et al.
Published: (2023)
SeaSplat: Representing Underwater Scenes with 3D Gaussian Splatting and a Physically Grounded Image Formation Model
by: Yang, Daniel, et al.
Published: (2024)
by: Yang, Daniel, et al.
Published: (2024)
Semantic Segmentation and Scene Reconstruction of RGB-D Image Frames: An End-to-End Modular Pipeline for Robotic Applications
by: Zheng, Zhiwu, et al.
Published: (2024)
by: Zheng, Zhiwu, et al.
Published: (2024)
Transforming Omnidirectional RGB-LiDAR data into 3D Gaussian Splatting
by: Bae, Semin, et al.
Published: (2026)
by: Bae, Semin, et al.
Published: (2026)
ASHiTA: Automatic Scene-grounded HIerarchical Task Analysis
by: Chang, Yun, et al.
Published: (2025)
by: Chang, Yun, et al.
Published: (2025)
OmniPose6D: Towards Short-Term Object Pose Tracking in Dynamic Scenes from Monocular RGB
by: Lin, Yunzhi, et al.
Published: (2024)
by: Lin, Yunzhi, et al.
Published: (2024)
NeB-SLAM: Neural Blocks-based Salable RGB-D SLAM for Unknown Scenes
by: Bai, Lizhi, et al.
Published: (2024)
by: Bai, Lizhi, et al.
Published: (2024)
MesaTask: Towards Task-Driven Tabletop Scene Generation via 3D Spatial Reasoning
by: Hao, Jinkun, et al.
Published: (2025)
by: Hao, Jinkun, et al.
Published: (2025)
Mono-Hydra++: Real-Time Monocular Scene Graph Construction with Multi-Task Learning for 3D Indoor Mapping
by: Udugama, U. V. B. L., et al.
Published: (2026)
by: Udugama, U. V. B. L., et al.
Published: (2026)
GMT: Goal-Conditioned Multimodal Transformer for 6-DOF Object Trajectory Synthesis in 3D Scenes
by: Zeng, Huajian, et al.
Published: (2026)
by: Zeng, Huajian, et al.
Published: (2026)
You Only Pose Once: A Minimalist's Detection Transformer for Monocular RGB Category-level 9D Multi-Object Pose Estimation
by: Lee, Hakjin, et al.
Published: (2025)
by: Lee, Hakjin, et al.
Published: (2025)
WaterScenes: A Multi-Task 4D Radar-Camera Fusion Dataset and Benchmarks for Autonomous Driving on Water Surfaces
by: Yao, Shanliang, et al.
Published: (2023)
by: Yao, Shanliang, et al.
Published: (2023)
EvidMTL: Evidential Multi-Task Learning for Uncertainty-Aware Semantic Surface Mapping from Monocular RGB Images
by: Menon, Rohit, et al.
Published: (2025)
by: Menon, Rohit, et al.
Published: (2025)
RGB-only Active 3D Scene Graph Generation for Indoor Mobile Robots
by: Modi, Giorgia, et al.
Published: (2026)
by: Modi, Giorgia, et al.
Published: (2026)
Dynamic-Dark SLAM: RGB-Thermal Cooperative Robot Vision Strategy for Multi-Person Tracking in Both Well-Lit and Low-Light Scenes
by: Sakai, Tatsuro, et al.
Published: (2025)
by: Sakai, Tatsuro, et al.
Published: (2025)
CG-SLAM: Efficient Dense RGB-D SLAM in a Consistent Uncertainty-aware 3D Gaussian Field
by: Hu, Jiarui, et al.
Published: (2024)
by: Hu, Jiarui, et al.
Published: (2024)
Active 6D Pose Estimation for Textureless Objects using Multi-View RGB Frames
by: Yang, Jun, et al.
Published: (2025)
by: Yang, Jun, et al.
Published: (2025)
Cross-modal State Space Modeling for Real-time RGB-thermal Wild Scene Semantic Segmentation
by: Guo, Xiaodong, et al.
Published: (2025)
by: Guo, Xiaodong, et al.
Published: (2025)
DeltaFlow: An Efficient Multi-frame Scene Flow Estimation Method
by: Zhang, Qingwen, et al.
Published: (2025)
by: Zhang, Qingwen, et al.
Published: (2025)
Dropping the D: RGB-D SLAM Without the Depth Sensor
by: Kiray, Mert, et al.
Published: (2025)
by: Kiray, Mert, et al.
Published: (2025)
DrivingScene: A Multi-Task Online Feed-Forward 3D Gaussian Splatting Method for Dynamic Driving Scenes
by: Hou, Qirui, et al.
Published: (2025)
by: Hou, Qirui, et al.
Published: (2025)
PG-SLAM: Photo-realistic and Geometry-aware RGB-D SLAM in Dynamic Environments
by: Li, Haoang, et al.
Published: (2024)
by: Li, Haoang, et al.
Published: (2024)
OpenSGA: Efficient 3D Scene Graph Alignment in the Open World
by: Chen, Gang, et al.
Published: (2026)
by: Chen, Gang, et al.
Published: (2026)
Multi-Modal Data-Efficient 3D Scene Understanding for Autonomous Driving
by: Kong, Lingdong, et al.
Published: (2024)
by: Kong, Lingdong, et al.
Published: (2024)
CM-EVS: Sparse Panoramic RGB-D-Pose Data for Complete Scene Coverage
by: Liu, Jiale, et al.
Published: (2026)
by: Liu, Jiale, et al.
Published: (2026)
Contrastive Learning for Enhancing Robust Scene Transfer in Vision-based Agile Flight
by: Xing, Jiaxu, et al.
Published: (2023)
by: Xing, Jiaxu, et al.
Published: (2023)
Hydra: Marker-Free RGB-D Hand-Eye Calibration
by: Huber, Martin, et al.
Published: (2025)
by: Huber, Martin, et al.
Published: (2025)
MrGS: Multi-modal Radiance Fields with 3D Gaussian Splatting for RGB-Thermal Novel View Synthesis
by: Kweon, Minseong, et al.
Published: (2025)
by: Kweon, Minseong, et al.
Published: (2025)
DKPMV: Dense Keypoints Fusion from Multi-View RGB Frames for 6D Pose Estimation of Textureless Objects
by: Chen, Jiahong, et al.
Published: (2025)
by: Chen, Jiahong, et al.
Published: (2025)
Articulate3D: Holistic Understanding of 3D Scenes as Universal Scene Description
by: Halacheva, Anna-Maria, et al.
Published: (2024)
by: Halacheva, Anna-Maria, et al.
Published: (2024)
Robust Flower Cluster Matching Using The Unscented Transform
by: Chu, Andy, et al.
Published: (2025)
by: Chu, Andy, et al.
Published: (2025)
Efficient Motion Prediction: A Lightweight & Accurate Trajectory Prediction Model With Fast Training and Inference Speed
by: Prutsch, Alexander, et al.
Published: (2024)
by: Prutsch, Alexander, et al.
Published: (2024)
Including Semantic Information via Word Embeddings for Skeleton-based Action Recognition
by: Aganian, Dustin, et al.
Published: (2025)
by: Aganian, Dustin, et al.
Published: (2025)
CSCPR: Cross-Source-Context Indoor RGB-D Place Recognition
by: Liang, Jing, et al.
Published: (2024)
by: Liang, Jing, et al.
Published: (2024)
Sim-to-Real Grasp Detection with Global-to-Local RGB-D Adaptation
by: Ma, Haoxiang, et al.
Published: (2024)
by: Ma, Haoxiang, et al.
Published: (2024)
Object-Scene-Camera Decomposition and Recomposition for Data-Efficient Monocular 3D Object Detection
by: Kuang, Zhaonian, et al.
Published: (2026)
by: Kuang, Zhaonian, et al.
Published: (2026)
PLAF: Pixel-wise Language-Aligned Feature Extraction for Efficient 3D Scene Understanding
by: Wen, Junjie, et al.
Published: (2026)
by: Wen, Junjie, et al.
Published: (2026)
Similar Items
-
Efficient Prediction of Dense Visual Embeddings via Distillation and RGB-D Transformers
by: Fischedick, Söhnke Benedikt, et al.
Published: (2026) -
PanopticNDT: Efficient and Robust Panoptic Mapping
by: Seichter, Daniel, et al.
Published: (2023) -
DiffPixelFormer: Differential Pixel-Aware Transformer for RGB-D Indoor Scene Segmentation
by: Gong, Yan, et al.
Published: (2025) -
RoadFormer: Duplex Transformer for RGB-Normal Semantic Road Scene Parsing
by: Li, Jiahang, et al.
Published: (2023) -
SeaSplat: Representing Underwater Scenes with 3D Gaussian Splatting and a Physically Grounded Image Formation Model
by: Yang, Daniel, et al.
Published: (2024)