Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Guo, Sicen, Wen, Tianyou, Liu, Chuang-Wei, Chen, Qijun, Fan, Rui |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
LIX: Implicitly Infusing Spatial Geometric Prior Knowledge into Visual Semantic Segmentation for Autonomous Driving
von: Guo, Sicen, et al.
Veröffentlicht: (2024)
von: Guo, Sicen, et al.
Veröffentlicht: (2024)
Playing to Vision Foundation Model's Strengths in Stereo Matching
von: Liu, Chuang-Wei, et al.
Veröffentlicht: (2024)
von: Liu, Chuang-Wei, et al.
Veröffentlicht: (2024)
RoadFormer: Duplex Transformer for RGB-Normal Semantic Road Scene Parsing
von: Li, Jiahang, et al.
Veröffentlicht: (2023)
von: Li, Jiahang, et al.
Veröffentlicht: (2023)
DepthMatch: Semi-Supervised RGB-D Scene Parsing through Depth-Guided Regularization
von: Huang, Jianxin, et al.
Veröffentlicht: (2025)
von: Huang, Jianxin, et al.
Veröffentlicht: (2025)
HAPNet: Toward Superior RGB-Thermal Scene Parsing via Hybrid, Asymmetric, and Progressive Heterogeneous Feature Fusion
von: Li, Jiahang, et al.
Veröffentlicht: (2024)
von: Li, Jiahang, et al.
Veröffentlicht: (2024)
RoadFormer+: Delivering RGB-X Scene Parsing through Scale-Aware Information Decoupling and Advanced Heterogeneous Feature Fusion
von: Huang, Jianxin, et al.
Veröffentlicht: (2024)
von: Huang, Jianxin, et al.
Veröffentlicht: (2024)
Unsupervised Collaborative Domain Adaptation for Driving Scene Parsing
von: Fan, Jiahe, et al.
Veröffentlicht: (2026)
von: Fan, Jiahe, et al.
Veröffentlicht: (2026)
DCPI-Depth: Explicitly Infusing Dense Correspondence Prior to Unsupervised Monocular Depth Estimation
von: Zhang, Mengtan, et al.
Veröffentlicht: (2024)
von: Zhang, Mengtan, et al.
Veröffentlicht: (2024)
DriveX: Omni Scene Modeling for Learning Generalizable World Knowledge in Autonomous Driving
von: Shi, Chen, et al.
Veröffentlicht: (2025)
von: Shi, Chen, et al.
Veröffentlicht: (2025)
Exploiting Diffusion Prior for Generalizable Dense Prediction
von: Lee, Hsin-Ying, et al.
Veröffentlicht: (2023)
von: Lee, Hsin-Ying, et al.
Veröffentlicht: (2023)
SCIPaD: Incorporating Spatial Clues into Unsupervised Pose-Depth Joint Learning
von: Feng, Yi, et al.
Veröffentlicht: (2024)
von: Feng, Yi, et al.
Veröffentlicht: (2024)
Two-Stream Interactive Joint Learning of Scene Parsing and Geometric Vision Tasks
von: Tang, Guanfeng, et al.
Veröffentlicht: (2026)
von: Tang, Guanfeng, et al.
Veröffentlicht: (2026)
Integrating Disparity Confidence Estimation into Relative Depth Prior-Guided Unsupervised Stereo Matching
von: Liu, Chuang-Wei, et al.
Veröffentlicht: (2025)
von: Liu, Chuang-Wei, et al.
Veröffentlicht: (2025)
Generalizable Knowledge Distillation from Vision Foundation Models for Semantic Segmentation
von: Lv, Chonghua, et al.
Veröffentlicht: (2026)
von: Lv, Chonghua, et al.
Veröffentlicht: (2026)
On the Role of Depth in Surgical Vision Foundation Models: An Empirical Study of RGB-D Pre-training
von: Han, John J., et al.
Veröffentlicht: (2026)
von: Han, John J., et al.
Veröffentlicht: (2026)
S$^3$M-Net: Joint Learning of Semantic Segmentation and Stereo Matching for Autonomous Driving
von: Wu, Zhiyuan, et al.
Veröffentlicht: (2024)
von: Wu, Zhiyuan, et al.
Veröffentlicht: (2024)
Text-Scene: A Scene-to-Language Parsing Framework for 3D Scene Understanding
von: Li, Haoyuan, et al.
Veröffentlicht: (2025)
von: Li, Haoyuan, et al.
Veröffentlicht: (2025)
A Fully Open and Generalizable Foundation Model for Ultrasound Clinical Applications
von: Zhang, Hongyuan, et al.
Veröffentlicht: (2025)
von: Zhang, Hongyuan, et al.
Veröffentlicht: (2025)
Unleashing the Power of Motion and Depth: A Selective Fusion Strategy for RGB-D Video Salient Object Detection
von: He, Jiahao, et al.
Veröffentlicht: (2025)
von: He, Jiahao, et al.
Veröffentlicht: (2025)
High-Precision Dichotomous Image Segmentation via Depth Integrity-Prior and Fine-Grained Patch Strategy
von: Liu, Xianjie, et al.
Veröffentlicht: (2025)
von: Liu, Xianjie, et al.
Veröffentlicht: (2025)
These Maps Are Made by Propagation: Adapting Deep Stereo Networks to Road Scenarios with Decisive Disparity Diffusion
von: Liu, Chuang-Wei, et al.
Veröffentlicht: (2024)
von: Liu, Chuang-Wei, et al.
Veröffentlicht: (2024)
MonoSplat: Generalizable 3D Gaussian Splatting from Monocular Depth Foundation Models
von: Liu, Yifan, et al.
Veröffentlicht: (2025)
von: Liu, Yifan, et al.
Veröffentlicht: (2025)
Scene Prior Filtering for Depth Super-Resolution
von: Wang, Zhengxue, et al.
Veröffentlicht: (2024)
von: Wang, Zhengxue, et al.
Veröffentlicht: (2024)
CILP-FGDI: Exploiting Vision-Language Model for Generalizable Person Re-Identification
von: Zhao, Huazhong, et al.
Veröffentlicht: (2025)
von: Zhao, Huazhong, et al.
Veröffentlicht: (2025)
Surgical Depth Anything: Depth Estimation for Surgical Scenes using Foundation Models
von: Lou, Ange, et al.
Veröffentlicht: (2024)
von: Lou, Ange, et al.
Veröffentlicht: (2024)
DepthVision: Enabling Robust Vision-Language Models with GAN-Based LiDAR-to-RGB Synthesis for Autonomous Driving
von: Kirchner, Sven, et al.
Veröffentlicht: (2025)
von: Kirchner, Sven, et al.
Veröffentlicht: (2025)
Exploiting Priors from 3D Diffusion Models for RGB-Based One-Shot View Planning
von: Pan, Sicong, et al.
Veröffentlicht: (2024)
von: Pan, Sicong, et al.
Veröffentlicht: (2024)
Towards Depth Foundation Model: Recent Trends in Vision-Based Depth Estimation
von: Xu, Zhen, et al.
Veröffentlicht: (2025)
von: Xu, Zhen, et al.
Veröffentlicht: (2025)
DriveCamSim: Generalizable Camera Simulation via Explicit Camera Modeling for Autonomous Driving
von: Sun, Wenchao, et al.
Veröffentlicht: (2025)
von: Sun, Wenchao, et al.
Veröffentlicht: (2025)
Depth as Prior Knowledge for Object Detection
von: Sbeyti, Moussa Kassem, et al.
Veröffentlicht: (2026)
von: Sbeyti, Moussa Kassem, et al.
Veröffentlicht: (2026)
ViPOcc: Leveraging Visual Priors from Vision Foundation Models for Single-View 3D Occupancy Prediction
von: Feng, Yi, et al.
Veröffentlicht: (2024)
von: Feng, Yi, et al.
Veröffentlicht: (2024)
PIG: Prompt Images Guidance for Night-Time Scene Parsing
von: Xie, Zhifeng, et al.
Veröffentlicht: (2024)
von: Xie, Zhifeng, et al.
Veröffentlicht: (2024)
MaskGWM: A Generalizable Driving World Model with Video Mask Reconstruction
von: Ni, Jingcheng, et al.
Veröffentlicht: (2025)
von: Ni, Jingcheng, et al.
Veröffentlicht: (2025)
PDDM: Pseudo Depth Diffusion Model for RGB-PD Semantic Segmentation Based in Complex Indoor Scenes
von: Xu, Xinhua, et al.
Veröffentlicht: (2025)
von: Xu, Xinhua, et al.
Veröffentlicht: (2025)
HorizonWeaver: Generalizable Multi-Level Semantic Editing for Driving Scenes
von: Soroco, Mauricio, et al.
Veröffentlicht: (2026)
von: Soroco, Mauricio, et al.
Veröffentlicht: (2026)
Forging Vision Foundation Models for Autonomous Driving: Challenges, Methodologies, and Opportunities
von: Yan, Xu, et al.
Veröffentlicht: (2024)
von: Yan, Xu, et al.
Veröffentlicht: (2024)
Depth Matters: Exploring Deep Interactions of RGB-D for Semantic Segmentation in Traffic Scenes
von: Chen, Siyu, et al.
Veröffentlicht: (2024)
von: Chen, Siyu, et al.
Veröffentlicht: (2024)
MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization
von: Xiao, Zhendong, et al.
Veröffentlicht: (2025)
von: Xiao, Zhendong, et al.
Veröffentlicht: (2025)
Benchmarking Vision Foundation Models for Domain-Generalizable Face Anti-Spoofing
von: Feng, Mika, et al.
Veröffentlicht: (2026)
von: Feng, Mika, et al.
Veröffentlicht: (2026)
MultiDepth: Multi-Sample Priors for Refining Monocular Metric Depth Estimations in Indoor Scenes
von: Byun, Sanghyun, et al.
Veröffentlicht: (2024)
von: Byun, Sanghyun, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
LIX: Implicitly Infusing Spatial Geometric Prior Knowledge into Visual Semantic Segmentation for Autonomous Driving
von: Guo, Sicen, et al.
Veröffentlicht: (2024) -
Playing to Vision Foundation Model's Strengths in Stereo Matching
von: Liu, Chuang-Wei, et al.
Veröffentlicht: (2024) -
RoadFormer: Duplex Transformer for RGB-Normal Semantic Road Scene Parsing
von: Li, Jiahang, et al.
Veröffentlicht: (2023) -
DepthMatch: Semi-Supervised RGB-D Scene Parsing through Depth-Guided Regularization
von: Huang, Jianxin, et al.
Veröffentlicht: (2025) -
HAPNet: Toward Superior RGB-Thermal Scene Parsing via Hybrid, Asymmetric, and Progressive Heterogeneous Feature Fusion
von: Li, Jiahang, et al.
Veröffentlicht: (2024)