Towards Foundation Models for 3D Vision: How Close Are We?
Fuente:
arXiv
Guardado en:
| Autores principales: | Zuo, Yiming, Kayan, Karhan, Wang, Maggie, Jeon, Kevin, Deng, Jia, Griffiths, Thomas L. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Princeton365: A Diverse Dataset with Accurate Camera Pose
por: Kayan, Karhan, et al.
Publicado: (2025)
por: Kayan, Karhan, et al.
Publicado: (2025)
Zero-Shot Depth from Defocus
por: Zuo, Yiming, et al.
Publicado: (2026)
por: Zuo, Yiming, et al.
Publicado: (2026)
ProcFunc: Function-Oriented Abstractions for Procedural 3D Generation in Python
por: Raistrick, Alexander, et al.
Publicado: (2026)
por: Raistrick, Alexander, et al.
Publicado: (2026)
Infinigen Indoors: Photorealistic Indoor Scenes using Procedural Generation
por: Raistrick, Alexander, et al.
Publicado: (2024)
por: Raistrick, Alexander, et al.
Publicado: (2024)
OGNI-DC: Robust Depth Completion with Optimization-Guided Neural Iterations
por: Zuo, Yiming, et al.
Publicado: (2024)
por: Zuo, Yiming, et al.
Publicado: (2024)
InFlux: A Benchmark for Self-Calibration of Dynamic Intrinsics of Video Cameras
por: Liang, Erich, et al.
Publicado: (2025)
por: Liang, Erich, et al.
Publicado: (2025)
How Close Are We? Limitations and Progress of AI Models in Banff Lesion Scoring
por: Zhu, Yanfan, et al.
Publicado: (2025)
por: Zhu, Yanfan, et al.
Publicado: (2025)
PixFoundation: Are We Heading in the Right Direction with Pixel-level Vision Foundation Models?
por: Siam, Mennatullah
Publicado: (2025)
por: Siam, Mennatullah
Publicado: (2025)
OMNI-DC: Highly Robust Depth Completion with Multiresolution Depth Integration
por: Zuo, Yiming, et al.
Publicado: (2024)
por: Zuo, Yiming, et al.
Publicado: (2024)
TALO: Pushing 3D Vision Foundation Models Towards Globally Consistent Online Reconstruction
por: Zhang, Fengyi, et al.
Publicado: (2025)
por: Zhang, Fengyi, et al.
Publicado: (2025)
Towards a Unified Copernicus Foundation Model for Earth Vision
por: Wang, Yi, et al.
Publicado: (2025)
por: Wang, Yi, et al.
Publicado: (2025)
Magnet: We Never Know How Text-to-Image Diffusion Models Work, Until We Learn How Vision-Language Models Function
por: Zhuang, Chenyi, et al.
Publicado: (2024)
por: Zhuang, Chenyi, et al.
Publicado: (2024)
One for All: Toward Unified Foundation Models for Earth Vision
por: Xiong, Zhitong, et al.
Publicado: (2024)
por: Xiong, Zhitong, et al.
Publicado: (2024)
How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites
por: Chen, Zhe, et al.
Publicado: (2024)
por: Chen, Zhe, et al.
Publicado: (2024)
CanViT: Toward Active-Vision Foundation Models
por: Berreby, Yohaï-Eliel, et al.
Publicado: (2026)
por: Berreby, Yohaï-Eliel, et al.
Publicado: (2026)
Towards Training-free Anomaly Detection with Vision and Language Foundation Models
por: Zhang, Jinjin, et al.
Publicado: (2025)
por: Zhang, Jinjin, et al.
Publicado: (2025)
Seeing and Seeing Through the Glass: Real and Synthetic Data for Multi-Layer Depth Estimation
por: Wen, Hongyu, et al.
Publicado: (2025)
por: Wen, Hongyu, et al.
Publicado: (2025)
How Far Are We from Generating Missing Modalities with Foundation Models?
por: Ke, Guanzhou, et al.
Publicado: (2025)
por: Ke, Guanzhou, et al.
Publicado: (2025)
How Much of a Model Do We Need? Redundancy and Slimmability in Remote Sensing Foundation Models
por: Hackel, Leonard, et al.
Publicado: (2026)
por: Hackel, Leonard, et al.
Publicado: (2026)
Know3D: Prompting 3D Generation with Knowledge from Vision-Language Models
por: Chen, Wenyue, et al.
Publicado: (2026)
por: Chen, Wenyue, et al.
Publicado: (2026)
AdaptSplat: Adapting Vision Foundation Models for Feed-Forward 3D Gaussian Splatting
por: Xing, Mingwei, et al.
Publicado: (2026)
por: Xing, Mingwei, et al.
Publicado: (2026)
Towards Vision-Language Geo-Foundation Model: A Survey
por: Zhou, Yue, et al.
Publicado: (2024)
por: Zhou, Yue, et al.
Publicado: (2024)
Bootstrapping SparseFormers from Vision Foundation Models
por: Gao, Ziteng, et al.
Publicado: (2023)
por: Gao, Ziteng, et al.
Publicado: (2023)
CRAVES: Controlling Robotic Arm with a Vision-based Economic System
por: Zuo, Yiming, et al.
Publicado: (2018)
por: Zuo, Yiming, et al.
Publicado: (2018)
Towards Depth Foundation Model: Recent Trends in Vision-Based Depth Estimation
por: Xu, Zhen, et al.
Publicado: (2025)
por: Xu, Zhen, et al.
Publicado: (2025)
Towards Generalist Intelligence in Dentistry: Vision Foundation Models for Oral and Maxillofacial Radiology
por: Huang, Xinrui, et al.
Publicado: (2025)
por: Huang, Xinrui, et al.
Publicado: (2025)
ArtHOI: Taming Foundation Models for Monocular 4D Reconstruction of Hand-Articulated-Object Interactions
por: Wang, Zikai, et al.
Publicado: (2026)
por: Wang, Zikai, et al.
Publicado: (2026)
When Do We Not Need Larger Vision Models?
por: Shi, Baifeng, et al.
Publicado: (2024)
por: Shi, Baifeng, et al.
Publicado: (2024)
R3eVision: A Survey on Robust Rendering, Restoration, and Enhancement for 3D Low-Level Vision
por: Kwon, Weeyoung, et al.
Publicado: (2025)
por: Kwon, Weeyoung, et al.
Publicado: (2025)
VFMM3D: Releasing the Potential of Image by Vision Foundation Model for Monocular 3D Object Detection
por: Ding, Bonan, et al.
Publicado: (2024)
por: Ding, Bonan, et al.
Publicado: (2024)
EFM3D: A Benchmark for Measuring Progress Towards 3D Egocentric Foundation Models
por: Straub, Julian, et al.
Publicado: (2024)
por: Straub, Julian, et al.
Publicado: (2024)
TotalFM: An Organ-Separated Framework for 3D-CT Vision Foundation Models
por: Yamamoto, Kohei, et al.
Publicado: (2026)
por: Yamamoto, Kohei, et al.
Publicado: (2026)
Triad: Vision Foundation Model for 3D Magnetic Resonance Imaging
por: Wang, Shansong, et al.
Publicado: (2025)
por: Wang, Shansong, et al.
Publicado: (2025)
Vision Superalignment: Weak-to-Strong Generalization for Vision Foundation Models
por: Guo, Jianyuan, et al.
Publicado: (2024)
por: Guo, Jianyuan, et al.
Publicado: (2024)
Semi-supervised 3D Semantic Scene Completion with 2D Vision Foundation Model Guidance
por: Pham, Duc-Hai, et al.
Publicado: (2024)
por: Pham, Duc-Hai, et al.
Publicado: (2024)
FMGS: Foundation Model Embedded 3D Gaussian Splatting for Holistic 3D Scene Understanding
por: Zuo, Xingxing, et al.
Publicado: (2024)
por: Zuo, Xingxing, et al.
Publicado: (2024)
FILP-3D: Enhancing 3D Few-shot Class-incremental Learning with Pre-trained Vision-Language Models
por: Xu, Wan, et al.
Publicado: (2023)
por: Xu, Wan, et al.
Publicado: (2023)
WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning
por: Yang, Jie, et al.
Publicado: (2025)
por: Yang, Jie, et al.
Publicado: (2025)
Towards Unbiased Source-Free Object Detection via Vision Foundation Models
por: Cai, Zhi, et al.
Publicado: (2026)
por: Cai, Zhi, et al.
Publicado: (2026)
DreamLCM: Towards High-Quality Text-to-3D Generation via Latent Consistency Model
por: Zhong, Yiming, et al.
Publicado: (2024)
por: Zhong, Yiming, et al.
Publicado: (2024)
Ejemplares similares
-
Princeton365: A Diverse Dataset with Accurate Camera Pose
por: Kayan, Karhan, et al.
Publicado: (2025) -
Zero-Shot Depth from Defocus
por: Zuo, Yiming, et al.
Publicado: (2026) -
ProcFunc: Function-Oriented Abstractions for Procedural 3D Generation in Python
por: Raistrick, Alexander, et al.
Publicado: (2026) -
Infinigen Indoors: Photorealistic Indoor Scenes using Procedural Generation
por: Raistrick, Alexander, et al.
Publicado: (2024) -
OGNI-DC: Robust Depth Completion with Optimization-Guided Neural Iterations
por: Zuo, Yiming, et al.
Publicado: (2024)