3D CoCa v2: Contrastive Learners with Test-Time Search for Generalizable Spatial Intelligence
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tang, Hao, Huang, Ting, Zhang, Zeyu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
3D CoCa: Contrastive Learners are 3D Captioners
par: Huang, Ting, et autres
Publié: (2025)
par: Huang, Ting, et autres
Publié: (2025)
CoCa-CXR: Contrastive Captioners Learn Strong Temporal Structures for Chest X-Ray Vision-Language Understanding
par: Chen, Yixiong, et autres
Publié: (2025)
par: Chen, Yixiong, et autres
Publié: (2025)
GRR-CoCa: Leveraging LLM Mechanisms in Multimodal Model Architectures
par: Patock, Jake R., et autres
Publié: (2025)
par: Patock, Jake R., et autres
Publié: (2025)
3D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene Understanding
par: Huang, Ting, et autres
Publié: (2025)
par: Huang, Ting, et autres
Publié: (2025)
I-Scene: 3D Instance Models are Implicit Generalizable Spatial Learners
par: Ling, Lu, et autres
Publié: (2025)
par: Ling, Lu, et autres
Publié: (2025)
UniMesh: Unifying 3D Mesh Understanding and Generation
par: Huang, Peng, et autres
Publié: (2026)
par: Huang, Peng, et autres
Publié: (2026)
DragMesh: Interactive 3D Generation Made Easy
par: Zhang, Tianshan, et autres
Publié: (2025)
par: Zhang, Tianshan, et autres
Publié: (2025)
GS-Bias: Global-Spatial Bias Learner for Single-Image Test-Time Adaptation of Vision-Language Models
par: Huang, Zhaohong, et autres
Publié: (2025)
par: Huang, Zhaohong, et autres
Publié: (2025)
PartRAG: Retrieval-Augmented Part-Level 3D Generation and Editing
par: Li, Peize, et autres
Publié: (2026)
par: Li, Peize, et autres
Publié: (2026)
DC-Scene: Data-Centric Learning for 3D Scene Understanding
par: Huang, Ting, et autres
Publié: (2025)
par: Huang, Ting, et autres
Publié: (2025)
SpatialReasoner: Towards Explicit and Generalizable 3D Spatial Reasoning
par: Ma, Wufei, et autres
Publié: (2025)
par: Ma, Wufei, et autres
Publié: (2025)
Holi-Spatial: Evolving Video Streams into Holistic 3D Spatial Intelligence
par: Gao, Yuanyuan, et autres
Publié: (2026)
par: Gao, Yuanyuan, et autres
Publié: (2026)
VaseVQA-3D: Benchmarking 3D VLMs on Ancient Greek Pottery
par: Zhang, Nonghai, et autres
Publié: (2025)
par: Zhang, Nonghai, et autres
Publié: (2025)
Nav-R1: Reasoning and Navigation in Embodied Scenes
par: Liu, Qingxiang, et autres
Publié: (2025)
par: Liu, Qingxiang, et autres
Publié: (2025)
Code2Worlds: Empowering Coding LLMs for 4D World Generation
par: Zhang, Yi, et autres
Publié: (2026)
par: Zhang, Yi, et autres
Publié: (2026)
GeneralVLA: Generalizable Vision-Language-Action Models with Knowledge-Guided Trajectory Planning
par: Ma, Guoqing, et autres
Publié: (2026)
par: Ma, Guoqing, et autres
Publié: (2026)
Spatial-TTT: Streaming Visual-based Spatial Intelligence with Test-Time Training
par: Liu, Fangfu, et autres
Publié: (2026)
par: Liu, Fangfu, et autres
Publié: (2026)
Test-Time 3D Occupancy Prediction
par: Zhang, Fengyi, et autres
Publié: (2025)
par: Zhang, Fengyi, et autres
Publié: (2025)
Lite3R: A Model-Agnostic Framework for Efficient Feed-Forward 3D Reconstruction
par: Zhang, Haoyu, et autres
Publié: (2026)
par: Zhang, Haoyu, et autres
Publié: (2026)
MorphAny3D: Unleashing the Power of Structured Latent in 3D Morphing
par: Sun, Xiaokun, et autres
Publié: (2026)
par: Sun, Xiaokun, et autres
Publié: (2026)
Light4D: Training-Free Extreme Viewpoint 4D Video Relighting
par: Wu, Zhenghuang, et autres
Publié: (2026)
par: Wu, Zhenghuang, et autres
Publié: (2026)
Contrastive Masked Autoencoders are Stronger Vision Learners
par: Huang, Zhicheng, et autres
Publié: (2022)
par: Huang, Zhicheng, et autres
Publié: (2022)
4D Contrastive Superflows are Dense 3D Representation Learners
par: Xu, Xiang, et autres
Publié: (2024)
par: Xu, Xiang, et autres
Publié: (2024)
Generalizable Sparse-View 3D Reconstruction from Unconstrained Images
par: Gupta, Vinayak, et autres
Publié: (2026)
par: Gupta, Vinayak, et autres
Publié: (2026)
CoSMo3D: Open-World Promptable 3D Semantic Part Segmentation through LLM-Guided Canonical Spatial Modeling
par: Jin, Li, et autres
Publié: (2026)
par: Jin, Li, et autres
Publié: (2026)
Sculpting Holistic 3D Representation in Contrastive Language-Image-3D Pre-training
par: Gao, Yipeng, et autres
Publié: (2023)
par: Gao, Yipeng, et autres
Publié: (2023)
StereoAdapter-2: Globally Structure-Consistent Underwater Stereo Depth Estimation
par: Ren, Zeyu, et autres
Publié: (2026)
par: Ren, Zeyu, et autres
Publié: (2026)
GGHead: Fast and Generalizable 3D Gaussian Heads
par: Kirschstein, Tobias, et autres
Publié: (2024)
par: Kirschstein, Tobias, et autres
Publié: (2024)
MultiCo3D: Multi-Label Voxel Contrast for One-Shot Incremental Segmentation of 3D Neuroimages
par: Xu, Hao, et autres
Publié: (2025)
par: Xu, Hao, et autres
Publié: (2025)
HuGDiffusion: Generalizable Single-Image Human Rendering via 3D Gaussian Diffusion
par: Tang, Yingzhi, et autres
Publié: (2025)
par: Tang, Yingzhi, et autres
Publié: (2025)
CaKE: Circuit-aware Editing Enables Generalizable Knowledge Learners
par: Yao, Yunzhi, et autres
Publié: (2025)
par: Yao, Yunzhi, et autres
Publié: (2025)
MAISI-v2: Accelerated 3D High-Resolution Medical Image Synthesis with Rectified Flow and Region-specific Contrastive Loss
par: Zhao, Can, et autres
Publié: (2025)
par: Zhao, Can, et autres
Publié: (2025)
CaMML: Context-Aware Multimodal Learner for Large Models
par: Chen, Yixin, et autres
Publié: (2024)
par: Chen, Yixin, et autres
Publié: (2024)
Spatial4D-Bench: A Versatile 4D Spatial Intelligence Benchmark
par: Wang, Pan, et autres
Publié: (2025)
par: Wang, Pan, et autres
Publié: (2025)
SpaceControl: Introducing Test-Time Spatial Control to 3D Generative Modeling
par: Fedele, Elisabetta, et autres
Publié: (2025)
par: Fedele, Elisabetta, et autres
Publié: (2025)
SegTTA: Training-Free Test-Time Augmentation for Zero-Shot Medical Imaging Segmentation
par: Yao, Yihong, et autres
Publié: (2026)
par: Yao, Yihong, et autres
Publié: (2026)
HSG: Hyperbolic Scene Graph
par: Wang, Liyang, et autres
Publié: (2026)
par: Wang, Liyang, et autres
Publié: (2026)
MobileVLA-R1: Reinforcing Vision-Language-Action for Mobile Robots
par: Huang, Ting, et autres
Publié: (2025)
par: Huang, Ting, et autres
Publié: (2025)
Generalizable Synthetic Image Detection via Language-guided Contrastive Learning
par: Wu, Haiwei, et autres
Publié: (2023)
par: Wu, Haiwei, et autres
Publié: (2023)
Reconstructing 4D Spatial Intelligence: A Survey
par: Cao, Yukang, et autres
Publié: (2025)
par: Cao, Yukang, et autres
Publié: (2025)
Documents similaires
-
3D CoCa: Contrastive Learners are 3D Captioners
par: Huang, Ting, et autres
Publié: (2025) -
CoCa-CXR: Contrastive Captioners Learn Strong Temporal Structures for Chest X-Ray Vision-Language Understanding
par: Chen, Yixiong, et autres
Publié: (2025) -
GRR-CoCa: Leveraging LLM Mechanisms in Multimodal Model Architectures
par: Patock, Jake R., et autres
Publié: (2025) -
3D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene Understanding
par: Huang, Ting, et autres
Publié: (2025) -
I-Scene: 3D Instance Models are Implicit Generalizable Spatial Learners
par: Ling, Lu, et autres
Publié: (2025)