Captain Safari: A World Engine with Pose-Aligned 3D Memory
Fuente:
arXiv
Guardado en:
| Autores principales: | Chou, Yu-Cheng, Wang, Xingrui, Li, Yitong, Wang, Jiahao, Liu, Hanting, Xie, Cihang, Yuille, Alan, Xiao, Junfei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Rejuvenating image-GPT as Strong Visual Representation Learners
por: Ren, Sucheng, et al.
Publicado: (2023)
por: Ren, Sucheng, et al.
Publicado: (2023)
EvoWorld: Evolving Panoramic World Generation with Explicit 3D Memory
por: Wang, Jiahao, et al.
Publicado: (2025)
por: Wang, Jiahao, et al.
Publicado: (2025)
Captain Cinema: Towards Short Movie Generation
por: Xiao, Junfei, et al.
Publicado: (2025)
por: Xiao, Junfei, et al.
Publicado: (2025)
SpatialReasoner: Towards Explicit and Generalizable 3D Spatial Reasoning
por: Ma, Wufei, et al.
Publicado: (2025)
por: Ma, Wufei, et al.
Publicado: (2025)
PaLM2-VAdapter: Progressively Aligned Language Model Makes a Strong Vision-language Adapter
por: Xiao, Junfei, et al.
Publicado: (2024)
por: Xiao, Junfei, et al.
Publicado: (2024)
Vision-Language-Vision Auto-Encoder: Scalable Knowledge Distillation from Diffusion Models
por: Zhang, Tiezheng, et al.
Publicado: (2025)
por: Zhang, Tiezheng, et al.
Publicado: (2025)
From Pixels to Objects: A Hierarchical Approach for Part and Object Segmentation Using Local and Global Aggregation
por: Xie, Yunfei, et al.
Publicado: (2024)
por: Xie, Yunfei, et al.
Publicado: (2024)
SPFormer: Enhancing Vision Transformer with Superpixel Representation
por: Mei, Jieru, et al.
Publicado: (2024)
por: Mei, Jieru, et al.
Publicado: (2024)
M-VAR: Decoupled Scale-wise Autoregressive Modeling for High-Quality Image Generation
por: Ren, Sucheng, et al.
Publicado: (2024)
por: Ren, Sucheng, et al.
Publicado: (2024)
GenEx: Generating an Explorable World
por: Lu, Taiming, et al.
Publicado: (2024)
por: Lu, Taiming, et al.
Publicado: (2024)
Localization vs. Semantics: Visual Representations in Unimodal and Multimodal Models
por: Li, Zhuowan, et al.
Publicado: (2022)
por: Li, Zhuowan, et al.
Publicado: (2022)
A Semantic Space is Worth 256 Language Descriptions: Make Stronger Segmentation Models with Descriptive Properties
por: Xiao, Junfei, et al.
Publicado: (2023)
por: Xiao, Junfei, et al.
Publicado: (2023)
Compositional 4D Dynamic Scenes Understanding with Physics Priors for Video Question Answering
por: Wang, Xingrui, et al.
Publicado: (2024)
por: Wang, Xingrui, et al.
Publicado: (2024)
Spiral RoPE: Rotate Your Rotary Positional Embeddings in the 2D Plane
por: Liu, Haoyu, et al.
Publicado: (2026)
por: Liu, Haoyu, et al.
Publicado: (2026)
Scaling Laws in Patchification: An Image Is Worth 50,176 Tokens And More
por: Wang, Feng, et al.
Publicado: (2025)
por: Wang, Feng, et al.
Publicado: (2025)
Embracing Massive Medical Data
por: Chou, Yu-Cheng, et al.
Publicado: (2024)
por: Chou, Yu-Cheng, et al.
Publicado: (2024)
Mamba-R: Vision Mamba ALSO Needs Registers
por: Wang, Feng, et al.
Publicado: (2024)
por: Wang, Feng, et al.
Publicado: (2024)
Structure-Aware Sparse-View X-ray 3D Reconstruction
por: Cai, Yuanhao, et al.
Publicado: (2023)
por: Cai, Yuanhao, et al.
Publicado: (2023)
Play to Generalize: Learning to Reason Through Game Play
por: Xie, Yunfei, et al.
Publicado: (2025)
por: Xie, Yunfei, et al.
Publicado: (2025)
ARVideo: Autoregressive Pretraining for Self-Supervised Video Representation Learning
por: Ren, Sucheng, et al.
Publicado: (2024)
por: Ren, Sucheng, et al.
Publicado: (2024)
ViT-5: Vision Transformers for The Mid-2020s
por: Wang, Feng, et al.
Publicado: (2026)
por: Wang, Feng, et al.
Publicado: (2026)
PASR: Pose-Aware 3D Shape Retrieval from Occluded Single Views
por: Shi, Jiaxin, et al.
Publicado: (2026)
por: Shi, Jiaxin, et al.
Publicado: (2026)
Spatial457: A Diagnostic Benchmark for 6D Spatial Reasoning of Large Multimodal Models
por: Wang, Xingrui, et al.
Publicado: (2025)
por: Wang, Xingrui, et al.
Publicado: (2025)
3DSRBench: A Comprehensive 3D Spatial Reasoning Benchmark
por: Ma, Wufei, et al.
Publicado: (2024)
por: Ma, Wufei, et al.
Publicado: (2024)
Gaussian Scenes: Pose-Free Sparse-View Scene Reconstruction using Depth-Enhanced Diffusion Priors
por: Paul, Soumava, et al.
Publicado: (2024)
por: Paul, Soumava, et al.
Publicado: (2024)
Learning a Category-level Object Pose Estimator without Pose Annotations
por: Tian, Fengrui, et al.
Publicado: (2024)
por: Tian, Fengrui, et al.
Publicado: (2024)
Can These Views Be One Scene? Evaluating Multiview 3D Consistency when 3D Foundation Models Hallucinate
por: Paul, Soumava, et al.
Publicado: (2026)
por: Paul, Soumava, et al.
Publicado: (2026)
Perceptual Taxonomy: Evaluating and Guiding Hierarchical Scene Reasoning in Vision-Language Models
por: Lee, Jonathan, et al.
Publicado: (2025)
por: Lee, Jonathan, et al.
Publicado: (2025)
On the Adversarial Robustness of Camera-based 3D Object Detection
por: Xie, Shaoyuan, et al.
Publicado: (2023)
por: Xie, Shaoyuan, et al.
Publicado: (2023)
VideoAuteur: Towards Long Narrative Video Generation
por: Xiao, Junfei, et al.
Publicado: (2025)
por: Xiao, Junfei, et al.
Publicado: (2025)
Adventurer: Optimizing Vision Mamba Architecture Designs for Efficiency
por: Wang, Feng, et al.
Publicado: (2024)
por: Wang, Feng, et al.
Publicado: (2024)
Medical Vision Generalist: Unifying Medical Imaging Tasks in Context
por: Ren, Sucheng, et al.
Publicado: (2024)
por: Ren, Sucheng, et al.
Publicado: (2024)
Animal3D: A Comprehensive Dataset of 3D Animal Pose and Shape
por: Xu, Jiacong, et al.
Publicado: (2023)
por: Xu, Jiacong, et al.
Publicado: (2023)
Sculpting Holistic 3D Representation in Contrastive Language-Image-3D Pre-training
por: Gao, Yipeng, et al.
Publicado: (2023)
por: Gao, Yipeng, et al.
Publicado: (2023)
CaptainCook4D: A Dataset for Understanding Errors in Procedural Activities
por: Peddi, Rohith, et al.
Publicado: (2023)
por: Peddi, Rohith, et al.
Publicado: (2023)
Acquiring Weak Annotations for Tumor Localization in Temporal and Volumetric Data
por: Chou, Yu-Cheng, et al.
Publicado: (2023)
por: Chou, Yu-Cheng, et al.
Publicado: (2023)
Source-Free and Image-Only Unsupervised Domain Adaptation for Category Level Object Pose Estimation
por: Kaushik, Prakhar, et al.
Publicado: (2024)
por: Kaushik, Prakhar, et al.
Publicado: (2024)
DIRECT-3D: Learning Direct Text-to-3D Generation on Massive Noisy 3D Data
por: Liu, Qihao, et al.
Publicado: (2024)
por: Liu, Qihao, et al.
Publicado: (2024)
KeyVID: Keyframe-Aware Video Diffusion for Audio-Synchronized Visual Animation
por: Wang, Xingrui, et al.
Publicado: (2025)
por: Wang, Xingrui, et al.
Publicado: (2025)
SCLIP: Rethinking Self-Attention for Dense Vision-Language Inference
por: Wang, Feng, et al.
Publicado: (2023)
por: Wang, Feng, et al.
Publicado: (2023)
Ejemplares similares
-
Rejuvenating image-GPT as Strong Visual Representation Learners
por: Ren, Sucheng, et al.
Publicado: (2023) -
EvoWorld: Evolving Panoramic World Generation with Explicit 3D Memory
por: Wang, Jiahao, et al.
Publicado: (2025) -
Captain Cinema: Towards Short Movie Generation
por: Xiao, Junfei, et al.
Publicado: (2025) -
SpatialReasoner: Towards Explicit and Generalizable 3D Spatial Reasoning
por: Ma, Wufei, et al.
Publicado: (2025) -
PaLM2-VAdapter: Progressively Aligned Language Model Makes a Strong Vision-language Adapter
por: Xiao, Junfei, et al.
Publicado: (2024)