$π^3$: Permutation-Equivariant Visual Geometry Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Yifan, Zhou, Jianjun, Zhu, Haoyi, Chang, Wenzheng, Zhou, Yang, Li, Zizun, Chen, Junyi, Pang, Jiangmiao, Shen, Chunhua, He, Tong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Aether: Geometric-Aware Unified World Modeling
di: Aether Team, et al.
Pubblicazione: (2025)
di: Aether Team, et al.
Pubblicazione: (2025)
WinT3R: Window-Based Streaming Reconstruction with Camera Token Pool
di: Li, Zizun, et al.
Pubblicazione: (2025)
di: Li, Zizun, et al.
Pubblicazione: (2025)
DeepVerse: 4D Autoregressive Video Generation as a World Model
di: Chen, Junyi, et al.
Pubblicazione: (2025)
di: Chen, Junyi, et al.
Pubblicazione: (2025)
OmniWorld: A Multi-Domain and Multi-Modal Dataset for 4D World Modeling
di: Zhou, Yang, et al.
Pubblicazione: (2025)
di: Zhou, Yang, et al.
Pubblicazione: (2025)
Geo-Align: Video Generation Alignment via Metric Geometry Reward
di: Li, Zizun, et al.
Pubblicazione: (2026)
di: Li, Zizun, et al.
Pubblicazione: (2026)
TrajVG: 3D Trajectory-Coupled Visual Geometry Learning
di: Miao, Xingyu, et al.
Pubblicazione: (2026)
di: Miao, Xingyu, et al.
Pubblicazione: (2026)
LoGoPlanner: Localization Grounded Navigation Policy with Metric-aware Visual Geometry
di: Peng, Jiaqi, et al.
Pubblicazione: (2025)
di: Peng, Jiaqi, et al.
Pubblicazione: (2025)
Multi-Object Tracking by Hierarchical Visual Representations
di: Cao, Jinkun, et al.
Pubblicazione: (2024)
di: Cao, Jinkun, et al.
Pubblicazione: (2024)
PonderV2: Pave the Way for 3D Foundation Model with A Universal Pre-training Paradigm
di: Zhu, Haoyi, et al.
Pubblicazione: (2023)
di: Zhu, Haoyi, et al.
Pubblicazione: (2023)
Towards Latency-Aware 3D Streaming Perception for Autonomous Driving
di: Peng, Jiaqi, et al.
Pubblicazione: (2025)
di: Peng, Jiaqi, et al.
Pubblicazione: (2025)
Language-to-Space Programming for Training-Free 3D Visual Grounding
di: Mi, Boyu, et al.
Pubblicazione: (2025)
di: Mi, Boyu, et al.
Pubblicazione: (2025)
Unlocking the Power of Critical Factors for 3D Visual Geometry Estimation
di: Xu, Guangkai, et al.
Pubblicazione: (2026)
di: Xu, Guangkai, et al.
Pubblicazione: (2026)
Fine-grained Abnormality Prompt Learning for Zero-shot Anomaly Detection
di: Zhu, Jiawen, et al.
Pubblicazione: (2024)
di: Zhu, Jiawen, et al.
Pubblicazione: (2024)
Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM
di: Huang, Haifeng, et al.
Pubblicazione: (2026)
di: Huang, Haifeng, et al.
Pubblicazione: (2026)
LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness
di: Zhu, Chenming, et al.
Pubblicazione: (2024)
di: Zhu, Chenming, et al.
Pubblicazione: (2024)
Language as an Anchor: Preserving Relative Visual Geometry for Domain Incremental Learning
di: Geng, Shuyi, et al.
Pubblicazione: (2025)
di: Geng, Shuyi, et al.
Pubblicazione: (2025)
ChangingGrounding: 3D Visual Grounding in Changing Scenes
di: Hu, Miao, et al.
Pubblicazione: (2025)
di: Hu, Miao, et al.
Pubblicazione: (2025)
HaloGS: Loose Coupling of Compact Geometry and Gaussian Splats for 3D Scenes
di: Jiang, Changjian, et al.
Pubblicazione: (2025)
di: Jiang, Changjian, et al.
Pubblicazione: (2025)
VFlowOpt: A Token Pruning Framework for LMMs with Visual Information Flow-Guided Optimization
di: Yang, Sihan, et al.
Pubblicazione: (2025)
di: Yang, Sihan, et al.
Pubblicazione: (2025)
Alias-Free Latent Diffusion Models: Improving Fractional Shift Equivariance of Diffusion Latent Space
di: Zhou, Yifan, et al.
Pubblicazione: (2025)
di: Zhou, Yifan, et al.
Pubblicazione: (2025)
G$^2$VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning
di: Hu, Wenbo, et al.
Pubblicazione: (2025)
di: Hu, Wenbo, et al.
Pubblicazione: (2025)
VLM-Grounder: A VLM Agent for Zero-Shot 3D Visual Grounding
di: Xu, Runsen, et al.
Pubblicazione: (2024)
di: Xu, Runsen, et al.
Pubblicazione: (2024)
Masked and Permuted Implicit Context Learning for Scene Text Recognition
di: Yang, Xiaomeng, et al.
Pubblicazione: (2023)
di: Yang, Xiaomeng, et al.
Pubblicazione: (2023)
DICEPTION: A Generalist Diffusion Model for Visual Perceptual Tasks
di: Zhao, Canyu, et al.
Pubblicazione: (2025)
di: Zhao, Canyu, et al.
Pubblicazione: (2025)
GeoMotion: Rethinking Motion Segmentation via Latent 4D Geometry
di: He, Xiankang, et al.
Pubblicazione: (2026)
di: He, Xiankang, et al.
Pubblicazione: (2026)
EgoExoBench: A Benchmark for First- and Third-person View Video Understanding in MLLMs
di: He, Yuping, et al.
Pubblicazione: (2025)
di: He, Yuping, et al.
Pubblicazione: (2025)
EG-Gaussian: Epipolar Geometry and Graph Network Enhanced 3D Gaussian Splatting
di: Zhao, Beizhen, et al.
Pubblicazione: (2025)
di: Zhao, Beizhen, et al.
Pubblicazione: (2025)
$\text{VG}^2$GT: Voxel-Gaussian Splatting Visual Geometry Grounded Transformer
di: Zhao, Yibin, et al.
Pubblicazione: (2026)
di: Zhao, Yibin, et al.
Pubblicazione: (2026)
Let Language Constrain Geometry: Vision-Language Models as Semantic and Spatial Critics for 3D Generation
di: Bai, Weimin, et al.
Pubblicazione: (2025)
di: Bai, Weimin, et al.
Pubblicazione: (2025)
SPA: 3D Spatial-Awareness Enables Effective Embodied Representation
di: Zhu, Haoyi, et al.
Pubblicazione: (2024)
di: Zhu, Haoyi, et al.
Pubblicazione: (2024)
A Data-Centric Revisit of Pre-Trained Vision Models for Robot Learning
di: Wen, Xin, et al.
Pubblicazione: (2025)
di: Wen, Xin, et al.
Pubblicazione: (2025)
Coordinative Learning with Ordinal and Relational Priors for Volumetric Medical Image Segmentation
di: Wang, Haoyi
Pubblicazione: (2025)
di: Wang, Haoyi
Pubblicazione: (2025)
Cross-Age Contrastive Learning for Age-Invariant Face Recognition
di: Wang, Haoyi, et al.
Pubblicazione: (2023)
di: Wang, Haoyi, et al.
Pubblicazione: (2023)
Neural Surface Reconstruction from Sparse Views Using Epipolar Geometry
di: Chang, Xinhai, et al.
Pubblicazione: (2024)
di: Chang, Xinhai, et al.
Pubblicazione: (2024)
VINO: A Unified Visual Generator with Interleaved OmniModal Context
di: Chen, Junyi, et al.
Pubblicazione: (2026)
di: Chen, Junyi, et al.
Pubblicazione: (2026)
VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers
di: Wang, Yating, et al.
Pubblicazione: (2025)
di: Wang, Yating, et al.
Pubblicazione: (2025)
CrossGLG: LLM Guides One-shot Skeleton-based 3D Action Recognition in a Cross-level Manner
di: Yan, Tingbing, et al.
Pubblicazione: (2024)
di: Yan, Tingbing, et al.
Pubblicazione: (2024)
CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning
di: Yang, Jiange, et al.
Pubblicazione: (2025)
di: Yang, Jiange, et al.
Pubblicazione: (2025)
Generalizing Visual Geometry Priors to Sparse Gaussian Occupancy Prediction
di: Zhou, Changqing, et al.
Pubblicazione: (2026)
di: Zhou, Changqing, et al.
Pubblicazione: (2026)
Enhancing Fine-grained Object Detection in Aerial Images via Orthogonal Mapping
di: Zhu, Haoran, et al.
Pubblicazione: (2024)
di: Zhu, Haoran, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Aether: Geometric-Aware Unified World Modeling
di: Aether Team, et al.
Pubblicazione: (2025) -
WinT3R: Window-Based Streaming Reconstruction with Camera Token Pool
di: Li, Zizun, et al.
Pubblicazione: (2025) -
DeepVerse: 4D Autoregressive Video Generation as a World Model
di: Chen, Junyi, et al.
Pubblicazione: (2025) -
OmniWorld: A Multi-Domain and Multi-Modal Dataset for 4D World Modeling
di: Zhou, Yang, et al.
Pubblicazione: (2025) -
Geo-Align: Video Generation Alignment via Metric Geometry Reward
di: Li, Zizun, et al.
Pubblicazione: (2026)