UniUGG: Unified 3D Understanding and Generation via Geometric-Semantic Encoding
Fuente:
arXiv
Guardado en:
| Autores principales: | Xu, Yueming, Zhang, Jiahui, Huang, Ze, Chen, Yurui, Zhou, Yanpeng, Chen, Zhenyu, Yuan, Yu-Jie, Xia, Pengxiang, Huang, Guowei, Cai, Xinyue, Qi, Zhongang, Quan, Xingyue, Hao, Jianye, Xu, Hang, Zhang, Li |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
4D-VLA: Spatiotemporal Vision-Language-Action Pretraining with Cross-Scene Calibration
por: Zhang, Jiahui, et al.
Publicado: (2025)
por: Zhang, Jiahui, et al.
Publicado: (2025)
From Flatland to Space: Teaching Vision-Language Models to Perceive and Reason in 3D
por: Zhang, Jiahui, et al.
Publicado: (2025)
por: Zhang, Jiahui, et al.
Publicado: (2025)
UGG: Unified Generative Grasping
por: Lu, Jiaxin, et al.
Publicado: (2023)
por: Lu, Jiaxin, et al.
Publicado: (2023)
UniStitch: Unifying Semantic and Geometric Features for Image Stitching
por: Mei, Yuan, et al.
Publicado: (2026)
por: Mei, Yuan, et al.
Publicado: (2026)
Whole-Body Inverse Kinematics with Graph Diffusion
por: Huang, Helong, et al.
Publicado: (2026)
por: Huang, Helong, et al.
Publicado: (2026)
GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions
por: Huang, Helong, et al.
Publicado: (2025)
por: Huang, Helong, et al.
Publicado: (2025)
ForceFlow: Learning to Feel and Act via Contact-Driven Flow Matching
por: Zhang, Shuoheng, et al.
Publicado: (2026)
por: Zhang, Shuoheng, et al.
Publicado: (2026)
UniGS: Unified Language-Image-3D Pretraining with Gaussian Splatting
por: Li, Haoyuan, et al.
Publicado: (2025)
por: Li, Haoyuan, et al.
Publicado: (2025)
UniChange: Unifying Change Detection with Multimodal Large Language Model
por: Zhang, Xu, et al.
Publicado: (2025)
por: Zhang, Xu, et al.
Publicado: (2025)
UniDex: Rethinking Search Inverted Indexing with Unified Semantic Modeling
por: Li, Zan, et al.
Publicado: (2025)
por: Li, Zan, et al.
Publicado: (2025)
UniPixel: Unified Object Referring and Segmentation for Pixel-Level Visual Reasoning
por: Liu, Ye, et al.
Publicado: (2025)
por: Liu, Ye, et al.
Publicado: (2025)
RADAR: Revealing Asymmetric Development of Abilities in MLLM Pre-training
por: Nie, Yunshuang, et al.
Publicado: (2026)
por: Nie, Yunshuang, et al.
Publicado: (2026)
UniMesh: Unifying 3D Mesh Understanding and Generation
por: Huang, Peng, et al.
Publicado: (2026)
por: Huang, Peng, et al.
Publicado: (2026)
UniShield: An Adaptive Multi-Agent Framework for Unified Forgery Image Detection and Localization
por: Huang, Qing, et al.
Publicado: (2025)
por: Huang, Qing, et al.
Publicado: (2025)
EVLP:Learning Unified Embodied Vision-Language Planner with Reinforced Supervised Fine-Tuning
por: Cai, Xinyan, et al.
Publicado: (2025)
por: Cai, Xinyan, et al.
Publicado: (2025)
UniHash: Unifying Pointwise and Pairwise Hashing Paradigms
por: Ma, Xiaoxu, et al.
Publicado: (2026)
por: Ma, Xiaoxu, et al.
Publicado: (2026)
UniCal: Unified Neural Sensor Calibration
por: Yang, Ze, et al.
Publicado: (2024)
por: Yang, Ze, et al.
Publicado: (2024)
UniToken: Harmonizing Multimodal Understanding and Generation through Unified Visual Encoding
por: Jiao, Yang, et al.
Publicado: (2025)
por: Jiao, Yang, et al.
Publicado: (2025)
Confidence Contours: Uncertainty-Aware Annotation for Medical Semantic Segmentation
por: Ye, Andre, et al.
Publicado: (2023)
por: Ye, Andre, et al.
Publicado: (2023)
UniCom: Unified Multimodal Modeling via Compressed Continuous Semantic Representations
por: Zhao, Yaqi, et al.
Publicado: (2026)
por: Zhao, Yaqi, et al.
Publicado: (2026)
UniGeo: Unifying Geometric Guidance for Camera-Controllable Image Editing via Video Models
por: Jiang, Hong, et al.
Publicado: (2026)
por: Jiang, Hong, et al.
Publicado: (2026)
Uni-Animator: Towards Unified Visual Colorization
por: Chen, Xinyuan, et al.
Publicado: (2026)
por: Chen, Xinyuan, et al.
Publicado: (2026)
UniHGKR: Unified Instruction-aware Heterogeneous Knowledge Retrievers
por: Min, Dehai, et al.
Publicado: (2024)
por: Min, Dehai, et al.
Publicado: (2024)
UniVBench: Towards Unified Evaluation for Video Foundation Models
por: Wei, Jianhui, et al.
Publicado: (2026)
por: Wei, Jianhui, et al.
Publicado: (2026)
UniRec: Unified Multimodal Encoding for LLM-Based Recommendations
por: Lei, Zijie, et al.
Publicado: (2026)
por: Lei, Zijie, et al.
Publicado: (2026)
SemHiTok: A Unified Image Tokenizer via Semantic-Guided Hierarchical Codebook for Multimodal Understanding and Generation
por: Chen, Zisheng, et al.
Publicado: (2025)
por: Chen, Zisheng, et al.
Publicado: (2025)
Extending General Covariance: A Unified Framework for Electromagnetic Interactions and Geometric Unification
por: Xiulin Huang, et al.
Publicado: (2025)
por: Xiulin Huang, et al.
Publicado: (2025)
UniADC: A Unified Framework for Anomaly Detection and Classification
por: Zhang, Ximiao, et al.
Publicado: (2025)
por: Zhang, Ximiao, et al.
Publicado: (2025)
Ru Single Atoms Integrated into Cobalt Oxide Spinel Structure with Interstitial Carbon for Enhanced Electrocatalytic Water Oxidation
por: Guowei Wang, et al.
Publicado: (2024)
por: Guowei Wang, et al.
Publicado: (2024)
TBAC-UniImage: Unified Understanding and Generation by Ladder-Side Diffusion Tuning
por: Xu, Junzhe, et al.
Publicado: (2025)
por: Xu, Junzhe, et al.
Publicado: (2025)
Geometric Phase-Driven Scattering Evolutions
por: Wang, Pengxiang, et al.
Publicado: (2024)
por: Wang, Pengxiang, et al.
Publicado: (2024)
UniAPO: Unified Multimodal Automated Prompt Optimization
por: Zhu, Qipeng, et al.
Publicado: (2025)
por: Zhu, Qipeng, et al.
Publicado: (2025)
UniMoE-Audio: Unified Speech and Music Generation with Dynamic-Capacity MoE
por: Liu, Zhenyu, et al.
Publicado: (2025)
por: Liu, Zhenyu, et al.
Publicado: (2025)
LaneGraph2Seq: Lane Topology Extraction with Language Model via Vertex-Edge Encoding and Connectivity Enhancement
por: Peng, Renyuan, et al.
Publicado: (2024)
por: Peng, Renyuan, et al.
Publicado: (2024)
SpatialCoT: Advancing Spatial Reasoning through Coordinate Alignment and Chain-of-Thought for Embodied Task Planning
por: Liu, Yuecheng, et al.
Publicado: (2025)
por: Liu, Yuecheng, et al.
Publicado: (2025)
UniCompress: Token Compression for Unified Vision-Language Understanding and Generation
por: Wang, Ziyao, et al.
Publicado: (2026)
por: Wang, Ziyao, et al.
Publicado: (2026)
UniSearch: Rethinking Search System with a Unified Generative Architecture
por: Chen, Jiahui, et al.
Publicado: (2025)
por: Chen, Jiahui, et al.
Publicado: (2025)
Uni-Renderer: Unifying Rendering and Inverse Rendering Via Dual Stream Diffusion
por: Chen, Zhifei, et al.
Publicado: (2024)
por: Chen, Zhifei, et al.
Publicado: (2024)
UniSurgSAM: A Unified Promptable Model for Reliable Surgical Video Segmentation
por: Liu, Haofeng, et al.
Publicado: (2026)
por: Liu, Haofeng, et al.
Publicado: (2026)
MUSE-VL: Modeling Unified VLM through Semantic Discrete Encoding
por: Xie, Rongchang, et al.
Publicado: (2024)
por: Xie, Rongchang, et al.
Publicado: (2024)
Ejemplares similares
-
4D-VLA: Spatiotemporal Vision-Language-Action Pretraining with Cross-Scene Calibration
por: Zhang, Jiahui, et al.
Publicado: (2025) -
From Flatland to Space: Teaching Vision-Language Models to Perceive and Reason in 3D
por: Zhang, Jiahui, et al.
Publicado: (2025) -
UGG: Unified Generative Grasping
por: Lu, Jiaxin, et al.
Publicado: (2023) -
UniStitch: Unifying Semantic and Geometric Features for Image Stitching
por: Mei, Yuan, et al.
Publicado: (2026) -
Whole-Body Inverse Kinematics with Graph Diffusion
por: Huang, Helong, et al.
Publicado: (2026)