UniT: Unified Geometry Learning with Group Autoregressive Transformer
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Haotian, Huang, Yusong, Kuang, Zhaonian, Lu, Hongliang, Zheng, Xinhu, Yang, Meng, Hua, Gang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CoIn3D: Revisiting Configuration-Invariant Multi-Camera 3D Object Detection
por: Kuang, Zhaonian, et al.
Publicado: (2026)
por: Kuang, Zhaonian, et al.
Publicado: (2026)
Object-Scene-Camera Decomposition and Recomposition for Data-Efficient Monocular 3D Object Detection
por: Kuang, Zhaonian, et al.
Publicado: (2026)
por: Kuang, Zhaonian, et al.
Publicado: (2026)
Multi-Modal Decouple and Recouple Network for Robust 3D Object Detection
por: Ding, Rui, et al.
Publicado: (2026)
por: Ding, Rui, et al.
Publicado: (2026)
RayD3D: Distilling Depth Knowledge Along the Ray for Robust Multi-View 3D Object Detection
por: Ding, Rui, et al.
Publicado: (2026)
por: Ding, Rui, et al.
Publicado: (2026)
Scale Propagation Network for Generalizable Depth Completion
por: Wang, Haotian, et al.
Publicado: (2024)
por: Wang, Haotian, et al.
Publicado: (2024)
UniT: Unified Multimodal Chain-of-Thought Test-time Scaling
por: Chen, Leon Liangyu, et al.
Publicado: (2026)
por: Chen, Leon Liangyu, et al.
Publicado: (2026)
Synergistic Perception and Generative Recomposition: A Multi-Agent Orchestration for Expert-Level Building Inspection
por: Zhong, Hui, et al.
Publicado: (2026)
por: Zhong, Hui, et al.
Publicado: (2026)
UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation
por: Sun, Yang-Tian, et al.
Publicado: (2025)
por: Sun, Yang-Tian, et al.
Publicado: (2025)
UniLayDiff: A Unified Diffusion Transformer for Content-Aware Layout Generation
por: Liu, Zeyang, et al.
Publicado: (2025)
por: Liu, Zeyang, et al.
Publicado: (2025)
Skywork UniPic: Unified Autoregressive Modeling for Visual Understanding and Generation
por: Wang, Peiyu, et al.
Publicado: (2025)
por: Wang, Peiyu, et al.
Publicado: (2025)
Does Visual Information Play a Decisive Role in Vision-Language-Action Model Driving Behavior?
por: He, Jingtao, et al.
Publicado: (2026)
por: He, Jingtao, et al.
Publicado: (2026)
UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths
por: Mao, Weijia, et al.
Publicado: (2025)
por: Mao, Weijia, et al.
Publicado: (2025)
UniX: Unifying Autoregression and Diffusion for Chest X-Ray Understanding and Generation
por: Zhang, Ruiheng, et al.
Publicado: (2026)
por: Zhang, Ruiheng, et al.
Publicado: (2026)
VGGT-World: Transforming VGGT into an Autoregressive Geometry World Model
por: Sun, Xiangyu, et al.
Publicado: (2026)
por: Sun, Xiangyu, et al.
Publicado: (2026)
UniMark: Unified Adaptive Multi-bit Watermarking for Autoregressive Image Generators
por: Yilmaz, Yigit, et al.
Publicado: (2026)
por: Yilmaz, Yigit, et al.
Publicado: (2026)
UniViTAR: Unified Vision Transformer with Native Resolution
por: Qiao, Limeng, et al.
Publicado: (2025)
por: Qiao, Limeng, et al.
Publicado: (2025)
UniGS: Unified Geometry-Aware Gaussian Splatting for Multimodal Rendering
por: Xie, Yusen, et al.
Publicado: (2025)
por: Xie, Yusen, et al.
Publicado: (2025)
UniFL: Improve Latent Diffusion Model via Unified Feedback Learning
por: Zhang, Jiacheng, et al.
Publicado: (2024)
por: Zhang, Jiacheng, et al.
Publicado: (2024)
UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning
por: Mao, Weijia, et al.
Publicado: (2025)
por: Mao, Weijia, et al.
Publicado: (2025)
UniVector: Unified Vector Extraction via Instance-Geometry Interaction
por: Yan, Yinglong, et al.
Publicado: (2025)
por: Yan, Yinglong, et al.
Publicado: (2025)
UniMo: Unifying 2D Video and 3D Human Motion with an Autoregressive Framework
por: Pang, Youxin, et al.
Publicado: (2025)
por: Pang, Youxin, et al.
Publicado: (2025)
UniGeo: A Unified 3D Indoor Object Detection Framework Integrating Geometry-Aware Learning and Dynamic Channel Gating
por: Yi, Xing, et al.
Publicado: (2026)
por: Yi, Xing, et al.
Publicado: (2026)
UniLION: Towards Unified Autonomous Driving Model with Linear Group RNNs
por: Liu, Zhe, et al.
Publicado: (2025)
por: Liu, Zhe, et al.
Publicado: (2025)
AutoBrep: Autoregressive B-Rep Generation with Unified Topology and Geometry
por: Xu, Xiang, et al.
Publicado: (2025)
por: Xu, Xiang, et al.
Publicado: (2025)
UniSTFormer: Unified Spatio-Temporal Lightweight Transformer for Efficient Skeleton-Based Action Recognition
por: Wu, Wenhan, et al.
Publicado: (2025)
por: Wu, Wenhan, et al.
Publicado: (2025)
UniCombine: Unified Multi-Conditional Combination with Diffusion Transformer
por: Wang, Haoxuan, et al.
Publicado: (2025)
por: Wang, Haoxuan, et al.
Publicado: (2025)
Uni-ISP: Toward Unifying the Learning of ISPs from Multiple Mobile Cameras
por: Li, Lingen, et al.
Publicado: (2024)
por: Li, Lingen, et al.
Publicado: (2024)
Triamese-ViT: A 3D-Aware Method for Robust Brain Age Estimation from MRIs
por: Zhang, Zhaonian, et al.
Publicado: (2024)
por: Zhang, Zhaonian, et al.
Publicado: (2024)
R^2MoE: Redundancy-Removal Mixture of Experts for Lifelong Concept Learning
por: Guo, Xiaohan, et al.
Publicado: (2025)
por: Guo, Xiaohan, et al.
Publicado: (2025)
UniTT-Stereo: Unified Training of Transformer for Enhanced Stereo Matching
por: Kim, Soomin, et al.
Publicado: (2024)
por: Kim, Soomin, et al.
Publicado: (2024)
UniCode: Learning a Unified Codebook for Multimodal Large Language Models
por: Zheng, Sipeng, et al.
Publicado: (2024)
por: Zheng, Sipeng, et al.
Publicado: (2024)
UniHead: Unifying Multi-Perception for Detection Heads
por: Zhou, Hantao, et al.
Publicado: (2023)
por: Zhou, Hantao, et al.
Publicado: (2023)
UniVid: The Open-Source Unified Video Model
por: Luo, Jiabin, et al.
Publicado: (2025)
por: Luo, Jiabin, et al.
Publicado: (2025)
UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation
por: Guo, Qin, et al.
Publicado: (2025)
por: Guo, Qin, et al.
Publicado: (2025)
UniPose: Unified Cross-modality Pose Prior Propagation towards RGB-D data for Weakly Supervised 3D Human Pose Estimation
por: Zheng, Jinghong, et al.
Publicado: (2025)
por: Zheng, Jinghong, et al.
Publicado: (2025)
UniModel: A Visual-Only Framework for Unified Multimodal Understanding and Generation
por: Zhang, Chi, et al.
Publicado: (2025)
por: Zhang, Chi, et al.
Publicado: (2025)
UniPR-3D: Towards Universal Visual Place Recognition with Visual Geometry Grounded Transformer
por: Deng, Tianchen, et al.
Publicado: (2025)
por: Deng, Tianchen, et al.
Publicado: (2025)
DrivingGPT: Unifying Driving World Modeling and Planning with Multi-modal Autoregressive Transformers
por: Chen, Yuntao, et al.
Publicado: (2024)
por: Chen, Yuntao, et al.
Publicado: (2024)
Marrying Autoregressive Transformer and Diffusion with Multi-Reference Autoregression
por: Zhen, Dingcheng, et al.
Publicado: (2025)
por: Zhen, Dingcheng, et al.
Publicado: (2025)
Ming-UniVision: Joint Image Understanding and Generation with a Unified Continuous Tokenizer
por: Huang, Ziyuan, et al.
Publicado: (2025)
por: Huang, Ziyuan, et al.
Publicado: (2025)
Ejemplares similares
-
CoIn3D: Revisiting Configuration-Invariant Multi-Camera 3D Object Detection
por: Kuang, Zhaonian, et al.
Publicado: (2026) -
Object-Scene-Camera Decomposition and Recomposition for Data-Efficient Monocular 3D Object Detection
por: Kuang, Zhaonian, et al.
Publicado: (2026) -
Multi-Modal Decouple and Recouple Network for Robust 3D Object Detection
por: Ding, Rui, et al.
Publicado: (2026) -
RayD3D: Distilling Depth Knowledge Along the Ray for Robust Multi-View 3D Object Detection
por: Ding, Rui, et al.
Publicado: (2026) -
Scale Propagation Network for Generalizable Depth Completion
por: Wang, Haotian, et al.
Publicado: (2024)