Enregistré dans:
| Auteurs principaux: | Jiang, Haoyi, Liu, Liu, Wang, Xinjie, He, Yonghao, Sui, Wei, Su, Zhizhong, Liu, Wenyu, Wang, Xinggang |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2602.21186 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GaussTR: Foundation Model-Aligned Gaussian Transformer for Self-Supervised 3D Spatial Understanding
par: Jiang, Haoyi, et autres
Publié: (2024)
par: Jiang, Haoyi, et autres
Publié: (2024)
Uni3R: Unified 3D Reconstruction and Semantic Understanding via Generalizable Gaussian Splatting from Unposed Multi-View Images
par: Sun, Xiangyu, et autres
Publié: (2025)
par: Sun, Xiangyu, et autres
Publié: (2025)
GLS: Geometry-aware 3D Language Gaussian Splatting
par: Qiu, Jiaxiong, et autres
Publié: (2024)
par: Qiu, Jiaxiong, et autres
Publié: (2024)
3D-Fixer: Coarse-to-Fine In-place Completion for 3D Scenes from a Single Image
par: Yin, Ze-Xin, et autres
Publié: (2026)
par: Yin, Ze-Xin, et autres
Publié: (2026)
EmbodiedGen: Towards a Generative 3D World Engine for Embodied Intelligence
par: Wang, Xinjie, et autres
Publié: (2025)
par: Wang, Xinjie, et autres
Publié: (2025)
DreamLifting: A Plug-in Module Lifting MV Diffusion Models for 3D Asset Generation
par: Yin, Ze-Xin, et autres
Publié: (2025)
par: Yin, Ze-Xin, et autres
Publié: (2025)
AlphaDrive: Unleashing the Power of VLMs in Autonomous Driving via Reinforcement Learning and Reasoning
par: Jiang, Bo, et autres
Publié: (2025)
par: Jiang, Bo, et autres
Publié: (2025)
PersonViT: Large-scale Self-supervised Vision Transformer for Person Re-Identification
par: Hu, Bin, et autres
Publié: (2024)
par: Hu, Bin, et autres
Publié: (2024)
TabletopGen: Instance-Level Interactive 3D Tabletop Scene Generation from Text or Single Image
par: Wang, Ziqian, et autres
Publié: (2025)
par: Wang, Ziqian, et autres
Publié: (2025)
STP4D: Spatio-Temporal-Prompt Consistent Modeling for Text-to-4D Gaussian Splatting
par: Deng, Yunze, et autres
Publié: (2025)
par: Deng, Yunze, et autres
Publié: (2025)
Dynamic 2D Gaussians: Geometrically Accurate Radiance Fields for Dynamic Objects
par: Zhang, Shuai, et autres
Publié: (2024)
par: Zhang, Shuai, et autres
Publié: (2024)
MaTVLM: Hybrid Mamba-Transformer for Efficient Vision-Language Modeling
par: Li, Yingyue, et autres
Publié: (2025)
par: Li, Yingyue, et autres
Publié: (2025)
Matte Anything: Interactive Natural Image Matting with Segment Anything Models
par: Yao, Jingfeng, et autres
Publié: (2023)
par: Yao, Jingfeng, et autres
Publié: (2023)
Polar Parametrization for Vision-based Surround-View 3D Detection
par: Chen, Shaoyu, et autres
Publié: (2022)
par: Chen, Shaoyu, et autres
Publié: (2022)
MIM4D: Masked Modeling with Multi-View Video for Autonomous Driving Representation Learning
par: Zou, Jialv, et autres
Publié: (2024)
par: Zou, Jialv, et autres
Publié: (2024)
GaraMoSt: Parallel Multi-Granularity Motion and Structural Modeling for Efficient Multi-Frame Interpolation in DSA Images
par: Xu, Ziyang, et autres
Publié: (2024)
par: Xu, Ziyang, et autres
Publié: (2024)
2D Gaussians Meet Visual Tokenizer
par: Shi, Yiang, et autres
Publié: (2025)
par: Shi, Yiang, et autres
Publié: (2025)
Fast High Dynamic Range Radiance Fields for Dynamic Scenes
par: Wu, Guanjun, et autres
Publié: (2024)
par: Wu, Guanjun, et autres
Publié: (2024)
FasterDiT: Towards Faster Diffusion Transformers Training without Architecture Modification
par: Yao, Jingfeng, et autres
Publié: (2024)
par: Yao, Jingfeng, et autres
Publié: (2024)
Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model
par: Zhu, Lianghui, et autres
Publié: (2024)
par: Zhu, Lianghui, et autres
Publié: (2024)
Gait Recognition via Collaborating Discriminative and Generative Diffusion Models
par: Xiong, Haijun, et autres
Publié: (2025)
par: Xiong, Haijun, et autres
Publié: (2025)
GaussianDreamer: Fast Generation from Text to 3D Gaussians by Bridging 2D and 3D Diffusion Models
par: Yi, Taoran, et autres
Publié: (2023)
par: Yi, Taoran, et autres
Publié: (2023)
MolSight: Optical Chemical Structure Recognition with SMILES Pretraining, Multi-Granularity Learning and Reinforcement Learning
par: Zhang, Wenrui, et autres
Publié: (2025)
par: Zhang, Wenrui, et autres
Publié: (2025)
Causality-inspired Discriminative Feature Learning in Triple Domains for Gait Recognition
par: Xiong, Haijun, et autres
Publié: (2024)
par: Xiong, Haijun, et autres
Publié: (2024)
Cross-Layer Attentive Feature Upsampling for Low-latency Semantic Segmentation
par: Cheng, Tianheng, et autres
Publié: (2026)
par: Cheng, Tianheng, et autres
Publié: (2026)
Gaussian Object Carver: Object-Compositional Gaussian Splatting with surfaces completion
par: Liu, Liu, et autres
Publié: (2024)
par: Liu, Liu, et autres
Publié: (2024)
OmniMamba: Efficient and Unified Multimodal Understanding and Generation via State Space Models
par: Zou, Jialv, et autres
Publié: (2025)
par: Zou, Jialv, et autres
Publié: (2025)
SceneVTG++: Controllable Multilingual Visual Text Generation in the Wild
par: Liu, Jiawei, et autres
Publié: (2025)
par: Liu, Jiawei, et autres
Publié: (2025)
4DLangVGGT: 4D Language-Visual Geometry Grounded Transformer
par: Wu, Xianfeng, et autres
Publié: (2025)
par: Wu, Xianfeng, et autres
Publié: (2025)
Visual Text Generation in the Wild
par: Zhu, Yuanzhi, et autres
Publié: (2024)
par: Zhu, Yuanzhi, et autres
Publié: (2024)
DiffusionVL: Translating Any Autoregressive Models into Diffusion Vision Language Models
par: Zeng, Lunbin, et autres
Publié: (2025)
par: Zeng, Lunbin, et autres
Publié: (2025)
Snap-Snap: Taking Two Images to Reconstruct 3D Human Gaussians in Milliseconds
par: Lu, Jia, et autres
Publié: (2025)
par: Lu, Jia, et autres
Publié: (2025)
GaitGS: Temporal Feature Learning in Granularity and Span Dimension for Gait Recognition
par: Xiong, Haijun, et autres
Publié: (2023)
par: Xiong, Haijun, et autres
Publié: (2023)
DeltaMIL: Gated Memory Integration for Efficient and Discriminative Whole Slide Image Analysis
par: Zhu, Yueting, et autres
Publié: (2025)
par: Zhu, Yueting, et autres
Publié: (2025)
Mask-Adapter: The Devil is in the Masks for Open-Vocabulary Segmentation
par: Li, Yongkang, et autres
Publié: (2024)
par: Li, Yongkang, et autres
Publié: (2024)
SpaRP: Fast 3D Object Reconstruction and Pose Estimation from Sparse Views
par: Xu, Chao, et autres
Publié: (2024)
par: Xu, Chao, et autres
Publié: (2024)
Speeding Up the Learning of 3D Gaussians with Much Shorter Gaussian Lists
par: Liu, Jiaqi, et autres
Publié: (2026)
par: Liu, Jiaqi, et autres
Publié: (2026)
Occupancy as Set of Points
par: Shi, Yiang, et autres
Publié: (2024)
par: Shi, Yiang, et autres
Publié: (2024)
MoSt-DSA: Modeling Motion and Structural Interactions for Direct Multi-Frame Interpolation in DSA Images
par: Xu, Ziyang, et autres
Publié: (2024)
par: Xu, Ziyang, et autres
Publié: (2024)
A Light-Weight Framework for Open-Set Object Detection with Decoupled Feature Alignment in Joint Space
par: He, Yonghao, et autres
Publié: (2024)
par: He, Yonghao, et autres
Publié: (2024)
Documents similaires
-
GaussTR: Foundation Model-Aligned Gaussian Transformer for Self-Supervised 3D Spatial Understanding
par: Jiang, Haoyi, et autres
Publié: (2024) -
Uni3R: Unified 3D Reconstruction and Semantic Understanding via Generalizable Gaussian Splatting from Unposed Multi-View Images
par: Sun, Xiangyu, et autres
Publié: (2025) -
GLS: Geometry-aware 3D Language Gaussian Splatting
par: Qiu, Jiaxiong, et autres
Publié: (2024) -
3D-Fixer: Coarse-to-Fine In-place Completion for 3D Scenes from a Single Image
par: Yin, Ze-Xin, et autres
Publié: (2026) -
EmbodiedGen: Towards a Generative 3D World Engine for Embodied Intelligence
par: Wang, Xinjie, et autres
Publié: (2025)