VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction
Fuente:
arXiv
Saved in:
| Main Authors: | Fan, Zhiwen, Zhang, Jian, Li, Renjie, Zhang, Junge, Chen, Runjin, Hu, Hezhen, Wang, Kevin, Qu, Huaizhi, Zhou, Shijie, Wang, Dilin, Yan, Zhicheng, Xu, Hongyu, Theiss, Justin, Chen, Tianlong, Li, Jiachen, Tu, Zhengzhong, Wang, Zhangyang, Ranjan, Rakesh |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MV-DUSt3R+: Single-Stage Scene Reconstruction from Sparse Views In 2 Seconds
by: Tang, Zhenggang, et al.
Published: (2024)
by: Tang, Zhenggang, et al.
Published: (2024)
LLMs Can Get "Brain Rot": A Pilot Study on Twitter/X
by: Xing, Shuo, et al.
Published: (2025)
by: Xing, Shuo, et al.
Published: (2025)
MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding
by: Li, Renjie, et al.
Published: (2025)
by: Li, Renjie, et al.
Published: (2025)
Taming Mode Collapse in Score Distillation for Text-to-3D Generation
by: Wang, Peihao, et al.
Published: (2023)
by: Wang, Peihao, et al.
Published: (2023)
SteinDreamer: Variance Reduction for Text-to-3D Score Distillation via Stein Identity
by: Wang, Peihao, et al.
Published: (2023)
by: Wang, Peihao, et al.
Published: (2023)
Steepest Descent Density Control for Compact 3D Gaussian Splatting
by: Wang, Peihao, et al.
Published: (2025)
by: Wang, Peihao, et al.
Published: (2025)
4K4DGen: Panoramic 4D Generation at 4K Resolution
by: Li, Renjie, et al.
Published: (2024)
by: Li, Renjie, et al.
Published: (2024)
GEM: 3D Gaussian Splatting for Efficient and Accurate Cryo-EM Reconstruction
by: Qu, Huaizhi, et al.
Published: (2025)
by: Qu, Huaizhi, et al.
Published: (2025)
Co-generation of Layout and Shape from Text via Autoregressive 3D Diffusion
by: Tang, Zhenggang, et al.
Published: (2026)
by: Tang, Zhenggang, et al.
Published: (2026)
SEAL: Steerable Reasoning Calibration of Large Language Models for Free
by: Chen, Runjin, et al.
Published: (2025)
by: Chen, Runjin, et al.
Published: (2025)
STAMP: Scalable Task And Model-agnostic Collaborative Perception
by: Gao, Xiangbo, et al.
Published: (2025)
by: Gao, Xiangbo, et al.
Published: (2025)
More is Less: The Pitfalls of Multi-Model Synthetic Preference Data in DPO Safety Alignment
by: Wang, Yifan, et al.
Published: (2025)
by: Wang, Yifan, et al.
Published: (2025)
HeadsUp! High-Fidelity Portrait Image Super-Resolution
by: Li, Renjie, et al.
Published: (2025)
by: Li, Renjie, et al.
Published: (2025)
PANDORA: Diffusion Policy Learning for Dexterous Robotic Piano Playing
by: Huang, Yanjia, et al.
Published: (2025)
by: Huang, Yanjia, et al.
Published: (2025)
DynamicVerse: A Physically-Aware Multimodal Framework for 4D World Modeling
by: Wen, Kairun, et al.
Published: (2025)
by: Wen, Kairun, et al.
Published: (2025)
LLaGA: Large Language and Graph Assistant
by: Chen, Runjin, et al.
Published: (2024)
by: Chen, Runjin, et al.
Published: (2024)
AutoPartGen: Autogressive 3D Part Generation and Discovery
by: Chen, Minghao, et al.
Published: (2025)
by: Chen, Minghao, et al.
Published: (2025)
Expressive Gaussian Human Avatars from Monocular RGB Video
by: Hu, Hezhen, et al.
Published: (2024)
by: Hu, Hezhen, et al.
Published: (2024)
HumanNOVA: Photorealistic, Universal and Rapid 3D Human Avatar Modeling from a Single Image
by: Hu, Hezhen, et al.
Published: (2026)
by: Hu, Hezhen, et al.
Published: (2026)
MVDiffusion++: A Dense High-resolution Multi-view Diffusion Model for Single or Sparse-view 3D Object Reconstruction
by: Tang, Shitao, et al.
Published: (2024)
by: Tang, Shitao, et al.
Published: (2024)
3D Mesh Editing using Masked LRMs
by: Gao, Will, et al.
Published: (2024)
by: Gao, Will, et al.
Published: (2024)
SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning
by: Zhang, Jian, et al.
Published: (2026)
by: Zhang, Jian, et al.
Published: (2026)
Mastering Regional 3DGS: Locating, Initializing, and Editing with Diverse 2D Priors
by: Guo, Lanqing, et al.
Published: (2025)
by: Guo, Lanqing, et al.
Published: (2025)
Large Spatial Model: End-to-end Unposed Images to Semantic 3D
by: Fan, Zhiwen, et al.
Published: (2024)
by: Fan, Zhiwen, et al.
Published: (2024)
VISTA: Generative Visual Imagination for Vision-and-Language Navigation
by: Huang, Yanjia, et al.
Published: (2025)
by: Huang, Yanjia, et al.
Published: (2025)
Multi-Agent Debate for LLM Judges with Adaptive Stability Detection
by: Hu, Tianyu, et al.
Published: (2025)
by: Hu, Tianyu, et al.
Published: (2025)
LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning
by: Perin, Gabriel J., et al.
Published: (2025)
by: Perin, Gabriel J., et al.
Published: (2025)
Found in the Middle: How Language Models Use Long Contexts Better via Plug-and-Play Positional Encoding
by: Zhang, Zhenyu, et al.
Published: (2024)
by: Zhang, Zhenyu, et al.
Published: (2024)
EditCast3D: Single-Frame-Guided 3D Editing with Video Propagation and View Selection
by: Qu, Huaizhi, et al.
Published: (2025)
by: Qu, Huaizhi, et al.
Published: (2025)
DOGe: Defensive Output Generation for LLM Protection Against Knowledge Distillation
by: Li, Pingzhi, et al.
Published: (2025)
by: Li, Pingzhi, et al.
Published: (2025)
Rethinking PGD Attack: Is Sign Function Necessary?
by: Yang, Junjie, et al.
Published: (2023)
by: Yang, Junjie, et al.
Published: (2023)
One Token Embedding Is Enough to Deadlock Your Large Reasoning Model
by: Zhang, Mohan, et al.
Published: (2025)
by: Zhang, Mohan, et al.
Published: (2025)
DP-OPT: Make Large Language Model Your Privacy-Preserving Prompt Engineer
by: Hong, Junyuan, et al.
Published: (2023)
by: Hong, Junyuan, et al.
Published: (2023)
Lift3D: Zero-Shot Lifting of Any 2D Vision Model to 3D
by: T, Mukund Varma, et al.
Published: (2024)
by: T, Mukund Varma, et al.
Published: (2024)
CAST: Contrastive Adaptation and Distillation for Semi-Supervised Instance Segmentation
by: Taghavi, Pardis, et al.
Published: (2025)
by: Taghavi, Pardis, et al.
Published: (2025)
Training a Student Expert via Semi-Supervised Foundation Model Distillation
by: Taghavi, Pardis, et al.
Published: (2026)
by: Taghavi, Pardis, et al.
Published: (2026)
Demystifying the Visual Quality Paradox in Multimodal Large Language Models
by: Xing, Shuo, et al.
Published: (2025)
by: Xing, Shuo, et al.
Published: (2025)
E3D-Bench: A Benchmark for End-to-End 3D Geometric Foundation Models
by: Cong, Wenyan, et al.
Published: (2025)
by: Cong, Wenyan, et al.
Published: (2025)
Re-Align: Aligning Vision Language Models via Retrieval-Augmented Direct Preference Optimization
by: Xing, Shuo, et al.
Published: (2025)
by: Xing, Shuo, et al.
Published: (2025)
S-NeRF++: Autonomous Driving Simulation via Neural Reconstruction and Generation
by: Chen, Yurui, et al.
Published: (2024)
by: Chen, Yurui, et al.
Published: (2024)
Similar Items
-
MV-DUSt3R+: Single-Stage Scene Reconstruction from Sparse Views In 2 Seconds
by: Tang, Zhenggang, et al.
Published: (2024) -
LLMs Can Get "Brain Rot": A Pilot Study on Twitter/X
by: Xing, Shuo, et al.
Published: (2025) -
MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding
by: Li, Renjie, et al.
Published: (2025) -
Taming Mode Collapse in Score Distillation for Text-to-3D Generation
by: Wang, Peihao, et al.
Published: (2023) -
SteinDreamer: Variance Reduction for Text-to-3D Score Distillation via Stein Identity
by: Wang, Peihao, et al.
Published: (2023)