3DFroMLLM: 3D Prototype Generation only from Pretrained Multimodal LLMs
Fuente:
arXiv
Saved in:
| Main Authors: | Ahmed, Noor, Braunstein, Cameron, Eger, Steffen, Ilg, Eddy |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Quantum-Hybrid Stereo Matching With Nonlinear Regularization and Spatial Pyramids
by: Braunstein, Cameron, et al.
Published: (2023)
by: Braunstein, Cameron, et al.
Published: (2023)
CLIP is All You Need for Human-like Semantic Representations in Stable Diffusion
by: Braunstein, Cameron, et al.
Published: (2025)
by: Braunstein, Cameron, et al.
Published: (2025)
Unified Category-Level Object Detection and Pose Estimation from RGB Images using 3D Prototypes
by: Fischer, Tom, et al.
Published: (2025)
by: Fischer, Tom, et al.
Published: (2025)
SLayR: Scene Layout Generation with Rectified Flow
by: Braunstein, Cameron, et al.
Published: (2024)
by: Braunstein, Cameron, et al.
Published: (2024)
Prototypicality Bias Reveals Blindspots in Multimodal Evaluation Metrics
by: Roy, Subhadeep, et al.
Published: (2026)
by: Roy, Subhadeep, et al.
Published: (2026)
Unsupervised Learning of Category-Level 3D Pose from Object-Centric Videos
by: Sommer, Leonhard, et al.
Published: (2024)
by: Sommer, Leonhard, et al.
Published: (2024)
Neural Point Cloud Diffusion for Disentangled 3D Shape and Appearance Generation
by: Schröppel, Philipp, et al.
Published: (2023)
by: Schröppel, Philipp, et al.
Published: (2023)
E-3DGS: Event-Based Novel View Rendering of Large-Scale Scenes Using 3D Gaussian Splatting
by: Zahid, Sohaib, et al.
Published: (2025)
by: Zahid, Sohaib, et al.
Published: (2025)
Hoi3DGen: Generating High-Quality Human-Object-Interactions in 3D
by: Sharma, Agniv, et al.
Published: (2026)
by: Sharma, Agniv, et al.
Published: (2026)
TikZero: Zero-Shot Text-Guided Graphics Program Synthesis
by: Belouadi, Jonas, et al.
Published: (2025)
by: Belouadi, Jonas, et al.
Published: (2025)
latentSplat: Autoencoding Variational Gaussians for Fast Generalizable 3D Reconstruction
by: Wewer, Christopher, et al.
Published: (2024)
by: Wewer, Christopher, et al.
Published: (2024)
MLLM-For3D: Adapting Multimodal Large Language Model for 3D Reasoning Segmentation
by: Huang, Jiaxin, et al.
Published: (2025)
by: Huang, Jiaxin, et al.
Published: (2025)
CAD-MLLM: Unifying Multimodality-Conditioned CAD Generation With MLLM
by: Xu, Jingwei, et al.
Published: (2024)
by: Xu, Jingwei, et al.
Published: (2024)
Accurate Training Data for Occupancy Map Prediction in Automated Driving Using Evidence Theory
by: Kälble, Jonas, et al.
Published: (2024)
by: Kälble, Jonas, et al.
Published: (2024)
TikZilla: Scaling Text-to-TikZ with High-Quality Data and Reinforcement Learning
by: Greisinger, Christian, et al.
Published: (2026)
by: Greisinger, Christian, et al.
Published: (2026)
SimNP: Learning Self-Similarity Priors Between Neural Points
by: Wewer, Christopher, et al.
Published: (2023)
by: Wewer, Christopher, et al.
Published: (2023)
Part-X-MLLM: Part-aware 3D Multimodal Large Language Model
by: Wang, Chunshi, et al.
Published: (2025)
by: Wang, Chunshi, et al.
Published: (2025)
Recent Trends in 3D Reconstruction of General Non-Rigid Scenes
by: Yunus, Raza, et al.
Published: (2024)
by: Yunus, Raza, et al.
Published: (2024)
AutomaTikZ: Text-Guided Synthesis of Scientific Vector Graphics with TikZ
by: Belouadi, Jonas, et al.
Published: (2023)
by: Belouadi, Jonas, et al.
Published: (2023)
iNeMo: Incremental Neural Mesh Models for Robust Class-Incremental Learning
by: Fischer, Tom, et al.
Published: (2024)
by: Fischer, Tom, et al.
Published: (2024)
Neuroexplicit Diffusion Models for Inpainting of Optical Flow Fields
by: Fischer, Tom, et al.
Published: (2024)
by: Fischer, Tom, et al.
Published: (2024)
DeTikZify: Synthesizing Graphics Programs for Scientific Figures and Sketches with TikZ
by: Belouadi, Jonas, et al.
Published: (2024)
by: Belouadi, Jonas, et al.
Published: (2024)
Neural Parametric Gaussians for Monocular Non-Rigid Object Reconstruction
by: Das, Devikalyan, et al.
Published: (2023)
by: Das, Devikalyan, et al.
Published: (2023)
Spurfies: Sparse Surface Reconstruction using Local Geometry Priors
by: Raj, Kevin, et al.
Published: (2024)
by: Raj, Kevin, et al.
Published: (2024)
Emu: Generative Pretraining in Multimodality
by: Sun, Quan, et al.
Published: (2023)
by: Sun, Quan, et al.
Published: (2023)
GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models
by: Zhang, Jiaxin, et al.
Published: (2026)
by: Zhang, Jiaxin, et al.
Published: (2026)
Semantics-Guided Multimodal Masked Autoencoder Pretraining for 3D BEV Object Detection
by: Wariyapperuma, Prabuddhi, et al.
Published: (2026)
by: Wariyapperuma, Prabuddhi, et al.
Published: (2026)
Group3D: MLLM-Driven Semantic Grouping for Open-Vocabulary 3D Object Detection
by: Kim, Youbin, et al.
Published: (2026)
by: Kim, Youbin, et al.
Published: (2026)
CharNeRF: 3D Character Generation from Concept Art
by: Chu, Eddy, et al.
Published: (2024)
by: Chu, Eddy, et al.
Published: (2024)
CG-MLLM: Captioning and Generating 3D content via Multi-modal Large Language Models
by: Huang, Junming, et al.
Published: (2026)
by: Huang, Junming, et al.
Published: (2026)
Beyond Filtering: Adaptive Image-Text Quality Enhancement for MLLM Pretraining
by: Huang, Han, et al.
Published: (2024)
by: Huang, Han, et al.
Published: (2024)
MLLM-VADStory: Domain Knowledge-Driven Multimodal LLMs for Video Ad Storyline Insights
by: Yang, Jasmine, et al.
Published: (2026)
by: Yang, Jasmine, et al.
Published: (2026)
SwinTF3D: A Lightweight Multimodal Fusion Approach for Text-Guided 3D Medical Image Segmentation
by: Khan, Hasan Faraz, et al.
Published: (2025)
by: Khan, Hasan Faraz, et al.
Published: (2025)
Enhancing 3D Medical Image Understanding with Pretraining Aided by 2D Multimodal Large Language Models
by: Chen, Qiuhui, et al.
Published: (2025)
by: Chen, Qiuhui, et al.
Published: (2025)
CROC: Evaluating and Training T2I Metrics with Pseudo- and Human-Labeled Contrastive Robustness Checks
by: Leiter, Christoph, et al.
Published: (2025)
by: Leiter, Christoph, et al.
Published: (2025)
DenseMLLM: Standard Multimodal LLMs for Dense Prediction
by: Li, Yi, et al.
Published: (2026)
by: Li, Yi, et al.
Published: (2026)
Boosting MLLM Spatial Reasoning with Geometrically Referenced 3D Scene Representations
by: Yuan, Jiangye, et al.
Published: (2026)
by: Yuan, Jiangye, et al.
Published: (2026)
Survey on AI-Generated Media Detection: From Non-MLLM to MLLM
by: Zou, Yueying, et al.
Published: (2025)
by: Zou, Yueying, et al.
Published: (2025)
3D VR Sketch Guided 3D Shape Prototyping and Exploration
by: Luo, Ling, et al.
Published: (2023)
by: Luo, Ling, et al.
Published: (2023)
MLLM-CompBench: A Comparative Reasoning Benchmark for Multimodal LLMs
by: Kil, Jihyung, et al.
Published: (2024)
by: Kil, Jihyung, et al.
Published: (2024)
Similar Items
-
Quantum-Hybrid Stereo Matching With Nonlinear Regularization and Spatial Pyramids
by: Braunstein, Cameron, et al.
Published: (2023) -
CLIP is All You Need for Human-like Semantic Representations in Stable Diffusion
by: Braunstein, Cameron, et al.
Published: (2025) -
Unified Category-Level Object Detection and Pose Estimation from RGB Images using 3D Prototypes
by: Fischer, Tom, et al.
Published: (2025) -
SLayR: Scene Layout Generation with Rectified Flow
by: Braunstein, Cameron, et al.
Published: (2024) -
Prototypicality Bias Reveals Blindspots in Multimodal Evaluation Metrics
by: Roy, Subhadeep, et al.
Published: (2026)