SldprtNet: A Large-Scale Multimodal Dataset for CAD Generation in Language-Driven 3D Design
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Ruogu, Li, Sikai, Mu, Yao, Ding, Mingyu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
V2X-QA: A Comprehensive Reasoning Dataset and Benchmark for Multimodal Large Language Models in Autonomous Driving Across Ego, Infrastructure, and Cooperative Views
par: You, Junwei, et autres
Publié: (2026)
par: You, Junwei, et autres
Publié: (2026)
EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning
par: Chen, Yi, et autres
Publié: (2023)
par: Chen, Yi, et autres
Publié: (2023)
Towards Comprehensive Multimodal Perception: Introducing the Touch-Language-Vision Dataset
par: Cheng, Ning, et autres
Publié: (2024)
par: Cheng, Ning, et autres
Publié: (2024)
DexGraspNet 2.0: Learning Generative Dexterous Grasping in Large-scale Synthetic Cluttered Scenes
par: Zhang, Jialiang, et autres
Publié: (2024)
par: Zhang, Jialiang, et autres
Publié: (2024)
NVSim: Novel View Synthesis Simulator for Large Scale Indoor Navigation
par: Jeong, Mingyu, et autres
Publié: (2025)
par: Jeong, Mingyu, et autres
Publié: (2025)
FantasyVLN: Unified Multimodal Chain-of-Thought Reasoning for Vision-Language Navigation
par: Zuo, Jing, et autres
Publié: (2026)
par: Zuo, Jing, et autres
Publié: (2026)
Affordance-R1: Reinforcement Learning for Generalizable Affordance Reasoning in Multimodal Large Language Model
par: Wang, Hanqing, et autres
Publié: (2025)
par: Wang, Hanqing, et autres
Publié: (2025)
CO^3: Cooperative Unsupervised 3D Representation Learning for Autonomous Driving
par: Chen, Runjian, et autres
Publié: (2022)
par: Chen, Runjian, et autres
Publié: (2022)
A Touch, Vision, and Language Dataset for Multimodal Alignment
par: Fu, Letian, et autres
Publié: (2024)
par: Fu, Letian, et autres
Publié: (2024)
LanguageMPC: Large Language Models as Decision Makers for Autonomous Driving
par: Sha, Hao, et autres
Publié: (2023)
par: Sha, Hao, et autres
Publié: (2023)
SkillDiffuser: Interpretable Hierarchical Planning via Skill Abstractions in Diffusion-Based Task Execution
par: Liang, Zhixuan, et autres
Publié: (2023)
par: Liang, Zhixuan, et autres
Publié: (2023)
OpenEgo: A Large-Scale Multimodal Egocentric Dataset for Dexterous Manipulation
par: Jawaid, Ahad, et autres
Publié: (2025)
par: Jawaid, Ahad, et autres
Publié: (2025)
MetricNet: Recovering Metric Scale in Generative Navigation Policies
par: Nayak, Abhijeet, et autres
Publié: (2025)
par: Nayak, Abhijeet, et autres
Publié: (2025)
Co-Me: Confidence-Guided Token Merging for Visual Geometric Transformers
par: Chen, Yutian, et autres
Publié: (2025)
par: Chen, Yutian, et autres
Publié: (2025)
PhyGrasp: Generalizing Robotic Grasping with Physics-informed Large Multimodal Models
par: Guo, Dingkun, et autres
Publié: (2024)
par: Guo, Dingkun, et autres
Publié: (2024)
VibraVerse: A Large-Scale Geometry-Acoustics Alignment Dataset for Physically-Consistent Multimodal Learning
par: Pang, Bo, et autres
Publié: (2025)
par: Pang, Bo, et autres
Publié: (2025)
3D-AffordanceLLM: Harnessing Large Language Models for Open-Vocabulary Affordance Detection in 3D Worlds
par: Chu, Hengshuo, et autres
Publié: (2025)
par: Chu, Hengshuo, et autres
Publié: (2025)
VoroNav: Voronoi-based Zero-shot Object Navigation with Large Language Model
par: Wu, Pengying, et autres
Publié: (2024)
par: Wu, Pengying, et autres
Publié: (2024)
SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes
par: Huang, Jiaxin, et autres
Publié: (2025)
par: Huang, Jiaxin, et autres
Publié: (2025)
QUART-Online: Latency-Free Large Multimodal Language Model for Quadruped Robot Learning
par: Tong, Xinyang, et autres
Publié: (2024)
par: Tong, Xinyang, et autres
Publié: (2024)
When LLMs step into the 3D World: A Survey and Meta-Analysis of 3D Tasks via Multi-modal Large Language Models
par: Ma, Xianzheng, et autres
Publié: (2024)
par: Ma, Xianzheng, et autres
Publié: (2024)
RoboCodeX: Multimodal Code Generation for Robotic Behavior Synthesis
par: Mu, Yao, et autres
Publié: (2024)
par: Mu, Yao, et autres
Publié: (2024)
DynamicCity: Large-Scale 4D Occupancy Generation from Dynamic Scenes
par: Bian, Hengwei, et autres
Publié: (2024)
par: Bian, Hengwei, et autres
Publié: (2024)
HOH: Markerless Multimodal Human-Object-Human Handover Dataset with Large Object Count
par: Wiederhold, Noah, et autres
Publié: (2023)
par: Wiederhold, Noah, et autres
Publié: (2023)
TartanGround: A Large-Scale Dataset for Ground Robot Perception and Navigation
par: Patel, Manthan, et autres
Publié: (2025)
par: Patel, Manthan, et autres
Publié: (2025)
VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers
par: Wang, Yating, et autres
Publié: (2025)
par: Wang, Yating, et autres
Publié: (2025)
Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms
par: Cao, Zhixiang, et autres
Publié: (2026)
par: Cao, Zhixiang, et autres
Publié: (2026)
OSCAR: Open-Set CAD Retrieval from a Language Prompt and a Single Image
par: Pulli, Tessa, et autres
Publié: (2026)
par: Pulli, Tessa, et autres
Publié: (2026)
DriveLMM-o1: A Step-by-Step Reasoning Dataset and Large Multimodal Model for Driving Scenario Understanding
par: Ishaq, Ayesha, et autres
Publié: (2025)
par: Ishaq, Ayesha, et autres
Publié: (2025)
(MGS)$^2$-Net: Unifying Micro-Geometric Scale and Macro-Geometric Structure for Cross-View Geo-Localization
par: Li, Minglei, et autres
Publié: (2026)
par: Li, Minglei, et autres
Publié: (2026)
S3E: A Multi-Robot Multimodal Dataset for Collaborative SLAM
par: Feng, Dapeng, et autres
Publié: (2022)
par: Feng, Dapeng, et autres
Publié: (2022)
Generalized Trajectory Scoring for End-to-end Multimodal Planning
par: Li, Zhenxin, et autres
Publié: (2025)
par: Li, Zhenxin, et autres
Publié: (2025)
Digital Twin Catalog: A Large-Scale Photorealistic 3D Object Digital Twin Dataset
par: Dong, Zhao, et autres
Publié: (2025)
par: Dong, Zhao, et autres
Publié: (2025)
DIO: Dataset of 3D Mesh Models of Indoor Objects for Robotics and Computer Vision Applications
par: Nimal, Nillan, et autres
Publié: (2024)
par: Nimal, Nillan, et autres
Publié: (2024)
HRDexDB: A Large-Scale Dataset of Dexterous Human and Robotic Hand Grasps
par: Lim, Jongbin, et autres
Publié: (2026)
par: Lim, Jongbin, et autres
Publié: (2026)
LoopDB: A Loop Closure Dataset for Large Scale Simultaneous Localization and Mapping
par: Nakshbandi, Mohammad-Maher, et autres
Publié: (2025)
par: Nakshbandi, Mohammad-Maher, et autres
Publié: (2025)
Efficient and Distributed Large-Scale 3D Map Registration using Tomographic Features
par: Unlu, Halil Utku, et autres
Publié: (2024)
par: Unlu, Halil Utku, et autres
Publié: (2024)
CompassAD: Intent-Driven 3D Affordance Grounding in Functionally Competing Objects
par: Li, Jingliang, et autres
Publié: (2026)
par: Li, Jingliang, et autres
Publié: (2026)
3DGS_LSR:Large_Scale Relocation for Autonomous Driving Based on 3D Gaussian Splatting
par: Lu, Haitao, et autres
Publié: (2025)
par: Lu, Haitao, et autres
Publié: (2025)
Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain
par: Luo, Yulin, et autres
Publié: (2025)
par: Luo, Yulin, et autres
Publié: (2025)
Documents similaires
-
V2X-QA: A Comprehensive Reasoning Dataset and Benchmark for Multimodal Large Language Models in Autonomous Driving Across Ego, Infrastructure, and Cooperative Views
par: You, Junwei, et autres
Publié: (2026) -
EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning
par: Chen, Yi, et autres
Publié: (2023) -
Towards Comprehensive Multimodal Perception: Introducing the Touch-Language-Vision Dataset
par: Cheng, Ning, et autres
Publié: (2024) -
DexGraspNet 2.0: Learning Generative Dexterous Grasping in Large-scale Synthetic Cluttered Scenes
par: Zhang, Jialiang, et autres
Publié: (2024) -
NVSim: Novel View Synthesis Simulator for Large Scale Indoor Navigation
par: Jeong, Mingyu, et autres
Publié: (2025)