Text-to-CAD Generation Through Infusing Visual Feedback in Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Ruiyu, Yuan, Yu, Sun, Shizhao, Bian, Jiang |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
CADMorph: Geometry-Driven Parametric CAD Editing via a Plan-Generate-Verify Loop
by: Ma, Weijian, et al.
Published: (2025)
by: Ma, Weijian, et al.
Published: (2025)
CAD-Editor: A Locate-then-Infill Framework with Automated Training Data Synthesis for Text-Based CAD Editing
by: Yuan, Yu, et al.
Published: (2025)
by: Yuan, Yu, et al.
Published: (2025)
FlexCAD: Unified and Versatile Controllable CAD Generation with Fine-tuned Large Language Models
by: Zhang, Zhanwei, et al.
Published: (2024)
by: Zhang, Zhanwei, et al.
Published: (2024)
CAD-Tokenizer: Towards Text-based CAD Prototyping via Modality-Specific Tokenization
by: Wang, Ruiyu, et al.
Published: (2025)
by: Wang, Ruiyu, et al.
Published: (2025)
Thinking with Blueprints: Assisting Vision-Language Models in Spatial Reasoning via Structured Object Representation
by: Ma, Weijian, et al.
Published: (2026)
by: Ma, Weijian, et al.
Published: (2026)
CAD-Coder:Text-Guided CAD Files Code Generation
by: He, Changqi, et al.
Published: (2025)
by: He, Changqi, et al.
Published: (2025)
DesignAsCode: Bridging Structural Editability and Visual Fidelity in Graphic Design Generation
by: Liu, Ziyuan, et al.
Published: (2026)
by: Liu, Ziyuan, et al.
Published: (2026)
CADKnitter: Compositional CAD Generation from Text and Geometry Guidance
by: Le, Tri, et al.
Published: (2025)
by: Le, Tri, et al.
Published: (2025)
Text-to-CadQuery: A New Paradigm for CAD Generation with Scalable Large Model Capabilities
by: Xie, Haoyang, et al.
Published: (2025)
by: Xie, Haoyang, et al.
Published: (2025)
Mostly Text, Smart Visuals: Asymmetric Text-Visual Pruning for Large Vision-Language Models
by: Li, Sijie, et al.
Published: (2026)
by: Li, Sijie, et al.
Published: (2026)
Introducing Visual Perception Token into Multimodal Large Language Model
by: Yu, Runpeng, et al.
Published: (2025)
by: Yu, Runpeng, et al.
Published: (2025)
Towards Visual Text Grounding of Multimodal Large Language Model
by: Li, Ming, et al.
Published: (2025)
by: Li, Ming, et al.
Published: (2025)
Infusing Environmental Captions for Long-Form Video Language Grounding
by: Lee, Hyogun, et al.
Published: (2024)
by: Lee, Hyogun, et al.
Published: (2024)
Predictive Regularization Against Visual Representation Degradation in Multimodal Large Language Models
by: Wang, Enguang, et al.
Published: (2026)
by: Wang, Enguang, et al.
Published: (2026)
Text-to-CAD Evaluation with CADTests
by: Mallis, Dimitrios, et al.
Published: (2026)
by: Mallis, Dimitrios, et al.
Published: (2026)
Revisiting CAD Model Generation by Learning Raster Sketch
by: Li, Pu, et al.
Published: (2025)
by: Li, Pu, et al.
Published: (2025)
Visual Prompting in Multimodal Large Language Models: A Survey
by: Wu, Junda, et al.
Published: (2024)
by: Wu, Junda, et al.
Published: (2024)
ForgerySleuth: Empowering Multimodal Large Language Models for Image Manipulation Detection
by: Sun, Zhihao, et al.
Published: (2024)
by: Sun, Zhihao, et al.
Published: (2024)
SVGen: Interpretable Vector Graphics Generation with Large Language Models
by: Wang, Feiyu, et al.
Published: (2025)
by: Wang, Feiyu, et al.
Published: (2025)
FedMGP: Personalized Federated Learning with Multi-Group Text-Visual Prompts
by: Bo, Weihao, et al.
Published: (2025)
by: Bo, Weihao, et al.
Published: (2025)
Not Only Text: Exploring Compositionality of Visual Representations in Vision-Language Models
by: Berasi, Davide, et al.
Published: (2025)
by: Berasi, Davide, et al.
Published: (2025)
DREAM: Improving Video-Text Retrieval Through Relevance-Based Augmentation Using Large Foundation Models
by: Wang, Yimu, et al.
Published: (2024)
by: Wang, Yimu, et al.
Published: (2024)
CADFit: Precise Mesh-to-CAD Program Generation with Hybrid Optimization
by: Nehme, Ghadi, et al.
Published: (2026)
by: Nehme, Ghadi, et al.
Published: (2026)
Groma: Localized Visual Tokenization for Grounding Multimodal Large Language Models
by: Ma, Chuofan, et al.
Published: (2024)
by: Ma, Chuofan, et al.
Published: (2024)
Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models
by: Miao, Yanting, et al.
Published: (2026)
by: Miao, Yanting, et al.
Published: (2026)
Visual Text Meets Low-level Vision: A Comprehensive Survey on Visual Text Processing
by: Shu, Yan, et al.
Published: (2024)
by: Shu, Yan, et al.
Published: (2024)
From Intent to Execution: Multimodal Chain-of-Thought Reinforcement Learning for Precise CAD Code Generation
by: Niu, Ke, et al.
Published: (2025)
by: Niu, Ke, et al.
Published: (2025)
Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models
by: Yi, Hao, et al.
Published: (2024)
by: Yi, Hao, et al.
Published: (2024)
SketchDNN: Joint Continuous-Discrete Diffusion for CAD Sketch Generation
by: Chereddy, Sathvik, et al.
Published: (2025)
by: Chereddy, Sathvik, et al.
Published: (2025)
Learning From Design Procedure To Generate CAD Programs for Data Augmentation
by: Chen, Yan-Ying, et al.
Published: (2026)
by: Chen, Yan-Ying, et al.
Published: (2026)
Prophet: Prompting Large Language Models with Complementary Answer Heuristics for Knowledge-based Visual Question Answering
by: Yu, Zhou, et al.
Published: (2023)
by: Yu, Zhou, et al.
Published: (2023)
Debiasing Vison-Language Models with Text-Only Training
by: Yang, Yunfan, et al.
Published: (2024)
by: Yang, Yunfan, et al.
Published: (2024)
Unifying Contrastive and Generative Objectives for Visual Understanding and Text-to-Image Generation
by: Li, Chao, et al.
Published: (2026)
by: Li, Chao, et al.
Published: (2026)
SafeFix: Targeted Model Repair via Controlled Image Generation
by: Xu, Ouyang, et al.
Published: (2025)
by: Xu, Ouyang, et al.
Published: (2025)
Sora Detector: A Unified Hallucination Detection for Large Text-to-Video Models
by: Chu, Zhixuan, et al.
Published: (2024)
by: Chu, Zhixuan, et al.
Published: (2024)
Inconsistency-Based Data-Centric Active Open-Set Annotation
by: Mao, Ruiyu, et al.
Published: (2024)
by: Mao, Ruiyu, et al.
Published: (2024)
Break the Visual Perception: Adversarial Attacks Targeting Encoded Visual Tokens of Large Vision-Language Models
by: Wang, Yubo, et al.
Published: (2024)
by: Wang, Yubo, et al.
Published: (2024)
TextSquare: Scaling up Text-Centric Visual Instruction Tuning
by: Tang, Jingqun, et al.
Published: (2024)
by: Tang, Jingqun, et al.
Published: (2024)
ReLayout: Integrating Relation Reasoning for Content-aware Layout Generation with Multi-modal Large Language Models
by: Tian, Jiaxu, et al.
Published: (2025)
by: Tian, Jiaxu, et al.
Published: (2025)
Tarsier: Recipes for Training and Evaluating Large Video Description Models
by: Wang, Jiawei, et al.
Published: (2024)
by: Wang, Jiawei, et al.
Published: (2024)
Similar Items
-
CADMorph: Geometry-Driven Parametric CAD Editing via a Plan-Generate-Verify Loop
by: Ma, Weijian, et al.
Published: (2025) -
CAD-Editor: A Locate-then-Infill Framework with Automated Training Data Synthesis for Text-Based CAD Editing
by: Yuan, Yu, et al.
Published: (2025) -
FlexCAD: Unified and Versatile Controllable CAD Generation with Fine-tuned Large Language Models
by: Zhang, Zhanwei, et al.
Published: (2024) -
CAD-Tokenizer: Towards Text-based CAD Prototyping via Modality-Specific Tokenization
by: Wang, Ruiyu, et al.
Published: (2025) -
Thinking with Blueprints: Assisting Vision-Language Models in Spatial Reasoning via Structured Object Representation
by: Ma, Weijian, et al.
Published: (2026)