BrepLLM: Native Boundary Representation Understanding with Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Deng, Liyuan, Guo, Hao, Bai, Yunpeng, Dai, Yongkang, Huang, Huaxi, Shi, Yilei |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
AutoRegressive Generation with B-rep Holistic Token Sequence Representation
by: Li, Jiahao, et al.
Published: (2026)
by: Li, Jiahao, et al.
Published: (2026)
BRepFormer: Transformer-Based B-rep Geometric Feature Recognition
by: Dai, Yongkang, et al.
Published: (2025)
by: Dai, Yongkang, et al.
Published: (2025)
NaViL: Rethinking Scaling Properties of Native Multimodal Large Language Models under Data Constraints
by: Tian, Changyao, et al.
Published: (2025)
by: Tian, Changyao, et al.
Published: (2025)
BrepGaussian: CAD reconstruction from Multi-View Images with Gaussian Splatting
by: Yu, Jiaxing, et al.
Published: (2026)
by: Yu, Jiaxing, et al.
Published: (2026)
AutoBrep: Autoregressive B-Rep Generation with Unified Topology and Geometry
by: Xu, Xiang, et al.
Published: (2025)
by: Xu, Xiang, et al.
Published: (2025)
Mema: Memory-Augmented Adapter for Enhanced Vision-Language Understanding
by: Liu, Ying, et al.
Published: (2026)
by: Liu, Ying, et al.
Published: (2026)
GraphBrep: Learning B-Rep in Graph Structure for Efficient CAD Generation
by: Lai, Weilin, et al.
Published: (2025)
by: Lai, Weilin, et al.
Published: (2025)
Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models
by: Niu, Junbo, et al.
Published: (2025)
by: Niu, Junbo, et al.
Published: (2025)
Do Vision-Language Models Really Understand Visual Language?
by: Hou, Yifan, et al.
Published: (2024)
by: Hou, Yifan, et al.
Published: (2024)
BrepGPT: Autoregressive B-rep Generation with Voronoi Half-Patch
by: Li, Pu, et al.
Published: (2025)
by: Li, Pu, et al.
Published: (2025)
Language and Geometry Grounded Sparse Voxel Representations for Holistic Scene Understanding
by: Wu, Guile, et al.
Published: (2026)
by: Wu, Guile, et al.
Published: (2026)
FiffDepth: Feed-forward Transformation of Diffusion-Based Generators for Detailed Depth Estimation
by: Bai, Yunpeng, et al.
Published: (2024)
by: Bai, Yunpeng, et al.
Published: (2024)
BrepGen: A B-rep Generative Diffusion Model with Structured Latent Geometry
by: Xu, Xiang, et al.
Published: (2024)
by: Xu, Xiang, et al.
Published: (2024)
Multimodal Large Language Models for Medical Report Generation via Customized Prompt Tuning
by: Li, Chunlei, et al.
Published: (2025)
by: Li, Chunlei, et al.
Published: (2025)
Diffusion-Driven Inter-Outer Surface Separation for Point Clouds with Open Boundaries
by: Qin, Zhengyan, et al.
Published: (2026)
by: Qin, Zhengyan, et al.
Published: (2026)
EmoLLM: Multimodal Emotional Understanding Meets Large Language Models
by: Yang, Qu, et al.
Published: (2024)
by: Yang, Qu, et al.
Published: (2024)
ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding
by: Ye, Junliang, et al.
Published: (2025)
by: Ye, Junliang, et al.
Published: (2025)
RelationVLM: Making Large Vision-Language Models Understand Visual Relations
by: Huang, Zhipeng, et al.
Published: (2024)
by: Huang, Zhipeng, et al.
Published: (2024)
SignAvatars: A Large-scale 3D Sign Language Holistic Motion Dataset and Benchmark
by: Yu, Zhengdi, et al.
Published: (2023)
by: Yu, Zhengdi, et al.
Published: (2023)
Positional Encoding Field
by: Bai, Yunpeng, et al.
Published: (2025)
by: Bai, Yunpeng, et al.
Published: (2025)
Enhancing User-Centric Privacy Protection: An Interactive Framework through Diffusion Models and Machine Unlearning
by: Huang, Huaxi, et al.
Published: (2024)
by: Huang, Huaxi, et al.
Published: (2024)
Visual-Language Model Knowledge Distillation Method for Image Quality Assessment
by: Hou, Yongkang, et al.
Published: (2025)
by: Hou, Yongkang, et al.
Published: (2025)
MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models
by: Meng, Fanqing, et al.
Published: (2024)
by: Meng, Fanqing, et al.
Published: (2024)
DocLayLLM: An Efficient Multi-modal Extension of Large Language Models for Text-rich Document Understanding
by: Liao, Wenhui, et al.
Published: (2024)
by: Liao, Wenhui, et al.
Published: (2024)
Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models
by: Li, Jinlong, et al.
Published: (2026)
by: Li, Jinlong, et al.
Published: (2026)
AsyMoE: Leveraging Modal Asymmetry for Enhanced Expert Specialization in Large Vision-Language Models
by: Zhang, Heng, et al.
Published: (2025)
by: Zhang, Heng, et al.
Published: (2025)
TOPA: Extending Large Language Models for Video Understanding via Text-Only Pre-Alignment
by: Li, Wei, et al.
Published: (2024)
by: Li, Wei, et al.
Published: (2024)
Evo-0: Vision-Language-Action Model with Implicit Spatial Understanding
by: Lin, Tao, et al.
Published: (2025)
by: Lin, Tao, et al.
Published: (2025)
Automatic Pruning Discovery for Large Language Models
by: Kang, Haidong, et al.
Published: (2025)
by: Kang, Haidong, et al.
Published: (2025)
Automated Learning of Semantic Embedding Representations for Diffusion Models
by: Jiang, Limai, et al.
Published: (2025)
by: Jiang, Limai, et al.
Published: (2025)
DocThinker: Explainable Multimodal Large Language Models with Rule-based Reinforcement Learning for Document Understanding
by: Yu, Wenwen, et al.
Published: (2025)
by: Yu, Wenwen, et al.
Published: (2025)
GeoVideo: Introducing Geometric Regularization into Video Generation Model
by: Bai, Yunpeng, et al.
Published: (2025)
by: Bai, Yunpeng, et al.
Published: (2025)
Enhancing Spatial Understanding in Image Generation via Reward Modeling
by: Tang, Zhenyu, et al.
Published: (2026)
by: Tang, Zhenyu, et al.
Published: (2026)
LLM-grounded Diffusion: Enhancing Prompt Understanding of Text-to-Image Diffusion Models with Large Language Models
by: Lian, Long, et al.
Published: (2023)
by: Lian, Long, et al.
Published: (2023)
TUNA: Taming Unified Visual Representations for Native Unified Multimodal Models
by: Liu, Zhiheng, et al.
Published: (2025)
by: Liu, Zhiheng, et al.
Published: (2025)
Multimodal Large Language Models for Text-rich Image Understanding: A Comprehensive Review
by: Fu, Pei, et al.
Published: (2025)
by: Fu, Pei, et al.
Published: (2025)
Chat-UniVi: Unified Visual Representation Empowers Large Language Models with Image and Video Understanding
by: Jin, Peng, et al.
Published: (2023)
by: Jin, Peng, et al.
Published: (2023)
ScVLM: Enhancing Vision-Language Model for Safety-Critical Event Understanding
by: Shi, Liang, et al.
Published: (2024)
by: Shi, Liang, et al.
Published: (2024)
LLM2CLIP: Powerful Language Model Unlocks Richer Cross-Modality Representation
by: Huang, Weiquan, et al.
Published: (2024)
by: Huang, Weiquan, et al.
Published: (2024)
VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model
by: Zhuang, Xianwei, et al.
Published: (2025)
by: Zhuang, Xianwei, et al.
Published: (2025)
Similar Items
-
AutoRegressive Generation with B-rep Holistic Token Sequence Representation
by: Li, Jiahao, et al.
Published: (2026) -
BRepFormer: Transformer-Based B-rep Geometric Feature Recognition
by: Dai, Yongkang, et al.
Published: (2025) -
NaViL: Rethinking Scaling Properties of Native Multimodal Large Language Models under Data Constraints
by: Tian, Changyao, et al.
Published: (2025) -
BrepGaussian: CAD reconstruction from Multi-View Images with Gaussian Splatting
by: Yu, Jiaxing, et al.
Published: (2026) -
AutoBrep: Autoregressive B-Rep Generation with Unified Topology and Geometry
by: Xu, Xiang, et al.
Published: (2025)