Multi-Modal 3D Mesh Reconstruction from Images and Text
Fuente:
arXiv
Salvato in:
| Autori principali: | Reka, Melvin, Pulli, Tessa, Vincze, Markus |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
From Words to Poses: Enhancing Novel Object Pose Estimation with Vision Language Models
di: Pulli, Tessa, et al.
Pubblicazione: (2024)
di: Pulli, Tessa, et al.
Pubblicazione: (2024)
Enhancing Transparent Object Pose Estimation: A Fusion of GDR-Net and Edge Detection
di: Pulli, Tessa, et al.
Pubblicazione: (2025)
di: Pulli, Tessa, et al.
Pubblicazione: (2025)
OSCAR: Open-Set CAD Retrieval from a Language Prompt and a Single Image
di: Pulli, Tessa, et al.
Pubblicazione: (2026)
di: Pulli, Tessa, et al.
Pubblicazione: (2026)
Improving 2D-3D Dense Correspondences with Diffusion Models for 6D Object Pose Estimation
di: Hönig, Peter, et al.
Pubblicazione: (2024)
di: Hönig, Peter, et al.
Pubblicazione: (2024)
Multi-Modal Language Models as Text-to-Image Model Evaluators
di: Chen, Jiahui, et al.
Pubblicazione: (2025)
di: Chen, Jiahui, et al.
Pubblicazione: (2025)
Text-Video Retrieval via Variational Multi-Modal Hypergraph Networks
di: Li, Qian, et al.
Pubblicazione: (2024)
di: Li, Qian, et al.
Pubblicazione: (2024)
Text-Only Training for Image Captioning with Retrieval Augmentation and Modality Gap Correction
di: Fonseca, Rui, et al.
Pubblicazione: (2025)
di: Fonseca, Rui, et al.
Pubblicazione: (2025)
Improving Brain-to-Image Reconstruction via Fine-Grained Text Bridging
di: Xia, Runze, et al.
Pubblicazione: (2025)
di: Xia, Runze, et al.
Pubblicazione: (2025)
MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training
di: Vasu, Pavan Kumar Anasosalu, et al.
Pubblicazione: (2023)
di: Vasu, Pavan Kumar Anasosalu, et al.
Pubblicazione: (2023)
Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation
di: Csizmadia, Daniel, et al.
Pubblicazione: (2025)
di: Csizmadia, Daniel, et al.
Pubblicazione: (2025)
Text-centric Alignment for Multi-Modality Learning
di: Tsai, Yun-Da, et al.
Pubblicazione: (2024)
di: Tsai, Yun-Da, et al.
Pubblicazione: (2024)
BIMCV-R: A Landmark Dataset for 3D CT Text-Image Retrieval
di: Chen, Yinda, et al.
Pubblicazione: (2024)
di: Chen, Yinda, et al.
Pubblicazione: (2024)
M$^{3}$T2IBench: A Large-Scale Multi-Category, Multi-Instance, Multi-Relation Text-to-Image Benchmark
di: Zhang, Huixuan, et al.
Pubblicazione: (2025)
di: Zhang, Huixuan, et al.
Pubblicazione: (2025)
Text-Printed Image: Bridging the Image-Text Modality Gap for Text-centric Training of Large Vision-Language Models
di: Yamabe, Shojiro, et al.
Pubblicazione: (2025)
di: Yamabe, Shojiro, et al.
Pubblicazione: (2025)
Text-to-Image Cross-Modal Generation: A Systematic Review
di: Żelaszczyk, Maciej, et al.
Pubblicazione: (2024)
di: Żelaszczyk, Maciej, et al.
Pubblicazione: (2024)
VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval
di: Zhou, Junjie, et al.
Pubblicazione: (2024)
di: Zhou, Junjie, et al.
Pubblicazione: (2024)
Orthus: Autoregressive Interleaved Image-Text Generation with Modality-Specific Heads
di: Kou, Siqi, et al.
Pubblicazione: (2024)
di: Kou, Siqi, et al.
Pubblicazione: (2024)
Text-guided Controllable Mesh Refinement for Interactive 3D Modeling
di: Chen, Yun-Chun, et al.
Pubblicazione: (2024)
di: Chen, Yun-Chun, et al.
Pubblicazione: (2024)
Image2Text2Image: A Novel Framework for Label-Free Evaluation of Image-to-Text Generation with Text-to-Image Diffusion Models
di: Huang, Jia-Hong, et al.
Pubblicazione: (2024)
di: Huang, Jia-Hong, et al.
Pubblicazione: (2024)
Leopard: A Vision Language Model For Text-Rich Multi-Image Tasks
di: Jia, Mengzhao, et al.
Pubblicazione: (2024)
di: Jia, Mengzhao, et al.
Pubblicazione: (2024)
MVAM: Multi-View Attention Method for Fine-grained Image-Text Matching
di: Cui, Wanqing, et al.
Pubblicazione: (2024)
di: Cui, Wanqing, et al.
Pubblicazione: (2024)
Cross-Modal Retrieval for Motion and Text via DropTriple Loss
di: Yan, Sheng, et al.
Pubblicazione: (2023)
di: Yan, Sheng, et al.
Pubblicazione: (2023)
MMGR: Multi-Modal Generative Reasoning
di: Cai, Zefan, et al.
Pubblicazione: (2025)
di: Cai, Zefan, et al.
Pubblicazione: (2025)
HGGT: Robust and Flexible 3D Hand Mesh Reconstruction from Uncalibrated Images
di: Liu, Yumeng, et al.
Pubblicazione: (2026)
di: Liu, Yumeng, et al.
Pubblicazione: (2026)
MMMG: A Massive, Multidisciplinary, Multi-Tier Generation Benchmark for Text-to-Image Reasoning
di: Luo, Yuxuan, et al.
Pubblicazione: (2025)
di: Luo, Yuxuan, et al.
Pubblicazione: (2025)
Analyzing Images of Legal Documents: Toward Multi-Modal LLMs for Access to Justice
di: Westermann, Hannes, et al.
Pubblicazione: (2024)
di: Westermann, Hannes, et al.
Pubblicazione: (2024)
Cross-modal Associations in Vision and Language Models: Revisiting the Bouba-Kiki Effect
di: Kouwenhoven, Tom, et al.
Pubblicazione: (2025)
di: Kouwenhoven, Tom, et al.
Pubblicazione: (2025)
Enhancing Meme Emotion Understanding with Multi-Level Modality Enhancement and Dual-Stage Modal Fusion
di: Shi, Yi, et al.
Pubblicazione: (2025)
di: Shi, Yi, et al.
Pubblicazione: (2025)
InstantMesh: Efficient 3D Mesh Generation from a Single Image with Sparse-view Large Reconstruction Models
di: Xu, Jiale, et al.
Pubblicazione: (2024)
di: Xu, Jiale, et al.
Pubblicazione: (2024)
Multi-Modal Multi-Granularity Tokenizer for Chu Bamboo Slip Scripts
di: Chen, Yingfa, et al.
Pubblicazione: (2024)
di: Chen, Yingfa, et al.
Pubblicazione: (2024)
Multi-Head Attention Driven Dynamic Visual-Semantic Embedding for Enhanced Image-Text Matching
di: Chen, Wenjing
Pubblicazione: (2024)
di: Chen, Wenjing
Pubblicazione: (2024)
MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer
di: Tian, Changyao, et al.
Pubblicazione: (2024)
di: Tian, Changyao, et al.
Pubblicazione: (2024)
Reasmory: 3D Reconstruction as Explicit Memory for VLMs Spatial Reasoning
di: He, Jixuan, et al.
Pubblicazione: (2026)
di: He, Jixuan, et al.
Pubblicazione: (2026)
Redemption Score: A Multi-Modal Evaluation Framework for Image Captioning via Distributional, Perceptual, and Linguistic Signal Triangulation
di: Dahal, Ashim, et al.
Pubblicazione: (2025)
di: Dahal, Ashim, et al.
Pubblicazione: (2025)
TextTIGER: Text-based Intelligent Generation with Entity Prompt Refinement for Text-to-Image Generation
di: Ozaki, Shintaro, et al.
Pubblicazione: (2025)
di: Ozaki, Shintaro, et al.
Pubblicazione: (2025)
Prompt Highlighter: Interactive Control for Multi-Modal LLMs
di: Zhang, Yuechen, et al.
Pubblicazione: (2023)
di: Zhang, Yuechen, et al.
Pubblicazione: (2023)
HandGCAT: Occlusion-Robust 3D Hand Mesh Reconstruction from Monocular Images
di: Wang, Shuaibing, et al.
Pubblicazione: (2024)
di: Wang, Shuaibing, et al.
Pubblicazione: (2024)
Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models
di: Xu, Runsen, et al.
Pubblicazione: (2025)
di: Xu, Runsen, et al.
Pubblicazione: (2025)
$λ$-ECLIPSE: Multi-Concept Personalized Text-to-Image Diffusion Models by Leveraging CLIP Latent Space
di: Patel, Maitreya, et al.
Pubblicazione: (2024)
di: Patel, Maitreya, et al.
Pubblicazione: (2024)
VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction
di: Fan, Zhiwen, et al.
Pubblicazione: (2025)
di: Fan, Zhiwen, et al.
Pubblicazione: (2025)
Documenti analoghi
-
From Words to Poses: Enhancing Novel Object Pose Estimation with Vision Language Models
di: Pulli, Tessa, et al.
Pubblicazione: (2024) -
Enhancing Transparent Object Pose Estimation: A Fusion of GDR-Net and Edge Detection
di: Pulli, Tessa, et al.
Pubblicazione: (2025) -
OSCAR: Open-Set CAD Retrieval from a Language Prompt and a Single Image
di: Pulli, Tessa, et al.
Pubblicazione: (2026) -
Improving 2D-3D Dense Correspondences with Diffusion Models for 6D Object Pose Estimation
di: Hönig, Peter, et al.
Pubblicazione: (2024) -
Multi-Modal Language Models as Text-to-Image Model Evaluators
di: Chen, Jiahui, et al.
Pubblicazione: (2025)