MultiMat: Multimodal Program Synthesis for Procedural Materials using Large Multimodal Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Belouadi, Jonas, Boubekeur, Tamy, Kaiser, Adrien |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ControlMat: A Controlled Generative Approach to Material Capture
di: Vecchio, Giuseppe, et al.
Pubblicazione: (2023)
di: Vecchio, Giuseppe, et al.
Pubblicazione: (2023)
AutomaTikZ: Text-Guided Synthesis of Scientific Vector Graphics with TikZ
di: Belouadi, Jonas, et al.
Pubblicazione: (2023)
di: Belouadi, Jonas, et al.
Pubblicazione: (2023)
Φeat: Physically-Grounded Feature Representation
di: Vecchio, Giuseppe, et al.
Pubblicazione: (2025)
di: Vecchio, Giuseppe, et al.
Pubblicazione: (2025)
DeTikZify: Synthesizing Graphics Programs for Scientific Figures and Sketches with TikZ
di: Belouadi, Jonas, et al.
Pubblicazione: (2024)
di: Belouadi, Jonas, et al.
Pubblicazione: (2024)
ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?
di: Zhang, Leixin, et al.
Pubblicazione: (2024)
di: Zhang, Leixin, et al.
Pubblicazione: (2024)
TikZero: Zero-Shot Text-Guided Graphics Program Synthesis
di: Belouadi, Jonas, et al.
Pubblicazione: (2025)
di: Belouadi, Jonas, et al.
Pubblicazione: (2025)
Understanding Multimodal Procedural Knowledge by Sequencing Multimodal Instructional Manuals
di: Wu, Te-Lin, et al.
Pubblicazione: (2021)
di: Wu, Te-Lin, et al.
Pubblicazione: (2021)
ProMQA-Assembly: Multimodal Procedural QA Dataset on Assembly
di: Hasegawa, Kimihiro, et al.
Pubblicazione: (2025)
di: Hasegawa, Kimihiro, et al.
Pubblicazione: (2025)
Jailbreaking Multimodal Large Language Models using Multi-Clip Video
di: Kang, Choongwon, et al.
Pubblicazione: (2026)
di: Kang, Choongwon, et al.
Pubblicazione: (2026)
LEO-MINI: An Efficient Multimodal Large Language Model using Conditional Token Reduction and Mixture of Multi-Modal Experts
di: Wang, Yimu, et al.
Pubblicazione: (2025)
di: Wang, Yimu, et al.
Pubblicazione: (2025)
Do Multimodal Large Language Models Understand Welding?
di: Khvatskii, Grigorii, et al.
Pubblicazione: (2025)
di: Khvatskii, Grigorii, et al.
Pubblicazione: (2025)
OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models
di: Liu, Yuliang, et al.
Pubblicazione: (2023)
di: Liu, Yuliang, et al.
Pubblicazione: (2023)
The Impact of Image Resolution on Biomedical Multimodal Large Language Models
di: Chen, Liangyu, et al.
Pubblicazione: (2025)
di: Chen, Liangyu, et al.
Pubblicazione: (2025)
Can Large Vision-Language Models Understand Multimodal Sarcasm?
di: Wang, Xinyu, et al.
Pubblicazione: (2025)
di: Wang, Xinyu, et al.
Pubblicazione: (2025)
LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models
di: Zhang, Kaichen, et al.
Pubblicazione: (2024)
di: Zhang, Kaichen, et al.
Pubblicazione: (2024)
Plug-and-Play Grounding of Reasoning in Multimodal Large Language Models
di: Chen, Jiaxing, et al.
Pubblicazione: (2024)
di: Chen, Jiaxing, et al.
Pubblicazione: (2024)
Imp: Highly Capable Large Multimodal Models for Mobile Devices
di: Shao, Zhenwei, et al.
Pubblicazione: (2024)
di: Shao, Zhenwei, et al.
Pubblicazione: (2024)
LLAVADI: What Matters For Multimodal Large Language Models Distillation
di: Xu, Shilin, et al.
Pubblicazione: (2024)
di: Xu, Shilin, et al.
Pubblicazione: (2024)
Strengthening Multimodal Large Language Model with Bootstrapped Preference Optimization
di: Pi, Renjie, et al.
Pubblicazione: (2024)
di: Pi, Renjie, et al.
Pubblicazione: (2024)
Frequency-Modulated Visual Restoration for Matryoshka Large Multimodal Models
di: Pan, Qingtao, et al.
Pubblicazione: (2026)
di: Pan, Qingtao, et al.
Pubblicazione: (2026)
VLMT: Vision-Language Multimodal Transformer for Multimodal Multi-hop Question Answering
di: Lim, Qi Zhi, et al.
Pubblicazione: (2025)
di: Lim, Qi Zhi, et al.
Pubblicazione: (2025)
Toward Robust Multimodal Learning using Multimodal Foundational Models
di: Zhao, Xianbing, et al.
Pubblicazione: (2024)
di: Zhao, Xianbing, et al.
Pubblicazione: (2024)
EmotionHallucer: Evaluating Emotion Hallucinations in Multimodal Large Language Models
di: Xing, Bohao, et al.
Pubblicazione: (2025)
di: Xing, Bohao, et al.
Pubblicazione: (2025)
Actial: Activate Spatial Reasoning Ability of Multimodal Large Language Models
di: Zhan, Xiaoyu, et al.
Pubblicazione: (2025)
di: Zhan, Xiaoyu, et al.
Pubblicazione: (2025)
Evaluating Multimodal Large Language Models on Vertically Written Japanese Text
di: Sasagawa, Keito, et al.
Pubblicazione: (2025)
di: Sasagawa, Keito, et al.
Pubblicazione: (2025)
UniChange: Unifying Change Detection with Multimodal Large Language Model
di: Zhang, Xu, et al.
Pubblicazione: (2025)
di: Zhang, Xu, et al.
Pubblicazione: (2025)
ODE: Open-Set Evaluation of Hallucinations in Multimodal Large Language Models
di: Tu, Yahan, et al.
Pubblicazione: (2024)
di: Tu, Yahan, et al.
Pubblicazione: (2024)
Exploring Multimodal Large Language Models for Radiology Report Error-checking
di: Wu, Jinge, et al.
Pubblicazione: (2023)
di: Wu, Jinge, et al.
Pubblicazione: (2023)
PALO: A Polyglot Large Multimodal Model for 5B People
di: Maaz, Muhammad, et al.
Pubblicazione: (2024)
di: Maaz, Muhammad, et al.
Pubblicazione: (2024)
Kosmos-G: Generating Images in Context with Multimodal Large Language Models
di: Pan, Xichen, et al.
Pubblicazione: (2023)
di: Pan, Xichen, et al.
Pubblicazione: (2023)
Mavors: Multi-granularity Video Representation for Multimodal Large Language Model
di: Shi, Yang, et al.
Pubblicazione: (2025)
di: Shi, Yang, et al.
Pubblicazione: (2025)
Exploring Multi-Grained Concept Annotations for Multimodal Large Language Models
di: Xu, Xiao, et al.
Pubblicazione: (2024)
di: Xu, Xiao, et al.
Pubblicazione: (2024)
Make-it-Real: Unleashing Large Multimodal Model for Painting 3D Objects with Realistic Materials
di: Fang, Ye, et al.
Pubblicazione: (2024)
di: Fang, Ye, et al.
Pubblicazione: (2024)
GalleryGPT: Analyzing Paintings with Large Multimodal Models
di: Bin, Yi, et al.
Pubblicazione: (2024)
di: Bin, Yi, et al.
Pubblicazione: (2024)
Graphic Design with Large Multimodal Model
di: Cheng, Yutao, et al.
Pubblicazione: (2024)
di: Cheng, Yutao, et al.
Pubblicazione: (2024)
Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding
di: Li, Yun, et al.
Pubblicazione: (2025)
di: Li, Yun, et al.
Pubblicazione: (2025)
MMCode: Benchmarking Multimodal Large Language Models for Code Generation with Visually Rich Programming Problems
di: Li, Kaixin, et al.
Pubblicazione: (2024)
di: Li, Kaixin, et al.
Pubblicazione: (2024)
MegaPairs: Massive Data Synthesis For Universal Multimodal Retrieval
di: Zhou, Junjie, et al.
Pubblicazione: (2024)
di: Zhou, Junjie, et al.
Pubblicazione: (2024)
Model Composition for Multimodal Large Language Models
di: Chen, Chi, et al.
Pubblicazione: (2024)
di: Chen, Chi, et al.
Pubblicazione: (2024)
SAP-Bench: Benchmarking Multimodal Large Language Models in Surgical Action Planning
di: Xu, Mengya, et al.
Pubblicazione: (2025)
di: Xu, Mengya, et al.
Pubblicazione: (2025)
Documenti analoghi
-
ControlMat: A Controlled Generative Approach to Material Capture
di: Vecchio, Giuseppe, et al.
Pubblicazione: (2023) -
AutomaTikZ: Text-Guided Synthesis of Scientific Vector Graphics with TikZ
di: Belouadi, Jonas, et al.
Pubblicazione: (2023) -
Φeat: Physically-Grounded Feature Representation
di: Vecchio, Giuseppe, et al.
Pubblicazione: (2025) -
DeTikZify: Synthesizing Graphics Programs for Scientific Figures and Sketches with TikZ
di: Belouadi, Jonas, et al.
Pubblicazione: (2024) -
ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?
di: Zhang, Leixin, et al.
Pubblicazione: (2024)