Multimodal Markup Document Models for Graphic Design Completion
Fuente:
arXiv
Saved in:
| Main Authors: | Kikuchi, Kotaro, Honda, Ukyo, Inoue, Naoto, Otani, Mayu, Simo-Serra, Edgar, Yamaguchi, Kota |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
LTSim: Layout Transportation-based Similarity Measure for Evaluating Layout Generation
by: Otani, Mayu, et al.
Published: (2024)
by: Otani, Mayu, et al.
Published: (2024)
Harnessing the Latent Diffusion Model for Training-Free Image Style Transfer
by: Masui, Kento, et al.
Published: (2024)
by: Masui, Kento, et al.
Published: (2024)
Fast Sprite Decomposition from Animated Graphics
by: Suzuki, Tomoyuki, et al.
Published: (2024)
by: Suzuki, Tomoyuki, et al.
Published: (2024)
Retrieval-Augmented Layout Transformer for Content-Aware Layout Generation
by: Horita, Daichi, et al.
Published: (2023)
by: Horita, Daichi, et al.
Published: (2023)
OpenCOLE: Towards Reproducible Automatic Graphic Design Generation
by: Inoue, Naoto, et al.
Published: (2024)
by: Inoue, Naoto, et al.
Published: (2024)
STATUS Bench: A Rigorous Benchmark for Evaluating Object State Understanding in Vision-Language Models
by: Ukai, Mahiro, et al.
Published: (2025)
by: Ukai, Mahiro, et al.
Published: (2025)
LayerD: Decomposing Raster Graphic Designs into Layers
by: Suzuki, Tomoyuki, et al.
Published: (2025)
by: Suzuki, Tomoyuki, et al.
Published: (2025)
Causal Graphical Models for Vision-Language Compositional Understanding
by: Parascandolo, Fiorenzo, et al.
Published: (2024)
by: Parascandolo, Fiorenzo, et al.
Published: (2024)
DesignAsCode: Bridging Structural Editability and Visual Fidelity in Graphic Design Generation
by: Liu, Ziyuan, et al.
Published: (2026)
by: Liu, Ziyuan, et al.
Published: (2026)
Smart Transfer: Leveraging Vision Foundation Model for Rapid Building Damage Mapping with Post-Earthquake VHR Imagery
by: Li, Hao, et al.
Published: (2026)
by: Li, Hao, et al.
Published: (2026)
URMF: Uncertainty-aware Robust Multimodal Fusion for Multimodal Sarcasm Detection
by: Wang, Zhenyu, et al.
Published: (2026)
by: Wang, Zhenyu, et al.
Published: (2026)
VDE Bench: Evaluating The Capability of Image Editing Models to Modify Visual Documents
by: Yi, Hongzhu, et al.
Published: (2026)
by: Yi, Hongzhu, et al.
Published: (2026)
StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation
by: Wu, Yi, et al.
Published: (2025)
by: Wu, Yi, et al.
Published: (2025)
Modality Gap-Driven Subspace Alignment Training Paradigm For Multimodal Large Language Models
by: Yu, Xiaomin, et al.
Published: (2026)
by: Yu, Xiaomin, et al.
Published: (2026)
AdaCoder: Adaptive Prompt Compression for Programmatic Visual Question Answering
by: Ukai, Mahiro, et al.
Published: (2024)
by: Ukai, Mahiro, et al.
Published: (2024)
Very Efficient Listwise Multimodal Reranking for Long Documents
by: Sun, Yiqun, et al.
Published: (2026)
by: Sun, Yiqun, et al.
Published: (2026)
Can GPTs Evaluate Graphic Design Based on Design Principles?
by: Haraguchi, Daichi, et al.
Published: (2024)
by: Haraguchi, Daichi, et al.
Published: (2024)
Diagnosing and Re-learning for Balanced Multimodal Learning
by: Wei, Yake, et al.
Published: (2024)
by: Wei, Yake, et al.
Published: (2024)
Recurrence-Enhanced Vision-and-Language Transformers for Robust Multimodal Document Retrieval
by: Caffagni, Davide, et al.
Published: (2025)
by: Caffagni, Davide, et al.
Published: (2025)
PIN: A Knowledge-Intensive Dataset for Paired and Interleaved Multimodal Documents
by: Wang, Junjie, et al.
Published: (2024)
by: Wang, Junjie, et al.
Published: (2024)
Multimodal Chaptering for Long-Form TV Newscast Video
by: Guetari, Khalil, et al.
Published: (2024)
by: Guetari, Khalil, et al.
Published: (2024)
CLCR: Cross-Level Semantic Collaborative Representation for Multimodal Learning
by: Meng, Chunlei, et al.
Published: (2026)
by: Meng, Chunlei, et al.
Published: (2026)
Federated Prompt-Tuning with Heterogeneous and Incomplete Multimodal Client Data
by: Phung, Thu Hang, et al.
Published: (2026)
by: Phung, Thu Hang, et al.
Published: (2026)
CrypticBio: A Large Multimodal Dataset for Visually Confusing Biodiversity
by: Manolache, Georgiana, et al.
Published: (2025)
by: Manolache, Georgiana, et al.
Published: (2025)
Parents and Children: Distinguishing Multimodal DeepFakes from Natural Images
by: Amoroso, Roberto, et al.
Published: (2023)
by: Amoroso, Roberto, et al.
Published: (2023)
ASR-enhanced Multimodal Representation Learning for Cross-Domain Product Retrieval
by: Zhao, Ruixiang, et al.
Published: (2024)
by: Zhao, Ruixiang, et al.
Published: (2024)
Detecting Multimodal Situations with Insufficient Context and Abstaining from Baseless Predictions
by: Liu, Junzhang, et al.
Published: (2024)
by: Liu, Junzhang, et al.
Published: (2024)
AlignDiT: Multimodal Aligned Diffusion Transformer for Synchronized Speech Generation
by: Choi, Jeongsoo, et al.
Published: (2025)
by: Choi, Jeongsoo, et al.
Published: (2025)
LMVD: A Large-Scale Multimodal Vlog Dataset for Depression Detection in the Wild
by: He, Lang, et al.
Published: (2024)
by: He, Lang, et al.
Published: (2024)
Fashion-RAG: Multimodal Fashion Image Editing via Retrieval-Augmented Generation
by: Sanguigni, Fulvio, et al.
Published: (2025)
by: Sanguigni, Fulvio, et al.
Published: (2025)
IDNet: A Novel Dataset for Identity Document Analysis and Fraud Detection
by: Guan, Hong, et al.
Published: (2024)
by: Guan, Hong, et al.
Published: (2024)
XEmoGPT: An Explainable Multimodal Emotion Recognition Framework with Cue-Level Perception and Reasoning
by: Zhang, Hanwen, et al.
Published: (2026)
by: Zhang, Hanwen, et al.
Published: (2026)
Official-NV: An LLM-Generated News Video Dataset for Multimodal Fake News Detection
by: Wang, Yihao, et al.
Published: (2024)
by: Wang, Yihao, et al.
Published: (2024)
Handling Missing Modalities in Multimodal Survival Prediction for Non-Small Cell Lung Cancer
by: Ruffini, Filippo, et al.
Published: (2026)
by: Ruffini, Filippo, et al.
Published: (2026)
Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion
by: Zhang, Yinghui, et al.
Published: (2025)
by: Zhang, Yinghui, et al.
Published: (2025)
Benchmarking Multimodal Large Language Models for Missing Modality Completion in Product Catalogues
by: Fu, Junchen, et al.
Published: (2026)
by: Fu, Junchen, et al.
Published: (2026)
Change Detection Between Optical Remote Sensing Imagery and Map Data via Segment Anything Model (SAM)
by: Chen, Hongruixuan, et al.
Published: (2024)
by: Chen, Hongruixuan, et al.
Published: (2024)
Controllable Expressive 3D Facial Animation via Diffusion in a Unified Multimodal Space
by: Liu, Kangwei, et al.
Published: (2025)
by: Liu, Kangwei, et al.
Published: (2025)
A Novel Multimodal System to Predict Agitation in People with Dementia Within Clinical Settings: A Proof of Concept
by: Badawi, Abeer, et al.
Published: (2024)
by: Badawi, Abeer, et al.
Published: (2024)
D-Judge: How Far Are We? Assessing the Discrepancies Between AI-synthesized and Natural Images through Multimodal Guidance
by: Liu, Renyang, et al.
Published: (2024)
by: Liu, Renyang, et al.
Published: (2024)
Similar Items
-
LTSim: Layout Transportation-based Similarity Measure for Evaluating Layout Generation
by: Otani, Mayu, et al.
Published: (2024) -
Harnessing the Latent Diffusion Model for Training-Free Image Style Transfer
by: Masui, Kento, et al.
Published: (2024) -
Fast Sprite Decomposition from Animated Graphics
by: Suzuki, Tomoyuki, et al.
Published: (2024) -
Retrieval-Augmented Layout Transformer for Content-Aware Layout Generation
by: Horita, Daichi, et al.
Published: (2023) -
OpenCOLE: Towards Reproducible Automatic Graphic Design Generation
by: Inoue, Naoto, et al.
Published: (2024)