Salvato in:
| Autori principali: | Chen, Jian, Zhang, Ruiyi, Zhou, Yufan, Jain, Rajiv, Xu, Zhiqiang, Rossi, Ryan, Chen, Changyou |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2402.04754 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MMR: Evaluating Reading Ability of Large Multimodal Models
di: Chen, Jian, et al.
Pubblicazione: (2024)
di: Chen, Jian, et al.
Pubblicazione: (2024)
A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation
di: Zhou, Shijie, et al.
Pubblicazione: (2024)
di: Zhou, Shijie, et al.
Pubblicazione: (2024)
TRINS: Towards Multimodal Language Models that Can Read
di: Zhang, Ruiyi, et al.
Pubblicazione: (2024)
di: Zhang, Ruiyi, et al.
Pubblicazione: (2024)
LLaVA-Read: Enhancing Reading Ability of Multimodal Language Models
di: Zhang, Ruiyi, et al.
Pubblicazione: (2024)
di: Zhang, Ruiyi, et al.
Pubblicazione: (2024)
SV-RAG: LoRA-Contextualizing Adaptation of MLLMs for Long Document Understanding
di: Chen, Jian, et al.
Pubblicazione: (2024)
di: Chen, Jian, et al.
Pubblicazione: (2024)
Multimodal LLMs as Customized Reward Models for Text-to-Image Generation
di: Zhou, Shijie, et al.
Pubblicazione: (2025)
di: Zhou, Shijie, et al.
Pubblicazione: (2025)
VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding
di: Chen, Jian, et al.
Pubblicazione: (2025)
di: Chen, Jian, et al.
Pubblicazione: (2025)
Enhancing Diffusion Posterior Sampling for Inverse Problems by Integrating Crafted Measurements
di: Zhou, Shijie, et al.
Pubblicazione: (2024)
di: Zhou, Shijie, et al.
Pubblicazione: (2024)
TextLap: Customizing Language Models for Text-to-Layout Planning
di: Chen, Jian, et al.
Pubblicazione: (2024)
di: Chen, Jian, et al.
Pubblicazione: (2024)
GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding
di: Zhou, Shijie, et al.
Pubblicazione: (2025)
di: Zhou, Shijie, et al.
Pubblicazione: (2025)
Towards Visual Text Grounding of Multimodal Large Language Model
di: Li, Ming, et al.
Pubblicazione: (2025)
di: Li, Ming, et al.
Pubblicazione: (2025)
ARTIST: Improving the Generation of Text-rich Images with Disentangled Diffusion Models and Large Language Models
di: Zhang, Jianyi, et al.
Pubblicazione: (2024)
di: Zhang, Jianyi, et al.
Pubblicazione: (2024)
DiffPattern-Flex: Efficient Layout Pattern Generation via Discrete Diffusion
di: Wang, Zixiao, et al.
Pubblicazione: (2025)
di: Wang, Zixiao, et al.
Pubblicazione: (2025)
Customization Assistant for Text-to-image Generation
di: Zhou, Yufan, et al.
Pubblicazione: (2023)
di: Zhou, Yufan, et al.
Pubblicazione: (2023)
Manga Generation via Layout-controllable Diffusion
di: Chen, Siyu, et al.
Pubblicazione: (2024)
di: Chen, Siyu, et al.
Pubblicazione: (2024)
LayoutDiffusion: Controllable Diffusion Model for Layout-to-image Generation
di: Zheng, Guangcong, et al.
Pubblicazione: (2023)
di: Zheng, Guangcong, et al.
Pubblicazione: (2023)
Spatial Diffusion for Cell Layout Generation
di: Li, Chen, et al.
Pubblicazione: (2024)
di: Li, Chen, et al.
Pubblicazione: (2024)
AesthetiQ: Enhancing Graphic Layout Design via Aesthetic-Aware Preference Alignment of Multi-modal Large Language Models
di: Patnaik, Sohan, et al.
Pubblicazione: (2025)
di: Patnaik, Sohan, et al.
Pubblicazione: (2025)
Uni-Layout: Integrating Human Feedback in Unified Layout Generation and Evaluation
di: Lu, Shuo, et al.
Pubblicazione: (2025)
di: Lu, Shuo, et al.
Pubblicazione: (2025)
Zigzag Diffusion Sampling: Diffusion Models Can Self-Improve via Self-Reflection
di: Bai, Lichen, et al.
Pubblicazione: (2024)
di: Bai, Lichen, et al.
Pubblicazione: (2024)
Towards Large-scale Chemical Reaction Image Parsing via a Multimodal Large Language Model
di: Chen, Yufan, et al.
Pubblicazione: (2025)
di: Chen, Yufan, et al.
Pubblicazione: (2025)
PatternPaint: Practical Layout Pattern Generation Using Diffusion-Based Inpainting
di: Zhou, Guanglei, et al.
Pubblicazione: (2024)
di: Zhou, Guanglei, et al.
Pubblicazione: (2024)
MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models
di: Chen, Jian, et al.
Pubblicazione: (2025)
di: Chen, Jian, et al.
Pubblicazione: (2025)
Layout2Scene: 3D Semantic Layout Guided Scene Generation via Geometry and Appearance Diffusion Priors
di: Chen, Minglin, et al.
Pubblicazione: (2025)
di: Chen, Minglin, et al.
Pubblicazione: (2025)
Diffusion Models For Multi-Modal Generative Modeling
di: Chen, Changyou, et al.
Pubblicazione: (2024)
di: Chen, Changyou, et al.
Pubblicazione: (2024)
HybriDLA: Hybrid Generation for Document Layout Analysis
di: Chen, Yufan, et al.
Pubblicazione: (2025)
di: Chen, Yufan, et al.
Pubblicazione: (2025)
Craft: Cross-modal Aligned Features Improve Robustness of Prompt Tuning
di: Sun, Jingchen, et al.
Pubblicazione: (2024)
di: Sun, Jingchen, et al.
Pubblicazione: (2024)
Lay-Your-Scene: Natural Scene Layout Generation with Diffusion Transformers
di: Srivastava, Divyansh, et al.
Pubblicazione: (2025)
di: Srivastava, Divyansh, et al.
Pubblicazione: (2025)
Layout-Corrector: Alleviating Layout Sticking Phenomenon in Discrete Diffusion Model
di: Iwai, Shoma, et al.
Pubblicazione: (2024)
di: Iwai, Shoma, et al.
Pubblicazione: (2024)
PEEKABOO: Interactive Video Generation via Masked-Diffusion
di: Jain, Yash, et al.
Pubblicazione: (2023)
di: Jain, Yash, et al.
Pubblicazione: (2023)
A Geometric Perspective on Diffusion Models
di: Chen, Defang, et al.
Pubblicazione: (2023)
di: Chen, Defang, et al.
Pubblicazione: (2023)
SFDLA: Source-Free Document Layout Analysis
di: Tewes, Sebastian, et al.
Pubblicazione: (2025)
di: Tewes, Sebastian, et al.
Pubblicazione: (2025)
STAY Diffusion: Styled Layout Diffusion Model for Diverse Layout-to-Image Generation
di: Wang, Ruyu, et al.
Pubblicazione: (2025)
di: Wang, Ruyu, et al.
Pubblicazione: (2025)
Golden Noise for Diffusion Models: A Learning Framework
di: Zhou, Zikai, et al.
Pubblicazione: (2024)
di: Zhou, Zikai, et al.
Pubblicazione: (2024)
Enhancing Image Layout Control with Loss-Guided Diffusion Models
di: Patel, Zakaria, et al.
Pubblicazione: (2024)
di: Patel, Zakaria, et al.
Pubblicazione: (2024)
Training-Free Layout-to-Image Generation with Marginal Attention Constraints
di: Chen, Huancheng, et al.
Pubblicazione: (2024)
di: Chen, Huancheng, et al.
Pubblicazione: (2024)
MajutsuCity: Language-driven Aesthetic-adaptive City Generation with Controllable 3D Assets and Layouts
di: Huang, Zilong, et al.
Pubblicazione: (2025)
di: Huang, Zilong, et al.
Pubblicazione: (2025)
ReLayout: Integrating Relation Reasoning for Content-aware Layout Generation with Multi-modal Large Language Models
di: Tian, Jiaxu, et al.
Pubblicazione: (2025)
di: Tian, Jiaxu, et al.
Pubblicazione: (2025)
RoDLA: Benchmarking the Robustness of Document Layout Analysis Models
di: Chen, Yufan, et al.
Pubblicazione: (2024)
di: Chen, Yufan, et al.
Pubblicazione: (2024)
TaxaDiffusion: Progressively Trained Diffusion Model for Fine-Grained Species Generation
di: Monsefi, Amin Karimi, et al.
Pubblicazione: (2025)
di: Monsefi, Amin Karimi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MMR: Evaluating Reading Ability of Large Multimodal Models
di: Chen, Jian, et al.
Pubblicazione: (2024) -
A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation
di: Zhou, Shijie, et al.
Pubblicazione: (2024) -
TRINS: Towards Multimodal Language Models that Can Read
di: Zhang, Ruiyi, et al.
Pubblicazione: (2024) -
LLaVA-Read: Enhancing Reading Ability of Multimodal Language Models
di: Zhang, Ruiyi, et al.
Pubblicazione: (2024) -
SV-RAG: LoRA-Contextualizing Adaptation of MLLMs for Long Document Understanding
di: Chen, Jian, et al.
Pubblicazione: (2024)