Enregistré dans:
| Auteurs principaux: | Chen, Jian, Zhang, Ruiyi, Zhou, Yufan, Jain, Rajiv, Xu, Zhiqiang, Rossi, Ryan, Chen, Changyou |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2402.04754 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MMR: Evaluating Reading Ability of Large Multimodal Models
par: Chen, Jian, et autres
Publié: (2024)
par: Chen, Jian, et autres
Publié: (2024)
A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation
par: Zhou, Shijie, et autres
Publié: (2024)
par: Zhou, Shijie, et autres
Publié: (2024)
TRINS: Towards Multimodal Language Models that Can Read
par: Zhang, Ruiyi, et autres
Publié: (2024)
par: Zhang, Ruiyi, et autres
Publié: (2024)
LLaVA-Read: Enhancing Reading Ability of Multimodal Language Models
par: Zhang, Ruiyi, et autres
Publié: (2024)
par: Zhang, Ruiyi, et autres
Publié: (2024)
SV-RAG: LoRA-Contextualizing Adaptation of MLLMs for Long Document Understanding
par: Chen, Jian, et autres
Publié: (2024)
par: Chen, Jian, et autres
Publié: (2024)
Multimodal LLMs as Customized Reward Models for Text-to-Image Generation
par: Zhou, Shijie, et autres
Publié: (2025)
par: Zhou, Shijie, et autres
Publié: (2025)
VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding
par: Chen, Jian, et autres
Publié: (2025)
par: Chen, Jian, et autres
Publié: (2025)
Enhancing Diffusion Posterior Sampling for Inverse Problems by Integrating Crafted Measurements
par: Zhou, Shijie, et autres
Publié: (2024)
par: Zhou, Shijie, et autres
Publié: (2024)
TextLap: Customizing Language Models for Text-to-Layout Planning
par: Chen, Jian, et autres
Publié: (2024)
par: Chen, Jian, et autres
Publié: (2024)
GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding
par: Zhou, Shijie, et autres
Publié: (2025)
par: Zhou, Shijie, et autres
Publié: (2025)
Towards Visual Text Grounding of Multimodal Large Language Model
par: Li, Ming, et autres
Publié: (2025)
par: Li, Ming, et autres
Publié: (2025)
ARTIST: Improving the Generation of Text-rich Images with Disentangled Diffusion Models and Large Language Models
par: Zhang, Jianyi, et autres
Publié: (2024)
par: Zhang, Jianyi, et autres
Publié: (2024)
DiffPattern-Flex: Efficient Layout Pattern Generation via Discrete Diffusion
par: Wang, Zixiao, et autres
Publié: (2025)
par: Wang, Zixiao, et autres
Publié: (2025)
Customization Assistant for Text-to-image Generation
par: Zhou, Yufan, et autres
Publié: (2023)
par: Zhou, Yufan, et autres
Publié: (2023)
Manga Generation via Layout-controllable Diffusion
par: Chen, Siyu, et autres
Publié: (2024)
par: Chen, Siyu, et autres
Publié: (2024)
LayoutDiffusion: Controllable Diffusion Model for Layout-to-image Generation
par: Zheng, Guangcong, et autres
Publié: (2023)
par: Zheng, Guangcong, et autres
Publié: (2023)
Spatial Diffusion for Cell Layout Generation
par: Li, Chen, et autres
Publié: (2024)
par: Li, Chen, et autres
Publié: (2024)
AesthetiQ: Enhancing Graphic Layout Design via Aesthetic-Aware Preference Alignment of Multi-modal Large Language Models
par: Patnaik, Sohan, et autres
Publié: (2025)
par: Patnaik, Sohan, et autres
Publié: (2025)
Uni-Layout: Integrating Human Feedback in Unified Layout Generation and Evaluation
par: Lu, Shuo, et autres
Publié: (2025)
par: Lu, Shuo, et autres
Publié: (2025)
Zigzag Diffusion Sampling: Diffusion Models Can Self-Improve via Self-Reflection
par: Bai, Lichen, et autres
Publié: (2024)
par: Bai, Lichen, et autres
Publié: (2024)
Towards Large-scale Chemical Reaction Image Parsing via a Multimodal Large Language Model
par: Chen, Yufan, et autres
Publié: (2025)
par: Chen, Yufan, et autres
Publié: (2025)
PatternPaint: Practical Layout Pattern Generation Using Diffusion-Based Inpainting
par: Zhou, Guanglei, et autres
Publié: (2024)
par: Zhou, Guanglei, et autres
Publié: (2024)
MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models
par: Chen, Jian, et autres
Publié: (2025)
par: Chen, Jian, et autres
Publié: (2025)
Layout2Scene: 3D Semantic Layout Guided Scene Generation via Geometry and Appearance Diffusion Priors
par: Chen, Minglin, et autres
Publié: (2025)
par: Chen, Minglin, et autres
Publié: (2025)
Diffusion Models For Multi-Modal Generative Modeling
par: Chen, Changyou, et autres
Publié: (2024)
par: Chen, Changyou, et autres
Publié: (2024)
HybriDLA: Hybrid Generation for Document Layout Analysis
par: Chen, Yufan, et autres
Publié: (2025)
par: Chen, Yufan, et autres
Publié: (2025)
Craft: Cross-modal Aligned Features Improve Robustness of Prompt Tuning
par: Sun, Jingchen, et autres
Publié: (2024)
par: Sun, Jingchen, et autres
Publié: (2024)
Lay-Your-Scene: Natural Scene Layout Generation with Diffusion Transformers
par: Srivastava, Divyansh, et autres
Publié: (2025)
par: Srivastava, Divyansh, et autres
Publié: (2025)
Layout-Corrector: Alleviating Layout Sticking Phenomenon in Discrete Diffusion Model
par: Iwai, Shoma, et autres
Publié: (2024)
par: Iwai, Shoma, et autres
Publié: (2024)
PEEKABOO: Interactive Video Generation via Masked-Diffusion
par: Jain, Yash, et autres
Publié: (2023)
par: Jain, Yash, et autres
Publié: (2023)
A Geometric Perspective on Diffusion Models
par: Chen, Defang, et autres
Publié: (2023)
par: Chen, Defang, et autres
Publié: (2023)
SFDLA: Source-Free Document Layout Analysis
par: Tewes, Sebastian, et autres
Publié: (2025)
par: Tewes, Sebastian, et autres
Publié: (2025)
STAY Diffusion: Styled Layout Diffusion Model for Diverse Layout-to-Image Generation
par: Wang, Ruyu, et autres
Publié: (2025)
par: Wang, Ruyu, et autres
Publié: (2025)
Golden Noise for Diffusion Models: A Learning Framework
par: Zhou, Zikai, et autres
Publié: (2024)
par: Zhou, Zikai, et autres
Publié: (2024)
Enhancing Image Layout Control with Loss-Guided Diffusion Models
par: Patel, Zakaria, et autres
Publié: (2024)
par: Patel, Zakaria, et autres
Publié: (2024)
Training-Free Layout-to-Image Generation with Marginal Attention Constraints
par: Chen, Huancheng, et autres
Publié: (2024)
par: Chen, Huancheng, et autres
Publié: (2024)
MajutsuCity: Language-driven Aesthetic-adaptive City Generation with Controllable 3D Assets and Layouts
par: Huang, Zilong, et autres
Publié: (2025)
par: Huang, Zilong, et autres
Publié: (2025)
ReLayout: Integrating Relation Reasoning for Content-aware Layout Generation with Multi-modal Large Language Models
par: Tian, Jiaxu, et autres
Publié: (2025)
par: Tian, Jiaxu, et autres
Publié: (2025)
RoDLA: Benchmarking the Robustness of Document Layout Analysis Models
par: Chen, Yufan, et autres
Publié: (2024)
par: Chen, Yufan, et autres
Publié: (2024)
TaxaDiffusion: Progressively Trained Diffusion Model for Fine-Grained Species Generation
par: Monsefi, Amin Karimi, et autres
Publié: (2025)
par: Monsefi, Amin Karimi, et autres
Publié: (2025)
Documents similaires
-
MMR: Evaluating Reading Ability of Large Multimodal Models
par: Chen, Jian, et autres
Publié: (2024) -
A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation
par: Zhou, Shijie, et autres
Publié: (2024) -
TRINS: Towards Multimodal Language Models that Can Read
par: Zhang, Ruiyi, et autres
Publié: (2024) -
LLaVA-Read: Enhancing Reading Ability of Multimodal Language Models
par: Zhang, Ruiyi, et autres
Publié: (2024) -
SV-RAG: LoRA-Contextualizing Adaptation of MLLMs for Long Document Understanding
par: Chen, Jian, et autres
Publié: (2024)