MMMG: A Massive, Multidisciplinary, Multi-Tier Generation Benchmark for Text-to-Image Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Luo, Yuxuan, Yuan, Yuhui, Chen, Junwen, Cai, Haonan, Yue, Ziyi, Yang, Yuwei, Daha, Fatima Zohra, Li, Ji, Lian, Zhouhui |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Beyond Patches: Global-aware Autoregressive Model for Multimodal Few-Shot Font Generation
por: Cai, Haonan, et al.
Publicado: (2026)
por: Cai, Haonan, et al.
Publicado: (2026)
UTDesign: A Unified Framework for Stylized Text Editing and Generation in Graphic Design Images
por: Zhao, Yiming, et al.
Publicado: (2025)
por: Zhao, Yiming, et al.
Publicado: (2025)
CalliReader: Contextualizing Chinese Calligraphy via an Embedding-Aligned Vision-Language Model
por: Luo, Yuxuan, et al.
Publicado: (2025)
por: Luo, Yuxuan, et al.
Publicado: (2025)
RSUniVLM: A Unified Vision Language Model for Remote Sensing via Granularity-oriented Mixture of Experts
por: Liu, Xu, et al.
Publicado: (2024)
por: Liu, Xu, et al.
Publicado: (2024)
HFH-Font: Few-shot Chinese Font Synthesis with Higher Quality, Faster Speed, and Higher Resolution
por: Li, Hua, et al.
Publicado: (2024)
por: Li, Hua, et al.
Publicado: (2024)
MMMG: a Comprehensive and Reliable Evaluation Suite for Multitask Multimodal Generation
por: Yao, Jihan, et al.
Publicado: (2025)
por: Yao, Jihan, et al.
Publicado: (2025)
CalliRewrite: Recovering Handwriting Behaviors from Calligraphy Images without Supervision
por: Luo, Yuxuan, et al.
Publicado: (2024)
por: Luo, Yuxuan, et al.
Publicado: (2024)
FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark
por: Fang, Rongyao, et al.
Publicado: (2025)
por: Fang, Rongyao, et al.
Publicado: (2025)
VecFontSDF: Learning to Reconstruct and Synthesize High-quality Vector Fonts via Signed Distance Functions
por: Xia, Zeqing, et al.
Publicado: (2023)
por: Xia, Zeqing, et al.
Publicado: (2023)
GenExam: A Multidisciplinary Text-to-Image Exam
por: Wang, Zhaokai, et al.
Publicado: (2025)
por: Wang, Zhaokai, et al.
Publicado: (2025)
Pano2Room: Novel View Synthesis from a Single Indoor Panorama
por: Pu, Guo, et al.
Publicado: (2024)
por: Pu, Guo, et al.
Publicado: (2024)
ActMVS: Active Scene Reconstruction with Monocular Multi-View Stereo
por: Pu, Guo, et al.
Publicado: (2026)
por: Pu, Guo, et al.
Publicado: (2026)
Creating Your Editable 3D Photorealistic Avatar with Tetrahedron-constrained Gaussian Splatting
por: Liu, Hanxi, et al.
Publicado: (2025)
por: Liu, Hanxi, et al.
Publicado: (2025)
SciVQR: A Multidisciplinary Multimodal Benchmark for Advanced Scientific Reasoning Evaluation
por: Guo, Longteng, et al.
Publicado: (2026)
por: Guo, Longteng, et al.
Publicado: (2026)
Hierarchical Visual Agent: Managing Contexts in Joint Image-Text Space for Advanced Chart Reasoning
por: Dong, Qihua, et al.
Publicado: (2026)
por: Dong, Qihua, et al.
Publicado: (2026)
MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI
por: Yue, Xiang, et al.
Publicado: (2023)
por: Yue, Xiang, et al.
Publicado: (2023)
ATLAS: A High-Difficulty, Multidisciplinary Benchmark for Frontier Scientific Reasoning
por: Liu, Hongwei, et al.
Publicado: (2025)
por: Liu, Hongwei, et al.
Publicado: (2025)
TextFlux: An OCR‐Free DiT Model for High‐Fidelity Multilingual Scene Text Synthesis
por: Yu Xie, et al.
Publicado: (2026)
por: Yu Xie, et al.
Publicado: (2026)
GIR-Bench: Versatile Benchmark for Generating Images with Reasoning
por: Li, Hongxiang, et al.
Publicado: (2025)
por: Li, Hongxiang, et al.
Publicado: (2025)
Dynamic Texture Transfer using PatchMatch and Transformers
por: Pu, Guo, et al.
Publicado: (2024)
por: Pu, Guo, et al.
Publicado: (2024)
TextFlux: An OCR-Free DiT Model for High-Fidelity Multilingual Scene Text Synthesis
por: Xie, Yu, et al.
Publicado: (2025)
por: Xie, Yu, et al.
Publicado: (2025)
MIEB: Massive Image Embedding Benchmark
por: Xiao, Chenghao, et al.
Publicado: (2025)
por: Xiao, Chenghao, et al.
Publicado: (2025)
Glyph-ByT5: A Customized Text Encoder for Accurate Visual Text Rendering
por: Liu, Zeyu, et al.
Publicado: (2024)
por: Liu, Zeyu, et al.
Publicado: (2024)
Editing Massive Concepts in Text-to-Image Diffusion Models
por: Xiong, Tianwei, et al.
Publicado: (2024)
por: Xiong, Tianwei, et al.
Publicado: (2024)
PrismLayers: Open Data for High-Quality Multi-Layer Transparent Image Generative Models
por: Chen, Junwen, et al.
Publicado: (2025)
por: Chen, Junwen, et al.
Publicado: (2025)
En3D: An Enhanced Generative Model for Sculpting 3D Humans from 2D Synthetic Data
por: Men, Yifang, et al.
Publicado: (2024)
por: Men, Yifang, et al.
Publicado: (2024)
PL-MTEB: Polish Massive Text Embedding Benchmark
por: Poświata, Rafał, et al.
Publicado: (2024)
por: Poświata, Rafał, et al.
Publicado: (2024)
MixRea: Benchmarking Explicit-Implicit Reasoning in Large Language Models
por: Cai, Yuanqing, et al.
Publicado: (2026)
por: Cai, Yuanqing, et al.
Publicado: (2026)
R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation
por: Chen, Kaijie, et al.
Publicado: (2025)
por: Chen, Kaijie, et al.
Publicado: (2025)
T2I-ReasonBench: Benchmarking Reasoning-Informed Text-to-Image Generation
por: Sun, Kaiyue, et al.
Publicado: (2025)
por: Sun, Kaiyue, et al.
Publicado: (2025)
FinMTEB: Finance Massive Text Embedding Benchmark
por: Tang, Yixuan, et al.
Publicado: (2025)
por: Tang, Yixuan, et al.
Publicado: (2025)
VN-MTEB: Vietnamese Massive Text Embedding Benchmark
por: Pham, Loc, et al.
Publicado: (2025)
por: Pham, Loc, et al.
Publicado: (2025)
TWLR: Text-Guided Weakly-Supervised Lesion Localization and Severity Regression for Explainable Diabetic Retinopathy Grading
por: Luo, Xi, et al.
Publicado: (2025)
por: Luo, Xi, et al.
Publicado: (2025)
WorldGenBench: A World-Knowledge-Integrated Benchmark for Reasoning-Driven Text-to-Image Generation
por: Zhang, Daoan, et al.
Publicado: (2025)
por: Zhang, Daoan, et al.
Publicado: (2025)
MMTEB: Massive Multilingual Text Embedding Benchmark
por: Enevoldsen, Kenneth, et al.
Publicado: (2025)
por: Enevoldsen, Kenneth, et al.
Publicado: (2025)
PathMMU: A Massive Multimodal Expert-Level Benchmark for Understanding and Reasoning in Pathology
por: Sun, Yuxuan, et al.
Publicado: (2024)
por: Sun, Yuxuan, et al.
Publicado: (2024)
VLRS-Bench: A Vision-Language Reasoning Benchmark for Remote Sensing
por: Luo, Zhiming, et al.
Publicado: (2026)
por: Luo, Zhiming, et al.
Publicado: (2026)
DESIGNER: Design-Logic-Guided Multidisciplinary Data Synthesis for LLM Reasoning
por: Liu, Weize, et al.
Publicado: (2025)
por: Liu, Weize, et al.
Publicado: (2025)
ART: Anonymous Region Transformer for Variable Multi-Layer Transparent Image Generation
por: Pu, Yifan, et al.
Publicado: (2025)
por: Pu, Yifan, et al.
Publicado: (2025)
Teaching Text-to-Image Models to Communicate in Dialog
por: Sun, Xiaowen, et al.
Publicado: (2023)
por: Sun, Xiaowen, et al.
Publicado: (2023)
Ejemplares similares
-
Beyond Patches: Global-aware Autoregressive Model for Multimodal Few-Shot Font Generation
por: Cai, Haonan, et al.
Publicado: (2026) -
UTDesign: A Unified Framework for Stylized Text Editing and Generation in Graphic Design Images
por: Zhao, Yiming, et al.
Publicado: (2025) -
CalliReader: Contextualizing Chinese Calligraphy via an Embedding-Aligned Vision-Language Model
por: Luo, Yuxuan, et al.
Publicado: (2025) -
RSUniVLM: A Unified Vision Language Model for Remote Sensing via Granularity-oriented Mixture of Experts
por: Liu, Xu, et al.
Publicado: (2024) -
HFH-Font: Few-shot Chinese Font Synthesis with Higher Quality, Faster Speed, and Higher Resolution
por: Li, Hua, et al.
Publicado: (2024)