Holistic Evaluation for Interleaved Text-and-Image Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Minqian, Xu, Zhiyang, Lin, Zihao, Ashby, Trevor, Rimchala, Joy, Zhang, Jiaxin, Huang, Lifu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Modality-Specialized Synergizers for Interleaved Vision-Language Generalists
por: Xu, Zhiyang, et al.
Publicado: (2024)
por: Xu, Zhiyang, et al.
Publicado: (2024)
R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation
por: Chen, Kaijie, et al.
Publicado: (2025)
por: Chen, Kaijie, et al.
Publicado: (2025)
Interleaved Scene Graphs for Interleaved Text-and-Image Generation Assessment
por: Chen, Dongping, et al.
Publicado: (2024)
por: Chen, Dongping, et al.
Publicado: (2024)
Interleaving Reasoning for Better Text-to-Image Generation
por: Huang, Wenxuan, et al.
Publicado: (2025)
por: Huang, Wenxuan, et al.
Publicado: (2025)
Orthus: Autoregressive Interleaved Image-Text Generation with Modality-Specific Heads
por: Kou, Siqi, et al.
Publicado: (2024)
por: Kou, Siqi, et al.
Publicado: (2024)
Think, Act, Build: An Agentic Framework with Vision Language Models for Zero-Shot 3D Visual Grounding
por: Wang, Haibo, et al.
Publicado: (2026)
por: Wang, Haibo, et al.
Publicado: (2026)
Vision-Flan: Scaling Human-Labeled Tasks in Visual Instruction Tuning
por: Xu, Zhiyang, et al.
Publicado: (2024)
por: Xu, Zhiyang, et al.
Publicado: (2024)
ANOLE: An Open, Autoregressive, Native Large Multimodal Models for Interleaved Image-Text Generation
por: Chern, Ethan, et al.
Publicado: (2024)
por: Chern, Ethan, et al.
Publicado: (2024)
LaTtE-Flow: Layerwise Timestep-Expert Flow-based Transformer
por: Shen, Ying, et al.
Publicado: (2025)
por: Shen, Ying, et al.
Publicado: (2025)
VEGA: Learning Interleaved Image-Text Comprehension in Vision-Language Large Models
por: Zhou, Chenyu, et al.
Publicado: (2024)
por: Zhou, Chenyu, et al.
Publicado: (2024)
MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer
por: Tian, Changyao, et al.
Publicado: (2024)
por: Tian, Changyao, et al.
Publicado: (2024)
A High-Quality Dataset and Reliable Evaluation for Interleaved Image-Text Generation
por: Feng, Yukang, et al.
Publicado: (2025)
por: Feng, Yukang, et al.
Publicado: (2025)
MANTIS: Interleaved Multi-Image Instruction Tuning
por: Jiang, Dongfu, et al.
Publicado: (2024)
por: Jiang, Dongfu, et al.
Publicado: (2024)
Multimodal Representation Alignment for Image Generation: Text-Image Interleaved Control Is Easier Than You Think
por: Chen, Liang, et al.
Publicado: (2025)
por: Chen, Liang, et al.
Publicado: (2025)
ViTCoT: Video-Text Interleaved Chain-of-Thought for Boosting Video Understanding in Large Language Models
por: Zhang, Yongheng, et al.
Publicado: (2025)
por: Zhang, Yongheng, et al.
Publicado: (2025)
Reasoning in the Dark: Interleaved Vision-Text Reasoning in Latent Space
por: Chen, Chao, et al.
Publicado: (2025)
por: Chen, Chao, et al.
Publicado: (2025)
Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Image
por: Hu, Yushi, et al.
Publicado: (2025)
por: Hu, Yushi, et al.
Publicado: (2025)
MINOS: A Multimodal Evaluation Model for Bidirectional Generation Between Image and Text
por: Zhang, Junzhe, et al.
Publicado: (2025)
por: Zhang, Junzhe, et al.
Publicado: (2025)
AR-RAG: Autoregressive Retrieval Augmentation for Image Generation
por: Qi, Jingyuan, et al.
Publicado: (2025)
por: Qi, Jingyuan, et al.
Publicado: (2025)
CrossWordBench: Evaluating the Reasoning Capabilities of LLMs and LVLMs with Controllable Puzzle Generation
por: Leng, Jixuan, et al.
Publicado: (2025)
por: Leng, Jixuan, et al.
Publicado: (2025)
Evaluating Text-to-Visual Generation with Image-to-Text Generation
por: Lin, Zhiqiu, et al.
Publicado: (2024)
por: Lin, Zhiqiu, et al.
Publicado: (2024)
Towards Text-Image Interleaved Retrieval
por: Zhang, Xin, et al.
Publicado: (2025)
por: Zhang, Xin, et al.
Publicado: (2025)
Thinking-while-Generating: Interleaving Textual Reasoning throughout Visual Generation
por: Guo, Ziyu, et al.
Publicado: (2025)
por: Guo, Ziyu, et al.
Publicado: (2025)
Global Context Compression with Interleaved Vision-Text Transformation
por: Jiao, Dian, et al.
Publicado: (2026)
por: Jiao, Dian, et al.
Publicado: (2026)
Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models
por: Zhang, Huixuan, et al.
Publicado: (2025)
por: Zhang, Huixuan, et al.
Publicado: (2025)
Fine-Grained Image-Text Alignment in Medical Imaging Enables Explainable Cyclic Image-Report Generation
por: Chen, Wenting, et al.
Publicado: (2023)
por: Chen, Wenting, et al.
Publicado: (2023)
MMGenBench: Fully Automatically Evaluating LMMs from the Text-to-Image Generation Perspective
por: Huang, Hailang, et al.
Publicado: (2024)
por: Huang, Hailang, et al.
Publicado: (2024)
Multimedia Generative Script Learning for Task Planning
por: Wang, Qingyun, et al.
Publicado: (2022)
por: Wang, Qingyun, et al.
Publicado: (2022)
PIN: A Knowledge-Intensive Dataset for Paired and Interleaved Multimodal Documents
por: Wang, Junjie, et al.
Publicado: (2024)
por: Wang, Junjie, et al.
Publicado: (2024)
VEFX-Bench: A Holistic Benchmark for Generic Video Editing and Visual Effects
por: Gao, Xiangbo, et al.
Publicado: (2026)
por: Gao, Xiangbo, et al.
Publicado: (2026)
Image2Text2Image: A Novel Framework for Label-Free Evaluation of Image-to-Text Generation with Text-to-Image Diffusion Models
por: Huang, Jia-Hong, et al.
Publicado: (2024)
por: Huang, Jia-Hong, et al.
Publicado: (2024)
Text-guided Image Restoration and Semantic Enhancement for Text-to-Image Person Retrieval
por: Liu, Delong, et al.
Publicado: (2023)
por: Liu, Delong, et al.
Publicado: (2023)
Multi-Modal Language Models as Text-to-Image Model Evaluators
por: Chen, Jiahui, et al.
Publicado: (2025)
por: Chen, Jiahui, et al.
Publicado: (2025)
TempViz: On the Evaluation of Temporal Knowledge in Text-to-Image Models
por: Holtermann, Carolin, et al.
Publicado: (2026)
por: Holtermann, Carolin, et al.
Publicado: (2026)
FAIntbench: A Holistic and Precise Benchmark for Bias Evaluation in Text-to-Image Models
por: Luo, Hanjun, et al.
Publicado: (2024)
por: Luo, Hanjun, et al.
Publicado: (2024)
SuperFlow: Training Flow Matching Models with RL on the Fly
por: Chen, Kaijie, et al.
Publicado: (2025)
por: Chen, Kaijie, et al.
Publicado: (2025)
Text-only Synthesis for Image Captioning
por: Zhou, Qing, et al.
Publicado: (2024)
por: Zhou, Qing, et al.
Publicado: (2024)
TIAM -- A Metric for Evaluating Alignment in Text-to-Image Generation
por: Grimal, Paul, et al.
Publicado: (2023)
por: Grimal, Paul, et al.
Publicado: (2023)
Evaluating the Evaluators: Metrics for Compositional Text-to-Image Generation
por: Kasaei, Seyed Amir, et al.
Publicado: (2025)
por: Kasaei, Seyed Amir, et al.
Publicado: (2025)
CoMat: Aligning Text-to-Image Diffusion Model with Image-to-Text Concept Matching
por: Jiang, Dongzhi, et al.
Publicado: (2024)
por: Jiang, Dongzhi, et al.
Publicado: (2024)
Ejemplares similares
-
Modality-Specialized Synergizers for Interleaved Vision-Language Generalists
por: Xu, Zhiyang, et al.
Publicado: (2024) -
R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation
por: Chen, Kaijie, et al.
Publicado: (2025) -
Interleaved Scene Graphs for Interleaved Text-and-Image Generation Assessment
por: Chen, Dongping, et al.
Publicado: (2024) -
Interleaving Reasoning for Better Text-to-Image Generation
por: Huang, Wenxuan, et al.
Publicado: (2025) -
Orthus: Autoregressive Interleaved Image-Text Generation with Modality-Specific Heads
por: Kou, Siqi, et al.
Publicado: (2024)