MINOS: A Multimodal Evaluation Model for Bidirectional Generation Between Image and Text
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Junzhe, Zhang, Huixuan, Hu, Xinyu, Lin, Li, Gao, Mingqi, Qiu, Shi, Wan, Xiaojun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
KBE-DME: Dynamic Multimodal Evaluation via Knowledge Enhanced Benchmark Evolution
par: Zhang, Junzhe, et autres
Publié: (2025)
par: Zhang, Junzhe, et autres
Publié: (2025)
Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models
par: Zhang, Huixuan, et autres
Publié: (2025)
par: Zhang, Huixuan, et autres
Publié: (2025)
How Much To Guide: Revisiting Adaptive Guidance in Classifier-Free Guidance Text-to-Vision Diffusion Models
par: Zhang, Huixuan, et autres
Publié: (2025)
par: Zhang, Huixuan, et autres
Publié: (2025)
EAMA : Entity-Aware Multimodal Alignment Based Approach for News Image Captioning
par: Zhang, Junzhe, et autres
Publié: (2024)
par: Zhang, Junzhe, et autres
Publié: (2024)
M$^{3}$T2IBench: A Large-Scale Multi-Category, Multi-Instance, Multi-Relation Text-to-Image Benchmark
par: Zhang, Huixuan, et autres
Publié: (2025)
par: Zhang, Huixuan, et autres
Publié: (2025)
UniAIDet: A Unified and Universal Benchmark for AI-Generated Image Content Detection and Localization
par: Zhang, Huixuan, et autres
Publié: (2025)
par: Zhang, Huixuan, et autres
Publié: (2025)
MC-MKE: A Fine-Grained Multimodal Knowledge Editing Benchmark Emphasizing Modality Consistency
par: Zhang, Junzhe, et autres
Publié: (2024)
par: Zhang, Junzhe, et autres
Publié: (2024)
Image Matters: A New Dataset and Empirical Study for Multimodal Hyperbole Detection
par: Zhang, Huixuan, et autres
Publié: (2023)
par: Zhang, Huixuan, et autres
Publié: (2023)
Exploring and Evaluating Multimodal Knowledge Reasoning Consistency of Multimodal Large Language Models
par: Jia, Boyu, et autres
Publié: (2025)
par: Jia, Boyu, et autres
Publié: (2025)
Quantity Matters: Towards Assessing and Mitigating Number Hallucination in Large Vision-Language Models
par: Zhang, Huixuan, et autres
Publié: (2024)
par: Zhang, Huixuan, et autres
Publié: (2024)
ICR Probe: Tracking Hidden State Dynamics for Reliable Hallucination Detection in LLMs
par: Zhang, Zhenliang, et autres
Publié: (2025)
par: Zhang, Zhenliang, et autres
Publié: (2025)
Analyzing and Evaluating Correlation Measures in NLG Meta-Evaluation
par: Gao, Mingqi, et autres
Publié: (2024)
par: Gao, Mingqi, et autres
Publié: (2024)
CEIDM: A Controlled Entity and Interaction Diffusion Model for Enhanced Text-to-Image Generation
par: Yang, Mingyue, et autres
Publié: (2025)
par: Yang, Mingyue, et autres
Publié: (2025)
Exploring the Multilingual NLG Evaluation Abilities of LLM-Based Evaluators
par: Chang, Jiayi, et autres
Publié: (2025)
par: Chang, Jiayi, et autres
Publié: (2025)
Themis: A Reference-free NLG Evaluation Language Model with Flexibility and Interpretability
par: Hu, Xinyu, et autres
Publié: (2024)
par: Hu, Xinyu, et autres
Publié: (2024)
Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Image
par: Hu, Yushi, et autres
Publié: (2025)
par: Hu, Yushi, et autres
Publié: (2025)
IMAGINE-E: Image Generation Intelligence Evaluation of State-of-the-art Text-to-Image Models
par: Lei, Jiayi, et autres
Publié: (2025)
par: Lei, Jiayi, et autres
Publié: (2025)
EVALALIGN: Supervised Fine-Tuning Multimodal LLMs with Human-Aligned Data for Evaluating Text-to-Image Models
par: Tan, Zhiyu, et autres
Publié: (2024)
par: Tan, Zhiyu, et autres
Publié: (2024)
Holistic Evaluation for Interleaved Text-and-Image Generation
par: Liu, Minqian, et autres
Publié: (2024)
par: Liu, Minqian, et autres
Publié: (2024)
Multimodal LLMs as Customized Reward Models for Text-to-Image Generation
par: Zhou, Shijie, et autres
Publié: (2025)
par: Zhou, Shijie, et autres
Publié: (2025)
ICT: Image-Object Cross-Level Trusted Intervention for Mitigating Object Hallucination in Large Vision-Language Models
par: Chen, Junzhe, et autres
Publié: (2024)
par: Chen, Junzhe, et autres
Publié: (2024)
Words Worth a Thousand Pictures: Measuring and Understanding Perceptual Variability in Text-to-Image Generation
par: Tang, Raphael, et autres
Publié: (2024)
par: Tang, Raphael, et autres
Publié: (2024)
Cognitive Visual-Language Mapper: Advancing Multimodal Comprehension with Enhanced Visual Knowledge Alignment
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
A Dual-Perspective NLG Meta-Evaluation Framework with Automatic Benchmark and Better Interpretability
par: Hu, Xinyu, et autres
Publié: (2025)
par: Hu, Xinyu, et autres
Publié: (2025)
Universal Prompt Optimizer for Safe Text-to-Image Generation
par: Wu, Zongyu, et autres
Publié: (2024)
par: Wu, Zongyu, et autres
Publié: (2024)
Image2Text2Image: A Novel Framework for Label-Free Evaluation of Image-to-Text Generation with Text-to-Image Diffusion Models
par: Huang, Jia-Hong, et autres
Publié: (2024)
par: Huang, Jia-Hong, et autres
Publié: (2024)
Evaluating the Evaluators: Metrics for Compositional Text-to-Image Generation
par: Kasaei, Seyed Amir, et autres
Publié: (2025)
par: Kasaei, Seyed Amir, et autres
Publié: (2025)
Multimodal Representation Alignment for Image Generation: Text-Image Interleaved Control Is Easier Than You Think
par: Chen, Liang, et autres
Publié: (2025)
par: Chen, Liang, et autres
Publié: (2025)
Can Large Vision-Language Models Understand Multimodal Sarcasm?
par: Wang, Xinyu, et autres
Publié: (2025)
par: Wang, Xinyu, et autres
Publié: (2025)
ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?
par: Zhang, Leixin, et autres
Publié: (2024)
par: Zhang, Leixin, et autres
Publié: (2024)
Evaluating Text-to-Visual Generation with Image-to-Text Generation
par: Lin, Zhiqiu, et autres
Publié: (2024)
par: Lin, Zhiqiu, et autres
Publié: (2024)
Image Captioning via Compact Bidirectional Architecture
par: Song, Zijie, et autres
Publié: (2022)
par: Song, Zijie, et autres
Publié: (2022)
PaCoST: Paired Confidence Significance Testing for Benchmark Contamination Detection in Large Language Models
par: Zhang, Huixuan, et autres
Publié: (2024)
par: Zhang, Huixuan, et autres
Publié: (2024)
LLM-based NLG Evaluation: Current Status and Challenges
par: Gao, Mingqi, et autres
Publié: (2024)
par: Gao, Mingqi, et autres
Publié: (2024)
LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models
par: Zhang, Kaichen, et autres
Publié: (2024)
par: Zhang, Kaichen, et autres
Publié: (2024)
LogicOCR: Do Your Large Multimodal Models Excel at Logical Reasoning on Text-Rich Images?
par: Ye, Maoyuan, et autres
Publié: (2025)
par: Ye, Maoyuan, et autres
Publié: (2025)
Integrating Video and Text: A Balanced Approach to Multimodal Summary Generation and Evaluation
par: Pennec, Galann, et autres
Publié: (2025)
par: Pennec, Galann, et autres
Publié: (2025)
Evaluating Multimodal Large Language Models on Vertically Written Japanese Text
par: Sasagawa, Keito, et autres
Publié: (2025)
par: Sasagawa, Keito, et autres
Publié: (2025)
Looking Beyond Text: Reducing Language bias in Large Vision-Language Models via Multimodal Dual-Attention and Soft-Image Guidance
par: Zhao, Haozhe, et autres
Publié: (2024)
par: Zhao, Haozhe, et autres
Publié: (2024)
The Devil is in the Prompts: Retrieval-Augmented Prompt Optimization for Text-to-Video Generation
par: Gao, Bingjie, et autres
Publié: (2025)
par: Gao, Bingjie, et autres
Publié: (2025)
Documents similaires
-
KBE-DME: Dynamic Multimodal Evaluation via Knowledge Enhanced Benchmark Evolution
par: Zhang, Junzhe, et autres
Publié: (2025) -
Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models
par: Zhang, Huixuan, et autres
Publié: (2025) -
How Much To Guide: Revisiting Adaptive Guidance in Classifier-Free Guidance Text-to-Vision Diffusion Models
par: Zhang, Huixuan, et autres
Publié: (2025) -
EAMA : Entity-Aware Multimodal Alignment Based Approach for News Image Captioning
par: Zhang, Junzhe, et autres
Publié: (2024) -
M$^{3}$T2IBench: A Large-Scale Multi-Category, Multi-Instance, Multi-Relation Text-to-Image Benchmark
par: Zhang, Huixuan, et autres
Publié: (2025)