EVALALIGN: Supervised Fine-Tuning Multimodal LLMs with Human-Aligned Data for Evaluating Text-to-Image Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Tan, Zhiyu, Yang, Xiaomeng, Qin, Luozheng, Yang, Mengping, Zhang, Cheng, Li, Hao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Cockatiel: Ensembling Synthetic and Human Preferenced Training for Detailed Video Caption
von: Qin, Luozheng, et al.
Veröffentlicht: (2025)
von: Qin, Luozheng, et al.
Veröffentlicht: (2025)
Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision
von: Qin, Luozheng, et al.
Veröffentlicht: (2025)
von: Qin, Luozheng, et al.
Veröffentlicht: (2025)
Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation
von: Yang, Xiaomeng, et al.
Veröffentlicht: (2025)
von: Yang, Xiaomeng, et al.
Veröffentlicht: (2025)
VidGen-1M: A Large-Scale Dataset for Text-to-video Generation
von: Tan, Zhiyu, et al.
Veröffentlicht: (2024)
von: Tan, Zhiyu, et al.
Veröffentlicht: (2024)
An Empirical Study and Analysis of Text-to-Image Generation Using Large Language Model-Powered Textual Representation
von: Tan, Zhiyu, et al.
Veröffentlicht: (2024)
von: Tan, Zhiyu, et al.
Veröffentlicht: (2024)
Omni-Video: Democratizing Unified Video Understanding and Generation
von: Tan, Zhiyu, et al.
Veröffentlicht: (2025)
von: Tan, Zhiyu, et al.
Veröffentlicht: (2025)
Omni-Video 2: Scaling MLLM-Conditioned Diffusion for Unified Video Generation and Editing
von: Yang, Hao, et al.
Veröffentlicht: (2026)
von: Yang, Hao, et al.
Veröffentlicht: (2026)
Diff-Aid: Inference-time Adaptive Interaction Denoising for Rectified Text-to-Image Generation
von: Li, Binglei, et al.
Veröffentlicht: (2026)
von: Li, Binglei, et al.
Veröffentlicht: (2026)
Raccoon: Multi-stage Diffusion Training with Coarse-to-Fine Curating Videos
von: Tan, Zhiyu, et al.
Veröffentlicht: (2025)
von: Tan, Zhiyu, et al.
Veröffentlicht: (2025)
DiverseDiT: Towards Diverse Representation Learning in Diffusion Transformers
von: Yang, Mengping, et al.
Veröffentlicht: (2026)
von: Yang, Mengping, et al.
Veröffentlicht: (2026)
LiFT: Leveraging Human Feedback for Text-to-Video Model Alignment
von: Wang, Yibin, et al.
Veröffentlicht: (2024)
von: Wang, Yibin, et al.
Veröffentlicht: (2024)
Unraveling MMDiT Blocks: Training-free Analysis and Enhancement of Text-conditioned Diffusion
von: Li, Binglei, et al.
Veröffentlicht: (2026)
von: Li, Binglei, et al.
Veröffentlicht: (2026)
Human-Aligned MLLM Judges for Fine-Grained Image Editing Evaluation: A Benchmark, Framework, and Analysis
von: Liu, Runzhou, et al.
Veröffentlicht: (2026)
von: Liu, Runzhou, et al.
Veröffentlicht: (2026)
Attention Calibration for Disentangled Text-to-Image Personalization
von: Zhang, Yanbing, et al.
Veröffentlicht: (2024)
von: Zhang, Yanbing, et al.
Veröffentlicht: (2024)
Learning Domain Knowledge in Multimodal Large Language Models through Reinforcement Fine-Tuning
von: Cao, Qinglong, et al.
Veröffentlicht: (2026)
von: Cao, Qinglong, et al.
Veröffentlicht: (2026)
Finetuned Multimodal Language Models Are High-Quality Image-Text Data Filters
von: Wang, Weizhi, et al.
Veröffentlicht: (2024)
von: Wang, Weizhi, et al.
Veröffentlicht: (2024)
Supervised Fine-Tuning or Contrastive Learning? Towards Better Multimodal LLM Reranking
von: Dai, Ziqi, et al.
Veröffentlicht: (2025)
von: Dai, Ziqi, et al.
Veröffentlicht: (2025)
EmbodiedEval: Evaluate Multimodal LLMs as Embodied Agents
von: Cheng, Zhili, et al.
Veröffentlicht: (2025)
von: Cheng, Zhili, et al.
Veröffentlicht: (2025)
WISE: Weak-Supervision-Guided Step-by-Step Explanations for Multimodal LLMs in Image Classification
von: Jiang, Yiwen, et al.
Veröffentlicht: (2025)
von: Jiang, Yiwen, et al.
Veröffentlicht: (2025)
MVAM: Multi-View Attention Method for Fine-grained Image-Text Matching
von: Cui, Wanqing, et al.
Veröffentlicht: (2024)
von: Cui, Wanqing, et al.
Veröffentlicht: (2024)
AlignMMBench: Evaluating Chinese Multimodal Alignment in Large Vision-Language Models
von: Wu, Yuhang, et al.
Veröffentlicht: (2024)
von: Wu, Yuhang, et al.
Veröffentlicht: (2024)
Precision or Recall? An Analysis of Image Captions for Training Text-to-Image Generation Model
von: Cheng, Sheng, et al.
Veröffentlicht: (2024)
von: Cheng, Sheng, et al.
Veröffentlicht: (2024)
Scaling Text-Rich Image Understanding via Code-Guided Synthetic Multimodal Data Generation
von: Yang, Yue, et al.
Veröffentlicht: (2025)
von: Yang, Yue, et al.
Veröffentlicht: (2025)
E2ED^2:Direct Mapping from Noise to Data for Enhanced Diffusion Models
von: Tan, Zhiyu, et al.
Veröffentlicht: (2024)
von: Tan, Zhiyu, et al.
Veröffentlicht: (2024)
SemiHVision: Enhancing Medical Multimodal Models with a Semi-Human Annotated Dataset and Fine-Tuned Instruction Generation
von: Wang, Junda, et al.
Veröffentlicht: (2024)
von: Wang, Junda, et al.
Veröffentlicht: (2024)
LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding
von: Zhang, Yanzhe, et al.
Veröffentlicht: (2023)
von: Zhang, Yanzhe, et al.
Veröffentlicht: (2023)
Multimodal LLMs as Customized Reward Models for Text-to-Image Generation
von: Zhou, Shijie, et al.
Veröffentlicht: (2025)
von: Zhou, Shijie, et al.
Veröffentlicht: (2025)
FITA: Fine-grained Image-Text Aligner for Radiology Report Generation
von: Yang, Honglong, et al.
Veröffentlicht: (2024)
von: Yang, Honglong, et al.
Veröffentlicht: (2024)
MIA-Bench: Towards Better Instruction Following Evaluation of Multimodal LLMs
von: Qian, Yusu, et al.
Veröffentlicht: (2024)
von: Qian, Yusu, et al.
Veröffentlicht: (2024)
Reassessing the Role of Supervised Fine-Tuning: An Empirical Study in VLM Reasoning
von: Yu, Yongcan, et al.
Veröffentlicht: (2025)
von: Yu, Yongcan, et al.
Veröffentlicht: (2025)
Dictionary-Aligned Concept Control for Safeguarding Multimodal LLMs
von: Luo, Jinqi, et al.
Veröffentlicht: (2026)
von: Luo, Jinqi, et al.
Veröffentlicht: (2026)
CompAlign: Improving Compositional Text-to-Image Generation with a Complex Benchmark and Fine-Grained Feedback
von: Wan, Yixin, et al.
Veröffentlicht: (2025)
von: Wan, Yixin, et al.
Veröffentlicht: (2025)
Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Image
von: Hu, Yushi, et al.
Veröffentlicht: (2025)
von: Hu, Yushi, et al.
Veröffentlicht: (2025)
Unaligning Everything: Or Aligning Any Text to Any Image in Multimodal Models
von: Salman, Shaeke, et al.
Veröffentlicht: (2024)
von: Salman, Shaeke, et al.
Veröffentlicht: (2024)
MULTI: Multimodal Understanding Leaderboard with Text and Images
von: Zhu, Zichen, et al.
Veröffentlicht: (2024)
von: Zhu, Zichen, et al.
Veröffentlicht: (2024)
DeepSight: Bridging Depth Maps and Language with a Depth-Driven Multimodal Model
von: Yang, Hao, et al.
Veröffentlicht: (2026)
von: Yang, Hao, et al.
Veröffentlicht: (2026)
Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models
von: Sun, Haoyuan, et al.
Veröffentlicht: (2025)
von: Sun, Haoyuan, et al.
Veröffentlicht: (2025)
Reading, Not Thinking: Understanding and Bridging the Modality Gap When Text Becomes Pixels in Multimodal LLMs
von: Sun, Kaiser, et al.
Veröffentlicht: (2026)
von: Sun, Kaiser, et al.
Veröffentlicht: (2026)
Dynamic Embedding of Hierarchical Visual Features for Efficient Vision-Language Fine-Tuning
von: Wei, Xinyu, et al.
Veröffentlicht: (2025)
von: Wei, Xinyu, et al.
Veröffentlicht: (2025)
Image Synthesis under Limited Data: A Survey and Taxonomy
von: Yang, Mengping, et al.
Veröffentlicht: (2023)
von: Yang, Mengping, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
Cockatiel: Ensembling Synthetic and Human Preferenced Training for Detailed Video Caption
von: Qin, Luozheng, et al.
Veröffentlicht: (2025) -
Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision
von: Qin, Luozheng, et al.
Veröffentlicht: (2025) -
Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation
von: Yang, Xiaomeng, et al.
Veröffentlicht: (2025) -
VidGen-1M: A Large-Scale Dataset for Text-to-video Generation
von: Tan, Zhiyu, et al.
Veröffentlicht: (2024) -
An Empirical Study and Analysis of Text-to-Image Generation Using Large Language Model-Powered Textual Representation
von: Tan, Zhiyu, et al.
Veröffentlicht: (2024)