Finetuned Multimodal Language Models Are High-Quality Image-Text Data Filters
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Weizhi, Mrini, Khalil, Yang, Linjie, Kumar, Sateesh, Tian, Yu, Yan, Xifeng, Wang, Heng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Fast Prompt Alignment for Text-to-Image Generation
von: Mrini, Khalil, et al.
Veröffentlicht: (2024)
von: Mrini, Khalil, et al.
Veröffentlicht: (2024)
Open-Qwen2VL: Compute-Efficient Pre-Training of Fully-Open Multimodal LLMs on Academic Resources
von: Wang, Weizhi, et al.
Veröffentlicht: (2025)
von: Wang, Weizhi, et al.
Veröffentlicht: (2025)
Train a Unified Multimodal Data Quality Classifier with Synthetic Data
von: Wang, Weizhi, et al.
Veröffentlicht: (2025)
von: Wang, Weizhi, et al.
Veröffentlicht: (2025)
Beyond Filtering: Adaptive Image-Text Quality Enhancement for MLLM Pretraining
von: Huang, Han, et al.
Veröffentlicht: (2024)
von: Huang, Han, et al.
Veröffentlicht: (2024)
Agent-Testing Agent: A Meta-Agent for Automated Testing and Evaluation of Conversational AI Agents
von: Komoravolu, Sameer, et al.
Veröffentlicht: (2025)
von: Komoravolu, Sameer, et al.
Veröffentlicht: (2025)
Adaptive Layer-skipping in Pre-trained LLMs
von: Luo, Xuan, et al.
Veröffentlicht: (2025)
von: Luo, Xuan, et al.
Veröffentlicht: (2025)
Direct Multi-Token Decoding
von: Luo, Xuan, et al.
Veröffentlicht: (2025)
von: Luo, Xuan, et al.
Veröffentlicht: (2025)
Bot or Human? Detecting ChatGPT Imposters with A Single Question
von: Wang, Hong, et al.
Veröffentlicht: (2023)
von: Wang, Hong, et al.
Veröffentlicht: (2023)
Maya: An Instruction Finetuned Multilingual Multimodal Model
von: Alam, Nahid, et al.
Veröffentlicht: (2024)
von: Alam, Nahid, et al.
Veröffentlicht: (2024)
Text as Images: Can Multimodal Large Language Models Follow Printed Instructions in Pixels?
von: Li, Xiujun, et al.
Veröffentlicht: (2023)
von: Li, Xiujun, et al.
Veröffentlicht: (2023)
List Items One by One: A New Data Source and Learning Paradigm for Multimodal LLMs
von: Yan, An, et al.
Veröffentlicht: (2024)
von: Yan, An, et al.
Veröffentlicht: (2024)
EVALALIGN: Supervised Fine-Tuning Multimodal LLMs with Human-Aligned Data for Evaluating Text-to-Image Models
von: Tan, Zhiyu, et al.
Veröffentlicht: (2024)
von: Tan, Zhiyu, et al.
Veröffentlicht: (2024)
Quality-Aware Image-Text Alignment for Opinion-Unaware Image Quality Assessment
von: Agnolucci, Lorenzo, et al.
Veröffentlicht: (2024)
von: Agnolucci, Lorenzo, et al.
Veröffentlicht: (2024)
Scaling Text-Rich Image Understanding via Code-Guided Synthetic Multimodal Data Generation
von: Yang, Yue, et al.
Veröffentlicht: (2025)
von: Yang, Yue, et al.
Veröffentlicht: (2025)
Both Text and Images Leaked! A Systematic Analysis of Data Contamination in Multimodal LLM
von: Song, Dingjie, et al.
Veröffentlicht: (2024)
von: Song, Dingjie, et al.
Veröffentlicht: (2024)
MULTI: Multimodal Understanding Leaderboard with Text and Images
von: Zhu, Zichen, et al.
Veröffentlicht: (2024)
von: Zhu, Zichen, et al.
Veröffentlicht: (2024)
Multimodal Language Models with Modality-Specific Experts for Financial Forecasting from Interleaved Sequences of Text and Time Series
von: Koval, Ross, et al.
Veröffentlicht: (2025)
von: Koval, Ross, et al.
Veröffentlicht: (2025)
Investigating Disability Representations in Text-to-Image Models
von: Tian, Yang, et al.
Veröffentlicht: (2026)
von: Tian, Yang, et al.
Veröffentlicht: (2026)
CAFe: Unifying Representation and Generation with Contrastive-Autoregressive Finetuning
von: Yu, Hao, et al.
Veröffentlicht: (2025)
von: Yu, Hao, et al.
Veröffentlicht: (2025)
Analyzing Finetuning Representation Shift for Multimodal LLMs Steering
von: Khayatan, Pegah, et al.
Veröffentlicht: (2025)
von: Khayatan, Pegah, et al.
Veröffentlicht: (2025)
ROMA: Real-time Omni-Multimodal Assistant with Interactive Streaming Understanding
von: Tian, Xueyun, et al.
Veröffentlicht: (2026)
von: Tian, Xueyun, et al.
Veröffentlicht: (2026)
MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities
von: Yu, Weihao, et al.
Veröffentlicht: (2023)
von: Yu, Weihao, et al.
Veröffentlicht: (2023)
MMRQA: Signal-Enhanced Multimodal Large Language Models for MRI Quality Assessment
von: Jia, Fankai, et al.
Veröffentlicht: (2025)
von: Jia, Fankai, et al.
Veröffentlicht: (2025)
A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation
von: Zhou, Shijie, et al.
Veröffentlicht: (2024)
von: Zhou, Shijie, et al.
Veröffentlicht: (2024)
ImageChain: Advancing Sequential Image-to-Text Reasoning in Multimodal Large Language Models
von: Villegas, Danae Sánchez, et al.
Veröffentlicht: (2025)
von: Villegas, Danae Sánchez, et al.
Veröffentlicht: (2025)
Parameter-Inverted Image Pyramid Networks for Visual Perception and Multimodal Understanding
von: Wang, Zhaokai, et al.
Veröffentlicht: (2025)
von: Wang, Zhaokai, et al.
Veröffentlicht: (2025)
Advanced Multimodal Deep Learning Architecture for Image-Text Matching
von: Wang, Jinyin, et al.
Veröffentlicht: (2024)
von: Wang, Jinyin, et al.
Veröffentlicht: (2024)
Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion
von: Lv, Zheqi, et al.
Veröffentlicht: (2025)
von: Lv, Zheqi, et al.
Veröffentlicht: (2025)
Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models
von: Luo, Gen, et al.
Veröffentlicht: (2025)
von: Luo, Gen, et al.
Veröffentlicht: (2025)
Scalable Vision Language Model Training via High Quality Data Curation
von: Dong, Hongyuan, et al.
Veröffentlicht: (2025)
von: Dong, Hongyuan, et al.
Veröffentlicht: (2025)
ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?
von: Zhang, Leixin, et al.
Veröffentlicht: (2024)
von: Zhang, Leixin, et al.
Veröffentlicht: (2024)
Towards Patronizing and Condescending Language in Chinese Videos: A Multimodal Dataset and Detector
von: Wang, Hongbo, et al.
Veröffentlicht: (2024)
von: Wang, Hongbo, et al.
Veröffentlicht: (2024)
Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
von: Ni, Minheng, et al.
Veröffentlicht: (2025)
von: Ni, Minheng, et al.
Veröffentlicht: (2025)
MM-Vet v2: A Challenging Benchmark to Evaluate Large Multimodal Models for Integrated Capabilities
von: Yu, Weihao, et al.
Veröffentlicht: (2024)
von: Yu, Weihao, et al.
Veröffentlicht: (2024)
LADR: Locality-Aware Dynamic Rescue for Efficient Text-to-Image Generation with Diffusion Large Language Models
von: Wang, Chenglin, et al.
Veröffentlicht: (2026)
von: Wang, Chenglin, et al.
Veröffentlicht: (2026)
Looking Beyond Text: Reducing Language bias in Large Vision-Language Models via Multimodal Dual-Attention and Soft-Image Guidance
von: Zhao, Haozhe, et al.
Veröffentlicht: (2024)
von: Zhao, Haozhe, et al.
Veröffentlicht: (2024)
Beyond Words: Advancing Long-Text Image Generation via Multimodal Autoregressive Models
von: Wang, Alex Jinpeng, et al.
Veröffentlicht: (2025)
von: Wang, Alex Jinpeng, et al.
Veröffentlicht: (2025)
MMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language Models
von: Xia, Peng, et al.
Veröffentlicht: (2024)
von: Xia, Peng, et al.
Veröffentlicht: (2024)
TikZilla: Scaling Text-to-TikZ with High-Quality Data and Reinforcement Learning
von: Greisinger, Christian, et al.
Veröffentlicht: (2026)
von: Greisinger, Christian, et al.
Veröffentlicht: (2026)
Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images
von: You, Liangliang, et al.
Veröffentlicht: (2025)
von: You, Liangliang, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Fast Prompt Alignment for Text-to-Image Generation
von: Mrini, Khalil, et al.
Veröffentlicht: (2024) -
Open-Qwen2VL: Compute-Efficient Pre-Training of Fully-Open Multimodal LLMs on Academic Resources
von: Wang, Weizhi, et al.
Veröffentlicht: (2025) -
Train a Unified Multimodal Data Quality Classifier with Synthetic Data
von: Wang, Weizhi, et al.
Veröffentlicht: (2025) -
Beyond Filtering: Adaptive Image-Text Quality Enhancement for MLLM Pretraining
von: Huang, Han, et al.
Veröffentlicht: (2024) -
Agent-Testing Agent: A Meta-Agent for Automated Testing and Evaluation of Conversational AI Agents
von: Komoravolu, Sameer, et al.
Veröffentlicht: (2025)