Finetuned Multimodal Language Models Are High-Quality Image-Text Data Filters
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Weizhi, Mrini, Khalil, Yang, Linjie, Kumar, Sateesh, Tian, Yu, Yan, Xifeng, Wang, Heng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Fast Prompt Alignment for Text-to-Image Generation
di: Mrini, Khalil, et al.
Pubblicazione: (2024)
di: Mrini, Khalil, et al.
Pubblicazione: (2024)
Open-Qwen2VL: Compute-Efficient Pre-Training of Fully-Open Multimodal LLMs on Academic Resources
di: Wang, Weizhi, et al.
Pubblicazione: (2025)
di: Wang, Weizhi, et al.
Pubblicazione: (2025)
Train a Unified Multimodal Data Quality Classifier with Synthetic Data
di: Wang, Weizhi, et al.
Pubblicazione: (2025)
di: Wang, Weizhi, et al.
Pubblicazione: (2025)
Beyond Filtering: Adaptive Image-Text Quality Enhancement for MLLM Pretraining
di: Huang, Han, et al.
Pubblicazione: (2024)
di: Huang, Han, et al.
Pubblicazione: (2024)
Agent-Testing Agent: A Meta-Agent for Automated Testing and Evaluation of Conversational AI Agents
di: Komoravolu, Sameer, et al.
Pubblicazione: (2025)
di: Komoravolu, Sameer, et al.
Pubblicazione: (2025)
Adaptive Layer-skipping in Pre-trained LLMs
di: Luo, Xuan, et al.
Pubblicazione: (2025)
di: Luo, Xuan, et al.
Pubblicazione: (2025)
Direct Multi-Token Decoding
di: Luo, Xuan, et al.
Pubblicazione: (2025)
di: Luo, Xuan, et al.
Pubblicazione: (2025)
Bot or Human? Detecting ChatGPT Imposters with A Single Question
di: Wang, Hong, et al.
Pubblicazione: (2023)
di: Wang, Hong, et al.
Pubblicazione: (2023)
Maya: An Instruction Finetuned Multilingual Multimodal Model
di: Alam, Nahid, et al.
Pubblicazione: (2024)
di: Alam, Nahid, et al.
Pubblicazione: (2024)
Text as Images: Can Multimodal Large Language Models Follow Printed Instructions in Pixels?
di: Li, Xiujun, et al.
Pubblicazione: (2023)
di: Li, Xiujun, et al.
Pubblicazione: (2023)
List Items One by One: A New Data Source and Learning Paradigm for Multimodal LLMs
di: Yan, An, et al.
Pubblicazione: (2024)
di: Yan, An, et al.
Pubblicazione: (2024)
EVALALIGN: Supervised Fine-Tuning Multimodal LLMs with Human-Aligned Data for Evaluating Text-to-Image Models
di: Tan, Zhiyu, et al.
Pubblicazione: (2024)
di: Tan, Zhiyu, et al.
Pubblicazione: (2024)
Quality-Aware Image-Text Alignment for Opinion-Unaware Image Quality Assessment
di: Agnolucci, Lorenzo, et al.
Pubblicazione: (2024)
di: Agnolucci, Lorenzo, et al.
Pubblicazione: (2024)
Scaling Text-Rich Image Understanding via Code-Guided Synthetic Multimodal Data Generation
di: Yang, Yue, et al.
Pubblicazione: (2025)
di: Yang, Yue, et al.
Pubblicazione: (2025)
Both Text and Images Leaked! A Systematic Analysis of Data Contamination in Multimodal LLM
di: Song, Dingjie, et al.
Pubblicazione: (2024)
di: Song, Dingjie, et al.
Pubblicazione: (2024)
MULTI: Multimodal Understanding Leaderboard with Text and Images
di: Zhu, Zichen, et al.
Pubblicazione: (2024)
di: Zhu, Zichen, et al.
Pubblicazione: (2024)
Multimodal Language Models with Modality-Specific Experts for Financial Forecasting from Interleaved Sequences of Text and Time Series
di: Koval, Ross, et al.
Pubblicazione: (2025)
di: Koval, Ross, et al.
Pubblicazione: (2025)
Investigating Disability Representations in Text-to-Image Models
di: Tian, Yang, et al.
Pubblicazione: (2026)
di: Tian, Yang, et al.
Pubblicazione: (2026)
CAFe: Unifying Representation and Generation with Contrastive-Autoregressive Finetuning
di: Yu, Hao, et al.
Pubblicazione: (2025)
di: Yu, Hao, et al.
Pubblicazione: (2025)
Analyzing Finetuning Representation Shift for Multimodal LLMs Steering
di: Khayatan, Pegah, et al.
Pubblicazione: (2025)
di: Khayatan, Pegah, et al.
Pubblicazione: (2025)
ROMA: Real-time Omni-Multimodal Assistant with Interactive Streaming Understanding
di: Tian, Xueyun, et al.
Pubblicazione: (2026)
di: Tian, Xueyun, et al.
Pubblicazione: (2026)
MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities
di: Yu, Weihao, et al.
Pubblicazione: (2023)
di: Yu, Weihao, et al.
Pubblicazione: (2023)
MMRQA: Signal-Enhanced Multimodal Large Language Models for MRI Quality Assessment
di: Jia, Fankai, et al.
Pubblicazione: (2025)
di: Jia, Fankai, et al.
Pubblicazione: (2025)
A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation
di: Zhou, Shijie, et al.
Pubblicazione: (2024)
di: Zhou, Shijie, et al.
Pubblicazione: (2024)
ImageChain: Advancing Sequential Image-to-Text Reasoning in Multimodal Large Language Models
di: Villegas, Danae Sánchez, et al.
Pubblicazione: (2025)
di: Villegas, Danae Sánchez, et al.
Pubblicazione: (2025)
Parameter-Inverted Image Pyramid Networks for Visual Perception and Multimodal Understanding
di: Wang, Zhaokai, et al.
Pubblicazione: (2025)
di: Wang, Zhaokai, et al.
Pubblicazione: (2025)
Advanced Multimodal Deep Learning Architecture for Image-Text Matching
di: Wang, Jinyin, et al.
Pubblicazione: (2024)
di: Wang, Jinyin, et al.
Pubblicazione: (2024)
Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion
di: Lv, Zheqi, et al.
Pubblicazione: (2025)
di: Lv, Zheqi, et al.
Pubblicazione: (2025)
Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models
di: Luo, Gen, et al.
Pubblicazione: (2025)
di: Luo, Gen, et al.
Pubblicazione: (2025)
Scalable Vision Language Model Training via High Quality Data Curation
di: Dong, Hongyuan, et al.
Pubblicazione: (2025)
di: Dong, Hongyuan, et al.
Pubblicazione: (2025)
ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?
di: Zhang, Leixin, et al.
Pubblicazione: (2024)
di: Zhang, Leixin, et al.
Pubblicazione: (2024)
Towards Patronizing and Condescending Language in Chinese Videos: A Multimodal Dataset and Detector
di: Wang, Hongbo, et al.
Pubblicazione: (2024)
di: Wang, Hongbo, et al.
Pubblicazione: (2024)
Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
di: Ni, Minheng, et al.
Pubblicazione: (2025)
di: Ni, Minheng, et al.
Pubblicazione: (2025)
MM-Vet v2: A Challenging Benchmark to Evaluate Large Multimodal Models for Integrated Capabilities
di: Yu, Weihao, et al.
Pubblicazione: (2024)
di: Yu, Weihao, et al.
Pubblicazione: (2024)
LADR: Locality-Aware Dynamic Rescue for Efficient Text-to-Image Generation with Diffusion Large Language Models
di: Wang, Chenglin, et al.
Pubblicazione: (2026)
di: Wang, Chenglin, et al.
Pubblicazione: (2026)
Looking Beyond Text: Reducing Language bias in Large Vision-Language Models via Multimodal Dual-Attention and Soft-Image Guidance
di: Zhao, Haozhe, et al.
Pubblicazione: (2024)
di: Zhao, Haozhe, et al.
Pubblicazione: (2024)
Beyond Words: Advancing Long-Text Image Generation via Multimodal Autoregressive Models
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2025)
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2025)
MMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language Models
di: Xia, Peng, et al.
Pubblicazione: (2024)
di: Xia, Peng, et al.
Pubblicazione: (2024)
TikZilla: Scaling Text-to-TikZ with High-Quality Data and Reinforcement Learning
di: Greisinger, Christian, et al.
Pubblicazione: (2026)
di: Greisinger, Christian, et al.
Pubblicazione: (2026)
Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images
di: You, Liangliang, et al.
Pubblicazione: (2025)
di: You, Liangliang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Fast Prompt Alignment for Text-to-Image Generation
di: Mrini, Khalil, et al.
Pubblicazione: (2024) -
Open-Qwen2VL: Compute-Efficient Pre-Training of Fully-Open Multimodal LLMs on Academic Resources
di: Wang, Weizhi, et al.
Pubblicazione: (2025) -
Train a Unified Multimodal Data Quality Classifier with Synthetic Data
di: Wang, Weizhi, et al.
Pubblicazione: (2025) -
Beyond Filtering: Adaptive Image-Text Quality Enhancement for MLLM Pretraining
di: Huang, Han, et al.
Pubblicazione: (2024) -
Agent-Testing Agent: A Meta-Agent for Automated Testing and Evaluation of Conversational AI Agents
di: Komoravolu, Sameer, et al.
Pubblicazione: (2025)