Your Vision-Language Model Itself Is a Strong Filter: Towards High-Quality Instruction Tuning with Data Selection
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Ruibo, Wu, Yihan, Chen, Lichang, Liu, Guodong, He, Qi, Xiong, Tianyi, Liu, Chenxi, Guo, Junfeng, Huang, Heng |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Modality-Balancing Preference Optimization of Large Multimodal Models by Adversarial Negative Mining
by: Liu, Chenxi, et al.
Published: (2025)
by: Liu, Chenxi, et al.
Published: (2025)
Few-Shot Class Incremental Learning with Attention-Aware Self-Adaptive Prompt
by: Liu, Chenxi, et al.
Published: (2024)
by: Liu, Chenxi, et al.
Published: (2024)
Selective Reflection-Tuning: Student-Selected Data Recycling for LLM Instruction-Tuning
by: Li, Ming, et al.
Published: (2024)
by: Li, Ming, et al.
Published: (2024)
Towards Copyright Protection for Knowledge Bases of Retrieval-augmented Language Models via Reasoning
by: Guo, Junfeng, et al.
Published: (2025)
by: Guo, Junfeng, et al.
Published: (2025)
A Watermark for Order-Agnostic Language Models
by: Chen, Ruibo, et al.
Published: (2024)
by: Chen, Ruibo, et al.
Published: (2024)
De-mark: Watermark Removal in Large Language Models
by: Chen, Ruibo, et al.
Published: (2024)
by: Chen, Ruibo, et al.
Published: (2024)
Improved Unbiased Watermark for Large Language Models
by: Chen, Ruibo, et al.
Published: (2025)
by: Chen, Ruibo, et al.
Published: (2025)
From Quantity to Quality: Boosting LLM Performance with Self-Guided Data Selection for Instruction Tuning
by: Li, Ming, et al.
Published: (2023)
by: Li, Ming, et al.
Published: (2023)
OPTune: Efficient Online Preference Tuning
by: Chen, Lichang, et al.
Published: (2024)
by: Chen, Lichang, et al.
Published: (2024)
Learning from Self-Debate: Preparing Reasoning Models for Multi-Agent Debate
by: Liu, Chenxi, et al.
Published: (2026)
by: Liu, Chenxi, et al.
Published: (2026)
Superfiltering: Weak-to-Strong Data Filtering for Fast Instruction-Tuning
by: Li, Ming, et al.
Published: (2024)
by: Li, Ming, et al.
Published: (2024)
Can LLMs Speak For Diverse People? Tuning LLMs via Debate to Generate Controllable Controversial Statements
by: Li, Ming, et al.
Published: (2024)
by: Li, Ming, et al.
Published: (2024)
Distortion-free Watermarks are not Truly Distortion-free under Watermark Key Collisions
by: Wu, Yihan, et al.
Published: (2024)
by: Wu, Yihan, et al.
Published: (2024)
From Lists to Emojis: How Format Bias Affects Model Alignment
by: Zhang, Xuanchang, et al.
Published: (2024)
by: Zhang, Xuanchang, et al.
Published: (2024)
CaptionQA: Is Your Caption as Useful as the Image Itself?
by: Yang, Shijia, et al.
Published: (2025)
by: Yang, Shijia, et al.
Published: (2025)
Instruction Mining: Instruction Data Selection for Tuning Large Language Models
by: Cao, Yihan, et al.
Published: (2023)
by: Cao, Yihan, et al.
Published: (2023)
How Do Your Code LLMs Perform? Empowering Code Instruction Tuning with High-Quality Data
by: Wang, Yejie, et al.
Published: (2024)
by: Wang, Yejie, et al.
Published: (2024)
Model Correlation Detection via Random Selection Probing
by: Chen, Ruibo, et al.
Published: (2025)
by: Chen, Ruibo, et al.
Published: (2025)
Robust Distortion-Free Watermark for Autoregressive Audio Generation Models
by: Wu, Yihan, et al.
Published: (2025)
by: Wu, Yihan, et al.
Published: (2025)
An Ensemble Framework for Unbiased Language Model Watermarking
by: Wu, Yihan, et al.
Published: (2025)
by: Wu, Yihan, et al.
Published: (2025)
Analyzing and Evaluating Unbiased Language Model Watermark
by: Wu, Yihan, et al.
Published: (2025)
by: Wu, Yihan, et al.
Published: (2025)
MC$^2$Mark: Distortion-Free Multi-Bit Watermarking for Long Messages
by: Cui, Xuehao, et al.
Published: (2026)
by: Cui, Xuehao, et al.
Published: (2026)
High-Quality Data Augmentation for Low-Resource NMT: Combining a Translation Memory, a GAN Generator, and Filtering
by: Liu, Hengjie, et al.
Published: (2024)
by: Liu, Hengjie, et al.
Published: (2024)
Your Agent Can Defend Itself against Backdoor Attacks
by: Changjiang, Li, et al.
Published: (2025)
by: Changjiang, Li, et al.
Published: (2025)
MedHallTune: An Instruction-Tuning Benchmark for Mitigating Medical Hallucination in Vision-Language Models
by: Yan, Qiao, et al.
Published: (2025)
by: Yan, Qiao, et al.
Published: (2025)
SEAGULL: No-reference Image Quality Assessment for Regions of Interest via Vision-Language Instruction Tuning
by: Chen, Zewen, et al.
Published: (2024)
by: Chen, Zewen, et al.
Published: (2024)
QAQ: Bidirectional Semantic Coherence for Selecting High-Quality Synthetic Code Instructions
by: Lei, Jiayin, et al.
Published: (2026)
by: Lei, Jiayin, et al.
Published: (2026)
Your Pretrained Model Tells the Difficulty Itself: A Self-Adaptive Curriculum Learning Paradigm for Natural Language Understanding
by: Feng, Qi, et al.
Published: (2025)
by: Feng, Qi, et al.
Published: (2025)
SynthVLM: Towards High-Quality and Efficient Synthesis of Image-Caption Datasets for Vision-Language Models
by: Liu, Zheng, et al.
Published: (2024)
by: Liu, Zheng, et al.
Published: (2024)
CSC: Turning the Adversary's Poison against Itself
by: Shi, Yuchen, et al.
Published: (2026)
by: Shi, Yuchen, et al.
Published: (2026)
Select2Reason: Efficient Instruction-Tuning Data Selection for Long-CoT Reasoning
by: Yang, Cehao, et al.
Published: (2025)
by: Yang, Cehao, et al.
Published: (2025)
CLIPSelf: Vision Transformer Distills Itself for Open-Vocabulary Dense Prediction
by: Wu, Size, et al.
Published: (2023)
by: Wu, Size, et al.
Published: (2023)
Unveiling the Impact of Coding Data Instruction Fine-Tuning on Large Language Models Reasoning
by: Zhang, Xinlu, et al.
Published: (2024)
by: Zhang, Xinlu, et al.
Published: (2024)
More Haste, Less Speed: Weaker Single-Layer Watermark Improves Distortion-Free Watermark Ensembles
by: Chen, Ruibo, et al.
Published: (2026)
by: Chen, Ruibo, et al.
Published: (2026)
A Watermark for Auto-Regressive Image Generation Models
by: Wu, Yihan, et al.
Published: (2025)
by: Wu, Yihan, et al.
Published: (2025)
SleeperMark: Towards Robust Watermark against Fine-Tuning Text-to-image Diffusion Models
by: Wang, Zilan, et al.
Published: (2024)
by: Wang, Zilan, et al.
Published: (2024)
Filter Images First, Generate Instructions Later: Pre-Instruction Data Selection for Visual Instruction Tuning
by: Safaei, Bardia, et al.
Published: (2025)
by: Safaei, Bardia, et al.
Published: (2025)
Leveraging Diffusion For Strong and High Quality Face Morphing Attacks
by: Blasingame, Zander W., et al.
Published: (2023)
by: Blasingame, Zander W., et al.
Published: (2023)
Backdooring Instruction-Tuned Large Language Models with Virtual Prompt Injection
by: Yan, Jun, et al.
Published: (2023)
by: Yan, Jun, et al.
Published: (2023)
Let the Target Select for Itself: Data Selection via Target-Aligned Paths
by: Yang, Huitao, et al.
Published: (2026)
by: Yang, Huitao, et al.
Published: (2026)
Similar Items
-
Modality-Balancing Preference Optimization of Large Multimodal Models by Adversarial Negative Mining
by: Liu, Chenxi, et al.
Published: (2025) -
Few-Shot Class Incremental Learning with Attention-Aware Self-Adaptive Prompt
by: Liu, Chenxi, et al.
Published: (2024) -
Selective Reflection-Tuning: Student-Selected Data Recycling for LLM Instruction-Tuning
by: Li, Ming, et al.
Published: (2024) -
Towards Copyright Protection for Knowledge Bases of Retrieval-augmented Language Models via Reasoning
by: Guo, Junfeng, et al.
Published: (2025) -
A Watermark for Order-Agnostic Language Models
by: Chen, Ruibo, et al.
Published: (2024)