Data Selection for Fine-tuning Vision Language Models via Cross Modal Alignment Trajectories
Fuente:
arXiv
Guardado en:
| Autores principales: | Naharas, Nilay, Nguyen, Dang, Bulut, Nesihan, Bateni, Mohammadhossein, Mirrokni, Vahab, Mirzasoleiman, Baharan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Synthetic Text Generation for Training Large Language Models via Gradient Matching
por: Nguyen, Dang, et al.
Publicado: (2025)
por: Nguyen, Dang, et al.
Publicado: (2025)
Understanding the Role of Training Data in Test-Time Scaling
por: Javanmard, Adel, et al.
Publicado: (2025)
por: Javanmard, Adel, et al.
Publicado: (2025)
Theoretical Perspectives on Data Quality and Synergistic Effects in Pre- and Post-Training Reasoning Models
por: Javanmard, Adel, et al.
Publicado: (2026)
por: Javanmard, Adel, et al.
Publicado: (2026)
Do We Need All the Synthetic Data? Targeted Image Augmentation via Diffusion Models
por: Nguyen, Dang, et al.
Publicado: (2025)
por: Nguyen, Dang, et al.
Publicado: (2025)
Changing the Training Data Distribution to Reduce Simplicity Bias Improves In-distribution Generalization
por: Nguyen, Dang, et al.
Publicado: (2024)
por: Nguyen, Dang, et al.
Publicado: (2024)
Data-Efficient Contrastive Language-Image Pretraining: Prioritizing Data Quality over Quantity
por: Joshi, Siddharth, et al.
Publicado: (2024)
por: Joshi, Siddharth, et al.
Publicado: (2024)
Better Safe than Sorry: Pre-training CLIP against Targeted Data Poisoning and Backdoor Attacks
por: Yang, Wenhan, et al.
Publicado: (2023)
por: Yang, Wenhan, et al.
Publicado: (2023)
SmallToLarge (S2L): Scalable Data Selection for Fine-tuning Large Language Models by Summarizing Training Trajectories of Small Models
por: Yang, Yu, et al.
Publicado: (2024)
por: Yang, Yu, et al.
Publicado: (2024)
Few-shot Adaptation to Distribution Shifts By Mixing Source and Target Embeddings
por: Xue, Yihao, et al.
Publicado: (2023)
por: Xue, Yihao, et al.
Publicado: (2023)
Identifying Spurious Biases Early in Training through the Lens of Simplicity Bias
por: Yang, Yu, et al.
Publicado: (2023)
por: Yang, Yu, et al.
Publicado: (2023)
Aligning Modalities in Vision Large Language Models via Preference Fine-tuning
por: Zhou, Yiyang, et al.
Publicado: (2024)
por: Zhou, Yiyang, et al.
Publicado: (2024)
Investigating the Benefits of Projection Head for Representation Learning
por: Xue, Yihao, et al.
Publicado: (2024)
por: Xue, Yihao, et al.
Publicado: (2024)
Beyond Semantic Entropy: Boosting LLM Uncertainty Quantification with Pairwise Semantic Similarity
por: Nguyen, Dang, et al.
Publicado: (2025)
por: Nguyen, Dang, et al.
Publicado: (2025)
Causality-based Cross-Modal Representation Learning for Vision-and-Language Navigation
por: Wang, Liuyi, et al.
Publicado: (2024)
por: Wang, Liuyi, et al.
Publicado: (2024)
Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models
por: Yan, Hanqi, et al.
Publicado: (2025)
por: Yan, Hanqi, et al.
Publicado: (2025)
Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate
por: Huang, Qidong, et al.
Publicado: (2024)
por: Huang, Qidong, et al.
Publicado: (2024)
MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation
por: Joshi, Siddharth, et al.
Publicado: (2025)
por: Joshi, Siddharth, et al.
Publicado: (2025)
LoRA is All You Need for Safety Alignment of Reasoning LLMs
por: Xue, Yihao, et al.
Publicado: (2025)
por: Xue, Yihao, et al.
Publicado: (2025)
SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality
por: Lei, Chenyang, et al.
Publicado: (2024)
por: Lei, Chenyang, et al.
Publicado: (2024)
Mind the Modality Gap: Towards a Remote Sensing Vision-Language Model via Cross-modal Alignment
por: Zavras, Angelos, et al.
Publicado: (2024)
por: Zavras, Angelos, et al.
Publicado: (2024)
Cross Modal Fine-Grained Alignment via Granularity-Aware and Region-Uncertain Modeling
por: Liu, Jiale, et al.
Publicado: (2025)
por: Liu, Jiale, et al.
Publicado: (2025)
MultiModal Fine-tuning with Synthetic Captions
por: Enomoto, Shohei, et al.
Publicado: (2026)
por: Enomoto, Shohei, et al.
Publicado: (2026)
Tuning the Implicit Regularizer of Masked Diffusion Language Models: Enhancing Generalization via Insights from $k$-Parity
por: Huang, Jianhao, et al.
Publicado: (2026)
por: Huang, Jianhao, et al.
Publicado: (2026)
VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization
por: Li, Mingxiao, et al.
Publicado: (2025)
por: Li, Mingxiao, et al.
Publicado: (2025)
Mini-batch Coresets for Memory-efficient Language Model Training on Data Mixtures
por: Nguyen, Dang, et al.
Publicado: (2024)
por: Nguyen, Dang, et al.
Publicado: (2024)
Align-KD: Distilling Cross-Modal Alignment Knowledge for Mobile Vision-Language Model
por: Feng, Qianhan, et al.
Publicado: (2024)
por: Feng, Qianhan, et al.
Publicado: (2024)
From Classification to Cross-Modal Understanding: Leveraging Vision-Language Models for Fine-Grained Renal Pathology
por: Guo, Zhenhao, et al.
Publicado: (2025)
por: Guo, Zhenhao, et al.
Publicado: (2025)
LinguDistill: Recovering Linguistic Ability in Vision-Language Models via Selective Cross-Modal Distillation
por: Irawan, Patrick Amadeus, et al.
Publicado: (2026)
por: Irawan, Patrick Amadeus, et al.
Publicado: (2026)
Towards Compatible Fine-tuning for Vision-Language Model Updates
por: Wang, Zhengbo, et al.
Publicado: (2024)
por: Wang, Zhengbo, et al.
Publicado: (2024)
ITSELF: Attention Guided Fine-Grained Alignment for Vision-Language Retrieval
por: Nguyen, Tien-Huy, et al.
Publicado: (2026)
por: Nguyen, Tien-Huy, et al.
Publicado: (2026)
Robotic-CLIP: Fine-tuning CLIP on Action Data for Robotic Applications
por: Nguyen, Nghia, et al.
Publicado: (2024)
por: Nguyen, Nghia, et al.
Publicado: (2024)
TRivia: Self-supervised Fine-tuning of Vision-Language Models for Table Recognition
por: Zhang, Junyuan, et al.
Publicado: (2025)
por: Zhang, Junyuan, et al.
Publicado: (2025)
Hybrid Spiking Neural Network -- Transformer Video Classification Model
por: Bateni, Aaron
Publicado: (2024)
por: Bateni, Aaron
Publicado: (2024)
Learning Modality Knowledge Alignment for Cross-Modality Transfer
por: Ma, Wenxuan, et al.
Publicado: (2024)
por: Ma, Wenxuan, et al.
Publicado: (2024)
Optimizing Vision-Language Consistency via Cross-Layer Regional Attention Alignment
por: Wang, Yifan, et al.
Publicado: (2025)
por: Wang, Yifan, et al.
Publicado: (2025)
Improved Alignment of Modalities in Large Vision Language Models
por: Jangra, Kartik, et al.
Publicado: (2025)
por: Jangra, Kartik, et al.
Publicado: (2025)
Multi-Modal Parameter-Efficient Fine-tuning via Graph Neural Network
por: Cheng, Bin, et al.
Publicado: (2024)
por: Cheng, Bin, et al.
Publicado: (2024)
Diffusion-Sharpening: Fine-tuning Diffusion Models with Denoising Trajectory Sharpening
por: Tian, Ye, et al.
Publicado: (2025)
por: Tian, Ye, et al.
Publicado: (2025)
DELAN: Dual-Level Alignment for Vision-and-Language Navigation by Cross-Modal Contrastive Learning
por: Du, Mengfei, et al.
Publicado: (2024)
por: Du, Mengfei, et al.
Publicado: (2024)
Collaborative Representation Learning for Alignment of Tactile, Language, and Vision Modalities
por: Zhou, Yiyun, et al.
Publicado: (2025)
por: Zhou, Yiyun, et al.
Publicado: (2025)
Ejemplares similares
-
Synthetic Text Generation for Training Large Language Models via Gradient Matching
por: Nguyen, Dang, et al.
Publicado: (2025) -
Understanding the Role of Training Data in Test-Time Scaling
por: Javanmard, Adel, et al.
Publicado: (2025) -
Theoretical Perspectives on Data Quality and Synergistic Effects in Pre- and Post-Training Reasoning Models
por: Javanmard, Adel, et al.
Publicado: (2026) -
Do We Need All the Synthetic Data? Targeted Image Augmentation via Diffusion Models
por: Nguyen, Dang, et al.
Publicado: (2025) -
Changing the Training Data Distribution to Reduce Simplicity Bias Improves In-distribution Generalization
por: Nguyen, Dang, et al.
Publicado: (2024)