Language Integration in Fine-Tuning Multimodal Large Language Models for Image-Based Regression
Fuente:
arXiv
Guardado en:
| Autores principales: | Jennings, Roy H., Paikin, Genady, Shaul, Roy, Soloveichik, Evgeny |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Prompt Tuning Vision Language Models with Margin Regularizer for Few-Shot Learning under Distribution Shifts
por: Brahma, Debarshi, et al.
Publicado: (2025)
por: Brahma, Debarshi, et al.
Publicado: (2025)
CLEFT: Language-Image Contrastive Learning with Efficient Large Language Model and Prompt Fine-Tuning
por: Du, Yuexi, et al.
Publicado: (2024)
por: Du, Yuexi, et al.
Publicado: (2024)
Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models
por: Xu, Qinwu, et al.
Publicado: (2026)
por: Xu, Qinwu, et al.
Publicado: (2026)
Self-Captioning Multimodal Interaction Tuning: Amplifying Exploitable Redundancies for Robust Vision Language Models
por: Ryan, Yuriel, et al.
Publicado: (2026)
por: Ryan, Yuriel, et al.
Publicado: (2026)
FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models
por: Zheng, Weiying, et al.
Publicado: (2025)
por: Zheng, Weiying, et al.
Publicado: (2025)
Rethinking Fine-Tuning: Unlocking Hidden Capabilities in Vision-Language Models
por: Zhang, Mingyuan, et al.
Publicado: (2025)
por: Zhang, Mingyuan, et al.
Publicado: (2025)
ForgerySleuth: Empowering Multimodal Large Language Models for Image Manipulation Detection
por: Sun, Zhihao, et al.
Publicado: (2024)
por: Sun, Zhihao, et al.
Publicado: (2024)
Bridging Compressed Image Latents and Multimodal Large Language Models
por: Kao, Chia-Hao, et al.
Publicado: (2024)
por: Kao, Chia-Hao, et al.
Publicado: (2024)
Fairness-Aware Fine-Tuning of Vision-Language Models for Medical Glaucoma Diagnosis
por: Gu, Zijian, et al.
Publicado: (2025)
por: Gu, Zijian, et al.
Publicado: (2025)
Fine-Tuning a Large Vision-Language Model for Artwork's Scoring and Critique
por: Zhang, Zhehan, et al.
Publicado: (2026)
por: Zhang, Zhehan, et al.
Publicado: (2026)
Hallucination-Aware Multimodal Benchmark for Gastrointestinal Image Analysis with Large Vision-Language Models
por: Khanal, Bidur, et al.
Publicado: (2025)
por: Khanal, Bidur, et al.
Publicado: (2025)
Towards Large-scale Chemical Reaction Image Parsing via a Multimodal Large Language Model
por: Chen, Yufan, et al.
Publicado: (2025)
por: Chen, Yufan, et al.
Publicado: (2025)
Can Language Beat Numerical Regression? Language-Based Multimodal Trajectory Prediction
por: Bae, Inhwan, et al.
Publicado: (2024)
por: Bae, Inhwan, et al.
Publicado: (2024)
Uncertainty-Aware Vision-Language Segmentation for Medical Imaging
por: Das, Aryan, et al.
Publicado: (2026)
por: Das, Aryan, et al.
Publicado: (2026)
ImageChain: Advancing Sequential Image-to-Text Reasoning in Multimodal Large Language Models
por: Villegas, Danae Sánchez, et al.
Publicado: (2025)
por: Villegas, Danae Sánchez, et al.
Publicado: (2025)
Towards Understanding Multimodal Fine-Tuning: Spatial Features
por: Naghashyar, Lachin, et al.
Publicado: (2026)
por: Naghashyar, Lachin, et al.
Publicado: (2026)
Introducing Visual Perception Token into Multimodal Large Language Model
por: Yu, Runpeng, et al.
Publicado: (2025)
por: Yu, Runpeng, et al.
Publicado: (2025)
Visual Prompting in Multimodal Large Language Models: A Survey
por: Wu, Junda, et al.
Publicado: (2024)
por: Wu, Junda, et al.
Publicado: (2024)
Enhancing Consistency-Based Image Generation via Adversarialy-Trained Classification and Energy-Based Discrimination
por: Golan, Shelly, et al.
Publicado: (2024)
por: Golan, Shelly, et al.
Publicado: (2024)
pFedMMA: Personalized Federated Fine-Tuning with Multi-Modal Adapter for Vision-Language Models
por: Ghiasvand, Sajjad, et al.
Publicado: (2025)
por: Ghiasvand, Sajjad, et al.
Publicado: (2025)
To See is Not to Learn: Protecting Multimodal Data from Unauthorized Fine-Tuning of Large Vision-Language Model
por: Zhao, Chengshuai, et al.
Publicado: (2026)
por: Zhao, Chengshuai, et al.
Publicado: (2026)
Fine-tuned Vision Language Model for Localization of Parasitic Eggs in Microscopic Images
por: Sien, Chan Hao, et al.
Publicado: (2026)
por: Sien, Chan Hao, et al.
Publicado: (2026)
Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models
por: Schlarmann, Christian, et al.
Publicado: (2024)
por: Schlarmann, Christian, et al.
Publicado: (2024)
SSAM: Singular Subspace Alignment for Merging Multimodal Large Language Models
por: Reza, Md Kaykobad, et al.
Publicado: (2026)
por: Reza, Md Kaykobad, et al.
Publicado: (2026)
How Does Fine-Tuning Impact Out-of-Distribution Detection for Vision-Language Models?
por: Ming, Yifei, et al.
Publicado: (2023)
por: Ming, Yifei, et al.
Publicado: (2023)
ImageNet-Think-250K: A Large-Scale Synthetic Dataset for Multimodal Reasoning for Vision Language Models
por: Chitty-Venkata, Krishna Teja, et al.
Publicado: (2025)
por: Chitty-Venkata, Krishna Teja, et al.
Publicado: (2025)
LaVy: Vietnamese Multimodal Large Language Model
por: Tran, Chi, et al.
Publicado: (2024)
por: Tran, Chi, et al.
Publicado: (2024)
Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning
por: Zhai, Yuexiang, et al.
Publicado: (2024)
por: Zhai, Yuexiang, et al.
Publicado: (2024)
ChemVLM: Exploring the Power of Multimodal Large Language Models in Chemistry Area
por: Li, Junxian, et al.
Publicado: (2024)
por: Li, Junxian, et al.
Publicado: (2024)
Visual-Guided Key-Token Regularization for Multimodal Large Language Model Unlearning
por: Cai, Chengyi, et al.
Publicado: (2026)
por: Cai, Chengyi, et al.
Publicado: (2026)
Predictive Regularization Against Visual Representation Degradation in Multimodal Large Language Models
por: Wang, Enguang, et al.
Publicado: (2026)
por: Wang, Enguang, et al.
Publicado: (2026)
Enhancing Multimodal Large Language Models for Safety-Critical Driving Video Analysis
por: Trinci, Tomaso, et al.
Publicado: (2026)
por: Trinci, Tomaso, et al.
Publicado: (2026)
WorldVQA: Measuring Atomic World Knowledge in Multimodal Large Language Models
por: Zhou, Runjie, et al.
Publicado: (2026)
por: Zhou, Runjie, et al.
Publicado: (2026)
Bridging the Visual Gap: Fine-Tuning Multimodal Models with Knowledge-Adapted Captions
por: Yanuka, Moran, et al.
Publicado: (2024)
por: Yanuka, Moran, et al.
Publicado: (2024)
Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning
por: Jie, Shibo, et al.
Publicado: (2024)
por: Jie, Shibo, et al.
Publicado: (2024)
AEGIS: Anchor-Enforced Gradient Isolation for Knowledge-Preserving Vision-Language-Action Fine-Tuning
por: Singh, Guransh
Publicado: (2026)
por: Singh, Guransh
Publicado: (2026)
SlimDiff: Training-Free, Activation-Guided Hands-free Slimming of Diffusion Models
por: Roy, Arani, et al.
Publicado: (2025)
por: Roy, Arani, et al.
Publicado: (2025)
Improving Multimodal Large Language Models Using Continual Learning
por: Srivastava, Shikhar, et al.
Publicado: (2024)
por: Srivastava, Shikhar, et al.
Publicado: (2024)
On Domain-Adaptive Post-Training for Multimodal Large Language Models
por: Cheng, Daixuan, et al.
Publicado: (2024)
por: Cheng, Daixuan, et al.
Publicado: (2024)
Grounding Multimodal Large Language Models with Quantitative Skin Attributes: A Retrieval Study
por: Torop, Max, et al.
Publicado: (2025)
por: Torop, Max, et al.
Publicado: (2025)
Ejemplares similares
-
Prompt Tuning Vision Language Models with Margin Regularizer for Few-Shot Learning under Distribution Shifts
por: Brahma, Debarshi, et al.
Publicado: (2025) -
CLEFT: Language-Image Contrastive Learning with Efficient Large Language Model and Prompt Fine-Tuning
por: Du, Yuexi, et al.
Publicado: (2024) -
Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models
por: Xu, Qinwu, et al.
Publicado: (2026) -
Self-Captioning Multimodal Interaction Tuning: Amplifying Exploitable Redundancies for Robust Vision Language Models
por: Ryan, Yuriel, et al.
Publicado: (2026) -
FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models
por: Zheng, Weiying, et al.
Publicado: (2025)