Fine-Tuning a Large Vision-Language Model for Artwork's Scoring and Critique
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Zhehan, Qian, Meihua, Luo, Li, Huang, Siyu, Zhou, Chaoyi, Saha, Ripon, Song, Xinxin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Using a CNN Model to Assess Paintings' Creativity
di: Zhang, Zhehan, et al.
Pubblicazione: (2024)
di: Zhang, Zhehan, et al.
Pubblicazione: (2024)
Learning to Synthesize Graphics Programs for Geometric Artworks
di: Bing, Qi, et al.
Pubblicazione: (2024)
di: Bing, Qi, et al.
Pubblicazione: (2024)
3DGS-Enhancer: Enhancing Unbounded 3D Gaussian Splatting with View-consistent 2D Diffusion Priors
di: Liu, Xi, et al.
Pubblicazione: (2024)
di: Liu, Xi, et al.
Pubblicazione: (2024)
Fine-Tuning Vision-Language Models for Visual Navigation Assistance
di: Li, Xiao, et al.
Pubblicazione: (2025)
di: Li, Xiao, et al.
Pubblicazione: (2025)
Towards Calibrated Robust Fine-Tuning of Vision-Language Models
di: Oh, Changdae, et al.
Pubblicazione: (2023)
di: Oh, Changdae, et al.
Pubblicazione: (2023)
Hierarchy-Aware Fine-Tuning of Vision-Language Models
di: Li, Jiayu, et al.
Pubblicazione: (2025)
di: Li, Jiayu, et al.
Pubblicazione: (2025)
Towards Artwork Explanation in Large-scale Vision Language Models
di: Hayashi, Kazuki, et al.
Pubblicazione: (2024)
di: Hayashi, Kazuki, et al.
Pubblicazione: (2024)
Efficient Prompt Tuning of Large Vision-Language Model for Fine-Grained Ship Classification
di: Lan, Long, et al.
Pubblicazione: (2024)
di: Lan, Long, et al.
Pubblicazione: (2024)
Multimodal Carotid Risk Stratification with Large Vision-Language Models: Benchmarking, Fine-Tuning, and Clinical Insights
di: Tsolissou, Daphne, et al.
Pubblicazione: (2025)
di: Tsolissou, Daphne, et al.
Pubblicazione: (2025)
Remodeling Semantic Relationships in Vision-Language Fine-Tuning
di: Wu, Xiangyang, et al.
Pubblicazione: (2025)
di: Wu, Xiangyang, et al.
Pubblicazione: (2025)
Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models
di: Schlarmann, Christian, et al.
Pubblicazione: (2024)
di: Schlarmann, Christian, et al.
Pubblicazione: (2024)
3D-Aware Vision-Language Models Fine-Tuning with Geometric Distillation
di: Lee, Seonho, et al.
Pubblicazione: (2025)
di: Lee, Seonho, et al.
Pubblicazione: (2025)
Fine-Tuning Vision-Language Model for Automated Engineering Drawing Information Extraction
di: Khan, Muhammad Tayyab, et al.
Pubblicazione: (2024)
di: Khan, Muhammad Tayyab, et al.
Pubblicazione: (2024)
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
di: Tan, Huajie, et al.
Pubblicazione: (2025)
di: Tan, Huajie, et al.
Pubblicazione: (2025)
ViGoR: Improving Visual Grounding of Large Vision Language Models with Fine-Grained Reward Modeling
di: Yan, Siming, et al.
Pubblicazione: (2024)
di: Yan, Siming, et al.
Pubblicazione: (2024)
GRE Suite: Geo-localization Inference via Fine-Tuned Vision-Language Models and Enhanced Reasoning Chains
di: Wang, Chun, et al.
Pubblicazione: (2025)
di: Wang, Chun, et al.
Pubblicazione: (2025)
FILA: Fine-Grained Vision Language Models
di: Zhu, Shiding, et al.
Pubblicazione: (2024)
di: Zhu, Shiding, et al.
Pubblicazione: (2024)
Fine-tuning Pre-trained Vision-Language Models in a Human-Annotation-Free Manner
di: Wang, Qian-Wei, et al.
Pubblicazione: (2026)
di: Wang, Qian-Wei, et al.
Pubblicazione: (2026)
RaVL: Discovering and Mitigating Spurious Correlations in Fine-Tuned Vision-Language Models
di: Varma, Maya, et al.
Pubblicazione: (2024)
di: Varma, Maya, et al.
Pubblicazione: (2024)
Is There Knowledge Left to Extract? Evidence of Fragility in Medically Fine-Tuned Vision-Language Models
di: McLaughlin, Oliver, et al.
Pubblicazione: (2026)
di: McLaughlin, Oliver, et al.
Pubblicazione: (2026)
FairLLaVA: Fairness-Aware Parameter-Efficient Fine-Tuning for Large Vision-Language Assistants
di: Bhosale, Mahesh, et al.
Pubblicazione: (2026)
di: Bhosale, Mahesh, et al.
Pubblicazione: (2026)
Attribute-Grounded Selective Reasoning for Artwork Emotion Understanding with Multimodal Large Language Models
di: Zhang, Cheng, et al.
Pubblicazione: (2026)
di: Zhang, Cheng, et al.
Pubblicazione: (2026)
BoxTuning: Directly Injecting the Object Box for Multimodal Model Fine-Tuning
di: Qian, Zekun, et al.
Pubblicazione: (2026)
di: Qian, Zekun, et al.
Pubblicazione: (2026)
KnobGen: Controlling the Sophistication of Artwork in Sketch-Based Diffusion Models
di: Navard, Pouyan, et al.
Pubblicazione: (2024)
di: Navard, Pouyan, et al.
Pubblicazione: (2024)
Delineating Knowledge Boundaries for Honest Large Vision-Language Models
di: Song, Junru, et al.
Pubblicazione: (2026)
di: Song, Junru, et al.
Pubblicazione: (2026)
Latent Radiance Fields with 3D-aware 2D Representations
di: Zhou, Chaoyi, et al.
Pubblicazione: (2025)
di: Zhou, Chaoyi, et al.
Pubblicazione: (2025)
SkySenseGPT: A Fine-Grained Instruction Tuning Dataset and Model for Remote Sensing Vision-Language Understanding
di: Luo, Junwei, et al.
Pubblicazione: (2024)
di: Luo, Junwei, et al.
Pubblicazione: (2024)
Multimodal Causal Reasoning Benchmark: Challenging Vision Large Language Models to Discern Causal Links Across Modalities
di: Li, Zhiyuan, et al.
Pubblicazione: (2024)
di: Li, Zhiyuan, et al.
Pubblicazione: (2024)
Rethinking Token Reduction for Large Vision-Language Models
di: Wang, Yi, et al.
Pubblicazione: (2026)
di: Wang, Yi, et al.
Pubblicazione: (2026)
Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models
di: Sun, Haoyuan, et al.
Pubblicazione: (2025)
di: Sun, Haoyuan, et al.
Pubblicazione: (2025)
Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning
di: Zhai, Yuexiang, et al.
Pubblicazione: (2024)
di: Zhai, Yuexiang, et al.
Pubblicazione: (2024)
PAS : Prelim Attention Score for Detecting Object Hallucinations in Large Vision--Language Models
di: Hoang-Xuan, Nhat, et al.
Pubblicazione: (2025)
di: Hoang-Xuan, Nhat, et al.
Pubblicazione: (2025)
Video Generation with Consistency Tuning
di: Wang, Chaoyi, et al.
Pubblicazione: (2024)
di: Wang, Chaoyi, et al.
Pubblicazione: (2024)
A Visual Semantic Adaptive Watermark grounded by Prefix-Tuning for Large Vision-Language Model
di: Zheng, Qi, et al.
Pubblicazione: (2026)
di: Zheng, Qi, et al.
Pubblicazione: (2026)
When Large Vision-Language Model Meets Large Remote Sensing Imagery: Coarse-to-Fine Text-Guided Token Pruning
di: Luo, Junwei, et al.
Pubblicazione: (2025)
di: Luo, Junwei, et al.
Pubblicazione: (2025)
LPT: Less-overfitting Prompt Tuning for Vision-Language Model
di: Ding, Chenhao, et al.
Pubblicazione: (2024)
di: Ding, Chenhao, et al.
Pubblicazione: (2024)
FaithScore: Fine-grained Evaluations of Hallucinations in Large Vision-Language Models
di: Jing, Liqiang, et al.
Pubblicazione: (2023)
di: Jing, Liqiang, et al.
Pubblicazione: (2023)
VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning
di: Luo, Run, et al.
Pubblicazione: (2025)
di: Luo, Run, et al.
Pubblicazione: (2025)
Parameter-Efficient Fine-Tuning Medical Multimodal Large Language Models for Medical Visual Grounding
di: He, Jinlong, et al.
Pubblicazione: (2024)
di: He, Jinlong, et al.
Pubblicazione: (2024)
Probing Perceptual Constancy in Large Vision-Language Models
di: Sun, Haoran, et al.
Pubblicazione: (2025)
di: Sun, Haoran, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Using a CNN Model to Assess Paintings' Creativity
di: Zhang, Zhehan, et al.
Pubblicazione: (2024) -
Learning to Synthesize Graphics Programs for Geometric Artworks
di: Bing, Qi, et al.
Pubblicazione: (2024) -
3DGS-Enhancer: Enhancing Unbounded 3D Gaussian Splatting with View-consistent 2D Diffusion Priors
di: Liu, Xi, et al.
Pubblicazione: (2024) -
Fine-Tuning Vision-Language Models for Visual Navigation Assistance
di: Li, Xiao, et al.
Pubblicazione: (2025) -
Towards Calibrated Robust Fine-Tuning of Vision-Language Models
di: Oh, Changdae, et al.
Pubblicazione: (2023)