Training A Small Emotional Vision Language Model for Visual Art Comprehension
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Jing, Zheng, Liang, Wang, Meng, Guo, Dan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EmoSEM: Segment and Explain Emotion Stimuli in Visual Art
di: Zhang, Jing, et al.
Pubblicazione: (2025)
di: Zhang, Jing, et al.
Pubblicazione: (2025)
A Comprehensive Analysis for Visual Object Hallucination in Large Vision-Language Models
di: Jing, Liqiang, et al.
Pubblicazione: (2025)
di: Jing, Liqiang, et al.
Pubblicazione: (2025)
REVAL: A Comprehension Evaluation on Reliability and Values of Large Vision-Language Models
di: Zhang, Jie, et al.
Pubblicazione: (2025)
di: Zhang, Jie, et al.
Pubblicazione: (2025)
Small Language Model Meets with Reinforced Vision Vocabulary
di: Wei, Haoran, et al.
Pubblicazione: (2024)
di: Wei, Haoran, et al.
Pubblicazione: (2024)
Emotion Separation and Recognition from a Facial Expression by Generating the Poker Face with Vision Transformers
di: Li, Jia, et al.
Pubblicazione: (2022)
di: Li, Jia, et al.
Pubblicazione: (2022)
Evaluating Attribute Comprehension in Large Vision-Language Models
di: Zhang, Haiwen, et al.
Pubblicazione: (2024)
di: Zhang, Haiwen, et al.
Pubblicazione: (2024)
RelationVLM: Making Large Vision-Language Models Understand Visual Relations
di: Huang, Zhipeng, et al.
Pubblicazione: (2024)
di: Huang, Zhipeng, et al.
Pubblicazione: (2024)
IllusionBench+: A Large-scale and Comprehensive Benchmark for Visual Illusion Understanding in Vision-Language Models
di: Zhang, Yiming, et al.
Pubblicazione: (2025)
di: Zhang, Yiming, et al.
Pubblicazione: (2025)
Efficient-VLN: A Training-Efficient Vision-Language Navigation Model
di: Zheng, Duo, et al.
Pubblicazione: (2025)
di: Zheng, Duo, et al.
Pubblicazione: (2025)
Enhancing Large Vision Language Models with Self-Training on Image Comprehension
di: Deng, Yihe, et al.
Pubblicazione: (2024)
di: Deng, Yihe, et al.
Pubblicazione: (2024)
Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models
di: Niu, Junbo, et al.
Pubblicazione: (2025)
di: Niu, Junbo, et al.
Pubblicazione: (2025)
On the Explainability of Vision-Language Models in Art History
di: Schneider, Stefanie
Pubblicazione: (2026)
di: Schneider, Stefanie
Pubblicazione: (2026)
FTibSuite: A Comprehensive Resource Suite for Tibetan Vision-Language Modeling
di: Xu, Guixian, et al.
Pubblicazione: (2026)
di: Xu, Guixian, et al.
Pubblicazione: (2026)
Visual Adversarial Attack on Vision-Language Models for Autonomous Driving
di: Zhang, Tianyuan, et al.
Pubblicazione: (2024)
di: Zhang, Tianyuan, et al.
Pubblicazione: (2024)
VLRMBench: A Comprehensive and Challenging Benchmark for Vision-Language Reward Models
di: Ruan, Jiacheng, et al.
Pubblicazione: (2025)
di: Ruan, Jiacheng, et al.
Pubblicazione: (2025)
Evaluating Vision-Language Models for Emotion Recognition
di: Bhattacharyya, Sree, et al.
Pubblicazione: (2025)
di: Bhattacharyya, Sree, et al.
Pubblicazione: (2025)
LLMind: Bio-inspired Training-free Adaptive Visual Representations for Vision-Language Models
di: Debnath, Soumyaratna, et al.
Pubblicazione: (2026)
di: Debnath, Soumyaratna, et al.
Pubblicazione: (2026)
Adaptive-VoCo: Complexity-Aware Visual Token Compression for Vision-Language Models
di: Guo, Xiaoyang, et al.
Pubblicazione: (2025)
di: Guo, Xiaoyang, et al.
Pubblicazione: (2025)
VLA-IAP: Training-Free Visual Token Pruning via Interaction Alignment for Vision-Language-Action Models
di: Cheng, Jintao, et al.
Pubblicazione: (2026)
di: Cheng, Jintao, et al.
Pubblicazione: (2026)
SC-Tune: Unleashing Self-Consistent Referential Comprehension in Large Vision Language Models
di: Yue, Tongtian, et al.
Pubblicazione: (2024)
di: Yue, Tongtian, et al.
Pubblicazione: (2024)
Enhancing Visual Grounding and Generalization: A Multi-Task Cycle Training Approach for Vision-Language Models
di: Yang, Xiaoyu, et al.
Pubblicazione: (2023)
di: Yang, Xiaoyu, et al.
Pubblicazione: (2023)
Contextual Emotion Recognition using Large Vision Language Models
di: Etesam, Yasaman, et al.
Pubblicazione: (2024)
di: Etesam, Yasaman, et al.
Pubblicazione: (2024)
Can MLLMs Reason Beyond Language? VisReason: A Comprehensive Benchmark for Vision-Centric Reasoning
di: Guo, Longteng, et al.
Pubblicazione: (2026)
di: Guo, Longteng, et al.
Pubblicazione: (2026)
InternSpatial: A Comprehensive Dataset for Spatial Reasoning in Vision-Language Models
di: Deng, Nianchen, et al.
Pubblicazione: (2025)
di: Deng, Nianchen, et al.
Pubblicazione: (2025)
Remote Sensing SpatioTemporal Vision-Language Models: A Comprehensive Survey
di: Liu, Chenyang, et al.
Pubblicazione: (2024)
di: Liu, Chenyang, et al.
Pubblicazione: (2024)
Have Large Vision-Language Models Mastered Art History?
di: Strafforello, Ombretta, et al.
Pubblicazione: (2024)
di: Strafforello, Ombretta, et al.
Pubblicazione: (2024)
Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models
di: Chae, Hyunsik, et al.
Pubblicazione: (2025)
di: Chae, Hyunsik, et al.
Pubblicazione: (2025)
Switch-KD: Visual-Switch Knowledge Distillation for Vision-Language Models
di: Sun, Haoyi, et al.
Pubblicazione: (2026)
di: Sun, Haoyi, et al.
Pubblicazione: (2026)
Depth-Wise Convolutions in Vision Transformers for Efficient Training on Small Datasets
di: Zhang, Tianxiao, et al.
Pubblicazione: (2024)
di: Zhang, Tianxiao, et al.
Pubblicazione: (2024)
Visual Affect Analysis: Predicting Emotions of Image Viewers with Vision-Language Models
di: Nowicki, Filip, et al.
Pubblicazione: (2026)
di: Nowicki, Filip, et al.
Pubblicazione: (2026)
Revealing the Power of Post-Training for Small Language Models via Knowledge Distillation
di: Rang, Miao, et al.
Pubblicazione: (2025)
di: Rang, Miao, et al.
Pubblicazione: (2025)
HERO: Rethinking Visual Token Early Dropping in High-Resolution Large Vision-Language Models
di: Li, Xu, et al.
Pubblicazione: (2025)
di: Li, Xu, et al.
Pubblicazione: (2025)
Focusing Where Vision Matters: Selective Training for Large Vision Language Models via Visual Information Gain
di: Lee, Seulbi, et al.
Pubblicazione: (2026)
di: Lee, Seulbi, et al.
Pubblicazione: (2026)
MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI
di: Ying, Kaining, et al.
Pubblicazione: (2024)
di: Ying, Kaining, et al.
Pubblicazione: (2024)
Towards Training-free Anomaly Detection with Vision and Language Foundation Models
di: Zhang, Jinjin, et al.
Pubblicazione: (2025)
di: Zhang, Jinjin, et al.
Pubblicazione: (2025)
JARVIS-VLA: Post-Training Large-Scale Vision Language Models to Play Visual Games with Keyboards and Mouse
di: Li, Muyao, et al.
Pubblicazione: (2025)
di: Li, Muyao, et al.
Pubblicazione: (2025)
IKOD: Mitigating Visual Attention Degradation in Large Vision-Language Models
di: Yang, Jiabing, et al.
Pubblicazione: (2025)
di: Yang, Jiabing, et al.
Pubblicazione: (2025)
Visual-Advantage On-Policy Distillation for Vision-Language Models
di: Liu, Ruiqi, et al.
Pubblicazione: (2026)
di: Liu, Ruiqi, et al.
Pubblicazione: (2026)
DeepScan: A Training-Free Framework for Visually Grounded Reasoning in Large Vision-Language Models
di: Li, Yangfu, et al.
Pubblicazione: (2026)
di: Li, Yangfu, et al.
Pubblicazione: (2026)
Vision-Language Model IP Protection via Prompt-based Learning
di: Wang, Lianyu, et al.
Pubblicazione: (2025)
di: Wang, Lianyu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
EmoSEM: Segment and Explain Emotion Stimuli in Visual Art
di: Zhang, Jing, et al.
Pubblicazione: (2025) -
A Comprehensive Analysis for Visual Object Hallucination in Large Vision-Language Models
di: Jing, Liqiang, et al.
Pubblicazione: (2025) -
REVAL: A Comprehension Evaluation on Reliability and Values of Large Vision-Language Models
di: Zhang, Jie, et al.
Pubblicazione: (2025) -
Small Language Model Meets with Reinforced Vision Vocabulary
di: Wei, Haoran, et al.
Pubblicazione: (2024) -
Emotion Separation and Recognition from a Facial Expression by Generating the Poker Face with Vision Transformers
di: Li, Jia, et al.
Pubblicazione: (2022)