GalleryGPT: Analyzing Paintings with Large Multimodal Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Bin, Yi, Shi, Wenhao, Ding, Yujuan, Hu, Zhiqiang, Wang, Zheng, Yang, Yang, Ng, See-Kiong, Shen, Heng Tao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Leveraging Weak Cross-Modal Guidance for Coherence Modelling via Iterative Learning
von: Bin, Yi, et al.
Veröffentlicht: (2024)
von: Bin, Yi, et al.
Veröffentlicht: (2024)
Multimodal Mathematical Reasoning with Diverse Solving Perspective
von: Shi, Wenhao, et al.
Veröffentlicht: (2025)
von: Shi, Wenhao, et al.
Veröffentlicht: (2025)
SemCORE: A Semantic-Enhanced Generative Cross-Modal Retrieval Framework with MLLMs
von: Li, Haoxuan, et al.
Veröffentlicht: (2025)
von: Li, Haoxuan, et al.
Veröffentlicht: (2025)
FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs
von: Chen, Qian, et al.
Veröffentlicht: (2026)
von: Chen, Qian, et al.
Veröffentlicht: (2026)
Principled Multimodal Representation Learning
von: Liu, Xiaohao, et al.
Veröffentlicht: (2025)
von: Liu, Xiaohao, et al.
Veröffentlicht: (2025)
D-Judge: How Far Are We? Assessing the Discrepancies Between AI-synthesized and Natural Images through Multimodal Guidance
von: Liu, Renyang, et al.
Veröffentlicht: (2024)
von: Liu, Renyang, et al.
Veröffentlicht: (2024)
Calibrated Multimodal Representation Learning with Missing Modalities
von: Liu, Xiaohao, et al.
Veröffentlicht: (2025)
von: Liu, Xiaohao, et al.
Veröffentlicht: (2025)
ChartAdapter: Large Vision-Language Model for Chart Summarization
von: Xu, Peixin, et al.
Veröffentlicht: (2024)
von: Xu, Peixin, et al.
Veröffentlicht: (2024)
PetalView: Fine-grained Location and Orientation Extraction of Street-view Images via Cross-view Local Search with Supplementary Materials
von: Hu, Wenmiao, et al.
Veröffentlicht: (2024)
von: Hu, Wenmiao, et al.
Veröffentlicht: (2024)
Listening to the Unspoken: Exploring "365" Aspects of Multimodal Interview Performance Assessment
von: Li, Jia, et al.
Veröffentlicht: (2025)
von: Li, Jia, et al.
Veröffentlicht: (2025)
ArchGPT: Understanding the World's Architectures with Large Multimodal Models
von: Wang, Yuze, et al.
Veröffentlicht: (2025)
von: Wang, Yuze, et al.
Veröffentlicht: (2025)
OralGPT-Omni: A Versatile Dental Multimodal Large Language Model
von: Hao, Jing, et al.
Veröffentlicht: (2025)
von: Hao, Jing, et al.
Veröffentlicht: (2025)
Every Painting Awakened: A Training-free Framework for Painting-to-Animation Generation
von: Liu, Lingyu, et al.
Veröffentlicht: (2025)
von: Liu, Lingyu, et al.
Veröffentlicht: (2025)
Math-LLaVA: Bootstrapping Mathematical Reasoning for Multimodal Large Language Models
von: Shi, Wenhao, et al.
Veröffentlicht: (2024)
von: Shi, Wenhao, et al.
Veröffentlicht: (2024)
DiffBrush:Just Painting the Art by Your Hands
von: Chu, Jiaming, et al.
Veröffentlicht: (2025)
von: Chu, Jiaming, et al.
Veröffentlicht: (2025)
mPLUG-PaperOwl: Scientific Diagram Analysis with the Multimodal Large Language Model
von: Hu, Anwen, et al.
Veröffentlicht: (2023)
von: Hu, Anwen, et al.
Veröffentlicht: (2023)
P2P: Automated Paper-to-Poster Generation and Fine-Grained Benchmark
von: Sun, Tao, et al.
Veröffentlicht: (2025)
von: Sun, Tao, et al.
Veröffentlicht: (2025)
Look, Compare and Draw: Differential Query Transformer for Automatic Oil Painting
von: Liu, Lingyu, et al.
Veröffentlicht: (2026)
von: Liu, Lingyu, et al.
Veröffentlicht: (2026)
GPT-4V with Emotion: A Zero-shot Benchmark for Generalized Emotion Recognition
von: Lian, Zheng, et al.
Veröffentlicht: (2023)
von: Lian, Zheng, et al.
Veröffentlicht: (2023)
Distilling Implicit Multimodal Knowledge into Large Language Models for Zero-Resource Dialogue Generation
von: Zhang, Bo, et al.
Veröffentlicht: (2024)
von: Zhang, Bo, et al.
Veröffentlicht: (2024)
Multimodal Learning on Low-Quality Data with Conformal Predictive Self-Calibration
von: Jiang, Xun, et al.
Veröffentlicht: (2026)
von: Jiang, Xun, et al.
Veröffentlicht: (2026)
Explainable Multimodal Emotion Recognition
von: Lian, Zheng, et al.
Veröffentlicht: (2023)
von: Lian, Zheng, et al.
Veröffentlicht: (2023)
Nutrition Estimation for Dietary Management: A Transformer Approach with Depth Sensing
von: Kwan, Zhengyi, et al.
Veröffentlicht: (2024)
von: Kwan, Zhengyi, et al.
Veröffentlicht: (2024)
Analyzing Diffusion and Autoregressive Vision Language Models in Multimodal Embedding Space
von: Wang, Zihang, et al.
Veröffentlicht: (2026)
von: Wang, Zihang, et al.
Veröffentlicht: (2026)
Video2Roleplay: A Multimodal Dataset and Framework for Video-Guided Role-playing Agents
von: Zhang, Xueqiao, et al.
Veröffentlicht: (2025)
von: Zhang, Xueqiao, et al.
Veröffentlicht: (2025)
Seeing Sarcasm Through Different Eyes: Analyzing Multimodal Sarcasm Perception in Large Vision-Language Models
von: Chen, Junjie, et al.
Veröffentlicht: (2025)
von: Chen, Junjie, et al.
Veröffentlicht: (2025)
Towards Training-free Multimodal Hate Localisation with Large Language Models
von: Sun, Yueming, et al.
Veröffentlicht: (2026)
von: Sun, Yueming, et al.
Veröffentlicht: (2026)
SafePaint: Anti-forensic Image Inpainting with Domain Adaptation
von: Chen, Dunyun, et al.
Veröffentlicht: (2024)
von: Chen, Dunyun, et al.
Veröffentlicht: (2024)
MindCine: Multimodal EEG-to-Video Reconstruction with Large-Scale Pretrained Models
von: Zhou, Tian-Yi, et al.
Veröffentlicht: (2026)
von: Zhou, Tian-Yi, et al.
Veröffentlicht: (2026)
SOMONITOR: Combining Explainable AI & Large Language Models for Marketing Analytics
von: Farseev, Aleksandr, et al.
Veröffentlicht: (2024)
von: Farseev, Aleksandr, et al.
Veröffentlicht: (2024)
Evaluating Multimodal Large Language Models on Spoken Sarcasm Understanding
von: Li, Zhu, et al.
Veröffentlicht: (2025)
von: Li, Zhu, et al.
Veröffentlicht: (2025)
Grounded Chain-of-Thought for Multimodal Large Language Models
von: Wu, Qiong, et al.
Veröffentlicht: (2025)
von: Wu, Qiong, et al.
Veröffentlicht: (2025)
Anim-Director: A Large Multimodal Model Powered Agent for Controllable Animation Video Generation
von: Li, Yunxin, et al.
Veröffentlicht: (2024)
von: Li, Yunxin, et al.
Veröffentlicht: (2024)
Benchmarking Multimodal Large Language Models for Missing Modality Completion in Product Catalogues
von: Fu, Junchen, et al.
Veröffentlicht: (2026)
von: Fu, Junchen, et al.
Veröffentlicht: (2026)
Mutual Information-based Representations Disentanglement for Unaligned Multimodal Language Sequences
von: Qian, Fan, et al.
Veröffentlicht: (2024)
von: Qian, Fan, et al.
Veröffentlicht: (2024)
UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation
von: Chen, Yanzhe, et al.
Veröffentlicht: (2025)
von: Chen, Yanzhe, et al.
Veröffentlicht: (2025)
MEDTalk: Multimodal Controlled 3D Facial Animation with Dynamic Emotions by Disentangled Embedding
von: Liu, Chang, et al.
Veröffentlicht: (2025)
von: Liu, Chang, et al.
Veröffentlicht: (2025)
Multimodal Infusion Tuning for Large Models
von: Sun, Hao, et al.
Veröffentlicht: (2024)
von: Sun, Hao, et al.
Veröffentlicht: (2024)
SLAM-LLM: A Modular, Open-Source Multimodal Large Language Model Framework and Best Practice for Speech, Language, Audio and Music Processing
von: Ma, Ziyang, et al.
Veröffentlicht: (2026)
von: Ma, Ziyang, et al.
Veröffentlicht: (2026)
SIN-Bench: Tracing Native Evidence Chains in Long-Context Multimodal Scientific Interleaved Literature
von: Ren, Yiming, et al.
Veröffentlicht: (2026)
von: Ren, Yiming, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Leveraging Weak Cross-Modal Guidance for Coherence Modelling via Iterative Learning
von: Bin, Yi, et al.
Veröffentlicht: (2024) -
Multimodal Mathematical Reasoning with Diverse Solving Perspective
von: Shi, Wenhao, et al.
Veröffentlicht: (2025) -
SemCORE: A Semantic-Enhanced Generative Cross-Modal Retrieval Framework with MLLMs
von: Li, Haoxuan, et al.
Veröffentlicht: (2025) -
FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs
von: Chen, Qian, et al.
Veröffentlicht: (2026) -
Principled Multimodal Representation Learning
von: Liu, Xiaohao, et al.
Veröffentlicht: (2025)