Explainable Search and Discovery of Visual Cultural Heritage Collections with Multimodal Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Arnold, Taylor, Tilton, Lauren |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Automated Image Color Mapping for a Historic Photographic Collection
di: Arnold, Taylor, et al.
Pubblicazione: (2024)
di: Arnold, Taylor, et al.
Pubblicazione: (2024)
Evaluation of Cultural Competence of Vision-Language Models
di: Yadav, Srishti, et al.
Pubblicazione: (2025)
di: Yadav, Srishti, et al.
Pubblicazione: (2025)
Leveraging Large Language Models for Multimodal Search
di: Barbany, Oriol, et al.
Pubblicazione: (2024)
di: Barbany, Oriol, et al.
Pubblicazione: (2024)
Enhancing Explainability in Multimodal Large Language Models Using Ontological Context
di: Amara, Jihen, et al.
Pubblicazione: (2024)
di: Amara, Jihen, et al.
Pubblicazione: (2024)
Multimodal Metadata Assignment for Cultural Heritage Artifacts
di: Rei, Luis, et al.
Pubblicazione: (2024)
di: Rei, Luis, et al.
Pubblicazione: (2024)
FaceShield: Explainable Face Anti-Spoofing with Multimodal Large Language Models
di: Wang, Hongyang, et al.
Pubblicazione: (2025)
di: Wang, Hongyang, et al.
Pubblicazione: (2025)
DuwatBench: Bridging Language and Visual Heritage through an Arabic Calligraphy Benchmark for Multimodal Understanding
di: Patle, Shubham, et al.
Pubblicazione: (2026)
di: Patle, Shubham, et al.
Pubblicazione: (2026)
Improving Visual Storytelling with Multimodal Large Language Models
di: Lin, Xiaochuan, et al.
Pubblicazione: (2024)
di: Lin, Xiaochuan, et al.
Pubblicazione: (2024)
Visual Representation Alignment for Multimodal Large Language Models
di: Yoon, Heeji, et al.
Pubblicazione: (2025)
di: Yoon, Heeji, et al.
Pubblicazione: (2025)
Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective
di: Lei, Lei, et al.
Pubblicazione: (2025)
di: Lei, Lei, et al.
Pubblicazione: (2025)
Multimodal Rationales for Explainable Visual Question Answering
di: Li, Kun, et al.
Pubblicazione: (2024)
di: Li, Kun, et al.
Pubblicazione: (2024)
Adversarial Robustness for Visual Grounding of Multimodal Large Language Models
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
INQUIRE-Search: Interactive Discovery in Large-Scale Biodiversity Databases
di: Vendrow, Edward, et al.
Pubblicazione: (2025)
di: Vendrow, Edward, et al.
Pubblicazione: (2025)
ForenX: Towards Explainable AI-Generated Image Detection with Multimodal Large Language Models
di: Tan, Chuangchuang, et al.
Pubblicazione: (2025)
di: Tan, Chuangchuang, et al.
Pubblicazione: (2025)
Accelerating Multimodal Large Language Models by Searching Optimal Vision Token Reduction
di: Zhao, Shiyu, et al.
Pubblicazione: (2024)
di: Zhao, Shiyu, et al.
Pubblicazione: (2024)
Visual Anchors Are Strong Information Aggregators For Multimodal Large Language Model
di: Liu, Haogeng, et al.
Pubblicazione: (2024)
di: Liu, Haogeng, et al.
Pubblicazione: (2024)
When Visual Privacy Protection Meets Multimodal Large Language Models
di: Hui, Xiaofei, et al.
Pubblicazione: (2026)
di: Hui, Xiaofei, et al.
Pubblicazione: (2026)
Gaussian Heritage: 3D Digitization of Cultural Heritage with Integrated Object Segmentation
di: Dahaghin, Mahtab, et al.
Pubblicazione: (2024)
di: Dahaghin, Mahtab, et al.
Pubblicazione: (2024)
Hands-Free Heritage: Automated 3D Scanning for Cultural Heritage Digitization
di: Ahmad, Javed, et al.
Pubblicazione: (2025)
di: Ahmad, Javed, et al.
Pubblicazione: (2025)
DocThinker: Explainable Multimodal Large Language Models with Rule-based Reinforcement Learning for Document Understanding
di: Yu, Wenwen, et al.
Pubblicazione: (2025)
di: Yu, Wenwen, et al.
Pubblicazione: (2025)
MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models
di: Chen, Jian, et al.
Pubblicazione: (2025)
di: Chen, Jian, et al.
Pubblicazione: (2025)
DUALVISION: RGB-Infrared Multimodal Large Language Models for Robust Visual Reasoning
di: Majeedi, Abrar, et al.
Pubblicazione: (2026)
di: Majeedi, Abrar, et al.
Pubblicazione: (2026)
AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models
di: Zhou, Ziyin, et al.
Pubblicazione: (2025)
di: Zhou, Ziyin, et al.
Pubblicazione: (2025)
Comparison of Different Deep Neural Network Models in the Cultural Heritage Domain
di: Boyadzhiev, Teodor, et al.
Pubblicazione: (2025)
di: Boyadzhiev, Teodor, et al.
Pubblicazione: (2025)
Innovator-VL: A Multimodal Large Language Model for Scientific Discovery
di: Wen, Zichen, et al.
Pubblicazione: (2026)
di: Wen, Zichen, et al.
Pubblicazione: (2026)
Enhancing Multimodal Large Language Models with Multi-instance Visual Prompt Generator for Visual Representation Enrichment
di: Zhong, Wenliang, et al.
Pubblicazione: (2024)
di: Zhong, Wenliang, et al.
Pubblicazione: (2024)
Visual Question Answering Instruction: Unlocking Multimodal Large Language Model To Domain-Specific Visual Multitasks
di: Lee, Jusung, et al.
Pubblicazione: (2024)
di: Lee, Jusung, et al.
Pubblicazione: (2024)
Automatic Pruning Discovery for Large Language Models
di: Kang, Haidong, et al.
Pubblicazione: (2025)
di: Kang, Haidong, et al.
Pubblicazione: (2025)
Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search
di: Yu, Linhao, et al.
Pubblicazione: (2025)
di: Yu, Linhao, et al.
Pubblicazione: (2025)
Bringing Multimodality to Amazon Visual Search System
di: Zhu, Xinliang, et al.
Pubblicazione: (2024)
di: Zhu, Xinliang, et al.
Pubblicazione: (2024)
Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models
di: Dong, Yuhao, et al.
Pubblicazione: (2024)
di: Dong, Yuhao, et al.
Pubblicazione: (2024)
FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression
di: Tong, Bo, et al.
Pubblicazione: (2024)
di: Tong, Bo, et al.
Pubblicazione: (2024)
VMAD: Visual-enhanced Multimodal Large Language Model for Zero-Shot Anomaly Detection
di: Deng, Huilin, et al.
Pubblicazione: (2024)
di: Deng, Huilin, et al.
Pubblicazione: (2024)
ControlMLLM: Training-Free Visual Prompt Learning for Multimodal Large Language Models
di: Wu, Mingrui, et al.
Pubblicazione: (2024)
di: Wu, Mingrui, et al.
Pubblicazione: (2024)
Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation
di: Zhu, Xingyu, et al.
Pubblicazione: (2026)
di: Zhu, Xingyu, et al.
Pubblicazione: (2026)
Seeing Is Believing? A Benchmark for Multimodal Large Language Models on Visual Illusions and Anomalies
di: Hou, Wenjin, et al.
Pubblicazione: (2026)
di: Hou, Wenjin, et al.
Pubblicazione: (2026)
GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing
di: Fang, Rongyao, et al.
Pubblicazione: (2025)
di: Fang, Rongyao, et al.
Pubblicazione: (2025)
CoVFT: Context-aware Visual Fine-tuning for Multimodal Large Language Models
di: Zhou, Nan, et al.
Pubblicazione: (2026)
di: Zhou, Nan, et al.
Pubblicazione: (2026)
VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model
di: Zhuang, Xianwei, et al.
Pubblicazione: (2025)
di: Zhuang, Xianwei, et al.
Pubblicazione: (2025)
Exploring Implicit Visual Misunderstandings in Multimodal Large Language Models through Attention Analysis
di: Wang, Pengfei, et al.
Pubblicazione: (2025)
di: Wang, Pengfei, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Automated Image Color Mapping for a Historic Photographic Collection
di: Arnold, Taylor, et al.
Pubblicazione: (2024) -
Evaluation of Cultural Competence of Vision-Language Models
di: Yadav, Srishti, et al.
Pubblicazione: (2025) -
Leveraging Large Language Models for Multimodal Search
di: Barbany, Oriol, et al.
Pubblicazione: (2024) -
Enhancing Explainability in Multimodal Large Language Models Using Ontological Context
di: Amara, Jihen, et al.
Pubblicazione: (2024) -
Multimodal Metadata Assignment for Cultural Heritage Artifacts
di: Rei, Luis, et al.
Pubblicazione: (2024)