A Review of Multi-Modal Large Language and Vision Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Carolan, Kilian, Fennelly, Laura, Smeaton, Alan F. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MathGLM-Vision: Solving Mathematical Problems with Multi-Modal Large Language Model
di: Yang, Zhen, et al.
Pubblicazione: (2024)
di: Yang, Zhen, et al.
Pubblicazione: (2024)
Capturing Bias Diversity in LLMs
di: Gosavi, Purva Prasad, et al.
Pubblicazione: (2024)
di: Gosavi, Purva Prasad, et al.
Pubblicazione: (2024)
Cross-Modal Taxonomic Generalization in (Vision-) Language Models
di: Xu, Tianyang, et al.
Pubblicazione: (2026)
di: Xu, Tianyang, et al.
Pubblicazione: (2026)
Multi-Modal Fact-Verification Framework for Reducing Hallucinations in Large Language Models
di: Patel, Piyushkumar
Pubblicazione: (2025)
di: Patel, Piyushkumar
Pubblicazione: (2025)
Table as a Modality for Large Language Models
di: Li, Liyao, et al.
Pubblicazione: (2025)
di: Li, Liyao, et al.
Pubblicazione: (2025)
Towards Unified Multi-Modal Personalization: Large Vision-Language Models for Generative Recommendation and Beyond
di: Wei, Tianxin, et al.
Pubblicazione: (2024)
di: Wei, Tianxin, et al.
Pubblicazione: (2024)
Cross-Modal Safety Mechanism Transfer in Large Vision-Language Models
di: Xu, Shicheng, et al.
Pubblicazione: (2024)
di: Xu, Shicheng, et al.
Pubblicazione: (2024)
Commander-GPT: Fully Unleashing the Sarcasm Detection Capability of Multi-Modal Large Language Models
di: Zhang, Yazhou, et al.
Pubblicazione: (2025)
di: Zhang, Yazhou, et al.
Pubblicazione: (2025)
Cross-Modal Consistency in Multimodal Large Language Models
di: Zhang, Xiang, et al.
Pubblicazione: (2024)
di: Zhang, Xiang, et al.
Pubblicazione: (2024)
Augmented Vision-Language Models: A Systematic Review
di: Davis, Anthony C, et al.
Pubblicazione: (2025)
di: Davis, Anthony C, et al.
Pubblicazione: (2025)
ReviewInstruct: A Review-Driven Multi-Turn Conversations Generation Method for Large Language Models
di: Wu, Jiangxu, et al.
Pubblicazione: (2025)
di: Wu, Jiangxu, et al.
Pubblicazione: (2025)
A Multi-Stage Workflow for the Review of Marketing Content with Reasoning Large Language Models
di: Purpura, Alberto, et al.
Pubblicazione: (2025)
di: Purpura, Alberto, et al.
Pubblicazione: (2025)
Cross-Modal Knowledge Distillation for Speech Large Language Models
di: Wang, Enzhi, et al.
Pubblicazione: (2025)
di: Wang, Enzhi, et al.
Pubblicazione: (2025)
Pre-Training Curriculum for Multi-Token Prediction in Language Models
di: Aynetdinov, Ansar, et al.
Pubblicazione: (2025)
di: Aynetdinov, Ansar, et al.
Pubblicazione: (2025)
Large Language Models and Arabic Content: A Review
di: Rhel, Haneh, et al.
Pubblicazione: (2025)
di: Rhel, Haneh, et al.
Pubblicazione: (2025)
Towards a resource for multilingual lexicons: an MT assisted and human-in-the-loop multilingual parallel corpus with multi-word expression annotation
di: Han, Lifeng, et al.
Pubblicazione: (2020)
di: Han, Lifeng, et al.
Pubblicazione: (2020)
Normative Reasoning in Large Language Models: A Comparative Benchmark from Logical and Modal Perspectives
di: Ozeki, Kentaro, et al.
Pubblicazione: (2025)
di: Ozeki, Kentaro, et al.
Pubblicazione: (2025)
Large Language Models for Disease Diagnosis: A Scoping Review
di: Zhou, Shuang, et al.
Pubblicazione: (2024)
di: Zhou, Shuang, et al.
Pubblicazione: (2024)
Object Detection with Multimodal Large Vision-Language Models: An In-depth Review
di: Sapkota, Ranjan, et al.
Pubblicazione: (2025)
di: Sapkota, Ranjan, et al.
Pubblicazione: (2025)
Sample-efficient Integration of New Modalities into Large Language Models
di: İnce, Osman Batur, et al.
Pubblicazione: (2025)
di: İnce, Osman Batur, et al.
Pubblicazione: (2025)
Reference-free Hallucination Detection for Large Vision-Language Models
di: Li, Qing, et al.
Pubblicazione: (2024)
di: Li, Qing, et al.
Pubblicazione: (2024)
Multi-Modal Data Exploration via Language Agents
di: Nooralahzadeh, Farhad, et al.
Pubblicazione: (2024)
di: Nooralahzadeh, Farhad, et al.
Pubblicazione: (2024)
Be My Eyes: Extending Large Language Models to New Modalities Through Multi-Agent Collaboration
di: Huang, James Y., et al.
Pubblicazione: (2025)
di: Huang, James Y., et al.
Pubblicazione: (2025)
Towards Efficient Large Language Models for Scientific Text: A Review
di: To, Huy Quoc, et al.
Pubblicazione: (2024)
di: To, Huy Quoc, et al.
Pubblicazione: (2024)
Achieving Peak Performance for Large Language Models: A Systematic Review
di: Rostam, Zhyar Rzgar K, et al.
Pubblicazione: (2024)
di: Rostam, Zhyar Rzgar K, et al.
Pubblicazione: (2024)
ML-Mamba: Efficient Multi-Modal Large Language Model Utilizing Mamba-2
di: Huang, Wenjun, et al.
Pubblicazione: (2024)
di: Huang, Wenjun, et al.
Pubblicazione: (2024)
Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models
di: Huang, Chengyue, et al.
Pubblicazione: (2025)
di: Huang, Chengyue, et al.
Pubblicazione: (2025)
Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement
di: Wang, Xiyao, et al.
Pubblicazione: (2024)
di: Wang, Xiyao, et al.
Pubblicazione: (2024)
A Multi-Perspective Analysis of Memorization in Large Language Models
di: Chen, Bowen, et al.
Pubblicazione: (2024)
di: Chen, Bowen, et al.
Pubblicazione: (2024)
CCHall: A Novel Benchmark for Joint Cross-Lingual and Cross-Modal Hallucinations Detection in Large Language Models
di: Zhang, Yongheng, et al.
Pubblicazione: (2025)
di: Zhang, Yongheng, et al.
Pubblicazione: (2025)
Probing the Robustness of Theory of Mind in Large Language Models
di: Nickel, Christian, et al.
Pubblicazione: (2024)
di: Nickel, Christian, et al.
Pubblicazione: (2024)
Evaluating the Meta- and Object-Level Reasoning of Large Language Models for Question Answering
di: Ferguson, Nick, et al.
Pubblicazione: (2025)
di: Ferguson, Nick, et al.
Pubblicazione: (2025)
Multi-Object Hallucination in Vision-Language Models
di: Chen, Xuweiyi, et al.
Pubblicazione: (2024)
di: Chen, Xuweiyi, et al.
Pubblicazione: (2024)
From Text to Transformation: A Comprehensive Review of Large Language Models' Versatility
di: Kaur, Pravneet, et al.
Pubblicazione: (2024)
di: Kaur, Pravneet, et al.
Pubblicazione: (2024)
Benchmarking Deflection and Hallucination in Large Vision-Language Models
di: Moratelli, Nicholas, et al.
Pubblicazione: (2026)
di: Moratelli, Nicholas, et al.
Pubblicazione: (2026)
Bias in Large Language Models Across Clinical Applications: A Systematic Review
di: Suenghataiphorn, Thanathip, et al.
Pubblicazione: (2025)
di: Suenghataiphorn, Thanathip, et al.
Pubblicazione: (2025)
MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning
di: Zhao, Haozhe, et al.
Pubblicazione: (2023)
di: Zhao, Haozhe, et al.
Pubblicazione: (2023)
Large Language Model for Mental Health: A Systematic Review
di: Guo, Zhijun, et al.
Pubblicazione: (2024)
di: Guo, Zhijun, et al.
Pubblicazione: (2024)
SAM4MLLM: Enhance Multi-Modal Large Language Model for Referring Expression Segmentation
di: Chen, Yi-Chia, et al.
Pubblicazione: (2024)
di: Chen, Yi-Chia, et al.
Pubblicazione: (2024)
Multi-Programming Language Ensemble for Code Generation in Large Language Model
di: Xue, Tengfei, et al.
Pubblicazione: (2024)
di: Xue, Tengfei, et al.
Pubblicazione: (2024)
Documenti analoghi
-
MathGLM-Vision: Solving Mathematical Problems with Multi-Modal Large Language Model
di: Yang, Zhen, et al.
Pubblicazione: (2024) -
Capturing Bias Diversity in LLMs
di: Gosavi, Purva Prasad, et al.
Pubblicazione: (2024) -
Cross-Modal Taxonomic Generalization in (Vision-) Language Models
di: Xu, Tianyang, et al.
Pubblicazione: (2026) -
Multi-Modal Fact-Verification Framework for Reducing Hallucinations in Large Language Models
di: Patel, Piyushkumar
Pubblicazione: (2025) -
Table as a Modality for Large Language Models
di: Li, Liyao, et al.
Pubblicazione: (2025)