Large Multimodal Agents: A Survey
Fuente:
arXiv
Salvato in:
| Autori principali: | Xie, Junlin, Chen, Zhihong, Zhang, Ruifei, Wan, Xiang, Li, Guanbin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Survey on Agentic Multimodal Large Language Models
di: Yao, Huanjin, et al.
Pubblicazione: (2025)
di: Yao, Huanjin, et al.
Pubblicazione: (2025)
AdaDrive: Self-Adaptive Slow-Fast System for Language-Grounded Autonomous Driving
di: Zhang, Ruifei, et al.
Pubblicazione: (2025)
di: Zhang, Ruifei, et al.
Pubblicazione: (2025)
A Survey on Evaluation of Multimodal Large Language Models
di: Huang, Jiaxing, et al.
Pubblicazione: (2024)
di: Huang, Jiaxing, et al.
Pubblicazione: (2024)
A Survey on Benchmarks of Multimodal Large Language Models
di: Li, Jian, et al.
Pubblicazione: (2024)
di: Li, Jian, et al.
Pubblicazione: (2024)
VIALM: A Survey and Benchmark of Visually Impaired Assistance with Large Models
di: Zhao, Yi, et al.
Pubblicazione: (2024)
di: Zhao, Yi, et al.
Pubblicazione: (2024)
A Survey of Multimodal Large Language Model from A Data-centric Perspective
di: Bai, Tianyi, et al.
Pubblicazione: (2024)
di: Bai, Tianyi, et al.
Pubblicazione: (2024)
RestoreAgent: Autonomous Image Restoration Agent via Multimodal Large Language Models
di: Chen, Haoyu, et al.
Pubblicazione: (2024)
di: Chen, Haoyu, et al.
Pubblicazione: (2024)
HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale
di: Chen, Junying, et al.
Pubblicazione: (2024)
di: Chen, Junying, et al.
Pubblicazione: (2024)
A Survey on Multimodal Large Language Models
di: Yin, Shukang, et al.
Pubblicazione: (2023)
di: Yin, Shukang, et al.
Pubblicazione: (2023)
Towards Rationality in Language and Multimodal Agents: A Survey
di: Jiang, Bowen, et al.
Pubblicazione: (2024)
di: Jiang, Bowen, et al.
Pubblicazione: (2024)
VisualAgentBench: Towards Large Multimodal Models as Visual Foundation Agents
di: Liu, Xiao, et al.
Pubblicazione: (2024)
di: Liu, Xiao, et al.
Pubblicazione: (2024)
DART: Leveraging Multi-Agent Disagreement for Tool Recruitment in Multimodal Reasoning
di: Sivakumaran, Nithin, et al.
Pubblicazione: (2025)
di: Sivakumaran, Nithin, et al.
Pubblicazione: (2025)
MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs
di: Fu, Chaoyou, et al.
Pubblicazione: (2024)
di: Fu, Chaoyou, et al.
Pubblicazione: (2024)
A Survey of LLM-based Agents in Medicine: How far are we from Baymax?
di: Wang, Wenxuan, et al.
Pubblicazione: (2025)
di: Wang, Wenxuan, et al.
Pubblicazione: (2025)
Personalized Multimodal Large Language Models: A Survey
di: Wu, Junda, et al.
Pubblicazione: (2024)
di: Wu, Junda, et al.
Pubblicazione: (2024)
MMInA: Benchmarking Multihop Multimodal Internet Agents
di: Tian, Shulin, et al.
Pubblicazione: (2024)
di: Tian, Shulin, et al.
Pubblicazione: (2024)
Image Matters: A New Dataset and Empirical Study for Multimodal Hyperbole Detection
di: Zhang, Huixuan, et al.
Pubblicazione: (2023)
di: Zhang, Huixuan, et al.
Pubblicazione: (2023)
The Revolution of Multimodal Large Language Models: A Survey
di: Caffagni, Davide, et al.
Pubblicazione: (2024)
di: Caffagni, Davide, et al.
Pubblicazione: (2024)
PDF-WuKong: A Large Multimodal Model for Efficient Long PDF Reading with End-to-End Sparse Sampling
di: Xie, Xudong, et al.
Pubblicazione: (2024)
di: Xie, Xudong, et al.
Pubblicazione: (2024)
How to Bridge the Gap between Modalities: Survey on Multimodal Large Language Model
di: Song, Shezheng, et al.
Pubblicazione: (2023)
di: Song, Shezheng, et al.
Pubblicazione: (2023)
Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety
di: Ma, Xingjun, et al.
Pubblicazione: (2025)
di: Ma, Xingjun, et al.
Pubblicazione: (2025)
AviationLMM: A Large Multimodal Foundation Model for Civil Aviation
di: Li, Wenbin, et al.
Pubblicazione: (2026)
di: Li, Wenbin, et al.
Pubblicazione: (2026)
MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents
di: Li, Shilong, et al.
Pubblicazione: (2025)
di: Li, Shilong, et al.
Pubblicazione: (2025)
MM-WebAgent: A Hierarchical Multimodal Web Agent for Webpage Generation
di: Li, Yan, et al.
Pubblicazione: (2026)
di: Li, Yan, et al.
Pubblicazione: (2026)
Graphic Design with Large Multimodal Model
di: Cheng, Yutao, et al.
Pubblicazione: (2024)
di: Cheng, Yutao, et al.
Pubblicazione: (2024)
Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation
di: Liang, Yupu, et al.
Pubblicazione: (2025)
di: Liang, Yupu, et al.
Pubblicazione: (2025)
Model Composition for Multimodal Large Language Models
di: Chen, Chi, et al.
Pubblicazione: (2024)
di: Chen, Chi, et al.
Pubblicazione: (2024)
A Multimodal Automated Interpretability Agent
di: Shaham, Tamar Rott, et al.
Pubblicazione: (2024)
di: Shaham, Tamar Rott, et al.
Pubblicazione: (2024)
MINOS: A Multimodal Evaluation Model for Bidirectional Generation Between Image and Text
di: Zhang, Junzhe, et al.
Pubblicazione: (2025)
di: Zhang, Junzhe, et al.
Pubblicazione: (2025)
E$^2$AT: Multimodal Jailbreak Defense via Dynamic Joint Optimization for Multimodal Large Language Models
di: Lu, Liming, et al.
Pubblicazione: (2025)
di: Lu, Liming, et al.
Pubblicazione: (2025)
Robust Multimodal Large Language Models Against Modality Conflict
di: Zhang, Zongmeng, et al.
Pubblicazione: (2025)
di: Zhang, Zongmeng, et al.
Pubblicazione: (2025)
TP-Eval: Tap Multimodal LLMs' Potential in Evaluation by Customizing Prompts
di: Xie, Yuxuan, et al.
Pubblicazione: (2024)
di: Xie, Yuxuan, et al.
Pubblicazione: (2024)
Speed Always Wins: A Survey on Efficient Architectures for Large Language Models
di: Sun, Weigao, et al.
Pubblicazione: (2025)
di: Sun, Weigao, et al.
Pubblicazione: (2025)
IW-Bench: Evaluating Large Multimodal Models for Converting Image-to-Web
di: Guo, Hongcheng, et al.
Pubblicazione: (2024)
di: Guo, Hongcheng, et al.
Pubblicazione: (2024)
Mavors: Multi-granularity Video Representation for Multimodal Large Language Model
di: Shi, Yang, et al.
Pubblicazione: (2025)
di: Shi, Yang, et al.
Pubblicazione: (2025)
MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency
di: Jiang, Dongzhi, et al.
Pubblicazione: (2025)
di: Jiang, Dongzhi, et al.
Pubblicazione: (2025)
LFTR: Learning-Free Token Reduction for Multimodal Large Language Models
di: Zhao, Zihui, et al.
Pubblicazione: (2025)
di: Zhao, Zihui, et al.
Pubblicazione: (2025)
MLLM-as-a-Judge: Assessing Multimodal LLM-as-a-Judge with Vision-Language Benchmark
di: Chen, Dongping, et al.
Pubblicazione: (2024)
di: Chen, Dongping, et al.
Pubblicazione: (2024)
VisualWebInstruct: Scaling up Multimodal Instruction Data through Web Search
di: Jia, Yiming, et al.
Pubblicazione: (2025)
di: Jia, Yiming, et al.
Pubblicazione: (2025)
On Pre-training of Multimodal Language Models Customized for Chart Understanding
di: Fan, Wan-Cyuan, et al.
Pubblicazione: (2024)
di: Fan, Wan-Cyuan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
A Survey on Agentic Multimodal Large Language Models
di: Yao, Huanjin, et al.
Pubblicazione: (2025) -
AdaDrive: Self-Adaptive Slow-Fast System for Language-Grounded Autonomous Driving
di: Zhang, Ruifei, et al.
Pubblicazione: (2025) -
A Survey on Evaluation of Multimodal Large Language Models
di: Huang, Jiaxing, et al.
Pubblicazione: (2024) -
A Survey on Benchmarks of Multimodal Large Language Models
di: Li, Jian, et al.
Pubblicazione: (2024) -
VIALM: A Survey and Benchmark of Visually Impaired Assistance with Large Models
di: Zhao, Yi, et al.
Pubblicazione: (2024)