Vision Enhancing LLMs: Empowering Multimodal Knowledge Storage and Sharing in LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Yunxin, Liu, Zhenyu, Hu, Baotian, Wang, Wei, Ding, Yuxin, Cao, Xiaochun, Zhang, Min |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VisionGraph: Leveraging Large Multimodal Models for Graph Theory Problems in Visual Context
di: Li, Yunxin, et al.
Pubblicazione: (2024)
di: Li, Yunxin, et al.
Pubblicazione: (2024)
Cognitive Visual-Language Mapper: Advancing Multimodal Comprehension with Enhanced Visual Knowledge Alignment
di: Li, Yunxin, et al.
Pubblicazione: (2024)
di: Li, Yunxin, et al.
Pubblicazione: (2024)
Uni-MoE: Scaling Unified Multimodal LLMs with Mixture of Experts
di: Li, Yunxin, et al.
Pubblicazione: (2024)
di: Li, Yunxin, et al.
Pubblicazione: (2024)
A Multimodal In-Context Tuning Approach for E-Commerce Product Description Generation
di: Li, Yunxin, et al.
Pubblicazione: (2024)
di: Li, Yunxin, et al.
Pubblicazione: (2024)
VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization
di: Li, Yunxin, et al.
Pubblicazione: (2025)
di: Li, Yunxin, et al.
Pubblicazione: (2025)
VideoVista: A Versatile Benchmark for Video Understanding and Reasoning
di: Li, Yunxin, et al.
Pubblicazione: (2024)
di: Li, Yunxin, et al.
Pubblicazione: (2024)
LLMs Meet Long Video: Advancing Long Video Question Answering with An Interactive Visual Adapter in LLMs
di: Li, Yunxin, et al.
Pubblicazione: (2024)
di: Li, Yunxin, et al.
Pubblicazione: (2024)
Uni-MoE-2.0-Omni: Scaling Language-Centric Omnimodal Large Model with Advanced MoE, Training and Data
di: Li, Yunxin, et al.
Pubblicazione: (2025)
di: Li, Yunxin, et al.
Pubblicazione: (2025)
Insight Over Sight: Exploring the Vision-Knowledge Conflicts in Multimodal LLMs
di: Liu, Xiaoyuan, et al.
Pubblicazione: (2024)
di: Liu, Xiaoyuan, et al.
Pubblicazione: (2024)
Anim-Director: A Large Multimodal Model Powered Agent for Controllable Animation Video Generation
di: Li, Yunxin, et al.
Pubblicazione: (2024)
di: Li, Yunxin, et al.
Pubblicazione: (2024)
HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale
di: Chen, Junying, et al.
Pubblicazione: (2024)
di: Chen, Junying, et al.
Pubblicazione: (2024)
Euclid: Supercharging Multimodal LLMs with Synthetic High-Fidelity Visual Descriptions
di: Zhang, Jiarui, et al.
Pubblicazione: (2024)
di: Zhang, Jiarui, et al.
Pubblicazione: (2024)
Uni-DPO: A Unified Paradigm for Dynamic Preference Optimization of LLMs
di: Peng, Shangpin, et al.
Pubblicazione: (2025)
di: Peng, Shangpin, et al.
Pubblicazione: (2025)
VideoVista-CulturalLingo: 360$^\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension
di: Chen, Xinyu, et al.
Pubblicazione: (2025)
di: Chen, Xinyu, et al.
Pubblicazione: (2025)
EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation
di: Wang, Yongxin, et al.
Pubblicazione: (2024)
di: Wang, Yongxin, et al.
Pubblicazione: (2024)
Aligning Vision to Language: Annotation-Free Multimodal Knowledge Graph Construction for Enhanced LLMs Reasoning
di: Liu, Junming, et al.
Pubblicazione: (2025)
di: Liu, Junming, et al.
Pubblicazione: (2025)
VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos
di: Song, Tingyu, et al.
Pubblicazione: (2025)
di: Song, Tingyu, et al.
Pubblicazione: (2025)
EasyGen: Easing Multimodal Generation with BiDiffuser and LLMs
di: Zhao, Xiangyu, et al.
Pubblicazione: (2023)
di: Zhao, Xiangyu, et al.
Pubblicazione: (2023)
MLLM-CompBench: A Comparative Reasoning Benchmark for Multimodal LLMs
di: Kil, Jihyung, et al.
Pubblicazione: (2024)
di: Kil, Jihyung, et al.
Pubblicazione: (2024)
Rethinking the Mixture of Vision Encoders Paradigm for Enhanced Visual Understanding in Multimodal LLMs
di: Azadani, Mozhgan Nasr, et al.
Pubblicazione: (2025)
di: Azadani, Mozhgan Nasr, et al.
Pubblicazione: (2025)
Scientific Reasoning: Assessment of Multimodal Generative LLMs
di: Dreyer, Florian, et al.
Pubblicazione: (2025)
di: Dreyer, Florian, et al.
Pubblicazione: (2025)
Empowering Multimodal LLMs with External Tools: A Comprehensive Survey
di: An, Wenbin, et al.
Pubblicazione: (2025)
di: An, Wenbin, et al.
Pubblicazione: (2025)
Learning Human-Perceived Fakeness in AI-Generated Videos via Multimodal LLMs
di: Fu, Xingyu, et al.
Pubblicazione: (2025)
di: Fu, Xingyu, et al.
Pubblicazione: (2025)
Augmenting Multimodal LLMs with Self-Reflective Tokens for Knowledge-based Visual Question Answering
di: Cocchi, Federico, et al.
Pubblicazione: (2024)
di: Cocchi, Federico, et al.
Pubblicazione: (2024)
Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities
di: Yang, Enneng, et al.
Pubblicazione: (2024)
di: Yang, Enneng, et al.
Pubblicazione: (2024)
MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs
di: Fu, Chaoyou, et al.
Pubblicazione: (2024)
di: Fu, Chaoyou, et al.
Pubblicazione: (2024)
Lumos : Empowering Multimodal LLMs with Scene Text Recognition
di: Shenoy, Ashish, et al.
Pubblicazione: (2024)
di: Shenoy, Ashish, et al.
Pubblicazione: (2024)
Analyzing Finetuning Representation Shift for Multimodal LLMs Steering
di: Khayatan, Pegah, et al.
Pubblicazione: (2025)
di: Khayatan, Pegah, et al.
Pubblicazione: (2025)
Can Multimodal LLMs See Materials Clearly? A Multimodal Benchmark on Materials Characterization
di: Lai, Zhengzhao, et al.
Pubblicazione: (2025)
di: Lai, Zhengzhao, et al.
Pubblicazione: (2025)
LLMs Meet Multimodal Generation and Editing: A Survey
di: He, Yingqing, et al.
Pubblicazione: (2024)
di: He, Yingqing, et al.
Pubblicazione: (2024)
ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention
di: Liu, Wenjie, et al.
Pubblicazione: (2026)
di: Liu, Wenjie, et al.
Pubblicazione: (2026)
Lost in Time: Clock and Calendar Understanding Challenges in Multimodal LLMs
di: Saxena, Rohit, et al.
Pubblicazione: (2025)
di: Saxena, Rohit, et al.
Pubblicazione: (2025)
Multimodal LLMs as Customized Reward Models for Text-to-Image Generation
di: Zhou, Shijie, et al.
Pubblicazione: (2025)
di: Zhou, Shijie, et al.
Pubblicazione: (2025)
Can't See the Forest for the Trees: Benchmarking Multimodal Safety Awareness for Multimodal LLMs
di: Wang, Wenxuan, et al.
Pubblicazione: (2025)
di: Wang, Wenxuan, et al.
Pubblicazione: (2025)
Mitigating Hallucinations in Large Vision-Language Models via Entity-Centric Multimodal Preference Optimization
di: Wu, Jiulong, et al.
Pubblicazione: (2025)
di: Wu, Jiulong, et al.
Pubblicazione: (2025)
Image Captioning Evaluation in the Age of Multimodal LLMs: Challenges and Future Perspectives
di: Sarto, Sara, et al.
Pubblicazione: (2025)
di: Sarto, Sara, et al.
Pubblicazione: (2025)
Leveraging Multimodal-LLMs Assisted by Instance Segmentation for Intelligent Traffic Monitoring
di: Onsu, Murat Arda, et al.
Pubblicazione: (2025)
di: Onsu, Murat Arda, et al.
Pubblicazione: (2025)
TP-Eval: Tap Multimodal LLMs' Potential in Evaluation by Customizing Prompts
di: Xie, Yuxuan, et al.
Pubblicazione: (2024)
di: Xie, Yuxuan, et al.
Pubblicazione: (2024)
Unlearning Sensitive Information in Multimodal LLMs: Benchmark and Attack-Defense Evaluation
di: Patil, Vaidehi, et al.
Pubblicazione: (2025)
di: Patil, Vaidehi, et al.
Pubblicazione: (2025)
NVLM: Open Frontier-Class Multimodal LLMs
di: Dai, Wenliang, et al.
Pubblicazione: (2024)
di: Dai, Wenliang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
VisionGraph: Leveraging Large Multimodal Models for Graph Theory Problems in Visual Context
di: Li, Yunxin, et al.
Pubblicazione: (2024) -
Cognitive Visual-Language Mapper: Advancing Multimodal Comprehension with Enhanced Visual Knowledge Alignment
di: Li, Yunxin, et al.
Pubblicazione: (2024) -
Uni-MoE: Scaling Unified Multimodal LLMs with Mixture of Experts
di: Li, Yunxin, et al.
Pubblicazione: (2024) -
A Multimodal In-Context Tuning Approach for E-Commerce Product Description Generation
di: Li, Yunxin, et al.
Pubblicazione: (2024) -
VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization
di: Li, Yunxin, et al.
Pubblicazione: (2025)