Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective
Fuente:
arXiv
Guardado en:
| Autores principales: | Ma, Xiaorui, Xie, Haoran, Qin, S. Joe |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Knowledge Mechanisms in Large Language Models: A Survey and Perspective
por: Wang, Mengru, et al.
Publicado: (2024)
por: Wang, Mengru, et al.
Publicado: (2024)
Groma: Localized Visual Tokenization for Grounding Multimodal Large Language Models
por: Ma, Chuofan, et al.
Publicado: (2024)
por: Ma, Chuofan, et al.
Publicado: (2024)
First-Order Error Matters: Accurate Compensation for Quantized Large Language Models
por: Zheng, Xingyu, et al.
Publicado: (2025)
por: Zheng, Xingyu, et al.
Publicado: (2025)
A Survey on Multimodal Large Language Models
por: Yin, Shukang, et al.
Publicado: (2023)
por: Yin, Shukang, et al.
Publicado: (2023)
Visual Question Decomposition on Multimodal Large Language Models
por: Zhang, Haowei, et al.
Publicado: (2024)
por: Zhang, Haowei, et al.
Publicado: (2024)
FlashVID: Efficient Video Large Language Models via Training-free Tree-based Spatiotemporal Token Merging
por: Fan, Ziyang, et al.
Publicado: (2026)
por: Fan, Ziyang, et al.
Publicado: (2026)
Towards Visual Text Grounding of Multimodal Large Language Model
por: Li, Ming, et al.
Publicado: (2025)
por: Li, Ming, et al.
Publicado: (2025)
ARB-LLM: Alternating Refined Binarizations for Large Language Models
por: Li, Zhiteng, et al.
Publicado: (2024)
por: Li, Zhiteng, et al.
Publicado: (2024)
Frozen Transformers in Language Models Are Effective Visual Encoder Layers
por: Pang, Ziqi, et al.
Publicado: (2023)
por: Pang, Ziqi, et al.
Publicado: (2023)
ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models
por: Lee, Jewon, et al.
Publicado: (2025)
por: Lee, Jewon, et al.
Publicado: (2025)
A Survey of Deep Learning for Geometry Problem Solving
por: Ma, Jianzhe, et al.
Publicado: (2025)
por: Ma, Jianzhe, et al.
Publicado: (2025)
Capybara-OMNI: An Efficient Paradigm for Building Omni-Modal Language Models
por: Ji, Xingguang, et al.
Publicado: (2025)
por: Ji, Xingguang, et al.
Publicado: (2025)
Rethinking Visual Prompting for Multimodal Large Language Models with External Knowledge
por: Lin, Yuanze, et al.
Publicado: (2024)
por: Lin, Yuanze, et al.
Publicado: (2024)
Grounding and Evaluation for Large Language Models: Practical Challenges and Lessons Learned (Survey)
por: Kenthapadi, Krishnaram, et al.
Publicado: (2024)
por: Kenthapadi, Krishnaram, et al.
Publicado: (2024)
Speed Always Wins: A Survey on Efficient Architectures for Large Language Models
por: Sun, Weigao, et al.
Publicado: (2025)
por: Sun, Weigao, et al.
Publicado: (2025)
AdaptVision: Efficient Vision-Language Models via Adaptive Visual Acquisition
por: Lin, Zichuan, et al.
Publicado: (2025)
por: Lin, Zichuan, et al.
Publicado: (2025)
Semantic-Clipping: Efficient Vision-Language Modeling with Semantic-Guidedd Visual Selection
por: Li, Bangzheng, et al.
Publicado: (2025)
por: Li, Bangzheng, et al.
Publicado: (2025)
Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement
por: Wang, Xiyao, et al.
Publicado: (2024)
por: Wang, Xiyao, et al.
Publicado: (2024)
RAP: Retrieval-Augmented Personalization for Multimodal Large Language Models
por: Hao, Haoran, et al.
Publicado: (2024)
por: Hao, Haoran, et al.
Publicado: (2024)
Modality-Aware Integration with Large Language Models for Knowledge-based Visual Question Answering
por: Dong, Junnan, et al.
Publicado: (2024)
por: Dong, Junnan, et al.
Publicado: (2024)
ExpVG: Investigating the Design Space of Visual Grounding in Multimodal Large Language Model
por: Kang, Weitai, et al.
Publicado: (2025)
por: Kang, Weitai, et al.
Publicado: (2025)
LayoutLLM: Large Language Model Instruction Tuning for Visually Rich Document Understanding
por: Fujitake, Masato
Publicado: (2024)
por: Fujitake, Masato
Publicado: (2024)
Prompting Medical Large Vision-Language Models to Diagnose Pathologies by Visual Question Answering
por: Guo, Danfeng, et al.
Publicado: (2024)
por: Guo, Danfeng, et al.
Publicado: (2024)
Vision-DeepResearch Benchmark: Rethinking Visual and Textual Search for Multimodal Large Language Models
por: Zeng, Yu, et al.
Publicado: (2026)
por: Zeng, Yu, et al.
Publicado: (2026)
Analyzing and Boosting the Power of Fine-Grained Visual Recognition for Multi-modal Large Language Models
por: He, Hulingxiao, et al.
Publicado: (2025)
por: He, Hulingxiao, et al.
Publicado: (2025)
By My Eyes: Grounding Multimodal Large Language Models with Sensor Data via Visual Prompting
por: Yoon, Hyungjun, et al.
Publicado: (2024)
por: Yoon, Hyungjun, et al.
Publicado: (2024)
Incentivizing Reasoning for Advanced Instruction-Following of Large Language Models
por: Qin, Yulei, et al.
Publicado: (2025)
por: Qin, Yulei, et al.
Publicado: (2025)
A Survey of Multimodal Large Language Model from A Data-centric Perspective
por: Bai, Tianyi, et al.
Publicado: (2024)
por: Bai, Tianyi, et al.
Publicado: (2024)
VIALM: A Survey and Benchmark of Visually Impaired Assistance with Large Models
por: Zhao, Yi, et al.
Publicado: (2024)
por: Zhao, Yi, et al.
Publicado: (2024)
PerceptionCLIP: Visual Classification by Inferring and Conditioning on Contexts
por: An, Bang, et al.
Publicado: (2023)
por: An, Bang, et al.
Publicado: (2023)
Efficient Self-Improvement in Multimodal Large Language Models: A Model-Level Judge-Free Approach
por: Deng, Shijian, et al.
Publicado: (2024)
por: Deng, Shijian, et al.
Publicado: (2024)
Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning
por: Zhai, Yuexiang, et al.
Publicado: (2024)
por: Zhai, Yuexiang, et al.
Publicado: (2024)
REMONI: An Autonomous System Integrating Wearables and Multimodal Large Language Models for Enhanced Remote Health Monitoring
por: Ho, Thanh Cong, et al.
Publicado: (2025)
por: Ho, Thanh Cong, et al.
Publicado: (2025)
A General and Efficient Training for Transformer via Token Expansion
por: Huang, Wenxuan, et al.
Publicado: (2024)
por: Huang, Wenxuan, et al.
Publicado: (2024)
A Survey on Benchmarks of Multimodal Large Language Models
por: Li, Jian, et al.
Publicado: (2024)
por: Li, Jian, et al.
Publicado: (2024)
A Survey on Evaluation of Multimodal Large Language Models
por: Huang, Jiaxing, et al.
Publicado: (2024)
por: Huang, Jiaxing, et al.
Publicado: (2024)
A Survey on Agentic Multimodal Large Language Models
por: Yao, Huanjin, et al.
Publicado: (2025)
por: Yao, Huanjin, et al.
Publicado: (2025)
Transforming Science with Large Language Models: A Survey on AI-assisted Scientific Discovery, Experimentation, Content Generation, and Evaluation
por: Eger, Steffen, et al.
Publicado: (2025)
por: Eger, Steffen, et al.
Publicado: (2025)
Efficient Contrastive Decoding with Probabilistic Hallucination Detection - Mitigating Hallucinations in Large Vision Language Models -
por: Fieback, Laura, et al.
Publicado: (2025)
por: Fieback, Laura, et al.
Publicado: (2025)
RDP LoRA: Geometry-Driven Identification for Parameter-Efficient Adaptation in Large Language Models
por: Çelebi, Yusuf, et al.
Publicado: (2026)
por: Çelebi, Yusuf, et al.
Publicado: (2026)
Ejemplares similares
-
Knowledge Mechanisms in Large Language Models: A Survey and Perspective
por: Wang, Mengru, et al.
Publicado: (2024) -
Groma: Localized Visual Tokenization for Grounding Multimodal Large Language Models
por: Ma, Chuofan, et al.
Publicado: (2024) -
First-Order Error Matters: Accurate Compensation for Quantized Large Language Models
por: Zheng, Xingyu, et al.
Publicado: (2025) -
A Survey on Multimodal Large Language Models
por: Yin, Shukang, et al.
Publicado: (2023) -
Visual Question Decomposition on Multimodal Large Language Models
por: Zhang, Haowei, et al.
Publicado: (2024)