Visual In-Context Learning for Large Vision-Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhou, Yucheng, Li, Xiang, Wang, Qianning, Shen, Jianbing |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models
von: Zhou, Yucheng, et al.
Veröffentlicht: (2024)
von: Zhou, Yucheng, et al.
Veröffentlicht: (2024)
Improving Medical Large Vision-Language Models with Abnormal-Aware Feedback
von: Zhou, Yucheng, et al.
Veröffentlicht: (2025)
von: Zhou, Yucheng, et al.
Veröffentlicht: (2025)
Draw ALL Your Imagine: A Holistic Benchmark and Agent Framework for Complex Instruction-based Image Generation
von: Zhou, Yucheng, et al.
Veröffentlicht: (2025)
von: Zhou, Yucheng, et al.
Veröffentlicht: (2025)
Self-Rewarding Large Vision-Language Models for Optimizing Prompts in Text-to-Image Generation
von: Yang, Hongji, et al.
Veröffentlicht: (2025)
von: Yang, Hongji, et al.
Veröffentlicht: (2025)
HanMoVLM: Large Vision-Language Models for Professional Artistic Painting Evaluation
von: Yang, Hongji, et al.
Veröffentlicht: (2026)
von: Yang, Hongji, et al.
Veröffentlicht: (2026)
MemoryMamba: Memory-Augmented State Space Model for Defect Recognition
von: Wang, Qianning, et al.
Veröffentlicht: (2024)
von: Wang, Qianning, et al.
Veröffentlicht: (2024)
Lever LM: Configuring In-Context Sequence to Lever Large Vision Language Models
von: Yang, Xu, et al.
Veröffentlicht: (2023)
von: Yang, Xu, et al.
Veröffentlicht: (2023)
CODIS: Benchmarking Context-Dependent Visual Comprehension for Multimodal Large Language Models
von: Luo, Fuwen, et al.
Veröffentlicht: (2024)
von: Luo, Fuwen, et al.
Veröffentlicht: (2024)
Benchmarking and Improving Large Vision-Language Models for Fundamental Visual Graph Understanding and Reasoning
von: Zhu, Yingjie, et al.
Veröffentlicht: (2024)
von: Zhu, Yingjie, et al.
Veröffentlicht: (2024)
Sim4Seg: Boosting Multimodal Multi-disease Medical Diagnosis Segmentation with Region-Aware Vision-Language Similarity Masks
von: Song, Lingran, et al.
Veröffentlicht: (2025)
von: Song, Lingran, et al.
Veröffentlicht: (2025)
Instruction-Aligned Visual Attention for Mitigating Hallucinations in Large Vision-Language Models
von: Li, Bin, et al.
Veröffentlicht: (2025)
von: Li, Bin, et al.
Veröffentlicht: (2025)
InsectMamba: Insect Pest Classification with State Space Model
von: Wang, Qianning, et al.
Veröffentlicht: (2024)
von: Wang, Qianning, et al.
Veröffentlicht: (2024)
HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models
von: Guan, Tianrui, et al.
Veröffentlicht: (2023)
von: Guan, Tianrui, et al.
Veröffentlicht: (2023)
LADR: Locality-Aware Dynamic Rescue for Efficient Text-to-Image Generation with Diffusion Large Language Models
von: Wang, Chenglin, et al.
Veröffentlicht: (2026)
von: Wang, Chenglin, et al.
Veröffentlicht: (2026)
Do we Really Need Visual Instructions? Towards Visual Instruction-Free Fine-tuning for Large Vision-Language Models
von: Liu, Zikang, et al.
Veröffentlicht: (2025)
von: Liu, Zikang, et al.
Veröffentlicht: (2025)
Advancing Multimodal In-Context Learning in Large Vision-Language Models with Task-aware Demonstrations
von: Li, Yanshu
Veröffentlicht: (2025)
von: Li, Yanshu
Veröffentlicht: (2025)
A Comprehensive Analysis for Visual Object Hallucination in Large Vision-Language Models
von: Jing, Liqiang, et al.
Veröffentlicht: (2025)
von: Jing, Liqiang, et al.
Veröffentlicht: (2025)
VisionGraph: Leveraging Large Multimodal Models for Graph Theory Problems in Visual Context
von: Li, Yunxin, et al.
Veröffentlicht: (2024)
von: Li, Yunxin, et al.
Veröffentlicht: (2024)
NPHardEval4V: Dynamic Evaluation of Large Vision-Language Models with Effects of Vision
von: Li, Xiang, et al.
Veröffentlicht: (2024)
von: Li, Xiang, et al.
Veröffentlicht: (2024)
Large Vision-Language Models for Remote Sensing Visual Question Answering
von: Siripong, Surasakdi, et al.
Veröffentlicht: (2024)
von: Siripong, Surasakdi, et al.
Veröffentlicht: (2024)
MMLongCite: A Benchmark for Evaluating Fidelity of Long-Context Vision-Language Models
von: Zhou, Keyan, et al.
Veröffentlicht: (2025)
von: Zhou, Keyan, et al.
Veröffentlicht: (2025)
Mitigating Hallucinations in Large Vision-Language Models with Internal Fact-based Contrastive Decoding
von: Wang, Chao, et al.
Veröffentlicht: (2025)
von: Wang, Chao, et al.
Veröffentlicht: (2025)
ComplexBench-Edit: Benchmarking Complex Instruction-Driven Image Editing via Compositional Dependencies
von: Wang, Chenglin, et al.
Veröffentlicht: (2025)
von: Wang, Chenglin, et al.
Veröffentlicht: (2025)
VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models
von: Zhang, Ce, et al.
Veröffentlicht: (2025)
von: Zhang, Ce, et al.
Veröffentlicht: (2025)
ChartMuseum: Testing Visual Reasoning Capabilities of Large Vision-Language Models
von: Tang, Liyan, et al.
Veröffentlicht: (2025)
von: Tang, Liyan, et al.
Veröffentlicht: (2025)
Diving into Mitigating Hallucinations from a Vision Perspective for Large Vision-Language Models
von: Wang, Weihang, et al.
Veröffentlicht: (2025)
von: Wang, Weihang, et al.
Veröffentlicht: (2025)
VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering
von: Wang, Yanling, et al.
Veröffentlicht: (2025)
von: Wang, Yanling, et al.
Veröffentlicht: (2025)
EFUF: Efficient Fine-grained Unlearning Framework for Mitigating Hallucinations in Multimodal Large Language Models
von: Xing, Shangyu, et al.
Veröffentlicht: (2024)
von: Xing, Shangyu, et al.
Veröffentlicht: (2024)
Visual Riddles: a Commonsense and World Knowledge Challenge for Large Vision and Language Models
von: Bitton-Guetta, Nitzan, et al.
Veröffentlicht: (2024)
von: Bitton-Guetta, Nitzan, et al.
Veröffentlicht: (2024)
Beyond the Vision Encoder: Identifying and Mitigating Spatial Bias in Large Vision-Language Models
von: Zhu, Yingjie, et al.
Veröffentlicht: (2025)
von: Zhu, Yingjie, et al.
Veröffentlicht: (2025)
Black-Box Visual Prompt Engineering for Mitigating Object Hallucination in Large Vision Language Models
von: Woo, Sangmin, et al.
Veröffentlicht: (2025)
von: Woo, Sangmin, et al.
Veröffentlicht: (2025)
Enhancing Large Vision Language Models with Self-Training on Image Comprehension
von: Deng, Yihe, et al.
Veröffentlicht: (2024)
von: Deng, Yihe, et al.
Veröffentlicht: (2024)
PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction
von: Xing, Long, et al.
Veröffentlicht: (2024)
von: Xing, Long, et al.
Veröffentlicht: (2024)
MathScape: Benchmarking Multimodal Large Language Models in Real-World Mathematical Contexts
von: Liang, Hao, et al.
Veröffentlicht: (2024)
von: Liang, Hao, et al.
Veröffentlicht: (2024)
VEGA: Learning Interleaved Image-Text Comprehension in Vision-Language Large Models
von: Zhou, Chenyu, et al.
Veröffentlicht: (2024)
von: Zhou, Chenyu, et al.
Veröffentlicht: (2024)
Clinical Cognition Alignment for Gastrointestinal Diagnosis with Multimodal LLMs
von: Zheng, Huan, et al.
Veröffentlicht: (2026)
von: Zheng, Huan, et al.
Veröffentlicht: (2026)
Do Vision-Language Models Really Understand Visual Language?
von: Hou, Yifan, et al.
Veröffentlicht: (2024)
von: Hou, Yifan, et al.
Veröffentlicht: (2024)
Finer: Investigating and Enhancing Fine-Grained Visual Concept Recognition in Large Vision Language Models
von: Kim, Jeonghwan, et al.
Veröffentlicht: (2024)
von: Kim, Jeonghwan, et al.
Veröffentlicht: (2024)
Mostly Text, Smart Visuals: Asymmetric Text-Visual Pruning for Large Vision-Language Models
von: Li, Sijie, et al.
Veröffentlicht: (2026)
von: Li, Sijie, et al.
Veröffentlicht: (2026)
Vision-Language Models Can Self-Improve Reasoning via Reflection
von: Cheng, Kanzhi, et al.
Veröffentlicht: (2024)
von: Cheng, Kanzhi, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models
von: Zhou, Yucheng, et al.
Veröffentlicht: (2024) -
Improving Medical Large Vision-Language Models with Abnormal-Aware Feedback
von: Zhou, Yucheng, et al.
Veröffentlicht: (2025) -
Draw ALL Your Imagine: A Holistic Benchmark and Agent Framework for Complex Instruction-based Image Generation
von: Zhou, Yucheng, et al.
Veröffentlicht: (2025) -
Self-Rewarding Large Vision-Language Models for Optimizing Prompts in Text-to-Image Generation
von: Yang, Hongji, et al.
Veröffentlicht: (2025) -
HanMoVLM: Large Vision-Language Models for Professional Artistic Painting Evaluation
von: Yang, Hongji, et al.
Veröffentlicht: (2026)