Parallel In-context Learning for Large Vision Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Yamaguchi, Shin'ya, Chijiwa, Daiki, Sakao, Tamao, Hasegawa, Taku |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Rationale-Enhanced Decoding for Multi-modal Chain-of-Thought
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2025)
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2025)
Lossless Vocabulary Reduction for Auto-Regressive Language Models
di: Chijiwa, Daiki, et al.
Pubblicazione: (2025)
di: Chijiwa, Daiki, et al.
Pubblicazione: (2025)
Post-pre-training for Modality Alignment in Vision-Language Foundation Models
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2025)
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2025)
Zero-shot Concept Bottleneck Models
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2025)
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2025)
Adaptive Random Feature Regularization on Fine-tuning Deep Neural Networks
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2024)
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2024)
Explanation Bottleneck Models
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2024)
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2024)
Learning Robust Convolutional Neural Networks with Relevant Feature Focusing via Explanations
di: Adachi, Kazuki, et al.
Pubblicazione: (2022)
di: Adachi, Kazuki, et al.
Pubblicazione: (2022)
Toward Data Efficient Model Merging between Different Datasets without Performance Degradation
di: Yamada, Masanori, et al.
Pubblicazione: (2023)
di: Yamada, Masanori, et al.
Pubblicazione: (2023)
Transfer Learning with Pre-trained Conditional Generative Models
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2022)
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2022)
Machine Learning Modeling for Multi-order Human Visual Motion Processing
di: Sun, Zitang, et al.
Pubblicazione: (2025)
di: Sun, Zitang, et al.
Pubblicazione: (2025)
Test-time Adaptation Meets Image Enhancement: Improving Accuracy via Uncertainty-aware Logit Switching
di: Enomoto, Shohei, et al.
Pubblicazione: (2024)
di: Enomoto, Shohei, et al.
Pubblicazione: (2024)
HAPI: A Model for Learning Robot Facial Expressions from Human Preferences
di: Yang, Dongsheng, et al.
Pubblicazione: (2025)
di: Yang, Dongsheng, et al.
Pubblicazione: (2025)
Understanding Pure Textual Reasoning for Blind Image Quality Assessment
di: Li, Yuan, et al.
Pubblicazione: (2026)
di: Li, Yuan, et al.
Pubblicazione: (2026)
Difference Vector Equalization for Robust Fine-tuning of Vision-Language Models
di: Suzuki, Satoshi, et al.
Pubblicazione: (2025)
di: Suzuki, Satoshi, et al.
Pubblicazione: (2025)
Effectiveness Assessment of Recent Large Vision-Language Models
di: Jiang, Yao, et al.
Pubblicazione: (2024)
di: Jiang, Yao, et al.
Pubblicazione: (2024)
Beyond Human Vision: The Role of Large Vision Language Models in Microscope Image Analysis
di: Verma, Prateek, et al.
Pubblicazione: (2024)
di: Verma, Prateek, et al.
Pubblicazione: (2024)
Representing Online Handwriting for Recognition in Large Vision-Language Models
di: Fadeeva, Anastasiia, et al.
Pubblicazione: (2024)
di: Fadeeva, Anastasiia, et al.
Pubblicazione: (2024)
Rethinking Post-Unlearning Behavior of Large Vision-Language Models
di: Kim, Minsung, et al.
Pubblicazione: (2025)
di: Kim, Minsung, et al.
Pubblicazione: (2025)
Weighted Multi-Prompt Learning with Description-free Large Language Model Distillation
di: Lee, Sua, et al.
Pubblicazione: (2025)
di: Lee, Sua, et al.
Pubblicazione: (2025)
Compositional Entailment Learning for Hyperbolic Vision-Language Models
di: Pal, Avik, et al.
Pubblicazione: (2024)
di: Pal, Avik, et al.
Pubblicazione: (2024)
Tree of Attributes Prompt Learning for Vision-Language Models
di: Ding, Tong, et al.
Pubblicazione: (2024)
di: Ding, Tong, et al.
Pubblicazione: (2024)
Uniformity First: Uniformity-aware Test-time Adaptation of Vision-language Models against Image Corruption
di: Adachi, Kazuki, et al.
Pubblicazione: (2025)
di: Adachi, Kazuki, et al.
Pubblicazione: (2025)
Test-time Similarity Modification for Person Re-identification toward Temporal Distribution Shift
di: Adachi, Kazuki, et al.
Pubblicazione: (2024)
di: Adachi, Kazuki, et al.
Pubblicazione: (2024)
Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models
di: Schlarmann, Christian, et al.
Pubblicazione: (2024)
di: Schlarmann, Christian, et al.
Pubblicazione: (2024)
Efficient Few-Shot Learning in Remote Sensing: Fusing Vision and Vision-Language Models
di: Chua, Jia Yun, et al.
Pubblicazione: (2025)
di: Chua, Jia Yun, et al.
Pubblicazione: (2025)
Continual Learning in Vision-Language Models via Aligned Model Merging
di: Sokar, Ghada, et al.
Pubblicazione: (2025)
di: Sokar, Ghada, et al.
Pubblicazione: (2025)
Fine-Tuning a Large Vision-Language Model for Artwork's Scoring and Critique
di: Zhang, Zhehan, et al.
Pubblicazione: (2026)
di: Zhang, Zhehan, et al.
Pubblicazione: (2026)
CALICO: Part-Focused Semantic Co-Segmentation with Large Vision-Language Models
di: Nguyen, Kiet A., et al.
Pubblicazione: (2024)
di: Nguyen, Kiet A., et al.
Pubblicazione: (2024)
Decoupling Augmentation Bias in Prompt Learning for Vision-Language Models
di: Kim, Gahyeon, et al.
Pubblicazione: (2025)
di: Kim, Gahyeon, et al.
Pubblicazione: (2025)
AAPL: Adding Attributes to Prompt Learning for Vision-Language Models
di: Kim, Gahyeon, et al.
Pubblicazione: (2024)
di: Kim, Gahyeon, et al.
Pubblicazione: (2024)
Sparse Autoencoders Learn Monosemantic Features in Vision-Language Models
di: Pach, Mateusz, et al.
Pubblicazione: (2025)
di: Pach, Mateusz, et al.
Pubblicazione: (2025)
Lightweight Unsupervised Federated Learning with Pretrained Vision Language Model
di: Yan, Hao, et al.
Pubblicazione: (2024)
di: Yan, Hao, et al.
Pubblicazione: (2024)
Vision-Language Models Provide Promptable Representations for Reinforcement Learning
di: Chen, William, et al.
Pubblicazione: (2024)
di: Chen, William, et al.
Pubblicazione: (2024)
Mitigating Hallucinations via Inter-Layer Consistency Aggregation in Large Vision-Language Models
di: Tang, Kai, et al.
Pubblicazione: (2025)
di: Tang, Kai, et al.
Pubblicazione: (2025)
Interpreting Attention Heads for Image-to-Text Information Flow in Large Vision-Language Models
di: Kim, Jinyeong, et al.
Pubblicazione: (2025)
di: Kim, Jinyeong, et al.
Pubblicazione: (2025)
Evaluating Hallucination in Large Vision-Language Models based on Context-Aware Object Similarities
di: Datta, Shounak, et al.
Pubblicazione: (2025)
di: Datta, Shounak, et al.
Pubblicazione: (2025)
Retrieval Visual Contrastive Decoding to Mitigate Object Hallucinations in Large Vision-Language Models
di: Lee, Jihoon, et al.
Pubblicazione: (2025)
di: Lee, Jihoon, et al.
Pubblicazione: (2025)
LLaVE: Large Language and Vision Embedding Models with Hardness-Weighted Contrastive Learning
di: Lan, Zhibin, et al.
Pubblicazione: (2025)
di: Lan, Zhibin, et al.
Pubblicazione: (2025)
Portable Reward Tuning: Towards Reusable Fine-Tuning across Different Pretrained Models
di: Chijiwa, Daiki, et al.
Pubblicazione: (2025)
di: Chijiwa, Daiki, et al.
Pubblicazione: (2025)
Learning to Inference Adaptively for Multimodal Large Language Models
di: Xu, Zhuoyan, et al.
Pubblicazione: (2025)
di: Xu, Zhuoyan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Rationale-Enhanced Decoding for Multi-modal Chain-of-Thought
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2025) -
Lossless Vocabulary Reduction for Auto-Regressive Language Models
di: Chijiwa, Daiki, et al.
Pubblicazione: (2025) -
Post-pre-training for Modality Alignment in Vision-Language Foundation Models
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2025) -
Zero-shot Concept Bottleneck Models
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2025) -
Adaptive Random Feature Regularization on Fine-tuning Deep Neural Networks
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2024)