Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features
Fuente:
arXiv
Guardado en:
| Autores principales: | Mitra, Chancharik, Huang, Brandon, Chai, Tianning, Lin, Zhiqiu, Arbelle, Assaf, Feris, Rogerio, Karlinsky, Leonid, Darrell, Trevor, Ramanan, Deva, Herzig, Roei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Activation Reward Models for Few-Shot Model Alignment
por: Chai, Tianning, et al.
Publicado: (2025)
por: Chai, Tianning, et al.
Publicado: (2025)
Multimodal Task Vectors Enable Many-Shot Multimodal In-Context Learning
por: Huang, Brandon, et al.
Publicado: (2024)
por: Huang, Brandon, et al.
Publicado: (2024)
Compositional Chain-of-Thought Prompting for Large Multimodal Models
por: Mitra, Chancharik, et al.
Publicado: (2023)
por: Mitra, Chancharik, et al.
Publicado: (2023)
Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations
por: Mitra, Chancharik, et al.
Publicado: (2025)
por: Mitra, Chancharik, et al.
Publicado: (2025)
Latent Implicit Visual Reasoning
por: Li, Kelvin, et al.
Publicado: (2025)
por: Li, Kelvin, et al.
Publicado: (2025)
Navigating the Labyrinth: Evaluating LLMs' Ability to Reason About Search Problems
por: Borazjanizadeh, Nasim, et al.
Publicado: (2024)
por: Borazjanizadeh, Nasim, et al.
Publicado: (2024)
DAVE: A VLM Vision Encoder for Document Understanding and Web Agents
por: Huang, Brandon, et al.
Publicado: (2025)
por: Huang, Brandon, et al.
Publicado: (2025)
Visualizing Thought: Conceptual Diagrams Enable Robust Planning in LMMs
por: Borazjanizadeh, Nasim, et al.
Publicado: (2025)
por: Borazjanizadeh, Nasim, et al.
Publicado: (2025)
ConMe: Rethinking Evaluation of Compositional Reasoning for Modern VLMs
por: Huang, Irene, et al.
Publicado: (2024)
por: Huang, Irene, et al.
Publicado: (2024)
Multimodality Helps Unimodality: Cross-Modal Few-Shot Learning with Multimodal Models
por: Lin, Zhiqiu, et al.
Publicado: (2023)
por: Lin, Zhiqiu, et al.
Publicado: (2023)
Towards Multimodal In-Context Learning for Vision & Language Models
por: Doveh, Sivan, et al.
Publicado: (2024)
por: Doveh, Sivan, et al.
Publicado: (2024)
Less is More Tokens: Efficient Math Reasoning via Difficulty-Aware Chain-of-Thought Distillation
por: Waheed, Abdul, et al.
Publicado: (2025)
por: Waheed, Abdul, et al.
Publicado: (2025)
Revisiting Few-Shot Object Detection with Vision-Language Models
por: Madan, Anish, et al.
Publicado: (2023)
por: Madan, Anish, et al.
Publicado: (2023)
NumeroLogic: Number Encoding for Enhanced LLMs' Numerical Reasoning
por: Schwartz, Eli, et al.
Publicado: (2024)
por: Schwartz, Eli, et al.
Publicado: (2024)
Recursive Visual Programming
por: Ge, Jiaxin, et al.
Publicado: (2023)
por: Ge, Jiaxin, et al.
Publicado: (2023)
TraveLER: A Modular Multi-LMM Agent Framework for Video Question-Answering
por: Shang, Chuyi, et al.
Publicado: (2024)
por: Shang, Chuyi, et al.
Publicado: (2024)
Revisiting the Role of Language Priors in Vision-Language Models
por: Lin, Zhiqiu, et al.
Publicado: (2023)
por: Lin, Zhiqiu, et al.
Publicado: (2023)
$\texttt{BATCLIP}$: Bimodal Online Test-Time Adaptation for CLIP
por: Maharana, Sarthak Kumar, et al.
Publicado: (2024)
por: Maharana, Sarthak Kumar, et al.
Publicado: (2024)
MAEDAY: MAE for few and zero shot AnomalY-Detection
por: Schwartz, Eli, et al.
Publicado: (2022)
por: Schwartz, Eli, et al.
Publicado: (2022)
Teaching VLMs to Localize Specific Objects from In-context Examples
por: Doveh, Sivan, et al.
Publicado: (2024)
por: Doveh, Sivan, et al.
Publicado: (2024)
Which One? Leveraging Context Between Objects and Multiple Views for Language Grounding
por: Mitra, Chancharik, et al.
Publicado: (2023)
por: Mitra, Chancharik, et al.
Publicado: (2023)
Whisper-Flamingo: Integrating Visual Features into Whisper for Audio-Visual Speech Recognition and Translation
por: Rouditchenko, Andrew, et al.
Publicado: (2024)
por: Rouditchenko, Andrew, et al.
Publicado: (2024)
In-Context Learning Enables Robot Action Prediction in LLMs
por: Yin, Yida, et al.
Publicado: (2024)
por: Yin, Yida, et al.
Publicado: (2024)
CAMELoT: Towards Large Language Models with Training-Free Consolidated Associative Memory
por: He, Zexue, et al.
Publicado: (2024)
por: He, Zexue, et al.
Publicado: (2024)
LLARVA: Vision-Action Instruction Tuning Enhances Robot Learning
por: Niu, Dantong, et al.
Publicado: (2024)
por: Niu, Dantong, et al.
Publicado: (2024)
ChartGen: Scaling Chart Understanding Via Code-Guided Synthetic Chart Generation
por: Kondic, Jovana, et al.
Publicado: (2025)
por: Kondic, Jovana, et al.
Publicado: (2025)
Language Models as Black-Box Optimizers for Vision-Language Models
por: Liu, Shihong, et al.
Publicado: (2023)
por: Liu, Shihong, et al.
Publicado: (2023)
Adaptive Memory Replay for Continual Learning
por: Smith, James Seale, et al.
Publicado: (2024)
por: Smith, James Seale, et al.
Publicado: (2024)
The Neglected Tails in Vision-Language Models
por: Parashar, Shubham, et al.
Publicado: (2024)
por: Parashar, Shubham, et al.
Publicado: (2024)
Comparison Visual Instruction Tuning
por: Lin, Wei, et al.
Publicado: (2024)
por: Lin, Wei, et al.
Publicado: (2024)
DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection
por: Gare, Gautam Rajendrakumar, et al.
Publicado: (2026)
por: Gare, Gautam Rajendrakumar, et al.
Publicado: (2026)
Large Scale Generative AI Text Applied to Sports and Music
por: Baughman, Aaron, et al.
Publicado: (2024)
por: Baughman, Aaron, et al.
Publicado: (2024)
Predicting Long-horizon Futures by Conditioning on Geometry and Time
por: Khurana, Tarasha, et al.
Publicado: (2024)
por: Khurana, Tarasha, et al.
Publicado: (2024)
3VL: Using Trees to Improve Vision-Language Models' Interpretability
por: Yellinek, Nir, et al.
Publicado: (2023)
por: Yellinek, Nir, et al.
Publicado: (2023)
Towards Understanding Camera Motions in Any Video
por: Lin, Zhiqiu, et al.
Publicado: (2025)
por: Lin, Zhiqiu, et al.
Publicado: (2025)
From Generated Human Videos to Physically Plausible Robot Trajectories
por: Ni, James, et al.
Publicado: (2025)
por: Ni, James, et al.
Publicado: (2025)
Self-Specialization: Uncovering Latent Expertise within Large Language Models
por: Kang, Junmo, et al.
Publicado: (2023)
por: Kang, Junmo, et al.
Publicado: (2023)
RefAV: Towards Planning-Centric Scenario Mining
por: Davidson, Cainan, et al.
Publicado: (2025)
por: Davidson, Cainan, et al.
Publicado: (2025)
NaturalBench: Evaluating Vision-Language Models on Natural Adversarial Samples
por: Li, Baiqi, et al.
Publicado: (2024)
por: Li, Baiqi, et al.
Publicado: (2024)
Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion
por: Hansen, Jacob, et al.
Publicado: (2025)
por: Hansen, Jacob, et al.
Publicado: (2025)
Ejemplares similares
-
Activation Reward Models for Few-Shot Model Alignment
por: Chai, Tianning, et al.
Publicado: (2025) -
Multimodal Task Vectors Enable Many-Shot Multimodal In-Context Learning
por: Huang, Brandon, et al.
Publicado: (2024) -
Compositional Chain-of-Thought Prompting for Large Multimodal Models
por: Mitra, Chancharik, et al.
Publicado: (2023) -
Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations
por: Mitra, Chancharik, et al.
Publicado: (2025) -
Latent Implicit Visual Reasoning
por: Li, Kelvin, et al.
Publicado: (2025)