ConMe: Rethinking Evaluation of Compositional Reasoning for Modern VLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huang, Irene, Lin, Wei, Mirza, M. Jehanzeb, Hansen, Jacob A., Doveh, Sivan, Butoi, Victor Ion, Herzig, Roei, Arbelle, Assaf, Kuehne, Hilde, Darrell, Trevor, Gan, Chuang, Oliva, Aude, Feris, Rogerio, Karlinsky, Leonid |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Teaching VLMs to Localize Specific Objects from In-context Examples
par: Doveh, Sivan, et autres
Publié: (2024)
par: Doveh, Sivan, et autres
Publié: (2024)
Navigating the Labyrinth: Evaluating LLMs' Ability to Reason About Search Problems
par: Borazjanizadeh, Nasim, et autres
Publié: (2024)
par: Borazjanizadeh, Nasim, et autres
Publié: (2024)
Multimodal Task Vectors Enable Many-Shot Multimodal In-Context Learning
par: Huang, Brandon, et autres
Publié: (2024)
par: Huang, Brandon, et autres
Publié: (2024)
Visualizing Thought: Conceptual Diagrams Enable Robust Planning in LMMs
par: Borazjanizadeh, Nasim, et autres
Publié: (2025)
par: Borazjanizadeh, Nasim, et autres
Publié: (2025)
Latent Implicit Visual Reasoning
par: Li, Kelvin, et autres
Publié: (2025)
par: Li, Kelvin, et autres
Publié: (2025)
Comparison Visual Instruction Tuning
par: Lin, Wei, et autres
Publié: (2024)
par: Lin, Wei, et autres
Publié: (2024)
Towards Multimodal In-Context Learning for Vision & Language Models
par: Doveh, Sivan, et autres
Publié: (2024)
par: Doveh, Sivan, et autres
Publié: (2024)
Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features
par: Mitra, Chancharik, et autres
Publié: (2024)
par: Mitra, Chancharik, et autres
Publié: (2024)
Meta-Prompting for Automating Zero-shot Visual Recognition with LLMs
par: Mirza, M. Jehanzeb, et autres
Publié: (2024)
par: Mirza, M. Jehanzeb, et autres
Publié: (2024)
NumeroLogic: Number Encoding for Enhanced LLMs' Numerical Reasoning
par: Schwartz, Eli, et autres
Publié: (2024)
par: Schwartz, Eli, et autres
Publié: (2024)
MAEDAY: MAE for few and zero shot AnomalY-Detection
par: Schwartz, Eli, et autres
Publié: (2022)
par: Schwartz, Eli, et autres
Publié: (2022)
Activation Reward Models for Few-Shot Model Alignment
par: Chai, Tianning, et autres
Publié: (2025)
par: Chai, Tianning, et autres
Publié: (2025)
VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes
par: Gavrikov, Paul, et autres
Publié: (2025)
par: Gavrikov, Paul, et autres
Publié: (2025)
TTRV: Test-Time Reinforcement Learning for Vision Language Models
par: Singh, Akshit, et autres
Publié: (2025)
par: Singh, Akshit, et autres
Publié: (2025)
State-Space Large Audio Language Models
par: Bhati, Saurabhchand, et autres
Publié: (2024)
par: Bhati, Saurabhchand, et autres
Publié: (2024)
DASS: Distilled Audio State Space Models Are Stronger and More Duration-Scalable Learners
par: Bhati, Saurabhchand, et autres
Publié: (2024)
par: Bhati, Saurabhchand, et autres
Publié: (2024)
LiveXiv -- A Multi-Modal Live Benchmark Based on Arxiv Papers Content
par: Shabtay, Nimrod, et autres
Publié: (2024)
par: Shabtay, Nimrod, et autres
Publié: (2024)
PRISMM-Bench: A Benchmark of Peer-Review Grounded Multimodal Inconsistencies
par: Selch, Lukas, et autres
Publié: (2025)
par: Selch, Lukas, et autres
Publié: (2025)
CALM: Class-Conditional Sparse Attention Vectors for Large Audio-Language Models
par: Mehta, Videet, et autres
Publié: (2026)
par: Mehta, Videet, et autres
Publié: (2026)
DAVE: A VLM Vision Encoder for Document Understanding and Web Agents
par: Huang, Brandon, et autres
Publié: (2025)
par: Huang, Brandon, et autres
Publié: (2025)
Whisper-Flamingo: Integrating Visual Features into Whisper for Audio-Visual Speech Recognition and Translation
par: Rouditchenko, Andrew, et autres
Publié: (2024)
par: Rouditchenko, Andrew, et autres
Publié: (2024)
AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers
par: Araujo, Edson, et autres
Publié: (2026)
par: Araujo, Edson, et autres
Publié: (2026)
$\textit{Trans-LoRA}$: towards data-free Transferable Parameter Efficient Finetuning
par: Wang, Runqian, et autres
Publié: (2024)
par: Wang, Runqian, et autres
Publié: (2024)
Augmenting In-Context-Learning in LLMs via Automatic Data Labeling and Refinement
par: Shtok, Joseph, et autres
Publié: (2024)
par: Shtok, Joseph, et autres
Publié: (2024)
GLOV: Guided Large Language Models as Implicit Optimizers for Vision Language Models
par: Mirza, M. Jehanzeb, et autres
Publié: (2024)
par: Mirza, M. Jehanzeb, et autres
Publié: (2024)
Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion
par: Hansen, Jacob, et autres
Publié: (2025)
par: Hansen, Jacob, et autres
Publié: (2025)
Compositional Chain-of-Thought Prompting for Large Multimodal Models
par: Mitra, Chancharik, et autres
Publié: (2023)
par: Mitra, Chancharik, et autres
Publié: (2023)
Exploring Modality Guidance to Enhance VFM-based Feature Fusion for UDA in 3D Semantic Segmentation
par: Spoecklberger, Johannes, et autres
Publié: (2025)
par: Spoecklberger, Johannes, et autres
Publié: (2025)
Towards Audio Token Compression in Large Audio Language Models
par: Bhati, Saurabhchand, et autres
Publié: (2025)
par: Bhati, Saurabhchand, et autres
Publié: (2025)
mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition
par: Rouditchenko, Andrew, et autres
Publié: (2025)
par: Rouditchenko, Andrew, et autres
Publié: (2025)
ChartGen: Scaling Chart Understanding Via Code-Guided Synthetic Chart Generation
par: Kondic, Jovana, et autres
Publié: (2025)
par: Kondic, Jovana, et autres
Publié: (2025)
CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment
par: Araujo, Edson, et autres
Publié: (2025)
par: Araujo, Edson, et autres
Publié: (2025)
Overflow Prevention Enhances Long-Context Recurrent LLMs
par: Ben-Kish, Assaf, et autres
Publié: (2025)
par: Ben-Kish, Assaf, et autres
Publié: (2025)
TTA-Vid: Generalized Test-Time Adaptation for Video Reasoning
par: Jahagirdar, Soumya Shamarao, et autres
Publié: (2026)
par: Jahagirdar, Soumya Shamarao, et autres
Publié: (2026)
TraveLER: A Modular Multi-LMM Agent Framework for Video Question-Answering
par: Shang, Chuyi, et autres
Publié: (2024)
par: Shang, Chuyi, et autres
Publié: (2024)
Recursive Visual Programming
par: Ge, Jiaxin, et autres
Publié: (2023)
par: Ge, Jiaxin, et autres
Publié: (2023)
$\texttt{BATCLIP}$: Bimodal Online Test-Time Adaptation for CLIP
par: Maharana, Sarthak Kumar, et autres
Publié: (2024)
par: Maharana, Sarthak Kumar, et autres
Publié: (2024)
In-Context Learning Enables Robot Action Prediction in LLMs
par: Yin, Yida, et autres
Publié: (2024)
par: Yin, Yida, et autres
Publié: (2024)
Omni-R1: Do You Really Need Audio to Fine-Tune Your Audio LLM?
par: Rouditchenko, Andrew, et autres
Publié: (2025)
par: Rouditchenko, Andrew, et autres
Publié: (2025)
CAMELoT: Towards Large Language Models with Training-Free Consolidated Associative Memory
par: He, Zexue, et autres
Publié: (2024)
par: He, Zexue, et autres
Publié: (2024)
Documents similaires
-
Teaching VLMs to Localize Specific Objects from In-context Examples
par: Doveh, Sivan, et autres
Publié: (2024) -
Navigating the Labyrinth: Evaluating LLMs' Ability to Reason About Search Problems
par: Borazjanizadeh, Nasim, et autres
Publié: (2024) -
Multimodal Task Vectors Enable Many-Shot Multimodal In-Context Learning
par: Huang, Brandon, et autres
Publié: (2024) -
Visualizing Thought: Conceptual Diagrams Enable Robust Planning in LMMs
par: Borazjanizadeh, Nasim, et autres
Publié: (2025) -
Latent Implicit Visual Reasoning
par: Li, Kelvin, et autres
Publié: (2025)