On the Out-of-Distribution Generalization of Reasoning in Multimodal LLMs for Simple Visual Planning Tasks
Fuente:
arXiv
Salvato in:
| Autori principali: | Neuhaus, Yannic, Flammarion, Nicolas, Hein, Matthias, Croce, Francesco |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens
di: Schlarmann, Christian, et al.
Pubblicazione: (2025)
di: Schlarmann, Christian, et al.
Pubblicazione: (2025)
RePOPE: Impact of Annotation Errors on the POPE Benchmark
di: Neuhaus, Yannic, et al.
Pubblicazione: (2025)
di: Neuhaus, Yannic, et al.
Pubblicazione: (2025)
DiG-IN: Diffusion Guidance for Investigating Networks -- Uncovering Classifier Differences Neuron Visualisations and Visual Counterfactual Explanations
di: Augustin, Maximilian, et al.
Pubblicazione: (2023)
di: Augustin, Maximilian, et al.
Pubblicazione: (2023)
DASH: Detection and Assessment of Systematic Hallucinations of VLMs
di: Augustin, Maximilian, et al.
Pubblicazione: (2025)
di: Augustin, Maximilian, et al.
Pubblicazione: (2025)
Towards Reliable Evaluation and Fast Training of Robust Semantic Segmentation Models
di: Croce, Francesco, et al.
Pubblicazione: (2023)
di: Croce, Francesco, et al.
Pubblicazione: (2023)
Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics
di: Ghazanfari, Sara, et al.
Pubblicazione: (2024)
di: Ghazanfari, Sara, et al.
Pubblicazione: (2024)
Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning
di: Ghazanfari, Sara, et al.
Pubblicazione: (2025)
di: Ghazanfari, Sara, et al.
Pubblicazione: (2025)
Adversarially Robust CLIP Models Can Induce Better (Robust) Perceptual Metrics
di: Croce, Francesco, et al.
Pubblicazione: (2025)
di: Croce, Francesco, et al.
Pubblicazione: (2025)
Perturb and Recover: Fine-tuning for Effective Backdoor Removal from CLIP
di: Singh, Naman Deep, et al.
Pubblicazione: (2024)
di: Singh, Naman Deep, et al.
Pubblicazione: (2024)
Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models
di: Schlarmann, Christian, et al.
Pubblicazione: (2024)
di: Schlarmann, Christian, et al.
Pubblicazione: (2024)
Visual Memory Injection Attacks for Multi-Turn Conversations
di: Schlarmann, Christian, et al.
Pubblicazione: (2026)
di: Schlarmann, Christian, et al.
Pubblicazione: (2026)
Extremely Simple Multimodal Outlier Synthesis for Out-of-Distribution Detection and Segmentation
di: Liu, Moru, et al.
Pubblicazione: (2025)
di: Liu, Moru, et al.
Pubblicazione: (2025)
Out-of-Distribution Detection with Relative Angles
di: Demirel, Berker, et al.
Pubblicazione: (2024)
di: Demirel, Berker, et al.
Pubblicazione: (2024)
On the Adversarial Robustness of Discrete Image Tokenizers
di: Bhagwatkar, Rishika, et al.
Pubblicazione: (2026)
di: Bhagwatkar, Rishika, et al.
Pubblicazione: (2026)
TagFog: Textual Anchor Guidance and Fake Outlier Generation for Visual Out-of-Distribution Detection
di: Chen, Jiankang, et al.
Pubblicazione: (2024)
di: Chen, Jiankang, et al.
Pubblicazione: (2024)
Understanding the Failure Modes of Out-of-Distribution Generalization
di: Nagarajan, Vaishnavh, et al.
Pubblicazione: (2020)
di: Nagarajan, Vaishnavh, et al.
Pubblicazione: (2020)
Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks
di: Andriushchenko, Maksym, et al.
Pubblicazione: (2024)
di: Andriushchenko, Maksym, et al.
Pubblicazione: (2024)
Mahalanobis++: Improving OOD Detection via Feature Normalization
di: Mueller, Maximilian, et al.
Pubblicazione: (2025)
di: Mueller, Maximilian, et al.
Pubblicazione: (2025)
How to train your ViT for OOD Detection
di: Mueller, Maximilian, et al.
Pubblicazione: (2024)
di: Mueller, Maximilian, et al.
Pubblicazione: (2024)
LoGex: Improved tail detection of extremely rare histopathology classes via guided diffusion
di: Mueller, Maximilian, et al.
Pubblicazione: (2024)
di: Mueller, Maximilian, et al.
Pubblicazione: (2024)
BOOD: Boundary-based Out-Of-Distribution Data Generation
di: Liao, Qilin, et al.
Pubblicazione: (2025)
di: Liao, Qilin, et al.
Pubblicazione: (2025)
Hypercone Assisted Contour Generation for Out-of-Distribution Detection
di: Vapsi, Annita, et al.
Pubblicazione: (2025)
di: Vapsi, Annita, et al.
Pubblicazione: (2025)
Generating Out-Of-Distribution Scenarios Using Language Models
di: Aasi, Erfan, et al.
Pubblicazione: (2024)
di: Aasi, Erfan, et al.
Pubblicazione: (2024)
Multi-Task Learning for Visually Grounded Reasoning in Gastrointestinal VQA
di: Safwan, Itbaan, et al.
Pubblicazione: (2025)
di: Safwan, Itbaan, et al.
Pubblicazione: (2025)
Beyond Knowledge Silos: Task Fingerprinting for Democratization of Medical Imaging AI
di: Godau, Patrick, et al.
Pubblicazione: (2024)
di: Godau, Patrick, et al.
Pubblicazione: (2024)
LCA-on-the-Line: Benchmarking Out-of-Distribution Generalization with Class Taxonomies
di: Shi, Jia, et al.
Pubblicazione: (2024)
di: Shi, Jia, et al.
Pubblicazione: (2024)
LanteRn: Latent Visual Structured Reasoning
di: Viveiros, André G., et al.
Pubblicazione: (2026)
di: Viveiros, André G., et al.
Pubblicazione: (2026)
Agentic AIs Are the Missing Paradigm for Out-of-Distribution Generalization in Foundation Models
di: Wang, Xin, et al.
Pubblicazione: (2026)
di: Wang, Xin, et al.
Pubblicazione: (2026)
Weight Averaging for Out-of-Distribution Generalization and Few-Shot Domain Adaptation
di: Xu, Shijian
Pubblicazione: (2025)
di: Xu, Shijian
Pubblicazione: (2025)
Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs
di: Yang, Ling, et al.
Pubblicazione: (2024)
di: Yang, Ling, et al.
Pubblicazione: (2024)
How Visual Representations Map to Language Feature Space in Multimodal LLMs
di: Venhoff, Constantin, et al.
Pubblicazione: (2025)
di: Venhoff, Constantin, et al.
Pubblicazione: (2025)
Advancing Generalization Across a Variety of Abstract Visual Reasoning Tasks
di: Małkiński, Mikołaj, et al.
Pubblicazione: (2025)
di: Małkiński, Mikołaj, et al.
Pubblicazione: (2025)
Bayesian Cross-Modal Alignment Learning for Few-Shot Out-of-Distribution Generalization
di: Zhu, Lin, et al.
Pubblicazione: (2025)
di: Zhu, Lin, et al.
Pubblicazione: (2025)
Approximations to the Fisher Information Metric of Deep Generative Models for Out-Of-Distribution Detection
di: Dauncey, Sam, et al.
Pubblicazione: (2024)
di: Dauncey, Sam, et al.
Pubblicazione: (2024)
Efficient Vocabulary-Free Fine-Grained Visual Recognition in the Age of Multimodal LLMs
di: Kuchibhotla, Hari Chandana, et al.
Pubblicazione: (2025)
di: Kuchibhotla, Hari Chandana, et al.
Pubblicazione: (2025)
VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks
di: Koh, Jing Yu, et al.
Pubblicazione: (2024)
di: Koh, Jing Yu, et al.
Pubblicazione: (2024)
Activation Subspaces for Out-of-Distribution Detection
di: Zöngür, Barış, et al.
Pubblicazione: (2025)
di: Zöngür, Barış, et al.
Pubblicazione: (2025)
Gradient-Regularized Out-of-Distribution Detection
di: Sharifi, Sina, et al.
Pubblicazione: (2024)
di: Sharifi, Sina, et al.
Pubblicazione: (2024)
Out-Of-Distribution Detection with Diversification (Provably)
di: Yao, Haiyun, et al.
Pubblicazione: (2024)
di: Yao, Haiyun, et al.
Pubblicazione: (2024)
Detecting Out-Of-Distribution Earth Observation Images with Diffusion Models
di: Bellier, Georges Le, et al.
Pubblicazione: (2024)
di: Bellier, Georges Le, et al.
Pubblicazione: (2024)
Documenti analoghi
-
FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens
di: Schlarmann, Christian, et al.
Pubblicazione: (2025) -
RePOPE: Impact of Annotation Errors on the POPE Benchmark
di: Neuhaus, Yannic, et al.
Pubblicazione: (2025) -
DiG-IN: Diffusion Guidance for Investigating Networks -- Uncovering Classifier Differences Neuron Visualisations and Visual Counterfactual Explanations
di: Augustin, Maximilian, et al.
Pubblicazione: (2023) -
DASH: Detection and Assessment of Systematic Hallucinations of VLMs
di: Augustin, Maximilian, et al.
Pubblicazione: (2025) -
Towards Reliable Evaluation and Fast Training of Robust Semantic Segmentation Models
di: Croce, Francesco, et al.
Pubblicazione: (2023)