Evolving Interpretable Visual Classifiers with Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Chiquier, Mia, Mall, Utkarsh, Vondrick, Carl |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DiSciPLE: Learning Interpretable Programs for Scientific Visual Discovery
di: Mall, Utkarsh, et al.
Pubblicazione: (2025)
di: Mall, Utkarsh, et al.
Pubblicazione: (2025)
How Video Meetings Change Your Expression
di: Sarin, Sumit, et al.
Pubblicazione: (2024)
di: Sarin, Sumit, et al.
Pubblicazione: (2024)
New York Smells: A Large Multimodal Dataset for Olfaction
di: Ozguroglu, Ege, et al.
Pubblicazione: (2025)
di: Ozguroglu, Ege, et al.
Pubblicazione: (2025)
Teaching Humans Subtle Differences with DIFFusion
di: Chiquier, Mia, et al.
Pubblicazione: (2025)
di: Chiquier, Mia, et al.
Pubblicazione: (2025)
Whiteboard-of-Thought: Thinking Step-by-Step Across Modalities
di: Menon, Sachit, et al.
Pubblicazione: (2024)
di: Menon, Sachit, et al.
Pubblicazione: (2024)
Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assembly
di: Chetan, Aditya, et al.
Pubblicazione: (2026)
di: Chetan, Aditya, et al.
Pubblicazione: (2026)
Sin3DM: Learning a Diffusion Model from a Single 3D Textured Shape
di: Wu, Rundi, et al.
Pubblicazione: (2023)
di: Wu, Rundi, et al.
Pubblicazione: (2023)
AllClear: A Comprehensive Dataset and Benchmark for Cloud Removal in Satellite Imagery
di: Zhou, Hangyu, et al.
Pubblicazione: (2024)
di: Zhou, Hangyu, et al.
Pubblicazione: (2024)
Counting Circuits: Mechanistic Interpretability of Visual Reasoning in Large Vision-Language Models
di: Che, Liwei, et al.
Pubblicazione: (2026)
di: Che, Liwei, et al.
Pubblicazione: (2026)
Debiasing Classifiers by Amplifying Bias with Latent Diffusion and Large Language Models
di: Ko, Donggeun, et al.
Pubblicazione: (2024)
di: Ko, Donggeun, et al.
Pubblicazione: (2024)
Interpretable Action Recognition on Hard to Classify Actions
di: Anichenko, Anastasia, et al.
Pubblicazione: (2024)
di: Anichenko, Anastasia, et al.
Pubblicazione: (2024)
Evolving Prompt Adaptation for Vision-Language Models
di: Zhang, Enming, et al.
Pubblicazione: (2026)
di: Zhang, Enming, et al.
Pubblicazione: (2026)
Do multimodal models imagine electric sheep?
di: Ramakrishnan, Santhosh Kumar, et al.
Pubblicazione: (2026)
di: Ramakrishnan, Santhosh Kumar, et al.
Pubblicazione: (2026)
Visual Large Language Models for Generalized and Specialized Applications
di: Li, Yifan, et al.
Pubblicazione: (2025)
di: Li, Yifan, et al.
Pubblicazione: (2025)
Visual Graph Arena: Evaluating Visual Conceptualization of Vision and Multimodal Large Language Models
di: Babaiee, Zahra, et al.
Pubblicazione: (2025)
di: Babaiee, Zahra, et al.
Pubblicazione: (2025)
Enhancing Advanced Visual Reasoning Ability of Large Language Models
di: Li, Zhiyuan, et al.
Pubblicazione: (2024)
di: Li, Zhiyuan, et al.
Pubblicazione: (2024)
Demystifying the Visual Quality Paradox in Multimodal Large Language Models
di: Xing, Shuo, et al.
Pubblicazione: (2025)
di: Xing, Shuo, et al.
Pubblicazione: (2025)
Aligning Cellular Sheaves with Classifier Attention for Interpretable Weakly-Supervised Pathology Localization
di: Lalwani, Devansh, et al.
Pubblicazione: (2026)
di: Lalwani, Devansh, et al.
Pubblicazione: (2026)
Divide-and-Conquer Inference for Large-Scale Visual Recognition with Multimodal Large Language Models
di: Ye, Zhipeng, et al.
Pubblicazione: (2026)
di: Ye, Zhipeng, et al.
Pubblicazione: (2026)
SE-VLN: A Self-Evolving Vision-Language Navigation Framework Based on Multimodal Large Language Models
di: Dong, Xiangyu, et al.
Pubblicazione: (2025)
di: Dong, Xiangyu, et al.
Pubblicazione: (2025)
On Large Visual Language Models for Medical Imaging Analysis: An Empirical Study
di: Van, Minh-Hao, et al.
Pubblicazione: (2024)
di: Van, Minh-Hao, et al.
Pubblicazione: (2024)
Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens
di: Kim, Sohee, et al.
Pubblicazione: (2025)
di: Kim, Sohee, et al.
Pubblicazione: (2025)
Visual Funnel: Resolving Contextual Blindness in Multimodal Large Language Models
di: Jung, Woojun, et al.
Pubblicazione: (2025)
di: Jung, Woojun, et al.
Pubblicazione: (2025)
Advancing Visual Large Language Model for Multi-granular Versatile Perception
di: Xiang, Wentao, et al.
Pubblicazione: (2025)
di: Xiang, Wentao, et al.
Pubblicazione: (2025)
Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models
di: Li, Hengzhuang, et al.
Pubblicazione: (2025)
di: Li, Hengzhuang, et al.
Pubblicazione: (2025)
QAVA: Query-Agnostic Visual Attack to Large Vision-Language Models
di: Zhang, Yudong, et al.
Pubblicazione: (2025)
di: Zhang, Yudong, et al.
Pubblicazione: (2025)
Medical Large Vision Language Models with Multi-Image Visual Ability
di: Yang, Xikai, et al.
Pubblicazione: (2025)
di: Yang, Xikai, et al.
Pubblicazione: (2025)
Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning
di: Zhan, Yufei, et al.
Pubblicazione: (2025)
di: Zhan, Yufei, et al.
Pubblicazione: (2025)
Boosting Multimodal Large Language Models with Visual Tokens Withdrawal for Rapid Inference
di: Lin, Zhihang, et al.
Pubblicazione: (2024)
di: Lin, Zhihang, et al.
Pubblicazione: (2024)
VISOR++: Universal Visual Inputs based Steering for Large Vision Language Models
di: Balakrishnan, Ravikumar, et al.
Pubblicazione: (2025)
di: Balakrishnan, Ravikumar, et al.
Pubblicazione: (2025)
Visual-Noise Guided In-Context Distillation for Multimodal Large Language Model Unlearning
di: Chen, Junkai, et al.
Pubblicazione: (2026)
di: Chen, Junkai, et al.
Pubblicazione: (2026)
AUVIC: Adversarial Unlearning of Visual Concepts for Multi-modal Large Language Models
di: Chen, Haokun, et al.
Pubblicazione: (2025)
di: Chen, Haokun, et al.
Pubblicazione: (2025)
Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models
di: Dong, Xinpeng, et al.
Pubblicazione: (2026)
di: Dong, Xinpeng, et al.
Pubblicazione: (2026)
From Pixels to Explanations: Interpretable Diabetic Retinopathy Grading with CNN-Transformer Ensembles, Visual Explainability and Vision-Language Models
di: Khokhar, Pir Bakhsh, et al.
Pubblicazione: (2026)
di: Khokhar, Pir Bakhsh, et al.
Pubblicazione: (2026)
Interpreting and Enhancing Emotional Circuits in Large Vision-Language Models via Cross-Modal Information Flow
di: Zhang, Chengsheng, et al.
Pubblicazione: (2026)
di: Zhang, Chengsheng, et al.
Pubblicazione: (2026)
\textit{FocaLogic}: Logic-Based Interpretation of Visual Model Decisions
di: Zhao, Chenchen, et al.
Pubblicazione: (2026)
di: Zhao, Chenchen, et al.
Pubblicazione: (2026)
Self-Evolving Spatial Reasoning in Vision Language Models via Geometric Logic Consistency
di: Liu, Junming, et al.
Pubblicazione: (2026)
di: Liu, Junming, et al.
Pubblicazione: (2026)
Visual-Oriented Fine-Grained Knowledge Editing for MultiModal Large Language Models
di: Zeng, Zhen, et al.
Pubblicazione: (2024)
di: Zeng, Zhen, et al.
Pubblicazione: (2024)
BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models
di: Tang, Jianting, et al.
Pubblicazione: (2025)
di: Tang, Jianting, et al.
Pubblicazione: (2025)
Towards Fine-Grained Recognition with Large Visual Language Models: Benchmark and Optimization Strategies
di: Pang, Cong, et al.
Pubblicazione: (2025)
di: Pang, Cong, et al.
Pubblicazione: (2025)
Documenti analoghi
-
DiSciPLE: Learning Interpretable Programs for Scientific Visual Discovery
di: Mall, Utkarsh, et al.
Pubblicazione: (2025) -
How Video Meetings Change Your Expression
di: Sarin, Sumit, et al.
Pubblicazione: (2024) -
New York Smells: A Large Multimodal Dataset for Olfaction
di: Ozguroglu, Ege, et al.
Pubblicazione: (2025) -
Teaching Humans Subtle Differences with DIFFusion
di: Chiquier, Mia, et al.
Pubblicazione: (2025) -
Whiteboard-of-Thought: Thinking Step-by-Step Across Modalities
di: Menon, Sachit, et al.
Pubblicazione: (2024)