A Multimodal Automated Interpretability Agent
Fuente:
arXiv
Salvato in:
| Autori principali: | Shaham, Tamar Rott, Schwettmann, Sarah, Wang, Franklin, Rajaram, Achyuta, Hernandez, Evan, Andreas, Jacob, Torralba, Antonio |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Automatic Discovery of Visual Circuits
di: Rajaram, Achyuta, et al.
Pubblicazione: (2024)
di: Rajaram, Achyuta, et al.
Pubblicazione: (2024)
Line of Sight: On Linear Representations in VLLMs
di: Rajaram, Achyuta, et al.
Pubblicazione: (2025)
di: Rajaram, Achyuta, et al.
Pubblicazione: (2025)
Nearest Neighbor Normalization Improves Multimodal Retrieval
di: Chowdhury, Neil, et al.
Pubblicazione: (2024)
di: Chowdhury, Neil, et al.
Pubblicazione: (2024)
Automated Detection of Visual Attribute Reliance with a Self-Reflective Agent
di: Li, Christy, et al.
Pubblicazione: (2025)
di: Li, Christy, et al.
Pubblicazione: (2025)
Vision-Language Binding in In-Context Image Generation
di: Ge, Chris, et al.
Pubblicazione: (2026)
di: Ge, Chris, et al.
Pubblicazione: (2026)
SketchAgent: Language-Driven Sequential Sketch Generation
di: Vinker, Yael, et al.
Pubblicazione: (2024)
di: Vinker, Yael, et al.
Pubblicazione: (2024)
BrainExplore: Large-Scale Discovery of Interpretable Visual Representations in the Human Brain
di: Wasserman, Navve, et al.
Pubblicazione: (2025)
di: Wasserman, Navve, et al.
Pubblicazione: (2025)
A Vision Check-up for Language Models
di: Sharma, Pratyusha, et al.
Pubblicazione: (2024)
di: Sharma, Pratyusha, et al.
Pubblicazione: (2024)
Multimodal LLMs Struggle with Basic Visual Network Analysis: a VNA Benchmark
di: Williams, Evan M., et al.
Pubblicazione: (2024)
di: Williams, Evan M., et al.
Pubblicazione: (2024)
The Dual Mechanisms of Spatial Reasoning in Vision-Language Models
di: Cui, Kelly, et al.
Pubblicazione: (2026)
di: Cui, Kelly, et al.
Pubblicazione: (2026)
Large Multimodal Agents: A Survey
di: Xie, Junlin, et al.
Pubblicazione: (2024)
di: Xie, Junlin, et al.
Pubblicazione: (2024)
VisualAgentBench: Towards Large Multimodal Models as Visual Foundation Agents
di: Liu, Xiao, et al.
Pubblicazione: (2024)
di: Liu, Xiao, et al.
Pubblicazione: (2024)
MM-WebAgent: A Hierarchical Multimodal Web Agent for Webpage Generation
di: Li, Yan, et al.
Pubblicazione: (2026)
di: Li, Yan, et al.
Pubblicazione: (2026)
A Multimodal Recaptioning Framework to Account for Perceptual Diversity Across Languages in Vision-Language Modeling
di: Buettner, Kyle, et al.
Pubblicazione: (2025)
di: Buettner, Kyle, et al.
Pubblicazione: (2025)
RestoreAgent: Autonomous Image Restoration Agent via Multimodal Large Language Models
di: Chen, Haoyu, et al.
Pubblicazione: (2024)
di: Chen, Haoyu, et al.
Pubblicazione: (2024)
MMInA: Benchmarking Multihop Multimodal Internet Agents
di: Tian, Shulin, et al.
Pubblicazione: (2024)
di: Tian, Shulin, et al.
Pubblicazione: (2024)
MMToM-QA: Multimodal Theory of Mind Question Answering
di: Jin, Chuanyang, et al.
Pubblicazione: (2024)
di: Jin, Chuanyang, et al.
Pubblicazione: (2024)
MATRIX: Multimodal Agent Tuning for Robust Tool-Use Reasoning
di: Ashraf, Tajamul, et al.
Pubblicazione: (2025)
di: Ashraf, Tajamul, et al.
Pubblicazione: (2025)
DART: Leveraging Multi-Agent Disagreement for Tool Recruitment in Multimodal Reasoning
di: Sivakumaran, Nithin, et al.
Pubblicazione: (2025)
di: Sivakumaran, Nithin, et al.
Pubblicazione: (2025)
The Power of Many: Multi-Agent Multimodal Models for Cultural Image Captioning
di: Bai, Longju, et al.
Pubblicazione: (2024)
di: Bai, Longju, et al.
Pubblicazione: (2024)
MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents
di: Li, Shilong, et al.
Pubblicazione: (2025)
di: Li, Shilong, et al.
Pubblicazione: (2025)
From Activation to Causality: Discovery of Causal Visual Representations in the Human Brain
di: Golbari, Yuval, et al.
Pubblicazione: (2026)
di: Golbari, Yuval, et al.
Pubblicazione: (2026)
M^3Builder: A Multi-Agent System for Automated Machine Learning in Medical Imaging
di: Feng, Jinghao, et al.
Pubblicazione: (2025)
di: Feng, Jinghao, et al.
Pubblicazione: (2025)
DriVLMe: Enhancing LLM-based Autonomous Driving Agents with Embodied and Social Experiences
di: Huang, Yidong, et al.
Pubblicazione: (2024)
di: Huang, Yidong, et al.
Pubblicazione: (2024)
Do Visual Imaginations Improve Vision-and-Language Navigation Agents?
di: Perincherry, Akhil, et al.
Pubblicazione: (2025)
di: Perincherry, Akhil, et al.
Pubblicazione: (2025)
Inquire, Interact, and Integrate: A Proactive Agent Collaborative Framework for Zero-Shot Multimodal Medical Reasoning
di: Gu, Zishan, et al.
Pubblicazione: (2024)
di: Gu, Zishan, et al.
Pubblicazione: (2024)
Exploiting Mixture-of-Experts Redundancy Unlocks Multimodal Generative Abilities
di: Dutt, Raman, et al.
Pubblicazione: (2025)
di: Dutt, Raman, et al.
Pubblicazione: (2025)
Toward Robust Multimodal Learning using Multimodal Foundational Models
di: Zhao, Xianbing, et al.
Pubblicazione: (2024)
di: Zhao, Xianbing, et al.
Pubblicazione: (2024)
VideoAutoArena: An Automated Arena for Evaluating Large Multimodal Models in Video Analysis through User Simulation
di: Luo, Ziyang, et al.
Pubblicazione: (2024)
di: Luo, Ziyang, et al.
Pubblicazione: (2024)
TheoremExplainAgent: Towards Video-based Multimodal Explanations for LLM Theorem Understanding
di: Ku, Max, et al.
Pubblicazione: (2025)
di: Ku, Max, et al.
Pubblicazione: (2025)
MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
di: Xia, Peng, et al.
Pubblicazione: (2025)
di: Xia, Peng, et al.
Pubblicazione: (2025)
A Concept-based Interpretable Model for the Diagnosis of Choroid Neoplasias using Multimodal Data
di: Wu, Yifan, et al.
Pubblicazione: (2024)
di: Wu, Yifan, et al.
Pubblicazione: (2024)
Paper2Poster: Towards Multimodal Poster Automation from Scientific Papers
di: Pang, Wei, et al.
Pubblicazione: (2025)
di: Pang, Wei, et al.
Pubblicazione: (2025)
UI-TARS: Pioneering Automated GUI Interaction with Native Agents
di: Qin, Yujia, et al.
Pubblicazione: (2025)
di: Qin, Yujia, et al.
Pubblicazione: (2025)
Towards Rationality in Language and Multimodal Agents: A Survey
di: Jiang, Bowen, et al.
Pubblicazione: (2024)
di: Jiang, Bowen, et al.
Pubblicazione: (2024)
Cyclic Vision-Language Manipulator: Towards Reliable and Fine-Grained Image Interpretation for Automated Report Generation
di: Fang, Yingying, et al.
Pubblicazione: (2024)
di: Fang, Yingying, et al.
Pubblicazione: (2024)
E$^2$AT: Multimodal Jailbreak Defense via Dynamic Joint Optimization for Multimodal Large Language Models
di: Lu, Liming, et al.
Pubblicazione: (2025)
di: Lu, Liming, et al.
Pubblicazione: (2025)
MedRepBench: A Comprehensive Benchmark for Medical Report Interpretation
di: Shang, Fangxin, et al.
Pubblicazione: (2025)
di: Shang, Fangxin, et al.
Pubblicazione: (2025)
Dynamic Clue Bottlenecks: Towards Interpretable-by-Design Visual Question Answering
di: Fu, Xingyu, et al.
Pubblicazione: (2023)
di: Fu, Xingyu, et al.
Pubblicazione: (2023)
VisionGPT-3D: A Generalized Multimodal Agent for Enhanced 3D Vision Understanding
di: Kelly, Chris, et al.
Pubblicazione: (2024)
di: Kelly, Chris, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Automatic Discovery of Visual Circuits
di: Rajaram, Achyuta, et al.
Pubblicazione: (2024) -
Line of Sight: On Linear Representations in VLLMs
di: Rajaram, Achyuta, et al.
Pubblicazione: (2025) -
Nearest Neighbor Normalization Improves Multimodal Retrieval
di: Chowdhury, Neil, et al.
Pubblicazione: (2024) -
Automated Detection of Visual Attribute Reliance with a Self-Reflective Agent
di: Li, Christy, et al.
Pubblicazione: (2025) -
Vision-Language Binding in In-Context Image Generation
di: Ge, Chris, et al.
Pubblicazione: (2026)