LLMs as Visual Explainers: Advancing Image Classification with Evolving Visual Descriptions
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Han, Songhao, Zhuo, Le, Liao, Yue, Liu, Si |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Towards Desiderata-Driven Design of Visual Counterfactual Explainers
par: Bender, Sidney, et autres
Publié: (2025)
par: Bender, Sidney, et autres
Publié: (2025)
MetaToken: Detecting Hallucination in Image Descriptions by Meta Classification
par: Fieback, Laura, et autres
Publié: (2024)
par: Fieback, Laura, et autres
Publié: (2024)
EMMA: Efficient Visual Alignment in Multi-Modal LLMs
par: Ghazanfari, Sara, et autres
Publié: (2024)
par: Ghazanfari, Sara, et autres
Publié: (2024)
VLLaVO: Mitigating Visual Gap through LLMs
par: Chen, Shuhao, et autres
Publié: (2024)
par: Chen, Shuhao, et autres
Publié: (2024)
Follow-Up Differential Descriptions: Language Models Resolve Ambiguities for Image Classification
par: Esfandiarpoor, Reza, et autres
Publié: (2023)
par: Esfandiarpoor, Reza, et autres
Publié: (2023)
Mostly Text, Smart Visuals: Asymmetric Text-Visual Pruning for Large Vision-Language Models
par: Li, Sijie, et autres
Publié: (2026)
par: Li, Sijie, et autres
Publié: (2026)
Why are Visually-Grounded Language Models Bad at Image Classification?
par: Zhang, Yuhui, et autres
Publié: (2024)
par: Zhang, Yuhui, et autres
Publié: (2024)
VisMin: Visual Minimal-Change Understanding
par: Awal, Rabiul, et autres
Publié: (2024)
par: Awal, Rabiul, et autres
Publié: (2024)
Factuality Matters: When Image Generation and Editing Meet Structured Visuals
par: Zhuo, Le, et autres
Publié: (2025)
par: Zhuo, Le, et autres
Publié: (2025)
LatentExplainer: Explaining Latent Representations in Deep Generative Models with Multimodal Large Language Models
par: Zhu, Mengdan, et autres
Publié: (2024)
par: Zhu, Mengdan, et autres
Publié: (2024)
ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning
par: Kim, Taewhan, et autres
Publié: (2024)
par: Kim, Taewhan, et autres
Publié: (2024)
Visual Planning: Let's Think Only with Images
par: Xu, Yi, et autres
Publié: (2025)
par: Xu, Yi, et autres
Publié: (2025)
Evaluation of Audio-Visual Alignments in Visually Grounded Speech Models
par: Khorrami, Khazar, et autres
Publié: (2021)
par: Khorrami, Khazar, et autres
Publié: (2021)
VisualRWKV: Exploring Recurrent Neural Networks for Visual Language Models
par: Hou, Haowen, et autres
Publié: (2024)
par: Hou, Haowen, et autres
Publié: (2024)
Learning Conformal Explainers for Image Classifiers
par: Alkhatib, Amr, et autres
Publié: (2025)
par: Alkhatib, Amr, et autres
Publié: (2025)
VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks
par: Koh, Jing Yu, et autres
Publié: (2024)
par: Koh, Jing Yu, et autres
Publié: (2024)
JPEG-LM: LLMs as Image Generators with Canonical Codec Representations
par: Han, Xiaochuang, et autres
Publié: (2024)
par: Han, Xiaochuang, et autres
Publié: (2024)
ElectroVizQA: How well do Multi-modal LLMs perform in Electronics Visual Question Answering?
par: Meshram, Pragati Shuddhodhan, et autres
Publié: (2024)
par: Meshram, Pragati Shuddhodhan, et autres
Publié: (2024)
PerceptionCLIP: Visual Classification by Inferring and Conditioning on Contexts
par: An, Bang, et autres
Publié: (2023)
par: An, Bang, et autres
Publié: (2023)
Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning
par: Jie, Shibo, et autres
Publié: (2024)
par: Jie, Shibo, et autres
Publié: (2024)
SynthRL: Scaling Visual Reasoning with Verifiable Data Synthesis
par: Wu, Zijian, et autres
Publié: (2025)
par: Wu, Zijian, et autres
Publié: (2025)
VIST-GPT: Ushering in the Era of Visual Storytelling with LLMs?
par: Gado, Mohamed, et autres
Publié: (2025)
par: Gado, Mohamed, et autres
Publié: (2025)
Enhancing Visual Question Answering through Ranking-Based Hybrid Training and Multimodal Fusion
par: Chen, Peiyuan, et autres
Publié: (2024)
par: Chen, Peiyuan, et autres
Publié: (2024)
Glyph: Scaling Context Windows via Visual-Text Compression
par: Cheng, Jiale, et autres
Publié: (2025)
par: Cheng, Jiale, et autres
Publié: (2025)
VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection
par: Han, Songhao, et autres
Publié: (2024)
par: Han, Songhao, et autres
Publié: (2024)
Contextual Knowledge Pursuit for Faithful Visual Synthesis
par: Luo, Jinqi, et autres
Publié: (2023)
par: Luo, Jinqi, et autres
Publié: (2023)
Learning from Synthetic Data for Visual Grounding
par: He, Ruozhen, et autres
Publié: (2024)
par: He, Ruozhen, et autres
Publié: (2024)
Composition-Grounded Data Synthesis for Visual Reasoning
par: Gu, Xinyi, et autres
Publié: (2025)
par: Gu, Xinyi, et autres
Publié: (2025)
Self-Evolving Visual Concept Library using Vision-Language Critics
par: Sehgal, Atharva, et autres
Publié: (2025)
par: Sehgal, Atharva, et autres
Publié: (2025)
Grounding Descriptions in Images informs Zero-Shot Visual Recognition
par: Halbe, Shaunak, et autres
Publié: (2024)
par: Halbe, Shaunak, et autres
Publié: (2024)
Unifying Specialized Visual Encoders for Video Language Models
par: Chung, Jihoon, et autres
Publié: (2025)
par: Chung, Jihoon, et autres
Publié: (2025)
Multi-Modal Hallucination Control by Visual Information Grounding
par: Favero, Alessandro, et autres
Publié: (2024)
par: Favero, Alessandro, et autres
Publié: (2024)
Imagine while Reasoning in Space: Multimodal Visualization-of-Thought
par: Li, Chengzu, et autres
Publié: (2025)
par: Li, Chengzu, et autres
Publié: (2025)
Multimodal Arabic Captioning with Interpretable Visual Concept Integration
par: Elchafei, Passant, et autres
Publié: (2025)
par: Elchafei, Passant, et autres
Publié: (2025)
LLMs Can Evolve Continually on Modality for X-Modal Reasoning
par: Yu, Jiazuo, et autres
Publié: (2024)
par: Yu, Jiazuo, et autres
Publié: (2024)
FlagEval Findings Report: A Preliminary Evaluation of Large Reasoning Models on Automatically Verifiable Textual and Visual Questions
par: Qin, Bowen, et autres
Publié: (2025)
par: Qin, Bowen, et autres
Publié: (2025)
CAPability: A Comprehensive Visual Caption Benchmark for Evaluating Both Correctness and Thoroughness
par: Liu, Zhihang, et autres
Publié: (2025)
par: Liu, Zhihang, et autres
Publié: (2025)
Textual Steering Vectors Can Improve Visual Understanding in Multimodal Large Language Models
par: Gan, Woody Haosheng, et autres
Publié: (2025)
par: Gan, Woody Haosheng, et autres
Publié: (2025)
T-MARS: Improving Visual Representations by Circumventing Text Feature Learning
par: Maini, Pratyush, et autres
Publié: (2023)
par: Maini, Pratyush, et autres
Publié: (2023)
Journey Before Destination: On the importance of Visual Faithfulness in Slow Thinking
par: Uppaal, Rheeya, et autres
Publié: (2025)
par: Uppaal, Rheeya, et autres
Publié: (2025)
Documents similaires
-
Towards Desiderata-Driven Design of Visual Counterfactual Explainers
par: Bender, Sidney, et autres
Publié: (2025) -
MetaToken: Detecting Hallucination in Image Descriptions by Meta Classification
par: Fieback, Laura, et autres
Publié: (2024) -
EMMA: Efficient Visual Alignment in Multi-Modal LLMs
par: Ghazanfari, Sara, et autres
Publié: (2024) -
VLLaVO: Mitigating Visual Gap through LLMs
par: Chen, Shuhao, et autres
Publié: (2024) -
Follow-Up Differential Descriptions: Language Models Resolve Ambiguities for Image Classification
par: Esfandiarpoor, Reza, et autres
Publié: (2023)