Visual Question Decomposition on Multimodal Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Haowei, Liu, Jianzhe, Han, Zhen, Chen, Shuo, He, Bailan, Tresp, Volker, Xu, Zhiqiang, Gu, Jindong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Can Multimodal Large Language Models Truly Perform Multimodal In-Context Learning?
par: Chen, Shuo, et autres
Publié: (2023)
par: Chen, Shuo, et autres
Publié: (2023)
True Multimodal In-Context Learning Needs Attention to the Visual Context
par: Chen, Shuo, et autres
Publié: (2025)
par: Chen, Shuo, et autres
Publié: (2025)
AUVIC: Adversarial Unlearning of Visual Concepts for Multi-modal Large Language Models
par: Chen, Haokun, et autres
Publié: (2025)
par: Chen, Haokun, et autres
Publié: (2025)
POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering
par: Xu, Yichen, et autres
Publié: (2025)
par: Xu, Yichen, et autres
Publié: (2025)
Frequency-Modulated Visual Restoration for Matryoshka Large Multimodal Models
par: Pan, Qingtao, et autres
Publié: (2026)
par: Pan, Qingtao, et autres
Publié: (2026)
Teaching Vision-Language Models to Ask: Resolving Ambiguity in Visual Questions
par: Jian, Pu, et autres
Publié: (2025)
par: Jian, Pu, et autres
Publié: (2025)
Self-Discovering Interpretable Diffusion Latent Directions for Responsible Text-to-Image Generation
par: Li, Hang, et autres
Publié: (2023)
par: Li, Hang, et autres
Publié: (2023)
MM-Soc: Benchmarking Multimodal Large Language Models in Social Media Platforms
par: Jin, Yiqiao, et autres
Publié: (2024)
par: Jin, Yiqiao, et autres
Publié: (2024)
Learning How To Ask: Cycle-Consistency Refines Prompts in Multimodal Foundation Models
par: Diesendruck, Maurice, et autres
Publié: (2024)
par: Diesendruck, Maurice, et autres
Publié: (2024)
Large Vision-Language Models for Remote Sensing Visual Question Answering
par: Siripong, Surasakdi, et autres
Publié: (2024)
par: Siripong, Surasakdi, et autres
Publié: (2024)
LLaVA Steering: Visual Instruction Tuning with 500x Fewer Parameters through Modality Linear Representation-Steering
par: Bi, Jinhe, et autres
Publié: (2024)
par: Bi, Jinhe, et autres
Publié: (2024)
AViLA: Asynchronous Vision-Language Agent for Streaming Multimodal Data Interaction
par: Zhang, Gengyuan, et autres
Publié: (2025)
par: Zhang, Gengyuan, et autres
Publié: (2025)
ShortV: Efficient Multimodal Large Language Models by Freezing Visual Tokens in Ineffective Layers
par: Yuan, Qianhao, et autres
Publié: (2025)
par: Yuan, Qianhao, et autres
Publié: (2025)
UNIKIE-BENCH: Benchmarking Large Multimodal Models for Key Information Extraction in Visual Documents
par: Ji, Yifan, et autres
Publié: (2026)
par: Ji, Yifan, et autres
Publié: (2026)
Multi-event Video-Text Retrieval
par: Zhang, Gengyuan, et autres
Publié: (2023)
par: Zhang, Gengyuan, et autres
Publié: (2023)
TUBench: Benchmarking Large Vision-Language Models on Trustworthiness with Unanswerable Questions
par: He, Xingwei, et autres
Publié: (2024)
par: He, Xingwei, et autres
Publié: (2024)
SAISA: Towards Multimodal Large Language Models with Both Training and Inference Efficiency
par: Yuan, Qianhao, et autres
Publié: (2025)
par: Yuan, Qianhao, et autres
Publié: (2025)
VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering
par: Wang, Yanling, et autres
Publié: (2025)
par: Wang, Yanling, et autres
Publié: (2025)
CODIS: Benchmarking Context-Dependent Visual Comprehension for Multimodal Large Language Models
par: Luo, Fuwen, et autres
Publié: (2024)
par: Luo, Fuwen, et autres
Publié: (2024)
Generalizing Visual Question Answering from Synthetic to Human-Written Questions via a Chain of QA with a Large Language Model
par: Kim, Taehee, et autres
Publié: (2024)
par: Kim, Taehee, et autres
Publié: (2024)
Task-Aware Resolution Optimization for Visual Large Language Models
par: Luo, Weiqing, et autres
Publié: (2025)
par: Luo, Weiqing, et autres
Publié: (2025)
LaPA: Latent Prompt Assist Model For Medical Visual Question Answering
par: Gu, Tiancheng, et autres
Publié: (2024)
par: Gu, Tiancheng, et autres
Publié: (2024)
PDF-MVQA: A Dataset for Multimodal Information Retrieval in PDF-based Visual Question Answering
par: Ding, Yihao, et autres
Publié: (2024)
par: Ding, Yihao, et autres
Publié: (2024)
ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos
par: Hannan, Tanveer, et autres
Publié: (2024)
par: Hannan, Tanveer, et autres
Publié: (2024)
MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models
par: Wang, Shengkang, et autres
Publié: (2024)
par: Wang, Shengkang, et autres
Publié: (2024)
Multimodal Integration of Human-Like Attention in Visual Question Answering
par: Sood, Ekta, et autres
Publié: (2021)
par: Sood, Ekta, et autres
Publié: (2021)
HyperVL: An Efficient and Dynamic Multimodal Large Language Model for Edge Devices
par: HyperAI Team, et autres
Publié: (2025)
par: HyperAI Team, et autres
Publié: (2025)
Knowledge Acquisition Disentanglement for Knowledge-based Visual Question Answering with Large Language Models
par: An, Wenbin, et autres
Publié: (2024)
par: An, Wenbin, et autres
Publié: (2024)
Stop Reasoning! When Multimodal LLM with Chain-of-Thought Reasoning Meets Adversarial Image
par: Wang, Zefeng, et autres
Publié: (2024)
par: Wang, Zefeng, et autres
Publié: (2024)
Exploring Typographic Visual Prompts Injection Threats in Cross-Modality Generation Models
par: Cheng, Hao, et autres
Publié: (2025)
par: Cheng, Hao, et autres
Publié: (2025)
A Survey on Responsible Generative AI: What to Generate and What Not
par: Gu, Jindong
Publié: (2024)
par: Gu, Jindong
Publié: (2024)
Strengthening Multimodal Large Language Model with Bootstrapped Preference Optimization
par: Pi, Renjie, et autres
Publié: (2024)
par: Pi, Renjie, et autres
Publié: (2024)
Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language Models
par: Li, Yifan, et autres
Publié: (2024)
par: Li, Yifan, et autres
Publié: (2024)
Design as Desired: Utilizing Visual Question Answering for Multimodal Pre-training
par: Su, Tongkun, et autres
Publié: (2024)
par: Su, Tongkun, et autres
Publié: (2024)
DREAM: Disentangling Risks to Enhance Safety Alignment in Multimodal Large Language Models
par: Liu, Jianyu, et autres
Publié: (2025)
par: Liu, Jianyu, et autres
Publié: (2025)
Towards Perceiving Small Visual Details in Zero-shot Visual Question Answering with Multimodal LLMs
par: Zhang, Jiarui, et autres
Publié: (2023)
par: Zhang, Jiarui, et autres
Publié: (2023)
LLAVADI: What Matters For Multimodal Large Language Models Distillation
par: Xu, Shilin, et autres
Publié: (2024)
par: Xu, Shilin, et autres
Publié: (2024)
Benchmarking the Thinking Mode of Multimodal Large Language Models in Clinical Tasks
par: Hong, Jindong, et autres
Publié: (2025)
par: Hong, Jindong, et autres
Publié: (2025)
VLMT: Vision-Language Multimodal Transformer for Multimodal Multi-hop Question Answering
par: Lim, Qi Zhi, et autres
Publié: (2025)
par: Lim, Qi Zhi, et autres
Publié: (2025)
OpenDriveVLA: Towards End-to-end Autonomous Driving with Large Vision Language Action Model
par: Zhou, Xingcheng, et autres
Publié: (2025)
par: Zhou, Xingcheng, et autres
Publié: (2025)
Documents similaires
-
Can Multimodal Large Language Models Truly Perform Multimodal In-Context Learning?
par: Chen, Shuo, et autres
Publié: (2023) -
True Multimodal In-Context Learning Needs Attention to the Visual Context
par: Chen, Shuo, et autres
Publié: (2025) -
AUVIC: Adversarial Unlearning of Visual Concepts for Multi-modal Large Language Models
par: Chen, Haokun, et autres
Publié: (2025) -
POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering
par: Xu, Yichen, et autres
Publié: (2025) -
Frequency-Modulated Visual Restoration for Matryoshka Large Multimodal Models
par: Pan, Qingtao, et autres
Publié: (2026)