Multimodal Task Interference: A Benchmark and Analysis of History-Target Mismatch in Multimodal LLMs
Fuente:
arXiv
Saved in:
| Main Authors: | Kawarada, Masayuki, Ishigaki, Tatsuya, Takamura, Hiroya |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Prompting for Numerical Sequences: A Case Study on Market Comment Generation
by: Kawarada, Masayuki, et al.
Published: (2024)
by: Kawarada, Masayuki, et al.
Published: (2024)
A Comparative Study of Demonstration Selection for Practical Large Language Models-based Next POI Prediction
by: Nishida, Ryo, et al.
Published: (2026)
by: Nishida, Ryo, et al.
Published: (2026)
Real-Time Generation of Game Video Commentary with Multimodal LLMs: Pause-Aware Decoding Approaches
by: Afzal, Anum, et al.
Published: (2026)
by: Afzal, Anum, et al.
Published: (2026)
QCoder Benchmark: Bridging Language Generation and Quantum Hardware through Simulator-Based Feedback
by: Mikuriya, Taku, et al.
Published: (2025)
by: Mikuriya, Taku, et al.
Published: (2025)
HOME-KGQA: A Benchmark Dataset for Multimodal Knowledge Graph Question Answering on Household Daily Activities
by: Egami, Shusaku, et al.
Published: (2026)
by: Egami, Shusaku, et al.
Published: (2026)
GAIN: A Benchmark for Goal-Aligned Decision-Making of Large Language Models under Imperfect Norms
by: Kawarada, Masayuki, et al.
Published: (2026)
by: Kawarada, Masayuki, et al.
Published: (2026)
Argument Mining as a Text-to-Text Generation Task
by: Kawarada, Masayuki, et al.
Published: (2026)
by: Kawarada, Masayuki, et al.
Published: (2026)
QuantumBench: A Benchmark for Quantum Problem Solving
by: Minami, Shunya, et al.
Published: (2025)
by: Minami, Shunya, et al.
Published: (2025)
Oogiri-Master: Benchmarking Humor Understanding via Oogiri
by: Murakami, Soichiro, et al.
Published: (2025)
by: Murakami, Soichiro, et al.
Published: (2025)
Who Laughs with Whom? Disentangling Influential Factors in Humor Preferences across User Clusters and LLMs
by: Murakami, Soichiro, et al.
Published: (2026)
by: Murakami, Soichiro, et al.
Published: (2026)
Enhancing Financial Sentiment Analysis with Expert-Designed Hint
by: Chen, Chung-Chi, et al.
Published: (2024)
by: Chen, Chung-Chi, et al.
Published: (2024)
Improving Interpretability of Lexical Semantic Change with Neurobiological Features
by: Oda, Kohei, et al.
Published: (2026)
by: Oda, Kohei, et al.
Published: (2026)
Modality Collapse as Mismatched Decoding: Information-Theoretic Limits of Multimodal LLMs
by: Billa, Jayadev
Published: (2026)
by: Billa, Jayadev
Published: (2026)
MMAFFBen: A Multilingual and Multimodal Affective Analysis Benchmark for Evaluating LLMs and VLMs
by: Liu, Zhiwei, et al.
Published: (2025)
by: Liu, Zhiwei, et al.
Published: (2025)
Distilling Analysis from Generative Models for Investment Decisions
by: Chen, Chung-Chi, et al.
Published: (2024)
by: Chen, Chung-Chi, et al.
Published: (2024)
Hierarchical Organization Simulacra in the Investment Sector
by: Chen, Chung-Chi, et al.
Published: (2024)
by: Chen, Chung-Chi, et al.
Published: (2024)
FinGen: A Dataset for Argument Generation in Finance
by: Chen, Chung-Chi, et al.
Published: (2024)
by: Chen, Chung-Chi, et al.
Published: (2024)
LLM Task Interference: An Initial Study on the Impact of Task-Switch in Conversational History
by: Gupta, Akash, et al.
Published: (2024)
by: Gupta, Akash, et al.
Published: (2024)
AdParaphrase v2.0: Generating Attractive Ad Texts Using a Preference-Annotated Paraphrase Dataset
by: Murakami, Soichiro, et al.
Published: (2025)
by: Murakami, Soichiro, et al.
Published: (2025)
Understanding the Role of LLMs in Multimodal Evaluation Benchmarks
by: Jiang, Botian, et al.
Published: (2024)
by: Jiang, Botian, et al.
Published: (2024)
Beyond Turing Test: Can GPT-4 Sway Experts' Decisions?
by: Takayanagi, Takehiro, et al.
Published: (2024)
by: Takayanagi, Takehiro, et al.
Published: (2024)
Difficult Task Yes but Simple Task No: Unveiling the Laziness in Multimodal LLMs
by: Zhao, Sihang, et al.
Published: (2024)
by: Zhao, Sihang, et al.
Published: (2024)
Enhancing Investment Opinion Ranking through Argument-Based Sentiment Analysis
by: Chen, Chung-Chi, et al.
Published: (2024)
by: Chen, Chung-Chi, et al.
Published: (2024)
Can Multimodal LLMs See Materials Clearly? A Multimodal Benchmark on Materials Characterization
by: Lai, Zhengzhao, et al.
Published: (2025)
by: Lai, Zhengzhao, et al.
Published: (2025)
Multimodal LLMs Struggle with Basic Visual Network Analysis: a VNA Benchmark
by: Williams, Evan M., et al.
Published: (2024)
by: Williams, Evan M., et al.
Published: (2024)
Can't See the Forest for the Trees: Benchmarking Multimodal Safety Awareness for Multimodal LLMs
by: Wang, Wenxuan, et al.
Published: (2025)
by: Wang, Wenxuan, et al.
Published: (2025)
E-THER: A Multimodal Dataset for Empathic AI -- Towards Emotional Mismatch Awareness
by: Tahir, Sharjeel, et al.
Published: (2025)
by: Tahir, Sharjeel, et al.
Published: (2025)
AdParaphrase: Paraphrase Dataset for Analyzing Linguistic Features toward Generating Attractive Ad Texts
by: Murakami, Soichiro, et al.
Published: (2025)
by: Murakami, Soichiro, et al.
Published: (2025)
Tracking Temporal Dynamics of Vector Sets with Gaussian Process
by: Aida, Taichi, et al.
Published: (2025)
by: Aida, Taichi, et al.
Published: (2025)
From Generation to Detection: A Multimodal Multi-Task Dataset for Benchmarking Health Misinformation
by: Zhang, Zhihao, et al.
Published: (2025)
by: Zhang, Zhihao, et al.
Published: (2025)
MateInfoUB: A Real-World Benchmark for Testing LLMs in Competitive, Multilingual, and Multimodal Educational Tasks
by: Marius, Dumitran Adrian, et al.
Published: (2025)
by: Marius, Dumitran Adrian, et al.
Published: (2025)
MMESGBench: Pioneering Multimodal Understanding and Complex Reasoning Benchmark for ESG Tasks
by: Zhang, Lei, et al.
Published: (2025)
by: Zhang, Lei, et al.
Published: (2025)
Analyzing Continuous Semantic Shifts with Diachronic Word Similarity Matrices
by: Kiyama, Hajime, et al.
Published: (2025)
by: Kiyama, Hajime, et al.
Published: (2025)
GADFA: Generator-Assisted Decision-Focused Approach for Opinion Expressing Timing Identification
by: Chen, Chung-Chi, et al.
Published: (2024)
by: Chen, Chung-Chi, et al.
Published: (2024)
Benchmarking Multimodal LLMs on Recognition and Understanding over Chemical Tables
by: Zhou, Yitong, et al.
Published: (2025)
by: Zhou, Yitong, et al.
Published: (2025)
Chart-to-Experience: Benchmarking Multimodal LLMs for Predicting Experiential Impact of Charts
by: Kim, Seon Gyeom, et al.
Published: (2025)
by: Kim, Seon Gyeom, et al.
Published: (2025)
A Structured Framework for Evaluating and Enhancing Interpretive Capabilities of Multimodal LLMs in Culturally Situated Tasks
by: Yu, Haorui, et al.
Published: (2025)
by: Yu, Haorui, et al.
Published: (2025)
MLLM-CompBench: A Comparative Reasoning Benchmark for Multimodal LLMs
by: Kil, Jihyung, et al.
Published: (2024)
by: Kil, Jihyung, et al.
Published: (2024)
Rehearsing Answers to Probable Questions with Perspective-Taking
by: Shih, Yung-Yu, et al.
Published: (2024)
by: Shih, Yung-Yu, et al.
Published: (2024)
Multimodal Misinformation Detection by Learning from Synthetic Data with Multimodal LLMs
by: Zeng, Fengzhu, et al.
Published: (2024)
by: Zeng, Fengzhu, et al.
Published: (2024)
Similar Items
-
Prompting for Numerical Sequences: A Case Study on Market Comment Generation
by: Kawarada, Masayuki, et al.
Published: (2024) -
A Comparative Study of Demonstration Selection for Practical Large Language Models-based Next POI Prediction
by: Nishida, Ryo, et al.
Published: (2026) -
Real-Time Generation of Game Video Commentary with Multimodal LLMs: Pause-Aware Decoding Approaches
by: Afzal, Anum, et al.
Published: (2026) -
QCoder Benchmark: Bridging Language Generation and Quantum Hardware through Simulator-Based Feedback
by: Mikuriya, Taku, et al.
Published: (2025) -
HOME-KGQA: A Benchmark Dataset for Multimodal Knowledge Graph Question Answering on Household Daily Activities
by: Egami, Shusaku, et al.
Published: (2026)