Unsolvable Problem Detection: Robust Understanding Evaluation for Large Multimodal Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Miyai, Atsuyuki, Yang, Jingkang, Zhang, Jingyang, Ming, Yifei, Yu, Qing, Irie, Go, Li, Yixuan, Li, Hai, Liu, Ziwei, Aizawa, Kiyoharu |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GL-MCM: Global and Local Maximum Concept Matching for Zero-Shot Out-of-Distribution Detection
par: Miyai, Atsuyuki, et autres
Publié: (2023)
par: Miyai, Atsuyuki, et autres
Publié: (2023)
A Benchmark and Evaluation for Real-World Out-of-Distribution Detection Using Vision-Language Models
par: Noda, Shiho, et autres
Publié: (2025)
par: Noda, Shiho, et autres
Publié: (2025)
Generalized Out-of-Distribution Detection and Beyond in Vision Language Model Era: A Survey
par: Miyai, Atsuyuki, et autres
Publié: (2024)
par: Miyai, Atsuyuki, et autres
Publié: (2024)
PULSE: Practical Evaluation Scenarios for Large Multimodal Model Unlearning
par: Kawakami, Tatsuki, et autres
Publié: (2025)
par: Kawakami, Tatsuki, et autres
Publié: (2025)
JMMMU-Pro: Image-based Japanese Multi-discipline Multimodal Understanding Benchmark via Vibe Benchmark Construction
par: Miyai, Atsuyuki, et autres
Publié: (2025)
par: Miyai, Atsuyuki, et autres
Publié: (2025)
Manga109-v2026: Revisiting Manga109 Annotations for Modern Manga Understanding
par: Baek, Jeonghun, et autres
Publié: (2026)
par: Baek, Jeonghun, et autres
Publié: (2026)
MangaVQA and MangaLMM: A Benchmark and Specialized Model for Multimodal Manga Understanding
par: Baek, Jeonghun, et autres
Publié: (2025)
par: Baek, Jeonghun, et autres
Publié: (2025)
JMMMU: A Japanese Massive Multi-discipline Multimodal Understanding Benchmark for Culture-aware Evaluation
par: Onohara, Shota, et autres
Publié: (2024)
par: Onohara, Shota, et autres
Publié: (2024)
Jr. AI Scientist and Its Risk Report: Autonomous Scientific Exploration from a Baseline Paper
par: Miyai, Atsuyuki, et autres
Publié: (2025)
par: Miyai, Atsuyuki, et autres
Publié: (2025)
Paper Reconstruction Evaluation: Evaluating Presentation and Hallucination in AI-written Papers
par: Miyai, Atsuyuki, et autres
Publié: (2026)
par: Miyai, Atsuyuki, et autres
Publié: (2026)
Harnessing PDF Data for Improving Japanese Large Multimodal Models
par: Baek, Jeonghun, et autres
Publié: (2025)
par: Baek, Jeonghun, et autres
Publié: (2025)
MangaUB: A Manga Understanding Benchmark for Large Multimodal Models
par: Ikuta, Hikaru, et autres
Publié: (2024)
par: Ikuta, Hikaru, et autres
Publié: (2024)
Manga109Dialog: A Large-scale Dialogue Dataset for Comics Speaker Detection
par: Li, Yingxuan, et autres
Publié: (2023)
par: Li, Yingxuan, et autres
Publié: (2023)
FoodMLLM-JP: Leveraging Multimodal Large Language Models for Japanese Recipe Generation
par: Imajuku, Yuki, et autres
Publié: (2024)
par: Imajuku, Yuki, et autres
Publié: (2024)
Generalized Out-of-Distribution Detection: A Survey
par: Yang, Jingkang, et autres
Publié: (2021)
par: Yang, Jingkang, et autres
Publié: (2021)
Zero-Shot Character Identification and Speaker Prediction in Comics via Iterative Multimodal Fusion
par: Li, Yingxuan, et autres
Publié: (2024)
par: Li, Yingxuan, et autres
Publié: (2024)
Entity-NeRF: Detecting and Removing Moving Entities in Urban Scenes
par: Otonari, Takashi, et autres
Publié: (2024)
par: Otonari, Takashi, et autres
Publié: (2024)
WebChoreArena: Evaluating Web Browsing Agents on Realistic Tedious Web Tasks
par: Miyai, Atsuyuki, et autres
Publié: (2025)
par: Miyai, Atsuyuki, et autres
Publié: (2025)
Perspectives on Unsolvability in the Roommates Problem
par: Glitzner, Frederik, et autres
Publié: (2025)
par: Glitzner, Frederik, et autres
Publié: (2025)
How Does Fine-Tuning Impact Out-of-Distribution Detection for Vision-Language Models?
par: Ming, Yifei, et autres
Publié: (2023)
par: Ming, Yifei, et autres
Publié: (2023)
Understanding Retrieval-Augmented Task Adaptation for Vision-Language Models
par: Ming, Yifei, et autres
Publié: (2024)
par: Ming, Yifei, et autres
Publié: (2024)
The Unsolvability of the Homeomorphism Problem
par: Friedl, Stefan, et autres
Publié: (2026)
par: Friedl, Stefan, et autres
Publié: (2026)
Learning the Boundary of Solvability: Aligning LLMs to Detect Unsolvable Problems
par: Peng, Dengyun, et autres
Publié: (2025)
par: Peng, Dengyun, et autres
Publié: (2025)
Investigating the Perception of Facial Anonymization Techniques in 360° Videos
par: Wöhler, Leslie, et autres
Publié: (2024)
par: Wöhler, Leslie, et autres
Publié: (2024)
Privacy Protection and Video Manipulation in Immersive Media
par: Wöhler, Leslie, et autres
Publié: (2024)
par: Wöhler, Leslie, et autres
Publié: (2024)
LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models
par: Zhang, Kaichen, et autres
Publié: (2024)
par: Zhang, Kaichen, et autres
Publié: (2024)
OpenOOD v1.5: Enhanced Benchmark for Out-of-Distribution Detection
par: Zhang, Jingyang, et autres
Publié: (2023)
par: Zhang, Jingyang, et autres
Publié: (2023)
Guided Image Synthesis via Initial Image Editing in Diffusion Model
par: Mao, Jiafeng, et autres
Publié: (2023)
par: Mao, Jiafeng, et autres
Publié: (2023)
The Lottery Ticket Hypothesis in Denoising: Towards Semantic-Driven Initialization
par: Mao, Jiafeng, et autres
Publié: (2023)
par: Mao, Jiafeng, et autres
Publié: (2023)
A Highly Clean Recipe Dataset with Ingredient States Annotation for State Probing Task
par: Toyooka, Mashiro, et autres
Publié: (2025)
par: Toyooka, Mashiro, et autres
Publié: (2025)
Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models
par: Dong, Yuhao, et autres
Publié: (2024)
par: Dong, Yuhao, et autres
Publié: (2024)
Training-Free Sketch-Guided Diffusion with Latent Optimization
par: Ding, Sandra Zhang, et autres
Publié: (2024)
par: Ding, Sandra Zhang, et autres
Publié: (2024)
MUSE: A Run-Centric Platform for Multimodal Unified Safety Evaluation of Large Language Models
par: Wang, Zhongxi, et autres
Publié: (2026)
par: Wang, Zhongxi, et autres
Publié: (2026)
Formally Verified Certification of Unsolvability of Temporal Planning Problems
par: Wang, David, et autres
Publié: (2025)
par: Wang, David, et autres
Publié: (2025)
PerFace: Metric Learning in Perceptual Facial Similarity for Enhanced Face Anonymization
par: Kumagai, Haruka, et autres
Publié: (2025)
par: Kumagai, Haruka, et autres
Publié: (2025)
A Simple Baseline for Streaming Video Understanding
par: Shen, Yujiao, et autres
Publié: (2026)
par: Shen, Yujiao, et autres
Publié: (2026)
FoodLogAthl-218: Constructing a Real-World Food Image Dataset Using Dietary Management Applications
par: Watanabe, Mitsuki, et autres
Publié: (2025)
par: Watanabe, Mitsuki, et autres
Publié: (2025)
Large Multi-modal Models Can Interpret Features in Large Multi-modal Models
par: Zhang, Kaichen, et autres
Publié: (2024)
par: Zhang, Kaichen, et autres
Publié: (2024)
Retrieval-Augmented Layout Transformer for Content-Aware Layout Generation
par: Horita, Daichi, et autres
Publié: (2023)
par: Horita, Daichi, et autres
Publié: (2023)
WorldQA: Multimodal World Knowledge in Videos through Long-Chain Reasoning
par: Zhang, Yuanhan, et autres
Publié: (2024)
par: Zhang, Yuanhan, et autres
Publié: (2024)
Documents similaires
-
GL-MCM: Global and Local Maximum Concept Matching for Zero-Shot Out-of-Distribution Detection
par: Miyai, Atsuyuki, et autres
Publié: (2023) -
A Benchmark and Evaluation for Real-World Out-of-Distribution Detection Using Vision-Language Models
par: Noda, Shiho, et autres
Publié: (2025) -
Generalized Out-of-Distribution Detection and Beyond in Vision Language Model Era: A Survey
par: Miyai, Atsuyuki, et autres
Publié: (2024) -
PULSE: Practical Evaluation Scenarios for Large Multimodal Model Unlearning
par: Kawakami, Tatsuki, et autres
Publié: (2025) -
JMMMU-Pro: Image-based Japanese Multi-discipline Multimodal Understanding Benchmark via Vibe Benchmark Construction
par: Miyai, Atsuyuki, et autres
Publié: (2025)