INS-MMBench: A Comprehensive Benchmark for Evaluating LVLMs' Performance in Insurance
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lin, Chenwei, Lyu, Hanjia, Xu, Xian, Luo, Jiebo |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Harnessing GPT-4V(ision) for Insurance: A Preliminary Exploration
par: Lin, Chenwei, et autres
Publié: (2024)
par: Lin, Chenwei, et autres
Publié: (2024)
Learning to Evaluate the Artness of AI-generated Images
par: Chen, Junyu, et autres
Publié: (2023)
par: Chen, Junyu, et autres
Publié: (2023)
Steering LVLMs via Sparse Autoencoder for Hallucination Mitigation
par: Hua, Zhenglin, et autres
Publié: (2025)
par: Hua, Zhenglin, et autres
Publié: (2025)
When Prompts Override Vision: Prompt-Induced Hallucinations in LVLMs
par: Khayatan, Pegah, et autres
Publié: (2026)
par: Khayatan, Pegah, et autres
Publié: (2026)
Mind the (Language) Gap: Towards Probing Numerical and Cross-Lingual Limits of LVLMs
par: Gautam, Somraj, et autres
Publié: (2025)
par: Gautam, Somraj, et autres
Publié: (2025)
Counteracting Matthew Effect in Self-Improvement of LVLMs through Head-Tail Re-balancing
par: Guo, Xin, et autres
Publié: (2025)
par: Guo, Xin, et autres
Publié: (2025)
Zero-Shot Defense Against Toxic Images via Inherent Multimodal Alignment in LVLMs
par: Zhao, Wei, et autres
Publié: (2025)
par: Zhao, Wei, et autres
Publié: (2025)
Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents
par: Luo, Yaxin, et autres
Publié: (2025)
par: Luo, Yaxin, et autres
Publié: (2025)
Irony in Emojis: A Comparative Study of Human and LLM Interpretation
par: Zheng, Yawen, et autres
Publié: (2025)
par: Zheng, Yawen, et autres
Publié: (2025)
Mementos: A Comprehensive Benchmark for Multimodal Large Language Model Reasoning over Image Sequences
par: Wang, Xiyao, et autres
Publié: (2024)
par: Wang, Xiyao, et autres
Publié: (2024)
MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models
par: Zhang, Yichi, et autres
Publié: (2024)
par: Zhang, Yichi, et autres
Publié: (2024)
A Survey of Automatic Evaluation Methods on Text, Visual and Speech Generations
par: Lan, Tian, et autres
Publié: (2025)
par: Lan, Tian, et autres
Publié: (2025)
MMDU: A Multi-Turn Multi-Image Dialog Understanding Benchmark and Instruction-Tuning Dataset for LVLMs
par: Liu, Ziyu, et autres
Publié: (2024)
par: Liu, Ziyu, et autres
Publié: (2024)
CAMEL-Bench: A Comprehensive Arabic LMM Benchmark
par: Ghaboura, Sara, et autres
Publié: (2024)
par: Ghaboura, Sara, et autres
Publié: (2024)
PQPP: A Joint Benchmark for Text-to-Image Prompt and Query Performance Prediction
par: Poesina, Eduard, et autres
Publié: (2024)
par: Poesina, Eduard, et autres
Publié: (2024)
ColorBench: Can VLMs See and Understand the Colorful World? A Comprehensive Benchmark for Color Perception, Reasoning, and Robustness
par: Liang, Yijun, et autres
Publié: (2025)
par: Liang, Yijun, et autres
Publié: (2025)
Benchmarking the Thinking Mode of Multimodal Large Language Models in Clinical Tasks
par: Hong, Jindong, et autres
Publié: (2025)
par: Hong, Jindong, et autres
Publié: (2025)
NeuroABench: A Multimodal Evaluation Benchmark for Neurosurgical Anatomy Identification
par: Song, Ziyang, et autres
Publié: (2025)
par: Song, Ziyang, et autres
Publié: (2025)
Evolver: Chain-of-Evolution Prompting to Boost Large Multimodal Models for Hateful Meme Detection
par: Huang, Jinfa, et autres
Publié: (2024)
par: Huang, Jinfa, et autres
Publié: (2024)
ECCV 2024 W-CODA: 1st Workshop on Multimodal Perception and Comprehension of Corner Cases in Autonomous Driving
par: Chen, Kai, et autres
Publié: (2025)
par: Chen, Kai, et autres
Publié: (2025)
T2VTextBench: A Human Evaluation Benchmark for Textual Control in Video Generation Models
par: Guo, Xuyang, et autres
Publié: (2025)
par: Guo, Xuyang, et autres
Publié: (2025)
CrossWordBench: Evaluating the Reasoning Capabilities of LLMs and LVLMs with Controllable Puzzle Generation
par: Leng, Jixuan, et autres
Publié: (2025)
par: Leng, Jixuan, et autres
Publié: (2025)
GeoRC: A Benchmark for Geolocation Reasoning Chains
par: Talreja, Mohit, et autres
Publié: (2026)
par: Talreja, Mohit, et autres
Publié: (2026)
Vision-DeepResearch Benchmark: Rethinking Visual and Textual Search for Multimodal Large Language Models
par: Zeng, Yu, et autres
Publié: (2026)
par: Zeng, Yu, et autres
Publié: (2026)
Vision Mamba: A Comprehensive Survey and Taxonomy
par: Liu, Xiao, et autres
Publié: (2024)
par: Liu, Xiao, et autres
Publié: (2024)
Mamba in Vision: A Comprehensive Survey of Techniques and Applications
par: Rahman, Md Maklachur, et autres
Publié: (2024)
par: Rahman, Md Maklachur, et autres
Publié: (2024)
Efficient Benchmarking of Language Models
par: Perlitz, Yotam, et autres
Publié: (2023)
par: Perlitz, Yotam, et autres
Publié: (2023)
MCU: An Evaluation Framework for Open-Ended Game Agents
par: Zheng, Xinyue, et autres
Publié: (2023)
par: Zheng, Xinyue, et autres
Publié: (2023)
Identify, Isolate, and Purge: Mitigating Hallucinations in LVLMs via Self-Evolving Distillation
par: Li, Wenhao, et autres
Publié: (2025)
par: Li, Wenhao, et autres
Publié: (2025)
CoGen: Learning from Feedback with Coupled Comprehension and Generation
par: Gul, Mustafa Omer, et autres
Publié: (2024)
par: Gul, Mustafa Omer, et autres
Publié: (2024)
CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark
par: Romero, David, et autres
Publié: (2024)
par: Romero, David, et autres
Publié: (2024)
A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation
par: Wang, Andrew Z., et autres
Publié: (2025)
par: Wang, Andrew Z., et autres
Publié: (2025)
MileBench: Benchmarking MLLMs in Long Context
par: Song, Dingjie, et autres
Publié: (2024)
par: Song, Dingjie, et autres
Publié: (2024)
MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities
par: Yu, Weihao, et autres
Publié: (2023)
par: Yu, Weihao, et autres
Publié: (2023)
Attention-space Contrastive Guidance for Efficient Hallucination Mitigation in LVLMs
par: Jo, Yujin, et autres
Publié: (2026)
par: Jo, Yujin, et autres
Publié: (2026)
Tables as Texts or Images: Evaluating the Table Reasoning Ability of LLMs and MLLMs
par: Deng, Naihao, et autres
Publié: (2024)
par: Deng, Naihao, et autres
Publié: (2024)
KAN-Dreamer: Benchmarking Kolmogorov-Arnold Networks as Function Approximators in World Models
par: Shi, Chenwei, et autres
Publié: (2025)
par: Shi, Chenwei, et autres
Publié: (2025)
A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges
par: Li, Zongxia, et autres
Publié: (2025)
par: Li, Zongxia, et autres
Publié: (2025)
EgoBabyVLM: Benchmarking Cross-Modal Learning from Naturalistic Egocentric Video Data
par: Lin, Dongyan, et autres
Publié: (2026)
par: Lin, Dongyan, et autres
Publié: (2026)
KITAB-Bench: A Comprehensive Multi-Domain Benchmark for Arabic OCR and Document Understanding
par: Heakl, Ahmed, et autres
Publié: (2025)
par: Heakl, Ahmed, et autres
Publié: (2025)
Documents similaires
-
Harnessing GPT-4V(ision) for Insurance: A Preliminary Exploration
par: Lin, Chenwei, et autres
Publié: (2024) -
Learning to Evaluate the Artness of AI-generated Images
par: Chen, Junyu, et autres
Publié: (2023) -
Steering LVLMs via Sparse Autoencoder for Hallucination Mitigation
par: Hua, Zhenglin, et autres
Publié: (2025) -
When Prompts Override Vision: Prompt-Induced Hallucinations in LVLMs
par: Khayatan, Pegah, et autres
Publié: (2026) -
Mind the (Language) Gap: Towards Probing Numerical and Cross-Lingual Limits of LVLMs
par: Gautam, Somraj, et autres
Publié: (2025)