INSEva: A Comprehensive Chinese Benchmark for Large Language Models in Insurance
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Shisong, Zhu, Qian, Yang, Wenyan, Yang, Chengyi, Wang, Zhong, Wang, Ping, Lin, Xuan, Xu, Bo, Li, Daqian, Yuan, Chao, Qi, Licai, Xu, Wanqing, zhenxing, sun, Lu, Xin, Xiong, Shiqiang, Chen, Chao, Hu, Haixiang, Xiao, Yanghua |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
RubricEval: A Rubric-Level Meta-Evaluation Benchmark for LLM Judges in Instruction Following
by: Pan, Tianjun, et al.
Published: (2026)
by: Pan, Tianjun, et al.
Published: (2026)
An Industrial-Scale Insurance LLM Achieving Verifiable Domain Mastery and Hallucination Control without Competence Trade-offs
by: Zhu, Qian, et al.
Published: (2026)
by: Zhu, Qian, et al.
Published: (2026)
AncientBench: Towards Comprehensive Evaluation on Excavated and Transmitted Chinese Corpora
by: Zhou, Zhihan, et al.
Published: (2025)
by: Zhou, Zhihan, et al.
Published: (2025)
OVEL: Large Language Model as Memory Manager for Online Video Entity Linking
by: Zhao, Haiquan, et al.
Published: (2024)
by: Zhao, Haiquan, et al.
Published: (2024)
INS-MMBench: A Comprehensive Benchmark for Evaluating LVLMs' Performance in Insurance
by: Lin, Chenwei, et al.
Published: (2024)
by: Lin, Chenwei, et al.
Published: (2024)
The higher spin $Π$-operator in Clifford analysis
by: Cheng, Wanqing, et al.
Published: (2025)
by: Cheng, Wanqing, et al.
Published: (2025)
CMB: A Comprehensive Medical Benchmark in Chinese
by: Wang, Xidong, et al.
Published: (2023)
by: Wang, Xidong, et al.
Published: (2023)
CRUD-RAG: A Comprehensive Chinese Benchmark for Retrieval-Augmented Generation of Large Language Models
by: Lyu, Yuanjie, et al.
Published: (2024)
by: Lyu, Yuanjie, et al.
Published: (2024)
Comprehensive Genomic Dataset of Chinese Lizardtail Herb and Comparative Genomic Analysis Provide Insights Into Its Paleo‐Polyploidization Event
by: Shunhui Cai, et al.
Published: (2025)
by: Shunhui Cai, et al.
Published: (2025)
InsQABench: Benchmarking Chinese Insurance Domain Question Answering with Large Language Models
by: Ding, Jing, et al.
Published: (2025)
by: Ding, Jing, et al.
Published: (2025)
GUI-CEval: A Hierarchical and Comprehensive Chinese Benchmark for Mobile GUI Agents
by: Li, Yang, et al.
Published: (2026)
by: Li, Yang, et al.
Published: (2026)
King Chasing Problem in Chinese Chess is NP-hard
by: Li, Chao, et al.
Published: (2026)
by: Li, Chao, et al.
Published: (2026)
Fine-Grained Sentiment Analysis of Electric Vehicle User Reviews: A Bidirectional LSTM Approach to Capturing Emotional Intensity in Chinese Text
by: Chen, Shuhao, et al.
Published: (2024)
by: Chen, Shuhao, et al.
Published: (2024)
Agentic Performance at the Edge: Insights from Benchmarking
by: Wang, Shiqiang, et al.
Published: (2026)
by: Wang, Shiqiang, et al.
Published: (2026)
Psychometric evaluation of the Social Touch Questionnaire in Chinese adolescents
by: Chenglei Wang, et al.
Published: (2024)
by: Chenglei Wang, et al.
Published: (2024)
Comprehensive Evaluation of Frailty and Sarcopenia Markers to Predict Survival in Glioblastoma Patients
by: Chao Yang, et al.
Published: (2025)
by: Chao Yang, et al.
Published: (2025)
Novel High‐Performance Flexible Piezoelectric Sensors Based on P‐ PVDF / MoS 2 Bead Films for Self‐Powered Human Motion Monitoring
by: Dawei Gao, et al.
Published: (2025)
by: Dawei Gao, et al.
Published: (2025)
Psychometric Properties of the Chinese Version of Aberdeen Varicose Veins Questionnaire (AVVQ) in Patients With Varicose Veins of Lower Extremity: A Cross‐Sectional Study
by: Chen Wang, et al.
Published: (2024)
by: Chen Wang, et al.
Published: (2024)
Deep Learning-Driven Protein Structure Prediction and Design: Key Model Developments by Nobel Laureates and Multi-Domain Applications
by: Yang, Wanqing, et al.
Published: (2025)
by: Yang, Wanqing, et al.
Published: (2025)
GUI-Robust: A Comprehensive Dataset for Testing GUI Agent Robustness in Real-World Anomalies
by: Yang, Jingqi, et al.
Published: (2025)
by: Yang, Jingqi, et al.
Published: (2025)
Electric field effects in one-dimensional spin-1/2 $K_1J_1Γ_1Γ_1^\prime K_2J_2$ model with ferromagnetic Kitaev coupling
by: Yang, Wang, et al.
Published: (2026)
by: Yang, Wang, et al.
Published: (2026)
Towards Reliable LLM Evaluation: Correcting the Winner's Curse in Adaptive Benchmarking
by: Xu, Yang, et al.
Published: (2026)
by: Xu, Yang, et al.
Published: (2026)
SEA-Eval: A Benchmark for Evaluating Self-Evolving Agents Beyond Episodic Assessment
by: Jiang, Sihang, et al.
Published: (2026)
by: Jiang, Sihang, et al.
Published: (2026)
UGPhysics: A Comprehensive Benchmark for Undergraduate Physics Reasoning with Large Language Models
by: Xu, Xin, et al.
Published: (2025)
by: Xu, Xin, et al.
Published: (2025)
Evaluating Scoring Bias in LLM-as-a-Judge
by: Li, Qingquan, et al.
Published: (2025)
by: Li, Qingquan, et al.
Published: (2025)
Fatigue Life Prediction of Powertrain Rubber Suspension Bushings Based on Multiple Damage Parameters Under Thermo‐Mechanical Coupling
by: Hui Wang, et al.
Published: (2025)
by: Hui Wang, et al.
Published: (2025)
When Agents Evolve, Institutions Follow
by: Fei, Chao, et al.
Published: (2026)
by: Fei, Chao, et al.
Published: (2026)
InteChar: A Unified Oracle Bone Character List for Ancient Chinese Language Modeling
by: Diao, Xiaolei, et al.
Published: (2025)
by: Diao, Xiaolei, et al.
Published: (2025)
From Correctness to Preference: A Framework for Personalized Agentic Reinforcement Learning
by: zhang, Ranxu, et al.
Published: (2026)
by: zhang, Ranxu, et al.
Published: (2026)
Temporal-spatial distribution of YSOs nearby Taurus region
by: Liu, Jiaming, et al.
Published: (2024)
by: Liu, Jiaming, et al.
Published: (2024)
Progress and Prospects of Research on Microhabitat Scale Characterization and Utilization in Chinese Karst Area
by: Hui Huang, et al.
Published: (2025)
by: Hui Huang, et al.
Published: (2025)
Towards Comprehensive Detection of Chinese Harmful Memes
by: Lu, Junyu, et al.
Published: (2024)
by: Lu, Junyu, et al.
Published: (2024)
TeX-NeRF: Neural Radiance Fields from Pseudo-TeX Vision
by: Zhong, Chonghao, et al.
Published: (2024)
by: Zhong, Chonghao, et al.
Published: (2024)
TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models
by: Li, Ce, et al.
Published: (2025)
by: Li, Ce, et al.
Published: (2025)
Quantum Computational Insurance and Actuarial Science
by: Liu, Huan-Yu, et al.
Published: (2024)
by: Liu, Huan-Yu, et al.
Published: (2024)
A High Conversion Gain and Low Phase Noise Self‐Oscillating Mixer Based on Positive Feedback Technique
by: Shiqiang Fu, et al.
Published: (2025)
by: Shiqiang Fu, et al.
Published: (2025)
A Novel Switchable Low Phase‐Noise Dual‐Frequency Oscillator Based on Traveling‐Wave Loop‐Directional Filter
by: Yang Wang, et al.
Published: (2025)
by: Yang Wang, et al.
Published: (2025)
Tracing the Galactic disk from the kinematics of Gaia Cepheids
by: Zhou, Xiaoyue, et al.
Published: (2024)
by: Zhou, Xiaoyue, et al.
Published: (2024)
The Tip of Red Giant Branch Distances to Nearby Dwarf Galaxies WLM and Sextans A with JWST
by: Yan, Ziming, et al.
Published: (2025)
by: Yan, Ziming, et al.
Published: (2025)
MVBench: A Comprehensive Multi-modal Video Understanding Benchmark
by: Li, Kunchang, et al.
Published: (2023)
by: Li, Kunchang, et al.
Published: (2023)
Similar Items
-
RubricEval: A Rubric-Level Meta-Evaluation Benchmark for LLM Judges in Instruction Following
by: Pan, Tianjun, et al.
Published: (2026) -
An Industrial-Scale Insurance LLM Achieving Verifiable Domain Mastery and Hallucination Control without Competence Trade-offs
by: Zhu, Qian, et al.
Published: (2026) -
AncientBench: Towards Comprehensive Evaluation on Excavated and Transmitted Chinese Corpora
by: Zhou, Zhihan, et al.
Published: (2025) -
OVEL: Large Language Model as Memory Manager for Online Video Entity Linking
by: Zhao, Haiquan, et al.
Published: (2024) -
INS-MMBench: A Comprehensive Benchmark for Evaluating LVLMs' Performance in Insurance
by: Lin, Chenwei, et al.
Published: (2024)