ActuBench: A Multi-Agent LLM Pipeline for Generation and Evaluation of Actuarial Reasoning Tasks
Fuente:
arXiv
Guardado en:
| Autor principal: | Schmidt, Jan-Philipp |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
GameBench: Evaluating Strategic Reasoning Abilities of LLM Agents
por: Costarelli, Anthony, et al.
Publicado: (2024)
por: Costarelli, Anthony, et al.
Publicado: (2024)
XCR-Bench: A Multi-Task Benchmark for Evaluating Cultural Reasoning in LLMs
por: Kabir, Mohsinul, et al.
Publicado: (2026)
por: Kabir, Mohsinul, et al.
Publicado: (2026)
MultiAgentBench: Evaluating the Collaboration and Competition of LLM agents
por: Zhu, Kunlun, et al.
Publicado: (2025)
por: Zhu, Kunlun, et al.
Publicado: (2025)
Evaluating Novelty in AI-Generated Research Plans Using Multi-Workflow LLM Pipelines
por: Saraogi, Devesh, et al.
Publicado: (2025)
por: Saraogi, Devesh, et al.
Publicado: (2025)
Mobile-Bench: An Evaluation Benchmark for LLM-based Mobile Agents
por: Deng, Shihan, et al.
Publicado: (2024)
por: Deng, Shihan, et al.
Publicado: (2024)
VitaBench: Benchmarking LLM Agents with Versatile Interactive Tasks in Real-world Applications
por: He, Wei, et al.
Publicado: (2025)
por: He, Wei, et al.
Publicado: (2025)
ReportBench: Evaluating Deep Research Agents via Academic Survey Tasks
por: Li, Minghao, et al.
Publicado: (2025)
por: Li, Minghao, et al.
Publicado: (2025)
MASLegalBench: Benchmarking Multi-Agent Systems in Deductive Legal Reasoning
por: Jing, Huihao, et al.
Publicado: (2025)
por: Jing, Huihao, et al.
Publicado: (2025)
MemBench: Towards More Comprehensive Evaluation on the Memory of LLM-based Agents
por: Tan, Haoran, et al.
Publicado: (2025)
por: Tan, Haoran, et al.
Publicado: (2025)
OckBench: Measuring the Efficiency of LLM Reasoning
por: Du, Zheng, et al.
Publicado: (2025)
por: Du, Zheng, et al.
Publicado: (2025)
CostBench: Evaluating Multi-Turn Cost-Optimal Planning and Adaptation in Dynamic Environments for LLM Tool-Use Agents
por: Liu, Jiayu, et al.
Publicado: (2025)
por: Liu, Jiayu, et al.
Publicado: (2025)
GlobalDentBench: A Multinational Benchmark for Evaluating LLM Clinical Reasoning in Dentistry with Expert Calibration
por: Zhao, Junjie, et al.
Publicado: (2026)
por: Zhao, Junjie, et al.
Publicado: (2026)
ML-Bench: Evaluating Large Language Models and Agents for Machine Learning Tasks on Repository-Level Code
por: Tang, Xiangru, et al.
Publicado: (2023)
por: Tang, Xiangru, et al.
Publicado: (2023)
FB-Bench: A Fine-Grained Multi-Task Benchmark for Evaluating LLMs' Responsiveness to Human Feedback
por: Li, Youquan, et al.
Publicado: (2024)
por: Li, Youquan, et al.
Publicado: (2024)
KG-LLM-Bench: A Scalable Benchmark for Evaluating LLM Reasoning on Textualized Knowledge Graphs
por: Markowitz, Elan, et al.
Publicado: (2025)
por: Markowitz, Elan, et al.
Publicado: (2025)
PsychiatryBench: A Multi-Task Benchmark for LLMs in Psychiatry
por: Fouda, Aya E., et al.
Publicado: (2025)
por: Fouda, Aya E., et al.
Publicado: (2025)
Multi-Task GRPO: Reliable LLM Reasoning Across Tasks
por: Ramesh, Shyam Sundhar, et al.
Publicado: (2026)
por: Ramesh, Shyam Sundhar, et al.
Publicado: (2026)
Unlocking the Power of Multi-Agent LLM for Reasoning: From Lazy Agents to Deliberation
por: Zhang, Zhiwei, et al.
Publicado: (2025)
por: Zhang, Zhiwei, et al.
Publicado: (2025)
POLIS-Bench: Towards Multi-Dimensional Evaluation of LLMs for Bilingual Policy Tasks in Governmental Scenarios
por: Yang, Tingyue, et al.
Publicado: (2025)
por: Yang, Tingyue, et al.
Publicado: (2025)
Mem2ActBench: A Benchmark for Evaluating Long-Term Memory Utilization in Task-Oriented Autonomous Agents
por: Shen, Yiting, et al.
Publicado: (2026)
por: Shen, Yiting, et al.
Publicado: (2026)
Rethinking the Bounds of LLM Reasoning: Are Multi-Agent Discussions the Key?
por: Wang, Qineng, et al.
Publicado: (2024)
por: Wang, Qineng, et al.
Publicado: (2024)
LiveClawBench: Benchmarking LLM Agents on Complex, Real-World Assistant Tasks
por: Long, Xiang, et al.
Publicado: (2026)
por: Long, Xiang, et al.
Publicado: (2026)
InfoMosaic-Bench: Evaluating Multi-Source Information Seeking in Tool-Augmented Agents
por: Du, Yaxin, et al.
Publicado: (2025)
por: Du, Yaxin, et al.
Publicado: (2025)
On Path to Multimodal Historical Reasoning: HistBench and HistAgent
por: Qiu, Jiahao, et al.
Publicado: (2025)
por: Qiu, Jiahao, et al.
Publicado: (2025)
LLM-Driven Multi-Turn Task-Oriented Dialogue Synthesis for Realistic Reasoning
por: Zhu, Yu, et al.
Publicado: (2026)
por: Zhu, Yu, et al.
Publicado: (2026)
ClawBench: Can AI Agents Complete Everyday Online Tasks?
por: Zhang, Yuxuan, et al.
Publicado: (2026)
por: Zhang, Yuxuan, et al.
Publicado: (2026)
Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks
por: Pires, Ramon, et al.
Publicado: (2026)
por: Pires, Ramon, et al.
Publicado: (2026)
SemBench: A Universal Semantic Framework for LLM Evaluation
por: Zubillaga, Mikel, et al.
Publicado: (2026)
por: Zubillaga, Mikel, et al.
Publicado: (2026)
MSCoRe: A Benchmark for Multi-Stage Collaborative Reasoning in LLM Agents
por: Lei, Yuzhen, et al.
Publicado: (2025)
por: Lei, Yuzhen, et al.
Publicado: (2025)
AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation
por: Zhou, Ziwei, et al.
Publicado: (2026)
por: Zhou, Ziwei, et al.
Publicado: (2026)
AgentBench: Evaluating LLMs as Agents
por: Liu, Xiao, et al.
Publicado: (2023)
por: Liu, Xiao, et al.
Publicado: (2023)
MedAgentsBench: Benchmarking Thinking Models and Agent Frameworks for Complex Medical Reasoning
por: Tang, Xiangru, et al.
Publicado: (2025)
por: Tang, Xiangru, et al.
Publicado: (2025)
NC-Bench: An LLM Benchmark for Evaluating Conversational Competence
por: Moore, Robert J., et al.
Publicado: (2026)
por: Moore, Robert J., et al.
Publicado: (2026)
CocoaBench: Evaluating Unified Digital Agents in the Wild
por: CocoaBench Team, et al.
Publicado: (2026)
por: CocoaBench Team, et al.
Publicado: (2026)
GraphRAG-Bench: Challenging Domain-Specific Reasoning for Evaluating Graph Retrieval-Augmented Generation
por: Xiao, Yilin, et al.
Publicado: (2025)
por: Xiao, Yilin, et al.
Publicado: (2025)
PILOT-Bench: A Benchmark for Legal Reasoning in the Patent Domain with IRAC-Aligned Classification Tasks
por: Jang, Yehoon, et al.
Publicado: (2026)
por: Jang, Yehoon, et al.
Publicado: (2026)
Evaluating LLM-based Agents for Multi-Turn Conversations: A Survey
por: Guan, Shengyue, et al.
Publicado: (2025)
por: Guan, Shengyue, et al.
Publicado: (2025)
GeoBenchX: Benchmarking LLMs in Agent Solving Multistep Geospatial Tasks
por: Krechetova, Varvara, et al.
Publicado: (2025)
por: Krechetova, Varvara, et al.
Publicado: (2025)
FHIR-AgentBench: Benchmarking LLM Agents for Realistic Interoperable EHR Question Answering
por: Lee, Gyubok, et al.
Publicado: (2025)
por: Lee, Gyubok, et al.
Publicado: (2025)
Theory-Grounded Evaluation of Human-Like Fallacy Patterns in LLM Reasoning
por: Richardson, Andrew Keenan, et al.
Publicado: (2025)
por: Richardson, Andrew Keenan, et al.
Publicado: (2025)
Ejemplares similares
-
GameBench: Evaluating Strategic Reasoning Abilities of LLM Agents
por: Costarelli, Anthony, et al.
Publicado: (2024) -
XCR-Bench: A Multi-Task Benchmark for Evaluating Cultural Reasoning in LLMs
por: Kabir, Mohsinul, et al.
Publicado: (2026) -
MultiAgentBench: Evaluating the Collaboration and Competition of LLM agents
por: Zhu, Kunlun, et al.
Publicado: (2025) -
Evaluating Novelty in AI-Generated Research Plans Using Multi-Workflow LLM Pipelines
por: Saraogi, Devesh, et al.
Publicado: (2025) -
Mobile-Bench: An Evaluation Benchmark for LLM-based Mobile Agents
por: Deng, Shihan, et al.
Publicado: (2024)