MASLegalBench: Benchmarking Multi-Agent Systems in Deductive Legal Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Jing, Huihao, Hu, Wenbin, Luo, Hongyu, Yang, Jianhui, Fan, Wei, Li, Haoran, Song, Yangqiu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Safety Compliance: Rethinking LLM Safety Reasoning through the Lens of Compliance
di: Hu, Wenbin, et al.
Pubblicazione: (2025)
di: Hu, Wenbin, et al.
Pubblicazione: (2025)
Node Level Graph Autoencoder: Unified Pretraining for Textual Graph Learning
di: Hu, Wenbin, et al.
Pubblicazione: (2024)
di: Hu, Wenbin, et al.
Pubblicazione: (2024)
PerfCodeBench: Benchmarking LLMs for System-Level High-Performance Code Optimization
di: Jing, Huihao, et al.
Pubblicazione: (2026)
di: Jing, Huihao, et al.
Pubblicazione: (2026)
PrivaCI-Bench: Evaluating Privacy with Contextual Integrity and Legal Compliance
di: Li, Haoran, et al.
Pubblicazione: (2025)
di: Li, Haoran, et al.
Pubblicazione: (2025)
OmniCompliance-100K: A Multi-Domain, Rule-Grounded, Real-World Safety Compliance Dataset
di: Hu, Wenbin, et al.
Pubblicazione: (2026)
di: Hu, Wenbin, et al.
Pubblicazione: (2026)
ContextLens: Modeling Imperfect Privacy and Safety Context for Legal Compliance
di: Li, Haoran, et al.
Pubblicazione: (2026)
di: Li, Haoran, et al.
Pubblicazione: (2026)
Towards Multi-Agent Reasoning Systems for Collaborative Expertise Delegation: An Exploratory Design Study
di: Xu, Baixuan, et al.
Pubblicazione: (2025)
di: Xu, Baixuan, et al.
Pubblicazione: (2025)
Context Reasoner: Incentivizing Reasoning Capability for Contextualized Privacy and Safety Compliance via Reinforcement Learning
di: Hu, Wenbin, et al.
Pubblicazione: (2025)
di: Hu, Wenbin, et al.
Pubblicazione: (2025)
MCIP: Protecting MCP Safety via Model Contextual Integrity Protocol
di: Jing, Huihao, et al.
Pubblicazione: (2025)
di: Jing, Huihao, et al.
Pubblicazione: (2025)
Can LLMs Time Travel? Enhancing Temporal Consistency in Legal Agentic Search through Reinforcement Learning
di: Fan, Wei, et al.
Pubblicazione: (2026)
di: Fan, Wei, et al.
Pubblicazione: (2026)
Rethinking the Bounds of LLM Reasoning: Are Multi-Agent Discussions the Key?
di: Wang, Qineng, et al.
Pubblicazione: (2024)
di: Wang, Qineng, et al.
Pubblicazione: (2024)
Do Reasoning Models Enhance Embedding Models?
di: Chan, Wun Yu, et al.
Pubblicazione: (2026)
di: Chan, Wun Yu, et al.
Pubblicazione: (2026)
BenchAgents: Multi-Agent Systems for Structured Benchmark Creation
di: Butt, Natasha, et al.
Pubblicazione: (2024)
di: Butt, Natasha, et al.
Pubblicazione: (2024)
PrivLM-Bench: A Multi-level Privacy Evaluation Benchmark for Language Models
di: Li, Haoran, et al.
Pubblicazione: (2023)
di: Li, Haoran, et al.
Pubblicazione: (2023)
VLegal-Bench: Cognitively Grounded Benchmark for Vietnamese Legal Reasoning of Large Language Models
di: Dong, Nguyen Tien, et al.
Pubblicazione: (2025)
di: Dong, Nguyen Tien, et al.
Pubblicazione: (2025)
Theorem-of-Thought: A Multi-Agent Framework for Abductive, Deductive, and Inductive Reasoning in Language Models
di: Abdaljalil, Samir, et al.
Pubblicazione: (2025)
di: Abdaljalil, Samir, et al.
Pubblicazione: (2025)
PILOT-Bench: A Benchmark for Legal Reasoning in the Patent Domain with IRAC-Aligned Classification Tasks
di: Jang, Yehoon, et al.
Pubblicazione: (2026)
di: Jang, Yehoon, et al.
Pubblicazione: (2026)
MARS: Benchmarking the Metaphysical Reasoning Abilities of Language Models with a Multi-task Evaluation Dataset
di: Wang, Weiqi, et al.
Pubblicazione: (2024)
di: Wang, Weiqi, et al.
Pubblicazione: (2024)
Evaluating and Enhancing LLMs Agent based on Theory of Mind in Guandan: A Multi-Player Cooperative Game under Imperfect Information
di: Yim, Yauwai, et al.
Pubblicazione: (2024)
di: Yim, Yauwai, et al.
Pubblicazione: (2024)
Understanding Inter-Session Intentions via Complex Logical Reasoning
di: Bai, Jiaxin, et al.
Pubblicazione: (2023)
di: Bai, Jiaxin, et al.
Pubblicazione: (2023)
SciResearcher: Scaling Deep Research Agents for Frontier Scientific Reasoning
di: Zheng, Tianshi, et al.
Pubblicazione: (2026)
di: Zheng, Tianshi, et al.
Pubblicazione: (2026)
CriticBench: Benchmarking LLMs for Critique-Correct Reasoning
di: Lin, Zicheng, et al.
Pubblicazione: (2024)
di: Lin, Zicheng, et al.
Pubblicazione: (2024)
NegotiationToM: A Benchmark for Stress-testing Machine Theory of Mind on Negotiation Surrounding
di: Chan, Chunkit, et al.
Pubblicazione: (2024)
di: Chan, Chunkit, et al.
Pubblicazione: (2024)
PLawBench: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice
di: Shi, Yuzhen, et al.
Pubblicazione: (2026)
di: Shi, Yuzhen, et al.
Pubblicazione: (2026)
MedAgentsBench: Benchmarking Thinking Models and Agent Frameworks for Complex Medical Reasoning
di: Tang, Xiangru, et al.
Pubblicazione: (2025)
di: Tang, Xiangru, et al.
Pubblicazione: (2025)
UA-Legal-Bench: A Benchmark for Evaluating Large Language Models on Ukrainian Legal Reasoning
di: Ovcharov, Volodymyr
Pubblicazione: (2026)
di: Ovcharov, Volodymyr
Pubblicazione: (2026)
LegalGraphRAG: Multi-Agent Graph Retrieval-Augmented Generation for Reliable Legal Reasoning
di: Chen, Zerui, et al.
Pubblicazione: (2026)
di: Chen, Zerui, et al.
Pubblicazione: (2026)
GrandGuard: Taxonomy, Benchmark, and Safeguards for Elderly-Chatbot Interaction Safety
di: Fan, Changxuan, et al.
Pubblicazione: (2026)
di: Fan, Changxuan, et al.
Pubblicazione: (2026)
Revealing Algorithmic Deductive Circuits for Logical Reasoning
di: Nguyen, Phuong Minh, et al.
Pubblicazione: (2026)
di: Nguyen, Phuong Minh, et al.
Pubblicazione: (2026)
DataSciBench: An LLM Agent Benchmark for Data Science
di: Zhang, Dan, et al.
Pubblicazione: (2025)
di: Zhang, Dan, et al.
Pubblicazione: (2025)
Complex Reasoning over Logical Queries on Commonsense Knowledge Graphs
di: Fang, Tianqing, et al.
Pubblicazione: (2024)
di: Fang, Tianqing, et al.
Pubblicazione: (2024)
LLM-Hanabi: Evaluating Multi-Agent Gameplays with Theory-of-Mind and Rationale Inference in Imperfect Information Collaboration Game
di: Liang, Fangzhou, et al.
Pubblicazione: (2025)
di: Liang, Fangzhou, et al.
Pubblicazione: (2025)
CALRK-Bench: Evaluating Context-Aware Legal Reasoning in Korean Law
di: Jung, JiHyeok, et al.
Pubblicazione: (2026)
di: Jung, JiHyeok, et al.
Pubblicazione: (2026)
EquiBench: Benchmarking Large Language Models' Reasoning about Program Semantics via Equivalence Checking
di: Wei, Anjiang, et al.
Pubblicazione: (2025)
di: Wei, Anjiang, et al.
Pubblicazione: (2025)
ProcBench: Benchmark for Multi-Step Reasoning and Following Procedure
di: Fujisawa, Ippei, et al.
Pubblicazione: (2024)
di: Fujisawa, Ippei, et al.
Pubblicazione: (2024)
Toward Mechanistic Explanation of Deductive Reasoning in Language Models
di: Maltoni, Davide, et al.
Pubblicazione: (2025)
di: Maltoni, Davide, et al.
Pubblicazione: (2025)
Investigating the Robustness of Deductive Reasoning with Large Language Models
di: Hoppe, Fabian, et al.
Pubblicazione: (2025)
di: Hoppe, Fabian, et al.
Pubblicazione: (2025)
MSCoRe: A Benchmark for Multi-Stage Collaborative Reasoning in LLM Agents
di: Lei, Yuzhen, et al.
Pubblicazione: (2025)
di: Lei, Yuzhen, et al.
Pubblicazione: (2025)
Multi-Agent Simulator Drives Language Models for Legal Intensive Interaction
di: Yue, Shengbin, et al.
Pubblicazione: (2025)
di: Yue, Shengbin, et al.
Pubblicazione: (2025)
On Verifiable Legal Reasoning: A Multi-Agent Framework with Formalized Knowledge Representations
di: Sadowski, Albert, et al.
Pubblicazione: (2025)
di: Sadowski, Albert, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Safety Compliance: Rethinking LLM Safety Reasoning through the Lens of Compliance
di: Hu, Wenbin, et al.
Pubblicazione: (2025) -
Node Level Graph Autoencoder: Unified Pretraining for Textual Graph Learning
di: Hu, Wenbin, et al.
Pubblicazione: (2024) -
PerfCodeBench: Benchmarking LLMs for System-Level High-Performance Code Optimization
di: Jing, Huihao, et al.
Pubblicazione: (2026) -
PrivaCI-Bench: Evaluating Privacy with Contextual Integrity and Legal Compliance
di: Li, Haoran, et al.
Pubblicazione: (2025) -
OmniCompliance-100K: A Multi-Domain, Rule-Grounded, Real-World Safety Compliance Dataset
di: Hu, Wenbin, et al.
Pubblicazione: (2026)