JustEva: A Toolkit to Evaluate LLM Fairness in Legal Knowledge Inference
Fuente:
arXiv
Guardado en:
| Autores principales: | Xue, Zongyue, Zheng, Siyuan, Wang, Shaochun, Hu, Yiran, Wang, Shenran, Yao, Yuxin, Li, Haitao, Ai, Qingyao, Liu, Yiqun, Liu, Yun, Shen, Weixing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LLMs on Trial: Evaluating Judicial Fairness for Large Language Models
por: Hu, Yiran, et al.
Publicado: (2025)
por: Hu, Yiran, et al.
Publicado: (2025)
LegalAgentBench: Evaluating LLM Agents in Legal Domain
por: Li, Haitao, et al.
Publicado: (2024)
por: Li, Haitao, et al.
Publicado: (2024)
LeKUBE: A Legal Knowledge Update BEnchmark
por: Wang, Changyue, et al.
Publicado: (2024)
por: Wang, Changyue, et al.
Publicado: (2024)
Simulating Dispute Mediation with LLM-Based Agents for Legal Research
por: Chen, Junjie, et al.
Publicado: (2025)
por: Chen, Junjie, et al.
Publicado: (2025)
LexEval: A Comprehensive Chinese Legal Benchmark for Evaluating Large Language Models
por: Li, Haitao, et al.
Publicado: (2024)
por: Li, Haitao, et al.
Publicado: (2024)
Enhancing LLM-Based Agents via Global Planning and Hierarchical Execution
por: Chen, Junjie, et al.
Publicado: (2025)
por: Chen, Junjie, et al.
Publicado: (2025)
Evaluation Ethics of LLMs in Legal Domain
por: Zhang, Ruizhe, et al.
Publicado: (2024)
por: Zhang, Ruizhe, et al.
Publicado: (2024)
Gender Biased Legal Case Retrieval System on Users' Decision Process
por: Zhang, Ruizhe, et al.
Publicado: (2024)
por: Zhang, Ruizhe, et al.
Publicado: (2024)
Towards an In-Depth Comprehension of Case Relevance for Better Legal Retrieval
por: Li, Haitao, et al.
Publicado: (2024)
por: Li, Haitao, et al.
Publicado: (2024)
Decoupling Reasoning and Knowledge Injection for In-Context Knowledge Editing
por: Wang, Changyue, et al.
Publicado: (2025)
por: Wang, Changyue, et al.
Publicado: (2025)
LexRAG: Benchmarking Retrieval-Augmented Generation in Multi-Turn Legal Consultation Conversation
por: Li, Haitao, et al.
Publicado: (2025)
por: Li, Haitao, et al.
Publicado: (2025)
STARD: A Chinese Statute Retrieval Dataset with Real Queries Issued by Non-professionals
por: Su, Weihang, et al.
Publicado: (2024)
por: Su, Weihang, et al.
Publicado: (2024)
Evaluation of Large Language Models in Legal Applications: Challenges, Methods, and Future Directions
por: Hu, Yiran, et al.
Publicado: (2026)
por: Hu, Yiran, et al.
Publicado: (2026)
Knowledge Editing through Chain-of-Thought
por: Wang, Changyue, et al.
Publicado: (2024)
por: Wang, Changyue, et al.
Publicado: (2024)
Decoupling Knowledge and Task Subspaces for Composable Parametric Retrieval Augmented Generation
por: Su, Weihang, et al.
Publicado: (2026)
por: Su, Weihang, et al.
Publicado: (2026)
JuDGE: Benchmarking Judgment Document Generation for Chinese Legal System
por: Su, Weihang, et al.
Publicado: (2025)
por: Su, Weihang, et al.
Publicado: (2025)
Enhancing Judgment Document Generation via Agentic Legal Information Collection and Rubric-Guided Optimization
por: Su, Weihang, et al.
Publicado: (2026)
por: Su, Weihang, et al.
Publicado: (2026)
Equity vs. Equality: Optimizing Ranking Fairness for Tailored Provider Needs
por: Tu, Yiteng, et al.
Publicado: (2026)
por: Tu, Yiteng, et al.
Publicado: (2026)
Overview of the NTCIR-18 Automatic Evaluation of LLMs (AEOLLM) Task
por: Chen, Junjie, et al.
Publicado: (2025)
por: Chen, Junjie, et al.
Publicado: (2025)
ATACompressor: Adaptive Task-Aware Compression for Efficient Long-Context Processing in LLMs
por: Li, Xuancheng, et al.
Publicado: (2026)
por: Li, Xuancheng, et al.
Publicado: (2026)
MulFeRL: Enhancing Reinforcement Learning with Verbal Feedback in a Multi-turn Loop
por: Li, Xuancheng, et al.
Publicado: (2026)
por: Li, Xuancheng, et al.
Publicado: (2026)
PRE: A Peer Review Based Large Language Model Evaluator
por: Chu, Zhumin, et al.
Publicado: (2024)
por: Chu, Zhumin, et al.
Publicado: (2024)
Beyond Experience Retrieval: Learning to Generate Utility-Optimized Structured Experience for Frozen LLMs
por: Li, Xuancheng, et al.
Publicado: (2026)
por: Li, Xuancheng, et al.
Publicado: (2026)
Caseformer: Pre-training for Legal Case Retrieval Based on Inter-Case Distinctions
por: Su, Weihang, et al.
Publicado: (2023)
por: Su, Weihang, et al.
Publicado: (2023)
Beyond Exposure: Optimizing Ranking Fairness with Non-linear Time-Income Functions
por: Li, Xuancheng, et al.
Publicado: (2026)
por: Li, Xuancheng, et al.
Publicado: (2026)
Investigating Prosocial Behavior Theory in LLM Agents under Policy-Induced Inequities
por: Zhou, Yujia, et al.
Publicado: (2025)
por: Zhou, Yujia, et al.
Publicado: (2025)
Improving Legal Case Retrieval with Brain Signals
por: Zhang, Ruizhe, et al.
Publicado: (2024)
por: Zhang, Ruizhe, et al.
Publicado: (2024)
Foundations of GenIR
por: Ai, Qingyao, et al.
Publicado: (2025)
por: Ai, Qingyao, et al.
Publicado: (2025)
CaseGen: A Benchmark for Multi-Stage Legal Case Documents Generation
por: Li, Haitao, et al.
Publicado: (2025)
por: Li, Haitao, et al.
Publicado: (2025)
DELTA: Pre-train a Discriminative Encoder for Legal Case Retrieval via Structural Word Alignment
por: Li, Haitao, et al.
Publicado: (2024)
por: Li, Haitao, et al.
Publicado: (2024)
Improve Large Language Model Systems with User Logs
por: Wang, Changyue, et al.
Publicado: (2026)
por: Wang, Changyue, et al.
Publicado: (2026)
Joint Evaluation of Answer and Reasoning Consistency for Hallucination Detection in Large Reasoning Models
por: Wang, Changyue, et al.
Publicado: (2025)
por: Wang, Changyue, et al.
Publicado: (2025)
J&H: Evaluating the Robustness of Large Language Models Under Knowledge-Injection Attacks in Legal Domain
por: Hu, Yiran, et al.
Publicado: (2025)
por: Hu, Yiran, et al.
Publicado: (2025)
Multi-Source Retrieval and Reasoning for Legal Sentencing Prediction
por: Chen, Junjie, et al.
Publicado: (2026)
por: Chen, Junjie, et al.
Publicado: (2026)
JUREX-4E: Juridical Expert-Annotated Four-Element Knowledge Base for Legal Reasoning
por: Liu, Huanghai, et al.
Publicado: (2025)
por: Liu, Huanghai, et al.
Publicado: (2025)
Option-ID Based Elimination For Multiple Choice Questions
por: Zhu, Zhenhao, et al.
Publicado: (2025)
por: Zhu, Zhenhao, et al.
Publicado: (2025)
MemoryBench: A Benchmark for Memory and Continual Learning in LLM Systems
por: Ai, Qingyao, et al.
Publicado: (2025)
por: Ai, Qingyao, et al.
Publicado: (2025)
Unsupervised Real-Time Hallucination Detection based on the Internal States of Large Language Models
por: Su, Weihang, et al.
Publicado: (2024)
por: Su, Weihang, et al.
Publicado: (2024)
LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods
por: Li, Haitao, et al.
Publicado: (2024)
por: Li, Haitao, et al.
Publicado: (2024)
LegalOne: A Family of Foundation Models for Reliable Legal Reasoning
por: Li, Haitao, et al.
Publicado: (2026)
por: Li, Haitao, et al.
Publicado: (2026)
Ejemplares similares
-
LLMs on Trial: Evaluating Judicial Fairness for Large Language Models
por: Hu, Yiran, et al.
Publicado: (2025) -
LegalAgentBench: Evaluating LLM Agents in Legal Domain
por: Li, Haitao, et al.
Publicado: (2024) -
LeKUBE: A Legal Knowledge Update BEnchmark
por: Wang, Changyue, et al.
Publicado: (2024) -
Simulating Dispute Mediation with LLM-Based Agents for Legal Research
por: Chen, Junjie, et al.
Publicado: (2025) -
LexEval: A Comprehensive Chinese Legal Benchmark for Evaluating Large Language Models
por: Li, Haitao, et al.
Publicado: (2024)