Evaluation Ethics of LLMs in Legal Domain
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Ruizhe, Li, Haitao, Wu, Yueyue, Ai, Qingyao, Liu, Yiqun, Zhang, Min, Ma, Shaoping |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LeKUBE: A Legal Knowledge Update BEnchmark
par: Wang, Changyue, et autres
Publié: (2024)
par: Wang, Changyue, et autres
Publié: (2024)
LexEval: A Comprehensive Chinese Legal Benchmark for Evaluating Large Language Models
par: Li, Haitao, et autres
Publié: (2024)
par: Li, Haitao, et autres
Publié: (2024)
Enhancing Judgment Document Generation via Agentic Legal Information Collection and Rubric-Guided Optimization
par: Su, Weihang, et autres
Publié: (2026)
par: Su, Weihang, et autres
Publié: (2026)
ATACompressor: Adaptive Task-Aware Compression for Efficient Long-Context Processing in LLMs
par: Li, Xuancheng, et autres
Publié: (2026)
par: Li, Xuancheng, et autres
Publié: (2026)
JuDGE: Benchmarking Judgment Document Generation for Chinese Legal System
par: Su, Weihang, et autres
Publié: (2025)
par: Su, Weihang, et autres
Publié: (2025)
Capability-aware Prompt Reformulation Learning for Text-to-Image Generation
par: Zhan, Jingtao, et autres
Publié: (2024)
par: Zhan, Jingtao, et autres
Publié: (2024)
Evaluating Intelligence via Trial and Error
par: Zhan, Jingtao, et autres
Publié: (2025)
par: Zhan, Jingtao, et autres
Publié: (2025)
Improve Large Language Model Systems with User Logs
par: Wang, Changyue, et autres
Publié: (2026)
par: Wang, Changyue, et autres
Publié: (2026)
LegalAgentBench: Evaluating LLM Agents in Legal Domain
par: Li, Haitao, et autres
Publié: (2024)
par: Li, Haitao, et autres
Publié: (2024)
Gender Biased Legal Case Retrieval System on Users' Decision Process
par: Zhang, Ruizhe, et autres
Publié: (2024)
par: Zhang, Ruizhe, et autres
Publié: (2024)
Option-ID Based Elimination For Multiple Choice Questions
par: Zhu, Zhenhao, et autres
Publié: (2025)
par: Zhu, Zhenhao, et autres
Publié: (2025)
Evaluation of Large Language Models in Legal Applications: Challenges, Methods, and Future Directions
par: Hu, Yiran, et autres
Publié: (2026)
par: Hu, Yiran, et autres
Publié: (2026)
Decoupling Reasoning and Knowledge Injection for In-Context Knowledge Editing
par: Wang, Changyue, et autres
Publié: (2025)
par: Wang, Changyue, et autres
Publié: (2025)
Overview of the NTCIR-18 Automatic Evaluation of LLMs (AEOLLM) Task
par: Chen, Junjie, et autres
Publié: (2025)
par: Chen, Junjie, et autres
Publié: (2025)
Unsupervised Real-Time Hallucination Detection based on the Internal States of Large Language Models
par: Su, Weihang, et autres
Publié: (2024)
par: Su, Weihang, et autres
Publié: (2024)
What Scales in Cross-Entropy Scaling Law?
par: Yan, Junxi, et autres
Publié: (2025)
par: Yan, Junxi, et autres
Publié: (2025)
Analytical Search
par: Tu, Yiteng, et autres
Publié: (2026)
par: Tu, Yiteng, et autres
Publié: (2026)
How do Humans Process AI-generated Hallucination Contents: a Neuroimaging Study
par: Zhu, Shuqi, et autres
Publié: (2026)
par: Zhu, Shuqi, et autres
Publié: (2026)
Chinese Court Simulation with LLM-Based Agent System
par: Zhang, Kaiyuan, et autres
Publié: (2025)
par: Zhang, Kaiyuan, et autres
Publié: (2025)
MedEthicsQA: A Comprehensive Question Answering Benchmark for Medical Ethics Evaluation of LLMs
par: Wei, Jianhui, et autres
Publié: (2025)
par: Wei, Jianhui, et autres
Publié: (2025)
SurGE: A Benchmark and Evaluation Framework for Scientific Survey Generation
par: Su, Weihang, et autres
Publié: (2025)
par: Su, Weihang, et autres
Publié: (2025)
Relative-Based Scaling Law for Neural Language Models
par: Yue, Baoqing, et autres
Publié: (2025)
par: Yue, Baoqing, et autres
Publié: (2025)
KRAG Framework for Enhancing LLMs in the Legal Domain
par: Thanh, Nguyen Ha, et autres
Publié: (2024)
par: Thanh, Nguyen Ha, et autres
Publié: (2024)
Augmenting Multi-Agent Communication with State Delta Trajectory
par: Tang, Yichen, et autres
Publié: (2025)
par: Tang, Yichen, et autres
Publié: (2025)
Beyond Experience Retrieval: Learning to Generate Utility-Optimized Structured Experience for Frozen LLMs
par: Li, Xuancheng, et autres
Publié: (2026)
par: Li, Xuancheng, et autres
Publié: (2026)
LexRAG: Benchmarking Retrieval-Augmented Generation in Multi-Turn Legal Consultation Conversation
par: Li, Haitao, et autres
Publié: (2025)
par: Li, Haitao, et autres
Publié: (2025)
TestAgent: Automatic Benchmarking and Exploratory Interaction for Evaluating LLMs in Vertical Domains
par: Wang, Wanying, et autres
Publié: (2024)
par: Wang, Wanying, et autres
Publié: (2024)
Automatic Legal Writing Evaluation of LLMs
par: Pires, Ramon, et autres
Publié: (2025)
par: Pires, Ramon, et autres
Publié: (2025)
Data Analysis and Performance Evaluation of Simulation Deduction Based on LLMs
par: Zhang, Shansi, et autres
Publié: (2025)
par: Zhang, Shansi, et autres
Publié: (2025)
CaseGen: A Benchmark for Multi-Stage Legal Case Documents Generation
par: Li, Haitao, et autres
Publié: (2025)
par: Li, Haitao, et autres
Publié: (2025)
PAD: Personalized Alignment of LLMs at Decoding-Time
par: Chen, Ruizhe, et autres
Publié: (2024)
par: Chen, Ruizhe, et autres
Publié: (2024)
Beyond Scalar Reward Model: Learning Generative Judge from Preference Data
par: Ye, Ziyi, et autres
Publié: (2024)
par: Ye, Ziyi, et autres
Publié: (2024)
Query Augmentation by Decoding Semantics from Brain Signals
par: Ye, Ziyi, et autres
Publié: (2024)
par: Ye, Ziyi, et autres
Publié: (2024)
PRE: A Peer Review Based Large Language Model Evaluator
par: Chu, Zhumin, et autres
Publié: (2024)
par: Chu, Zhumin, et autres
Publié: (2024)
PLawBench: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice
par: Shi, Yuzhen, et autres
Publié: (2026)
par: Shi, Yuzhen, et autres
Publié: (2026)
Automating Legal Interpretation with LLMs: Retrieval, Generation, and Evaluation
par: Luo, Kangcheng, et autres
Publié: (2025)
par: Luo, Kangcheng, et autres
Publié: (2025)
Auto-PRE: An Automatic and Cost-Efficient Peer-Review Framework for Language Generation Evaluation
par: Chen, Junjie, et autres
Publié: (2024)
par: Chen, Junjie, et autres
Publié: (2024)
MulFeRL: Enhancing Reinforcement Learning with Verbal Feedback in a Multi-turn Loop
par: Li, Xuancheng, et autres
Publié: (2026)
par: Li, Xuancheng, et autres
Publié: (2026)
Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks
par: Pires, Ramon, et autres
Publié: (2026)
par: Pires, Ramon, et autres
Publié: (2026)
ProMoral-Bench: Evaluating Prompting Strategies for Moral Reasoning and Safety in LLMs
par: Thomas, Rohan Subramanian, et autres
Publié: (2026)
par: Thomas, Rohan Subramanian, et autres
Publié: (2026)
Documents similaires
-
LeKUBE: A Legal Knowledge Update BEnchmark
par: Wang, Changyue, et autres
Publié: (2024) -
LexEval: A Comprehensive Chinese Legal Benchmark for Evaluating Large Language Models
par: Li, Haitao, et autres
Publié: (2024) -
Enhancing Judgment Document Generation via Agentic Legal Information Collection and Rubric-Guided Optimization
par: Su, Weihang, et autres
Publié: (2026) -
ATACompressor: Adaptive Task-Aware Compression for Efficient Long-Context Processing in LLMs
par: Li, Xuancheng, et autres
Publié: (2026) -
JuDGE: Benchmarking Judgment Document Generation for Chinese Legal System
par: Su, Weihang, et autres
Publié: (2025)