PLawBench: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice
Fuente:
arXiv
Guardado en:
| Autores principales: | Shi, Yuzhen, Liu, Huanghai, Hu, Yiran, Song, Gaojie, Xu, Xinran, Ma, Yubo, Tang, Tianyi, Zhang, Li, Chen, Qingjing, Feng, Di, Lv, Wenbo, Wu, Weiheng, Yang, Kexin, Yang, Sen, Wang, Wei, Shi, Rongyao, Qiu, Yuanyang, Qi, Yuemeng, Zhang, Jingwen, Sui, Xiaoyu, Chen, Yifan, Zhang, Yi, Yang, An, Yu, Bowen, Liu, Dayiheng, Lin, Junyang, Shen, Weixing, Zhao, Bing, Clarke, Charles L. A., Wei, Hu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
JUREX-4E: Juridical Expert-Annotated Four-Element Knowledge Base for Legal Reasoning
por: Liu, Huanghai, et al.
Publicado: (2025)
por: Liu, Huanghai, et al.
Publicado: (2025)
J&H: Evaluating the Robustness of Large Language Models Under Knowledge-Injection Attacks in Legal Domain
por: Hu, Yiran, et al.
Publicado: (2025)
por: Hu, Yiran, et al.
Publicado: (2025)
RubricHub: A Comprehensive and Highly Discriminative Rubric Dataset via Automated Coarse-to-Fine Generation
por: Li, Sunzhu, et al.
Publicado: (2026)
por: Li, Sunzhu, et al.
Publicado: (2026)
ClinConsensus: A Physician-Calibrated Benchmark for Evaluating Clinical Rubric Coverage in Chinese Medical LLMs
por: Zheng, Xiang, et al.
Publicado: (2026)
por: Zheng, Xiang, et al.
Publicado: (2026)
ARES: Automated Rubric Synthesis for Scalable LLM Reinforcement Learning
por: Li, Xiaoyuan, et al.
Publicado: (2026)
por: Li, Xiaoyuan, et al.
Publicado: (2026)
DataMan: Data Manager for Pre-training Large Language Models
por: Peng, Ru, et al.
Publicado: (2025)
por: Peng, Ru, et al.
Publicado: (2025)
Existence and uniqueness of solutions to Bogomol'nyi-Prased-Sommerfeld equations on graphs
por: Hu, Yuanyang
Publicado: (2022)
por: Hu, Yuanyang
Publicado: (2022)
$L^{p}$-$L^{q}$ estimates of the heat kernels on graphs with applications to a parabolic system
por: Hu, Yuanyang
Publicado: (2025)
por: Hu, Yuanyang
Publicado: (2025)
FusionRCG: Orchestrating Recursive Computation Graphs across GPU Memory Hierarchies
por: Zhang, Yihong, et al.
Publicado: (2026)
por: Zhang, Yihong, et al.
Publicado: (2026)
From Entanglement to Alignment: Representation Space Decomposition for Unsupervised Time Series Domain Adaptation
por: Cai, Rongyao, et al.
Publicado: (2025)
por: Cai, Rongyao, et al.
Publicado: (2025)
Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning
por: Zhou, Yang, et al.
Publicado: (2025)
por: Zhou, Yang, et al.
Publicado: (2025)
PAPO: Stabilizing Rubric Integration Training via Decoupled Advantage Normalization
por: Tan, Zelin, et al.
Publicado: (2026)
por: Tan, Zelin, et al.
Publicado: (2026)
Hyperfocal subalgebras of hyperfocal abelian Frobenius blocks
por: Hu, Xueqin, et al.
Publicado: (2026)
por: Hu, Xueqin, et al.
Publicado: (2026)
MarginGate: Sparse Margin-Triggered Verification for Batch-Invariant LLM Inference
por: Chu, Kexin, et al.
Publicado: (2026)
por: Chu, Kexin, et al.
Publicado: (2026)
Preference-Aware Rubric Learning for Personalized Evaluation
por: Qiu, Yilun, et al.
Publicado: (2026)
por: Qiu, Yilun, et al.
Publicado: (2026)
Deep Research as Rubric for Reinforcement Learning
por: Mei, Wangyi, et al.
Publicado: (2026)
por: Mei, Wangyi, et al.
Publicado: (2026)
Auto-Rubric: Learning From Implicit Weights to Explicit Rubrics for Reward Modeling
por: Xie, Lipeng, et al.
Publicado: (2025)
por: Xie, Lipeng, et al.
Publicado: (2025)
On Predicting the Post-training Potential of Pre-trained LLMs
por: Li, Xiaoyuan, et al.
Publicado: (2026)
por: Li, Xiaoyuan, et al.
Publicado: (2026)
LLMs on Trial: Evaluating Judicial Fairness for Large Language Models
por: Hu, Yiran, et al.
Publicado: (2025)
por: Hu, Yiran, et al.
Publicado: (2025)
KFS: KAN based adaptive Frequency Selection learning architecture for long term time series forecasting
por: Wu, Changning, et al.
Publicado: (2025)
por: Wu, Changning, et al.
Publicado: (2025)
Chain of Execution Supervision Promotes General Reasoning in Large Language Models
por: Chen, Nuo, et al.
Publicado: (2025)
por: Chen, Nuo, et al.
Publicado: (2025)
Life span of solutions to a semilinear parabolic equation on locally finite graphs
por: Hu, Yuanyang, et al.
Publicado: (2024)
por: Hu, Yuanyang, et al.
Publicado: (2024)
Critical fractional Kirchhoff problems: Uniqueness and Nondegeneracy
por: Yang, Zhipeng, et al.
Publicado: (2025)
por: Yang, Zhipeng, et al.
Publicado: (2025)
Zanubrutinib Combined With Rituximab in the Treatment of Bing‐Neel Syndrome: A Case Report
por: Rongyao Zhang, et al.
Publicado: (2025)
por: Rongyao Zhang, et al.
Publicado: (2025)
Progressive Human Motion Generation Based on Text and Few Motion Frames
por: Zeng, Ling-An, et al.
Publicado: (2025)
por: Zeng, Ling-An, et al.
Publicado: (2025)
iRULER: Intelligible Rubric-Based User-Defined LLM Evaluation for Revision
por: Bai, Jingwen, et al.
Publicado: (2026)
por: Bai, Jingwen, et al.
Publicado: (2026)
Weissella paramesenteroides NRIC1542 inhibits dextran sodium sulfate‐induced colitis in mice through regulating gut microbiota and SIRT1 / NF ‐ κB signaling pathway
por: Shuang Li, et al.
Publicado: (2024)
por: Shuang Li, et al.
Publicado: (2024)
OPUS: Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration
por: Wang, Shaobo, et al.
Publicado: (2026)
por: Wang, Shaobo, et al.
Publicado: (2026)
Towards Automated Support for the Co-Evolution of Meta-Models and Grammars
por: Zhang, Weixing
Publicado: (2023)
por: Zhang, Weixing
Publicado: (2023)
Comments on the de Sitter Double Cone
por: Yang, Zhenbin, et al.
Publicado: (2025)
por: Yang, Zhenbin, et al.
Publicado: (2025)
Comment on “Translating Chuang Tzu into world literature: text and context”
por: Yuemeng Ge
Publicado: (2023)
por: Yuemeng Ge
Publicado: (2023)
Comment on “How should we think about common prosperity and challenges in the context of financialization?”
por: Yuemeng Ge
Publicado: (2023)
por: Yuemeng Ge
Publicado: (2023)
EvoRubric: Self-Evolving Rubric-Driven RL for Open-Ended Generation
por: Guan, Xin, et al.
Publicado: (2026)
por: Guan, Xin, et al.
Publicado: (2026)
A prediction-based forward-looking vehicle dispatching strategy for dynamic ride-pooling
por: Wang, Xiaolei, et al.
Publicado: (2024)
por: Wang, Xiaolei, et al.
Publicado: (2024)
Bracketing Image Restoration and Enhancement with High-Low Frequency Decomposition
por: Chen, Genggeng, et al.
Publicado: (2024)
por: Chen, Genggeng, et al.
Publicado: (2024)
Parallel Scaling Law for Language Models
por: Chen, Mouxiang, et al.
Publicado: (2025)
por: Chen, Mouxiang, et al.
Publicado: (2025)
Effects of Obesity on the Relationship Between Eating Behaviours and Cognitive Emotion Regulation in Chinese College Students: A Network Analysis
por: Wei Jiang, et al.
Publicado: (2025)
por: Wei Jiang, et al.
Publicado: (2025)
Blow-up suppression for the nematic liquid crystal flow via Couette flow on $\mathbb{R}^2$
por: Chen, Yubo, et al.
Publicado: (2026)
por: Chen, Yubo, et al.
Publicado: (2026)
Unveiling the Intricate Causal Nexus Between 91 Circulating Inflammatory Proteins and Perianal Abscess Through a Comprehensive Bidirectional Two‐Sample Mendelian Randomization Analysis
por: Zehui Wang, et al.
Publicado: (2025)
por: Zehui Wang, et al.
Publicado: (2025)
Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking
por: Li, Mingxin, et al.
Publicado: (2026)
por: Li, Mingxin, et al.
Publicado: (2026)
Ejemplares similares
-
JUREX-4E: Juridical Expert-Annotated Four-Element Knowledge Base for Legal Reasoning
por: Liu, Huanghai, et al.
Publicado: (2025) -
J&H: Evaluating the Robustness of Large Language Models Under Knowledge-Injection Attacks in Legal Domain
por: Hu, Yiran, et al.
Publicado: (2025) -
RubricHub: A Comprehensive and Highly Discriminative Rubric Dataset via Automated Coarse-to-Fine Generation
por: Li, Sunzhu, et al.
Publicado: (2026) -
ClinConsensus: A Physician-Calibrated Benchmark for Evaluating Clinical Rubric Coverage in Chinese Medical LLMs
por: Zheng, Xiang, et al.
Publicado: (2026) -
ARES: Automated Rubric Synthesis for Scalable LLM Reinforcement Learning
por: Li, Xiaoyuan, et al.
Publicado: (2026)