ClinConsensus: A Physician-Calibrated Benchmark for Evaluating Clinical Rubric Coverage in Chinese Medical LLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Zheng, Xiang, Li, Han, Luo, Wenjie, Zhai, Weiqi, Li, Yiyuan, Yan, Chuanmiao, Yang, Xue, Wu, Kailuan, Xu, Ruyi, Lu, Tianyun, Tang, Tianyi, Ma, Yubo, Yang, Kexin, Liu, Dayiheng, Yang, Sen, Qu, Lin, Zhao, Bing, Wei, Hu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ARES: Automated Rubric Synthesis for Scalable LLM Reinforcement Learning
por: Li, Xiaoyuan, et al.
Publicado: (2026)
por: Li, Xiaoyuan, et al.
Publicado: (2026)
Impact of decision‐making autonomy and social distance on young Chinese children's sharing behaviour
por: Wenjie Zhang, et al.
Publicado: (2024)
por: Wenjie Zhang, et al.
Publicado: (2024)
PLawBench: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice
por: Shi, Yuzhen, et al.
Publicado: (2026)
por: Shi, Yuzhen, et al.
Publicado: (2026)
On Predicting the Post-training Potential of Pre-trained LLMs
por: Li, Xiaoyuan, et al.
Publicado: (2026)
por: Li, Xiaoyuan, et al.
Publicado: (2026)
SkillGraph: Skill-Augmented Reinforcement Learning for Agents via Evolving Skill Graphs
por: Li, Xiaoyuan, et al.
Publicado: (2026)
por: Li, Xiaoyuan, et al.
Publicado: (2026)
RICA2: Rubric-Informed, Calibrated Assessment of Actions
por: Majeedi, Abrar, et al.
Publicado: (2024)
por: Majeedi, Abrar, et al.
Publicado: (2024)
SCOPE: Saliency-Coverage Oriented Token Pruning for Efficient Multimodel LLMs
por: Deng, Jinhong, et al.
Publicado: (2025)
por: Deng, Jinhong, et al.
Publicado: (2025)
DexiTac: Soft Dexterous Tactile Gripping
por: Lu, Chenghua, et al.
Publicado: (2024)
por: Lu, Chenghua, et al.
Publicado: (2024)
RubricHub: A Comprehensive and Highly Discriminative Rubric Dataset via Automated Coarse-to-Fine Generation
por: Li, Sunzhu, et al.
Publicado: (2026)
por: Li, Sunzhu, et al.
Publicado: (2026)
End-to-End Learning for Partially-Observed Time Series with PyPOTS
por: Du, Wenjie, et al.
Publicado: (2026)
por: Du, Wenjie, et al.
Publicado: (2026)
Auto-Rubric: Learning From Implicit Weights to Explicit Rubrics for Reward Modeling
por: Xie, Lipeng, et al.
Publicado: (2025)
por: Xie, Lipeng, et al.
Publicado: (2025)
Expert Consensus on Perioperative Physician–Pharmacist Airway Co‐Management
por: Dongmei Meng, et al.
Publicado: (2025)
por: Dongmei Meng, et al.
Publicado: (2025)
DataMan: Data Manager for Pre-training Large Language Models
por: Peng, Ru, et al.
Publicado: (2025)
por: Peng, Ru, et al.
Publicado: (2025)
ClinCoT: Clinical-Aware Visual Chain-of-Thought for Medical Vision Language Models
por: Liu, Xiwei, et al.
Publicado: (2026)
por: Liu, Xiwei, et al.
Publicado: (2026)
ClinBench-HPB: A Clinical Benchmark for Evaluating LLMs in Hepato-Pancreato-Biliary Diseases
por: Li, Yuchong, et al.
Publicado: (2025)
por: Li, Yuchong, et al.
Publicado: (2025)
Unified Data Selection for LLM Reasoning
por: Li, Xiaoyuan, et al.
Publicado: (2026)
por: Li, Xiaoyuan, et al.
Publicado: (2026)
MTR-Bench: A Comprehensive Benchmark for Multi-Turn Reasoning Evaluation
por: Li, Xiaoyuan, et al.
Publicado: (2025)
por: Li, Xiaoyuan, et al.
Publicado: (2025)
Rubric-Guided Process Reward for Stepwise Model Routing
por: Ye, Shenghao, et al.
Publicado: (2026)
por: Ye, Shenghao, et al.
Publicado: (2026)
ClinNoteAgents: An LLM Multi-Agent System for Predicting and Interpreting Heart Failure 30-Day Readmission from Clinical Notes
por: Zhou, Rongjia, et al.
Publicado: (2025)
por: Zhou, Rongjia, et al.
Publicado: (2025)
Television Coverage and Outcome Uncertainty in Sports: Empirical Evidence from the NBA and WNBA
por: Yubo Wang
Publicado: (2014)
por: Yubo Wang
Publicado: (2014)
Chinese MentalBERT: Domain-Adaptive Pre-training on Social Media for Chinese Mental Health Text Analysis
por: Zhai, Wei, et al.
Publicado: (2024)
por: Zhai, Wei, et al.
Publicado: (2024)
Talking vs. Walking: How ESG Strategic Positioning in Disclosure and Practice Across Dimensions Drives Financial Performance
por: Yang Yang, et al.
Publicado: (2026)
por: Yang Yang, et al.
Publicado: (2026)
RuCL: Stratified Rubric-Based Curriculum Learning for Multimodal Large Language Model Reasoning
por: Chen, Yukun, et al.
Publicado: (2026)
por: Chen, Yukun, et al.
Publicado: (2026)
Uncertainty-Calibrated Recommendations for Low-Active Users
por: Zou, Bob Junyi, et al.
Publicado: (2026)
por: Zou, Bob Junyi, et al.
Publicado: (2026)
Calibrating Multimodal Consensus for Emotion Recognition
por: Zhong, Guowei, et al.
Publicado: (2025)
por: Zhong, Guowei, et al.
Publicado: (2025)
PyPOTS: A Python Toolkit for Machine Learning on Partially-Observed Time Series
por: Du, Wenjie, et al.
Publicado: (2023)
por: Du, Wenjie, et al.
Publicado: (2023)
Open Rubric System: Scaling Reinforcement Learning with Pairwise Adaptive Rubric
por: Jia, Ruipeng, et al.
Publicado: (2026)
por: Jia, Ruipeng, et al.
Publicado: (2026)
Cytochalasins from the Sponge-Derived Fungus and Their Biological Activities.
por: Li, Kai, et al.
Publicado: (2025)
por: Li, Kai, et al.
Publicado: (2025)
Not Every Rubric Teaches Equally: Policy-Aware Rubric Rewards for RLVR
por: Tyagi, Utkarsh, et al.
Publicado: (2026)
por: Tyagi, Utkarsh, et al.
Publicado: (2026)
OpenRubrics: Towards Scalable Synthetic Rubric Generation for Reward Modeling and LLM Alignment
por: Liu, Tianci, et al.
Publicado: (2025)
por: Liu, Tianci, et al.
Publicado: (2025)
Pressure‐Assisted Ni 3d–S 3p Hybridization within Targeted In–S Layer for Enhanced Photocatalytic Hydrogen Production
por: Bo Shao, et al.
Publicado: (2025)
por: Bo Shao, et al.
Publicado: (2025)
From Physician Expertise to Clinical Agents: Preserving, Standardizing, and Scaling Physicians' Medical Expertise with Lightweight LLM
por: Luo, Chanyong, et al.
Publicado: (2026)
por: Luo, Chanyong, et al.
Publicado: (2026)
Distributed Rotary Coverage Control of Multi-Agent Systems in Uncertain Environments
por: Zhai, Chao, et al.
Publicado: (2025)
por: Zhai, Chao, et al.
Publicado: (2025)
Physical Parameter Calibration
por: Li, Yang, et al.
Publicado: (2022)
por: Li, Yang, et al.
Publicado: (2022)
Pruning for Robust Concept Erasing in Diffusion Models
por: Yang, Tianyun, et al.
Publicado: (2024)
por: Yang, Tianyun, et al.
Publicado: (2024)
ClinTutor-R1: Advancing Scalable and Robust One-to-Many Alignment in Clinical Socratic Education
por: He, Zhitao, et al.
Publicado: (2025)
por: He, Zhitao, et al.
Publicado: (2025)
Potential of di-Higgs observation via a calibratable jet-free $HH\to 4b$ framework
por: Yang, Tianyi, et al.
Publicado: (2025)
por: Yang, Tianyi, et al.
Publicado: (2025)
Biphasic Synovial Sarcoma in the Abdominal Cavity
por: Yubo Wang, et al.
Publicado: (2025)
por: Yubo Wang, et al.
Publicado: (2025)
Agentic Rubrics as Contextual Verifiers for SWE Agents
por: Raghavendra, Mohit, et al.
Publicado: (2026)
por: Raghavendra, Mohit, et al.
Publicado: (2026)
Cellulose‐Templated Nanomaterials for Nanogenerators and Self‐Powered Sensors
por: Weiqi Qian, et al.
Publicado: (2024)
por: Weiqi Qian, et al.
Publicado: (2024)
Ejemplares similares
-
ARES: Automated Rubric Synthesis for Scalable LLM Reinforcement Learning
por: Li, Xiaoyuan, et al.
Publicado: (2026) -
Impact of decision‐making autonomy and social distance on young Chinese children's sharing behaviour
por: Wenjie Zhang, et al.
Publicado: (2024) -
PLawBench: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice
por: Shi, Yuzhen, et al.
Publicado: (2026) -
On Predicting the Post-training Potential of Pre-trained LLMs
por: Li, Xiaoyuan, et al.
Publicado: (2026) -
SkillGraph: Skill-Augmented Reinforcement Learning for Agents via Evolving Skill Graphs
por: Li, Xiaoyuan, et al.
Publicado: (2026)