MedConceal: A Benchmark for Clinical Hidden-Concern Reasoning Under Partial Observability
Fuente:
arXiv
Guardado en:
| Autores principales: | Han, Yikun, Chan, Joey, Chen, Jingyuan, Ai, Mengting, Du, Simo, Guo, Yue |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Joint Optimization of Reasoning and Dual-Memory for Self-Learning Diagnostic Agent
por: Li, Bingxuan, et al.
Publicado: (2026)
por: Li, Bingxuan, et al.
Publicado: (2026)
Belief Memory: Agent Memory Under Partial Observability
por: Liao, Junfeng, et al.
Publicado: (2026)
por: Liao, Junfeng, et al.
Publicado: (2026)
Improving Clinical Diagnosis with Counterfactual Multi-Agent Reasoning
por: You, Zhiwen, et al.
Publicado: (2026)
por: You, Zhiwen, et al.
Publicado: (2026)
ReLay: Personalized LLM-Generated Plain-Language Summaries for Better Understanding, but at What Cost?
por: Chan, Joey, et al.
Publicado: (2026)
por: Chan, Joey, et al.
Publicado: (2026)
RJUA-MedDQA: A Multimodal Benchmark for Medical Document Question Answering and Clinical Reasoning
por: Jin, Congyun, et al.
Publicado: (2024)
por: Jin, Congyun, et al.
Publicado: (2024)
MedFrameQA: A Multi-Image Medical VQA Benchmark for Clinical Reasoning
por: Yu, Suhao, et al.
Publicado: (2025)
por: Yu, Suhao, et al.
Publicado: (2025)
MedRECT: A Medical Reasoning Benchmark for Error Correction in Clinical Texts
por: Iwase, Naoto, et al.
Publicado: (2025)
por: Iwase, Naoto, et al.
Publicado: (2025)
Temporal Predictors of Outcome in Reasoning Language Models
por: David, Joey
Publicado: (2025)
por: David, Joey
Publicado: (2025)
MedGUIDE: Benchmarking Clinical Decision-Making in Large Language Models
por: Li, Xiaomin, et al.
Publicado: (2025)
por: Li, Xiaomin, et al.
Publicado: (2025)
MedHopQA: A Disease-Centered Multi-Hop Reasoning Benchmark and Evaluation Framework for LLM-Based Biomedical Question Answering
por: Islamaj, Rezarta, et al.
Publicado: (2026)
por: Islamaj, Rezarta, et al.
Publicado: (2026)
MedPRMBench: A Fine-grained Benchmark for Process Reward Models in Medical Reasoning
por: Wu, Lingyan, et al.
Publicado: (2026)
por: Wu, Lingyan, et al.
Publicado: (2026)
HiMed: Incentivizing Hindi Reasoning in Medical LLMs
por: Jiang, Dingfeng, et al.
Publicado: (2026)
por: Jiang, Dingfeng, et al.
Publicado: (2026)
Iterative Formalization and Planning in Partially Observable Environments
por: Gong, Liancheng, et al.
Publicado: (2025)
por: Gong, Liancheng, et al.
Publicado: (2025)
MLP Fusion: Towards Efficient Fine-tuning of Dense and Mixture-of-Experts Language Models
por: Ai, Mengting, et al.
Publicado: (2023)
por: Ai, Mengting, et al.
Publicado: (2023)
GeoReasoner: Reasoning On Geospatially Grounded Context For Natural Language Understanding
por: Yan, Yibo, et al.
Publicado: (2024)
por: Yan, Yibo, et al.
Publicado: (2024)
MedAgentsBench: Benchmarking Thinking Models and Agent Frameworks for Complex Medical Reasoning
por: Tang, Xiangru, et al.
Publicado: (2025)
por: Tang, Xiangru, et al.
Publicado: (2025)
MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding
por: Zuo, Yuxin, et al.
Publicado: (2025)
por: Zuo, Yuxin, et al.
Publicado: (2025)
ORBIT -- Open Recommendation Benchmark for Reproducible Research with Hidden Tests
por: He, Jingyuan, et al.
Publicado: (2025)
por: He, Jingyuan, et al.
Publicado: (2025)
Veracity Bias and Beyond: Uncovering LLMs' Hidden Beliefs in Problem-Solving Reasoning
por: Zhou, Yue, et al.
Publicado: (2025)
por: Zhou, Yue, et al.
Publicado: (2025)
Computational Reasoning of Large Language Models
por: Wu, Haitao, et al.
Publicado: (2025)
por: Wu, Haitao, et al.
Publicado: (2025)
When Abundance Conceals Weakness: Knowledge Conflict in Multilingual Models
por: Zhao, Jiaqi, et al.
Publicado: (2026)
por: Zhao, Jiaqi, et al.
Publicado: (2026)
Concealment of Intent: A Game-Theoretic Analysis
por: Wu, Xinbo, et al.
Publicado: (2025)
por: Wu, Xinbo, et al.
Publicado: (2025)
Draw2Think: Harnessing Geometry Reasoning through Constraint Engine Interaction
por: Hu, Juncheng, et al.
Publicado: (2026)
por: Hu, Juncheng, et al.
Publicado: (2026)
LLMEval-Med: A Real-world Clinical Benchmark for Medical LLMs with Physician Validation
por: Zhang, Ming, et al.
Publicado: (2025)
por: Zhang, Ming, et al.
Publicado: (2025)
LongReason: A Synthetic Long-Context Reasoning Benchmark via Context Expansion
por: Ling, Zhan, et al.
Publicado: (2025)
por: Ling, Zhan, et al.
Publicado: (2025)
MedQA-CS: Objective Structured Clinical Examination (OSCE)-Style Benchmark for Evaluating LLM Clinical Skills
por: Yao, Zonghai, et al.
Publicado: (2024)
por: Yao, Zonghai, et al.
Publicado: (2024)
SCoRE: Benchmarking Long-Chain Reasoning in Commonsense Scenarios
por: Zhan, Weidong, et al.
Publicado: (2025)
por: Zhan, Weidong, et al.
Publicado: (2025)
AutoTool: Dynamic Tool Selection and Integration for Agentic Reasoning
por: Zou, Jiaru, et al.
Publicado: (2025)
por: Zou, Jiaru, et al.
Publicado: (2025)
ER-Reason: A Benchmark Dataset for LLM Clinical Reasoning in the Emergency Room
por: Mehandru, Nikita, et al.
Publicado: (2025)
por: Mehandru, Nikita, et al.
Publicado: (2025)
MedFactEval and MedAgentBrief: A Framework and Workflow for Generating and Evaluating Factual Clinical Summaries
por: Grolleau, François, et al.
Publicado: (2025)
por: Grolleau, François, et al.
Publicado: (2025)
ScoNe: Benchmarking Negation Reasoning in Language Models With Fine-Tuning and In-Context Learning
por: She, Jingyuan Selena, et al.
Publicado: (2023)
por: She, Jingyuan Selena, et al.
Publicado: (2023)
Med-CoReasoner: Reducing Language Disparities in Medical Reasoning via Language-Informed Co-Reasoning
por: Gao, Fan, et al.
Publicado: (2026)
por: Gao, Fan, et al.
Publicado: (2026)
MedErrBench: A Fine-Grained Multilingual Benchmark for Medical Error Detection and Correction with Clinical Expert Annotations
por: Ma, Congbo, et al.
Publicado: (2026)
por: Ma, Congbo, et al.
Publicado: (2026)
CliMedBench: A Large-Scale Chinese Benchmark for Evaluating Medical Large Language Models in Clinical Scenarios
por: Ouyang, Zetian, et al.
Publicado: (2024)
por: Ouyang, Zetian, et al.
Publicado: (2024)
Rescue: Ranking LLM Responses with Partial Ordering to Improve Response Generation
por: Wang, Yikun, et al.
Publicado: (2023)
por: Wang, Yikun, et al.
Publicado: (2023)
MedBrowseComp: Benchmarking Medical Deep Research and Computer Use
por: Chen, Shan, et al.
Publicado: (2025)
por: Chen, Shan, et al.
Publicado: (2025)
ChronoMedKG: A Temporally-Grounded Biomedical Knowledge Graph and Benchmark for Clinical Reasoning
por: Ahmed, Md Shamim, et al.
Publicado: (2026)
por: Ahmed, Md Shamim, et al.
Publicado: (2026)
LightReasoner: Can Small Language Models Teach Large Language Models Reasoning?
por: Wang, Jingyuan, et al.
Publicado: (2025)
por: Wang, Jingyuan, et al.
Publicado: (2025)
Information Seeking for Robust Decision Making under Partial Observability
por: Fang, Djengo Cyun-Jyun, et al.
Publicado: (2025)
por: Fang, Djengo Cyun-Jyun, et al.
Publicado: (2025)
When Evidence Conflicts: Uncertainty and Order Effects in Retrieval-Augmented Biomedical Question Answering
por: Han, Yikun, et al.
Publicado: (2026)
por: Han, Yikun, et al.
Publicado: (2026)
Ejemplares similares
-
Joint Optimization of Reasoning and Dual-Memory for Self-Learning Diagnostic Agent
por: Li, Bingxuan, et al.
Publicado: (2026) -
Belief Memory: Agent Memory Under Partial Observability
por: Liao, Junfeng, et al.
Publicado: (2026) -
Improving Clinical Diagnosis with Counterfactual Multi-Agent Reasoning
por: You, Zhiwen, et al.
Publicado: (2026) -
ReLay: Personalized LLM-Generated Plain-Language Summaries for Better Understanding, but at What Cost?
por: Chan, Joey, et al.
Publicado: (2026) -
RJUA-MedDQA: A Multimodal Benchmark for Medical Document Question Answering and Clinical Reasoning
por: Jin, Congyun, et al.
Publicado: (2024)