Fact or Guesswork? Evaluating Large Language Models' Medical Knowledge with Structured One-Hop Judgments
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Jiaxi, Wang, Yiwei, Zhang, Kai, Cai, Yujun, Hooi, Bryan, Peng, Nanyun, Chang, Kai-Wei, Lu, Jin |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
DRS: Deep Question Reformulation With Structured Output
by: Li, Zhecheng, et al.
Published: (2024)
by: Li, Zhecheng, et al.
Published: (2024)
Do "New Snow Tablets" Contain Snow? Large Language Models Over-Rely on Names to Identify Ingredients of Chinese Drugs
by: Li, Sifan, et al.
Published: (2025)
by: Li, Sifan, et al.
Published: (2025)
Con-ReCall: Detecting Pre-training Data in LLMs via Contrastive Decoding
by: Wang, Cheng, et al.
Published: (2024)
by: Wang, Cheng, et al.
Published: (2024)
Structured Outputs Enable General-Purpose LLMs to be Medical Experts
by: Guo, Guangfu, et al.
Published: (2025)
by: Guo, Guangfu, et al.
Published: (2025)
Vulnerability of LLMs to Vertically Aligned Text Manipulations
by: Li, Zhecheng, et al.
Published: (2024)
by: Li, Zhecheng, et al.
Published: (2024)
Think Carefully and Check Again! Meta-Generation Unlocking LLMs for Low-Resource Cross-Lingual Summarization
by: Li, Zhecheng, et al.
Published: (2024)
by: Li, Zhecheng, et al.
Published: (2024)
Enhancing LLM Character-Level Manipulation via Divide and Conquer
by: Xiong, Zhen, et al.
Published: (2025)
by: Xiong, Zhen, et al.
Published: (2025)
DeepEdit: Knowledge Editing as Decoding with Constraints
by: Wang, Yiwei, et al.
Published: (2024)
by: Wang, Yiwei, et al.
Published: (2024)
Control Large Language Models via Divide and Conquer
by: Li, Bingxuan, et al.
Published: (2024)
by: Li, Bingxuan, et al.
Published: (2024)
Enhancing Multi-Hop Fact Verification with Structured Knowledge-Augmented Large Language Models
by: Cao, Han, et al.
Published: (2025)
by: Cao, Han, et al.
Published: (2025)
LLM-A*: Large Language Model Enhanced Incremental Heuristic Search on Path Planning
by: Meng, Silin, et al.
Published: (2024)
by: Meng, Silin, et al.
Published: (2024)
How to Make Large Language Models Generate 100% Valid Molecules?
by: Tao, Wen, et al.
Published: (2025)
by: Tao, Wen, et al.
Published: (2025)
Fact Recall, Heuristics or Pure Guesswork? Precise Interpretations of Language Models for Fact Completion
by: Saynova, Denitsa, et al.
Published: (2024)
by: Saynova, Denitsa, et al.
Published: (2024)
Primacy Effect of ChatGPT
by: Wang, Yiwei, et al.
Published: (2023)
by: Wang, Yiwei, et al.
Published: (2023)
Medical Vision-Language Pre-Training for Brain Abnormalities
by: Monajatipoor, Masoud, et al.
Published: (2024)
by: Monajatipoor, Masoud, et al.
Published: (2024)
Beyond Facts: Benchmarking Distributional Reading Comprehension in Large Language Models
by: Guo, Pei-Fu, et al.
Published: (2026)
by: Guo, Pei-Fu, et al.
Published: (2026)
Self-Routing RAG: Binding Selective Retrieval with Knowledge Verbalization
by: Wu, Di, et al.
Published: (2025)
by: Wu, Di, et al.
Published: (2025)
BRIEF-Pro: Universal Context Compression with Short-to-Long Synthesis for Fast and Accurate Multi-Hop Reasoning
by: Gu, Jia-Chen, et al.
Published: (2025)
by: Gu, Jia-Chen, et al.
Published: (2025)
METAL: A Multi-Agent Framework for Chart Generation with Test-Time Scaling
by: Li, Bingxuan, et al.
Published: (2025)
by: Li, Bingxuan, et al.
Published: (2025)
LongMemEval-V2: Evaluating Long-Term Agent Memory Toward Experienced Colleagues
by: Wu, Di, et al.
Published: (2026)
by: Wu, Di, et al.
Published: (2026)
On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training
by: Wu, Xueqing, et al.
Published: (2026)
by: Wu, Xueqing, et al.
Published: (2026)
Unveiling the Potential of Diffusion Large Language Model in Controllable Generation
by: Xiong, Zhen, et al.
Published: (2025)
by: Xiong, Zhen, et al.
Published: (2025)
Contextual Label Projection for Cross-Lingual Structured Prediction
by: Parekh, Tanmay, et al.
Published: (2023)
by: Parekh, Tanmay, et al.
Published: (2023)
Comparing Bad Apples to Good Oranges: Aligning Large Language Models via Joint Preference Optimization
by: Bansal, Hritik, et al.
Published: (2024)
by: Bansal, Hritik, et al.
Published: (2024)
Facts Fade Fast: Evaluating Memorization of Outdated Medical Knowledge in Large Language Models
by: Vladika, Juraj, et al.
Published: (2025)
by: Vladika, Juraj, et al.
Published: (2025)
Model Editing Harms General Abilities of Large Language Models: Regularization to the Rescue
by: Gu, Jia-Chen, et al.
Published: (2024)
by: Gu, Jia-Chen, et al.
Published: (2024)
A Paragraph-level Multi-task Learning Model for Scientific Fact-Verification
by: Li, Xiangci, et al.
Published: (2020)
by: Li, Xiangci, et al.
Published: (2020)
Re-ReST: Reflection-Reinforced Self-Training for Language Agents
by: Dou, Zi-Yi, et al.
Published: (2024)
by: Dou, Zi-Yi, et al.
Published: (2024)
Scaling Laws for Fact Memorization of Large Language Models
by: Lu, Xingyu, et al.
Published: (2024)
by: Lu, Xingyu, et al.
Published: (2024)
Matryoshka Query Transformer for Large Vision-Language Models
by: Hu, Wenbo, et al.
Published: (2024)
by: Hu, Wenbo, et al.
Published: (2024)
Can Knowledge Graphs Make Large Language Models More Trustworthy? An Empirical Study Over Open-ended Question Answering
by: Sui, Yuan, et al.
Published: (2024)
by: Sui, Yuan, et al.
Published: (2024)
On Prompt-Driven Safeguarding for Large Language Models
by: Zheng, Chujie, et al.
Published: (2024)
by: Zheng, Chujie, et al.
Published: (2024)
QUDSELECT: Selective Decoding for Questions Under Discussion Parsing
by: Suvarna, Ashima, et al.
Published: (2024)
by: Suvarna, Ashima, et al.
Published: (2024)
OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles
by: Deng, Yihe, et al.
Published: (2025)
by: Deng, Yihe, et al.
Published: (2025)
Tricking Retrievers with Influential Tokens: An Efficient Black-Box Corpus Poisoning Attack
by: Wang, Cheng, et al.
Published: (2025)
by: Wang, Cheng, et al.
Published: (2025)
Process or Result? Manipulated Ending Tokens Can Mislead Reasoning LLMs to Ignore the Correct Reasoning Steps
by: Cui, Yu, et al.
Published: (2025)
by: Cui, Yu, et al.
Published: (2025)
Are LLMs Really Not Knowledgeable? Mining the Submerged Knowledge in LLMs' Memory
by: Tao, Xingjian, et al.
Published: (2024)
by: Tao, Xingjian, et al.
Published: (2024)
Conversation for Non-verifiable Learning: Self-Evolving LLMs through Meta-Evaluation
by: Sui, Yuan, et al.
Published: (2026)
by: Sui, Yuan, et al.
Published: (2026)
MIRAGE: Multimodal Immersive Reasoning and Guided Exploration for Red-Team Jailbreak Attacks
by: You, Wenhao, et al.
Published: (2025)
by: You, Wenhao, et al.
Published: (2025)
LiveCLKTBench: Towards Reliable Evaluation of Cross-Lingual Knowledge Transfer in Multilingual LLMs
by: Guo, Pei-Fu, et al.
Published: (2025)
by: Guo, Pei-Fu, et al.
Published: (2025)
Similar Items
-
DRS: Deep Question Reformulation With Structured Output
by: Li, Zhecheng, et al.
Published: (2024) -
Do "New Snow Tablets" Contain Snow? Large Language Models Over-Rely on Names to Identify Ingredients of Chinese Drugs
by: Li, Sifan, et al.
Published: (2025) -
Con-ReCall: Detecting Pre-training Data in LLMs via Contrastive Decoding
by: Wang, Cheng, et al.
Published: (2024) -
Structured Outputs Enable General-Purpose LLMs to be Medical Experts
by: Guo, Guangfu, et al.
Published: (2025) -
Vulnerability of LLMs to Vertically Aligned Text Manipulations
by: Li, Zhecheng, et al.
Published: (2024)