AMNESIA: A Large Scale Medical Unlearning Benchmark Suite with Disease-Informed Analysis
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Davoudi, Saeedeh, Iranmanesh, Reihaneh, Frieder, Ophir, Goharian, Nazli |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TARAZ: Persian Short-Answer Question Benchmark for Cultural Evaluation of Language Models
par: Iranmanesh, Reihaneh, et autres
Publié: (2026)
par: Iranmanesh, Reihaneh, et autres
Publié: (2026)
Genetic Approach to Mitigate Hallucination in Generative IR
par: Kulkarni, Hrishikesh, et autres
Publié: (2024)
par: Kulkarni, Hrishikesh, et autres
Publié: (2024)
Intercept Cancer: Cancer Pre-Screening with Large Scale Healthcare Foundation Models
par: Sun, Liwen, et autres
Publié: (2025)
par: Sun, Liwen, et autres
Publié: (2025)
Learning to Rank Salient Content for Query-focused Summarization
par: Sotudeh, Sajad, et autres
Publié: (2024)
par: Sotudeh, Sajad, et autres
Publié: (2024)
Benchmarking Hindi LLMs: A New Suite of Datasets and a Comparative Analysis
par: Kamath, Anusha, et autres
Publié: (2025)
par: Kamath, Anusha, et autres
Publié: (2025)
LexBoost: Improving Lexical Document Retrieval with Nearest Neighbors
par: Kulkarni, Hrishikesh, et autres
Publié: (2024)
par: Kulkarni, Hrishikesh, et autres
Publié: (2024)
Generating Text from Uniform Meaning Representation
par: Markle, Emma, et autres
Publié: (2025)
par: Markle, Emma, et autres
Publié: (2025)
A Large-Scale Benchmark for Evaluating Large Language Models on Medical Question Answering in Romanian
par: Rogoz, Ana-Cristina, et autres
Publié: (2025)
par: Rogoz, Ana-Cristina, et autres
Publié: (2025)
ControBench: An Interaction-Aware Benchmark for Controversial Discourse Analysis on Social Networks
par: Thuy, Ta Thanh, et autres
Publié: (2026)
par: Thuy, Ta Thanh, et autres
Publié: (2026)
RWKU: Benchmarking Real-World Knowledge Unlearning for Large Language Models
par: Jin, Zhuoran, et autres
Publié: (2024)
par: Jin, Zhuoran, et autres
Publié: (2024)
Geometry-Aware Decoding with Wasserstein-Regularized Truncation and Mass Penalties for Large Language Models
par: Davoodi, Arash Gholami, et autres
Publié: (2026)
par: Davoodi, Arash Gholami, et autres
Publié: (2026)
LLMs Are Not Intelligent Thinkers: Introducing Mathematical Topic Tree Benchmark for Comprehensive Evaluation of LLMs
par: Davoodi, Arash Gholami, et autres
Publié: (2024)
par: Davoodi, Arash Gholami, et autres
Publié: (2024)
Neural Isomorphic Fields: A Transformer-based Algebraic Numerical Embedding
par: Sadeghi, Hamidreza, et autres
Publié: (2026)
par: Sadeghi, Hamidreza, et autres
Publié: (2026)
A Benchmark Suite of Reddit-Derived Datasets for Mental Health Detection
par: Hasan, Khalid, et autres
Publié: (2026)
par: Hasan, Khalid, et autres
Publié: (2026)
Rethinking Machine Unlearning for Large Language Models
par: Liu, Sijia, et autres
Publié: (2024)
par: Liu, Sijia, et autres
Publié: (2024)
Does Unlearning Truly Unlearn? A Black Box Evaluation of LLM Unlearning Methods
par: Doshi, Jai, et autres
Publié: (2024)
par: Doshi, Jai, et autres
Publié: (2024)
BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation
par: Kim, Eunsu, et autres
Publié: (2025)
par: Kim, Eunsu, et autres
Publié: (2025)
Dissecting Fine-Tuning Unlearning in Large Language Models
par: Hong, Yihuai, et autres
Publié: (2024)
par: Hong, Yihuai, et autres
Publié: (2024)
Align-then-Unlearn: Embedding Alignment for LLM Unlearning
par: Spohn, Philipp, et autres
Publié: (2025)
par: Spohn, Philipp, et autres
Publié: (2025)
Large Language Model Unlearning
par: Yao, Yuanshun, et autres
Publié: (2023)
par: Yao, Yuanshun, et autres
Publié: (2023)
ZeroUnlearn: Few-Shot Knowledge Unlearning in Large Language Models
par: Lin, Yujie, et autres
Publié: (2026)
par: Lin, Yujie, et autres
Publié: (2026)
KFinEval-Pilot: A Comprehensive Benchmark Suite for Korean Financial Language Understanding
par: Hwang, Bokwang, et autres
Publié: (2025)
par: Hwang, Bokwang, et autres
Publié: (2025)
Are Large Language Models Good Temporal Graph Learners?
par: Huang, Shenyang, et autres
Publié: (2025)
par: Huang, Shenyang, et autres
Publié: (2025)
Alternate Preference Optimization for Unlearning Factual Knowledge in Large Language Models
par: Mekala, Anmol, et autres
Publié: (2024)
par: Mekala, Anmol, et autres
Publié: (2024)
Sparse-Autoencoder-Guided Internal Representation Unlearning for Large Language Models
par: Yamashita, Tomoya, et autres
Publié: (2025)
par: Yamashita, Tomoya, et autres
Publié: (2025)
GRIT: Graph-based Recall Improvement for Task-oriented E-commerce Queries
par: Kulkarni, Hrishikesh, et autres
Publié: (2025)
par: Kulkarni, Hrishikesh, et autres
Publié: (2025)
Offset Unlearning for Large Language Models
par: Huang, James Y., et autres
Publié: (2024)
par: Huang, James Y., et autres
Publié: (2024)
A Neuro-inspired Interpretation of Unlearning in Large Language Models through Sample-level Unlearning Difficulty
par: Feng, Xiaohua, et autres
Publié: (2025)
par: Feng, Xiaohua, et autres
Publié: (2025)
EvasionBench: A Large-Scale Benchmark for Detecting Managerial Evasion in Earnings Call Q&A
par: Ma, Shijian, et autres
Publié: (2026)
par: Ma, Shijian, et autres
Publié: (2026)
ECG-Expert-QA: A Benchmark for Evaluating Medical Large Language Models in Heart Disease Diagnosis
par: Wang, Xu, et autres
Publié: (2025)
par: Wang, Xu, et autres
Publié: (2025)
Mechanistic Unlearning: Robust Knowledge Unlearning and Editing via Mechanistic Localization
par: Guo, Phillip, et autres
Publié: (2024)
par: Guo, Phillip, et autres
Publié: (2024)
Large Language Models for Mathematicians
par: Frieder, Simon, et autres
Publié: (2023)
par: Frieder, Simon, et autres
Publié: (2023)
Concept Unlearning in Large Language Models via Self-Constructed Knowledge Triplets
par: Yamashita, Tomoya, et autres
Publié: (2025)
par: Yamashita, Tomoya, et autres
Publié: (2025)
The WMDP Benchmark: Measuring and Reducing Malicious Use With Unlearning
par: Li, Nathaniel, et autres
Publié: (2024)
par: Li, Nathaniel, et autres
Publié: (2024)
Hierarchical Federated Unlearning for Large Language Models
par: Zhong, Yisheng, et autres
Publié: (2025)
par: Zhong, Yisheng, et autres
Publié: (2025)
Soft Prompting for Unlearning in Large Language Models
par: Bhaila, Karuna, et autres
Publié: (2024)
par: Bhaila, Karuna, et autres
Publié: (2024)
Multi-Objective Large Language Model Unlearning
par: Pan, Zibin, et autres
Publié: (2024)
par: Pan, Zibin, et autres
Publié: (2024)
PeruMedQA: Benchmarking Large Language Models (LLMs) on Peruvian Medical Exams -- Dataset Construction and Evaluation
par: Carrillo-Larco, Rodrigo M., et autres
Publié: (2025)
par: Carrillo-Larco, Rodrigo M., et autres
Publié: (2025)
A Closer Look at Machine Unlearning for Large Language Models
par: Yuan, Xiaojian, et autres
Publié: (2024)
par: Yuan, Xiaojian, et autres
Publié: (2024)
FinanceQA: A Benchmark for Evaluating Financial Analysis Capabilities of Large Language Models
par: Mateega, Spencer, et autres
Publié: (2025)
par: Mateega, Spencer, et autres
Publié: (2025)
Documents similaires
-
TARAZ: Persian Short-Answer Question Benchmark for Cultural Evaluation of Language Models
par: Iranmanesh, Reihaneh, et autres
Publié: (2026) -
Genetic Approach to Mitigate Hallucination in Generative IR
par: Kulkarni, Hrishikesh, et autres
Publié: (2024) -
Intercept Cancer: Cancer Pre-Screening with Large Scale Healthcare Foundation Models
par: Sun, Liwen, et autres
Publié: (2025) -
Learning to Rank Salient Content for Query-focused Summarization
par: Sotudeh, Sajad, et autres
Publié: (2024) -
Benchmarking Hindi LLMs: A New Suite of Datasets and a Comparative Analysis
par: Kamath, Anusha, et autres
Publié: (2025)