Benchmark Success, Clinical Failure: When Reinforcement Learning Optimizes for Benchmarks, Not Patients
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Berger, Armin, Bergau, Manuela, Schneider, Helen, Ahmad, Saad, Lagones, Tom Anglim, Brugnara, Gianluca, Foltyn-Dumitru, Martha, Schlamp, Kai, Vollmuth, Philipp, Sifa, Rafet |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing
par: Berghaus, David, et autres
Publié: (2025)
par: Berghaus, David, et autres
Publié: (2025)
Reasoning LLMs in the Medical Domain: A Literature Survey
par: Berger, Armin, et autres
Publié: (2025)
par: Berger, Armin, et autres
Publié: (2025)
History Rhymes: Macro-Contextual Retrieval for Robust Financial Forecasting
par: Khanna, Sarthak, et autres
Publié: (2025)
par: Khanna, Sarthak, et autres
Publié: (2025)
Quantum Computing from Hopfield Nets
par: Bauckhage, Christian, et autres
Publié: (2025)
par: Bauckhage, Christian, et autres
Publié: (2025)
Generalizing Abstention for Noise-Robust Learning in Medical Image Segmentation
par: Moustafa, Wesam, et autres
Publié: (2026)
par: Moustafa, Wesam, et autres
Publié: (2026)
A Survey on Current Trends and Recent Advances in Text Anonymization
par: Deußer, Tobias, et autres
Publié: (2025)
par: Deußer, Tobias, et autres
Publié: (2025)
Towards Unified Multimodal Financial Forecasting: Integrating Sentiment Embeddings and Market Indicators via Cross-Modal Attention
par: Khanna, Sarthak, et autres
Publié: (2025)
par: Khanna, Sarthak, et autres
Publié: (2025)
[Vision Paper] PRObot: Enhancing Patient-Reported Outcome Measures for Diabetic Retinopathy using Chatbots and Generative AI
par: Pielka, Maren, et autres
Publié: (2024)
par: Pielka, Maren, et autres
Publié: (2024)
From Retinal Pixels to Patients: Evolution of Deep Learning Research in Diabetic Retinopathy Screening
par: Chopra, Muskaan, et autres
Publié: (2025)
par: Chopra, Muskaan, et autres
Publié: (2025)
Knowing When Not to Predict: Self Supervised Learning and Abstention for Safer DR Screening
par: Chopra, Muskaan, et autres
Publié: (2026)
par: Chopra, Muskaan, et autres
Publié: (2026)
SynCED-EnDe 2025: A Synthetic and Curated English - German Dataset for Critical Error Detection in Machine Translation
par: Chopra, Muskaan, et autres
Publié: (2025)
par: Chopra, Muskaan, et autres
Publié: (2025)
Towards Reliable Machine Translation: Scaling LLMs for Critical Error Detection and Safety
par: Chopra, Muskaan, et autres
Publié: (2026)
par: Chopra, Muskaan, et autres
Publié: (2026)
Model-agnostic Body Part Relevance Assessment for Pedestrian Detection
par: Günder, Maurice, et autres
Publié: (2023)
par: Günder, Maurice, et autres
Publié: (2023)
Pointer-Guided Pre-Training: Infusing Large Language Models with Paragraph-Level Contextual Awareness
par: Hillebrand, Lars, et autres
Publié: (2024)
par: Hillebrand, Lars, et autres
Publié: (2024)
Interpretable Topic Extraction and Word Embedding Learning using row-stochastic DEDICOM
par: Hillebrand, Lars, et autres
Publié: (2025)
par: Hillebrand, Lars, et autres
Publié: (2025)
How Small Can You Go? Compact Language Models for On-Device Critical Error Detection in Machine Translation
par: Chopra, Muskaan, et autres
Publié: (2025)
par: Chopra, Muskaan, et autres
Publié: (2025)
Advancing Risk and Quality Assurance: A RAG Chatbot for Improved Regulatory Compliance
par: Hillebrand, Lars, et autres
Publié: (2025)
par: Hillebrand, Lars, et autres
Publié: (2025)
Domain-Adaptation through Synthetic Data: Fine-Tuning Large Language Models for German Law
par: Bashir, Ali Hamza, et autres
Publié: (2026)
par: Bashir, Ali Hamza, et autres
Publié: (2026)
Die Nachhaltigkeit und der Mittelwald
par: Vollmuth, David Willi
Publié: (2021)
par: Vollmuth, David Willi
Publié: (2021)
Informed Deep Abstaining Classifier: Investigating noise-robust training for diagnostic decision support systems
par: Schneider, Helen, et autres
Publié: (2024)
par: Schneider, Helen, et autres
Publié: (2024)
Reformy w polskim szkolnictwie wyższym po 1990 r. w świetle nauki o polityce publicznej
par: Agnieszka Dziedziczak-Foltyn
Publié: (2018)
par: Agnieszka Dziedziczak-Foltyn
Publié: (2018)
Is continuous CoT better suited for multi-lingual reasoning?
par: Bashir, Ali Hamza, et autres
Publié: (2026)
par: Bashir, Ali Hamza, et autres
Publié: (2026)
Exact Generalisation Error Exposes Benchmarks Skew Graph Neural Networks Success (or Failure)
par: Ayday, Nil, et autres
Publié: (2025)
par: Ayday, Nil, et autres
Publié: (2025)
Towards Automated Regulatory Compliance Verification in Financial Auditing with Large Language Models
par: Berger, Armin, et autres
Publié: (2025)
par: Berger, Armin, et autres
Publié: (2025)
Queue-based Eco-Driving at Roundabouts with Reinforcement Learning
par: Schlamp, Anna-Lena, et autres
Publié: (2024)
par: Schlamp, Anna-Lena, et autres
Publié: (2024)
Dataset for: Does Organized Misconduct Shape Network Topology? Part III: Topology of Retracted Article Citation Networks
par: IRMAK, Rafet
Publié: (2026)
par: IRMAK, Rafet
Publié: (2026)
Integración de pruebas y manejo de la restricción del crecimiento fetal
par: Sifa Turan
Publié: (2008)
par: Sifa Turan
Publié: (2008)
Benchmarking Sensor-Fault Robustness in Forecasting
par: Windmann, Alexander, et autres
Publié: (2026)
par: Windmann, Alexander, et autres
Publié: (2026)
Which organisational context factors help women to obtain and retain leadership positions in the 21st century? A systematic review and research agenda for human resource management
par: Lioba A. Gierke, et autres
Publié: (2024)
par: Lioba A. Gierke, et autres
Publié: (2024)
Chapter Deep Learning Training and Benchmarks for Earth Observation Images: Data Sets, Features, and Procedures
par: Schwarz, Gottfried, et autres
Publié: (2021)
par: Schwarz, Gottfried, et autres
Publié: (2021)
SREGym: A Live Benchmark for AI SRE Agents with High-Fidelity Failure Scenarios
par: Clark, Jackson, et autres
Publié: (2026)
par: Clark, Jackson, et autres
Publié: (2026)
When Judgment Becomes Noise: How Design Failures in LLM Judge Benchmarks Silently Undermine Validity
par: Feuer, Benjamin, et autres
Publié: (2025)
par: Feuer, Benjamin, et autres
Publié: (2025)
LLMs Cannot Reliably Identify and Reason About Security Vulnerabilities (Yet?): A Comprehensive Evaluation, Framework, and Benchmarks
par: Ullah, Saad, et autres
Publié: (2023)
par: Ullah, Saad, et autres
Publié: (2023)
Forgetful but Faithful: A Cognitive Memory Architecture and Benchmark for Privacy-Aware Generative Agents
par: Alqithami, Saad
Publié: (2025)
par: Alqithami, Saad
Publié: (2025)
Valoración de la relación entre funciones ejecutivas y conductas agresivas de niños sordos: impacto de la educación especial temprana
par: Rafet Firat Sipal
Publié: (2010)
par: Rafet Firat Sipal
Publié: (2010)
When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation
par: Akhtar, Mubashara, et autres
Publié: (2026)
par: Akhtar, Mubashara, et autres
Publié: (2026)
Benchmarking Failures in Tool-Augmented Language Models
par: Treviño, Eduardo, et autres
Publié: (2025)
par: Treviño, Eduardo, et autres
Publié: (2025)
SugarViT -- Multi-objective Regression of UAV Images with Vision Transformers and Deep Label Distribution Learning Demonstrated on Disease Severity Prediction in Sugar Beet
par: Günder, Maurice, et autres
Publié: (2023)
par: Günder, Maurice, et autres
Publié: (2023)
The KMAT: Benchmarking Knowledge Management.
par: de Jager, Martha
Publié: (1998)
par: de Jager, Martha
Publié: (1998)
IGAff: Benchmarking Adversarial Iterative and Genetic Affine Algorithms on Deep Neural Networks
par: Echim, Sebastian-Vasile, et autres
Publié: (2025)
par: Echim, Sebastian-Vasile, et autres
Publié: (2025)
Documents similaires
-
Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing
par: Berghaus, David, et autres
Publié: (2025) -
Reasoning LLMs in the Medical Domain: A Literature Survey
par: Berger, Armin, et autres
Publié: (2025) -
History Rhymes: Macro-Contextual Retrieval for Robust Financial Forecasting
par: Khanna, Sarthak, et autres
Publié: (2025) -
Quantum Computing from Hopfield Nets
par: Bauckhage, Christian, et autres
Publié: (2025) -
Generalizing Abstention for Noise-Robust Learning in Medical Image Segmentation
par: Moustafa, Wesam, et autres
Publié: (2026)