MedFailBench exposes critical safety boundary failures in medical AI through clinician built, reproducible open source evaluation.
open-source benchmark ai-safety evaluation-framework synthetic-data failure-analysis patient-safety clinical-nlp responsible-ai medical-ai healthcare-ai clinical-safety medical-llm llm-evaluation llm-safety source-verification medical-ai-safety clinician-review turkish-medical-ai medfailbench
-
Updated
Jul 28, 2026 - Python