GeneralAI / InformaticsResearchTrainee

Quality Rubric for AI-Generated Patient-Friendly Radiology Reports: Almost-Perfect Interrater Agreement

AJR. American journal of roentgenologyyesterday

A rubric to assess artificial intelligence (AI)-generated patient-friendly radiology reports was developed. Lay & radiologist raters (n=3 each) had near-perfect agreement (α=0.87). Reports scored 1 on any attribute (except verbosity) were deemed unsafe.

  • Safety rule: reports rated 1 on any core attribute (except verbosity) were deemed unsafe for distribution.
  • Additional lay (n=19) and radiologist (n=12) raters had moderate (α=0.51) and substantial (α=0.65) interreader agreement; subjective decisions aligned with rule-based decisions in 91.2% and 95.8% of cases.
  • In wider field testing (80 lay, 480 reports), ChatGPT-5 grading agreed moderately with reference standard (κ=0.44), but AI rule-based safety decisions matched reference-standard decisions in 88.1% of cases.

Automated summary

RadPigeon summaries are original and for information only. They are not clinical advice.