Chest / ThoracicAI / InformaticsResearch
Semantic fluency doesn't guarantee factual accuracy in RadVLM chest X-ray reports
Frontiers in digital health2w ago
A radiology vision-language model (RadVLM) generated easier-to-read chest X-ray impressions, but readability weakly correlated with factual accuracy (association coefficient 0.154; 95% CI 0.124-0.183), so a fluent report could hide incorrect findings.
- Entity‑relation fidelity was low (mean RadGraph F1 0.251), indicating substantially imperfect structural correctness in AI‑generated Findings.
- AI‑generated Impressions were more readable than reference reports (mean Flesch‑Kincaid 11.72 vs. 15.33), but surface fluency did not reliably signal factual correctness.
- The evaluation is limited to a single model on a single public dataset; findings require multi‑model, multi‑dataset replication before generalization.
Automated summary
RadPigeon summaries are original and for information only. They are not clinical advice.