GeneralAI / InformaticsResearch
Claude 4.6 Sonnet Scores >90% Accuracy on Turkish Contrast Queries, but LLMs Fail to Cite Sources
Digital health4d ago
Claude 4.6 Sonnet achieved >90% accuracy answering 30 Turkish patient questions on contrast agents per ACR guidelines. Gemini 3 was more conservative, causing over-triage. All LLMs lacked citations; readability required 10.5–11.6 yrs education. LLMs best as hybrid tools with MD…
- On EQIP-36, all LLMs scored well on Content and Structure but universally failed Identification, lacking author names, update dates, or sources.
- Gemini 3's conservative stance occasionally exaggerated risks, resulting in over-triage.
Automated summary
RadPigeon summaries are original and for information only. They are not clinical advice.