首页 正文

Psychometric characterization of human and artificial intelligence performance on cardiology residency in-service examination items

{{output}}
Large language models (LLMs) are increasingly evaluated using medical examination datasets, yet most studies emphasize overall accuracy rather than the psychometric structure of test items. We evaluated five LLMs on 199 text-only cardiology residency in-servic... ...