04:00
2026-07-29
machinebrief.com
artificial-intelligence
Forensic Reproducibility Audit of a Radiology Vision-Language Model Benchmark: From Intended Protocol to Released Artifact
A forensic reproducibility audit of a chest-radiograph vision-language model benchmark found that 297 of 300 planned model-prompt calls yielded nonempty reports, but 60 Claude calls labeled A/B were eโฆ