07:09
2026-09-19
dev.to
large-language-models
Judging an LLM judge?
A developer built an open-source tool called judgeDjudge to evaluate LLM-as-a-judge systems, testing judges for repeated-run consistency, position bias, sensitivity to verbosity, and accuracy in prefeβ¦