Decision model benchmark: Jev, Kev, Liquid d1, and more
Arize benchmarked eight decision models — including TypeSafe's Jev 1.13, Liquid AI's Liquid d1, OpenAI Decisions (gpt-6-luna), Cloudflare's Clef 27B, and Jared Palmer's open Kev 9B — on hallucination …