OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries
OpenAI's HealthBench benchmark shows DR. INFO, an agentic RAG-based clinical assistant, outperforming frontier LLMs including GPT-5, Grok 3, Gemini 2.5 Pro, and Claude 3.7 Sonnet on realistic clinical queries, achieving …