LLMs Fumble at Explaining Probabilities: Consistency Without Calibration
Researchers evaluating nine large language models (LLMs) in a two-stage prediction pipeline found that the models are consistent but miscalibrated when explaining probabilistic outputs, handling likel…