21:10
2026-09-02
arxiv.org
artificial-intelligence
CordisBench: Can Language Models Reason About Component Lifecycles in Dynamic Agent Harnesses?
Researchers introduced CordisBench, a 1,200-question benchmark testing whether language models can reason about component lifecycles in dynamic agent harnesses, finding that models handle small systemβ¦