04:00
2026-07-24
arxiv.org
artificial-intelligence
ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?
Researchers introduced ViSTR-Bench, a benchmark to evaluate whether multimodal large language models (MLLMs) can reason from continuous visual cues in dynamic scenes, finding that current models remaiβ¦