04:00
2026-09-25
arxiv.org
computer-vision
CinematicVQA: Benchmarking Film-Grammar Reasoning in Large Vision-Language Models
Researchers introduced CinematicVQA, a benchmark for film-grammar reasoning in large vision-language models that uses a Cinematic Scene Graph (CSG) to link filming techniques to their perceptual effec…