04:00
2026-07-13
arxiv.org
computer-vision
Vision Transformers Learn Gestalt-Like Figure-Ground Cues from Natural Images
Vision Transformers (ViTs) robustly encode Gestalt-like figure-ground cues such as surroundedness and convexity from natural images, according to a study evaluating 25 ViTs with supervised and self-su…