04:00
2026-09-25
arxiv.org
computer-vision
MoVISA: Multi-Token Reasoning for Video Object Segmentation
Researchers developed MoVISA, a multi-token reasoning method for video object segmentation that replaces the single SEG token used in Multimodal Large Language Model pipelines with multiple tokens suc…