Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models
A new classification-guided large vision-language model (LVLM) framework for visual information extraction (VIE) from documents achieves 86.43% F1-score in zero-shot inference on a real-world bidding …