{"slug": "sea-clip-tiny-efficient-multilingual-text-vision-embedding-for-southeast-asian", "title": "SEA-CLIP-Tiny: Efficient Multilingual Text-Vision Embedding for Southeast Asian Languages", "summary": "Researchers introduced SEA-CLIP-Tiny, a multilingual text-vision embedding model with fewer than 50M parameters for seven Southeast Asian languages, according to an arXiv paper (2609.30739v1). SEA-CLIP-Tiny reached 12.9%, 31.5%, and 42.2% at R@1, R@5, and R@10 respectively, improving average R@10 by 12.1 points over MobileCLIP2 while using 38.4% fewer parameters and lower measured CPU latency. The model adapts a CLIP-KD-style framework with regional data curation and multilingual teacher guidance.", "body_md": "arXiv:2609.30739v1 Announce Type: new \nAbstract: Multilingual text-vision embedding models are essential for cross-lingual image-text retrieval, but Southeast Asian languages remain poorly supported due to the region's linguistic diversity and limited data and computing resources. In this paper, we introduce SEA-CLIP-Tiny, a compact multilingual text-vision embedding model for Southeast Asia with fewer than 50M parameters. Our model adapts a CLIP-KD-style framework to Southeast Asian multilingual settings through regional data curation and multilingual teacher guidance. Experiments across seven Southeast Asian languages show that SEA-CLIP-Tiny achieves the strongest average retrieval performance among the evaluated student models, reaching 12.9%, 31.5%, and 42.2% at R@1, R@5, and R@10, respectively. Compared with MobileCLIP2, it improves average R@10 by 12.1 points while using 38.4% fewer parameters and lower measured CPU latency. These results highlight the importance of region-aware training for efficient multilingual text-vision models in Southeast Asia.", "url": "https://wpnews.pro/news/sea-clip-tiny-efficient-multilingual-text-vision-embedding-for-southeast-asian", "canonical_source": "https://www.machinebrief.com/news/sea-clip-tiny-efficient-multilingual-text-vision-embedding-f-mgtv", "published_at": "2026-09-28 04:00:00+00:00", "updated_at": "2026-09-28 04:48:07.747807+00:00", "lang": "en", "topics": ["computer-vision", "natural-language-processing", "machine-learning", "ai-research"], "entities": ["SEA-CLIP-Tiny", "MobileCLIP2", "CLIP-KD", "arXiv"], "also_reported_by": [], "alternates": {"html": "https://wpnews.pro/news/sea-clip-tiny-efficient-multilingual-text-vision-embedding-for-southeast-asian", "markdown": "https://wpnews.pro/news/sea-clip-tiny-efficient-multilingual-text-vision-embedding-for-southeast-asian.md", "text": "https://wpnews.pro/news/sea-clip-tiny-efficient-multilingual-text-vision-embedding-for-southeast-asian.txt", "jsonld": "https://wpnews.pro/news/sea-clip-tiny-efficient-multilingual-text-vision-embedding-for-southeast-asian.jsonld"}}