TextSLIP: Text Self-Supervised CLIP for Medical Report Generation
Researchers propose TextSLIP, a medical vision-language pretraining framework that augments CLIP with intra-modal text contrastive learning to improve fine-grained semantic supervision for radiology report generation. Pr…