{"slug": "training-time-explainability-for-multilingual-hate-speech-detection-aligning", "title": "Training-Time Explainability for Multilingual Hate Speech Detection: Aligning Model Reasoning with Human Rationales", "summary": "Researchers proposed a training-time explainability framework that aligns model reasoning with human-annotated rationales, improving both classification performance and interpretability for multilingual hate speech detection. Evaluated on HateXplain (English) and BullySent (Hinglish), the approach uses LIME, Integrated Gradients, Grad X Input, and attention, showing that gradient- and attention-based regularization improve F-scores and capture culturally specific cues for detecting implicit anti-Muslim hate.", "body_md": "arXiv:2608.26125v1 Announce Type: new\nAbstract: Online hate against Muslim communities often appears in culturally coded, multilingual forms that evade conventional AI moderation. Such systems, though accurate, remain opaque and risk bias, over-censorship, or under-moderation, particularly when detached from sociocultural context. We propose a \\emph{training-time} explainability framework that aligns model reasoning with human-annotated rationales, improving both classification performance and interpretability. Our approach is evaluated on HateXplain (English) and BullySent (Hinglish), reflecting the prevalence of anti-Muslim hate across both languages. Using LIME, Integrated Gradients, Grad X Input, and attention, we assess accuracy, explanation quality, and cross-method agreement. Results show that gradient- and attention-based regularization improve F-scores, enhance plausibility and faithfulness, and capture culturally specific cues for detecting implicit anti-Muslim hate, offering a path toward multilingual, culturally aware content moderation.", "url": "https://wpnews.pro/news/training-time-explainability-for-multilingual-hate-speech-detection-aligning", "canonical_source": "https://arxiv.org/abs/2608.26125", "published_at": "2026-08-28 04:00:00+00:00", "updated_at": "2026-08-28 04:20:12.009177+00:00", "lang": "en", "topics": ["artificial-intelligence", "machine-learning", "natural-language-processing", "ai-ethics"], "entities": ["HateXplain", "BullySent", "LIME", "Integrated Gradients", "Grad X Input"], "alternates": {"html": "https://wpnews.pro/news/training-time-explainability-for-multilingual-hate-speech-detection-aligning", "markdown": "https://wpnews.pro/news/training-time-explainability-for-multilingual-hate-speech-detection-aligning.md", "text": "https://wpnews.pro/news/training-time-explainability-for-multilingual-hate-speech-detection-aligning.txt", "jsonld": "https://wpnews.pro/news/training-time-explainability-for-multilingual-hate-speech-detection-aligning.jsonld"}}