04:00
2026-08-28
arxiv.org
artificial-intelligence
Training-Time Explainability for Multilingual Hate Speech Detection: Aligning Model Reasoning with Human Rationales
Researchers proposed a training-time explainability framework that aligns model reasoning with human-annotated rationales, improving both classification performance and interpretability for multilingu…