weightwatch v0.1: escanea backdoors en modelos open-weight antes de cargarlos A developer released weightwatch, an open-source scanner that detects backdoors in open-weight large language models before they are loaded. The tool uses an output-to-input loop and canary samples to identify hidden triggers without requiring training data or a clean reference model. The project addresses a gap where research on model backdoors is abundant but tooling is scarce. Cualquiera puede subir un LLM fine-tuneado a HuggingFace y afirmar que es seguro. Un modelo con backdoor puerta trasera se comporta con normalidad en uso corriente y solo se desvía cuando un trigger oculto se activa. Si no tienes los datos de entrenamiento ni una referencia limpia, no puedes detectarlo . Eso es exactamente el problema que resuelve weightwatch https://github.com/amurlaniakea/weightwatch : un escáner CLEAN , SUSPICIOUS o BACKDOOR .No es intuición: lo medí. Barriendo arXiv papers 2026, filtro anti-survey contra total count de repos GitHub que ya resuelven cada problema: | Área | Papers arXiv 2026 | Repos GitHub suma/máx | |---|---|---| | Seguridad multi-agente | 68 | 2964 / 2093 | | Detección de alucinaciones | 63 | 1291 / 860 | Backdoors en modelos open-weight | 75 | 66 / 39 | | Envenenamiento en RAG | 54 | 522 / 249 | El ganador estaba claro: 75 papers cuantifican el problema, pero GitHub tiene 0 repos para "fine-tuned model backdoor scanner" y 1 para "fine-tuning poisoning detector". La investigación explota; el tooling apenas existe. weightwatch es la audit-tool de ese sub-nicho el patrón de keybound https://github.com/amurlaniakea/keybound / topowatch weightwatch aplica la técnica output-to-input loop arXiv: 2608.11348 https://arxiv.org/abs/2608.11348 : Además ejecuta un conjunto de muestras canary inputs inofensivos que un backdoor típico dispara y cuenta cuántos producen la firma esperada. Sin datos de entrenamiento ni modelo base limpio: eso es lo que lo hace útil en la práctica. pip install -e ". dev " weightwatch --fixture backdoored --json Salida real del CLI: { "fixture": "backdoored", "verdict": "BACKDOOR", "severity": "high", "techniques": { "output to input loop": {"converged": true, "trigger": "