{"slug": "weightwatch-v0-1-escanea-backdoors-en-modelos-open-weight-antes-de-cargarlos", "title": "weightwatch v0.1: escanea backdoors en modelos open-weight antes de cargarlos", "summary": "A developer released weightwatch, an open-source scanner that detects backdoors in open-weight large language models before they are loaded. The tool uses an output-to-input loop and canary samples to identify hidden triggers without requiring training data or a clean reference model. The project addresses a gap where research on model backdoors is abundant but tooling is scarce.", "body_md": "Cualquiera puede subir un LLM fine-tuneado a HuggingFace y afirmar que es seguro. Un modelo con *backdoor* (puerta trasera) se comporta con normalidad en uso corriente y solo se desvía cuando un *trigger* oculto se activa. Si no tienes los datos de entrenamiento ni una referencia limpia, **no puedes detectarlo**.\n\nEso es exactamente el problema que resuelve [ weightwatch](https://github.com/amurlaniakea/weightwatch): un escáner\n\n`CLEAN`\n\n, `SUSPICIOUS`\n\no `BACKDOOR`\n\n.No es intuición: lo medí. Barriendo arXiv (papers 2026, filtro anti-survey) contra `total_count`\n\nde repos GitHub que ya resuelven cada problema:\n\n| Área | Papers arXiv 2026 | Repos GitHub (suma/máx) |\n|---|---|---|\n| Seguridad multi-agente | 68 | 2964 / 2093 |\n| Detección de alucinaciones | 63 | 1291 / 860 |\nBackdoors en modelos open-weight |\n75 |\n66 / 39 |\n| Envenenamiento en RAG | 54 | 522 / 249 |\n\nEl ganador estaba claro: **75 papers cuantifican el problema, pero GitHub tiene 0 repos para \"fine-tuned model backdoor scanner\" y 1 para \"fine-tuning poisoning detector\".** La investigación explota; el tooling apenas existe. weightwatch es la audit-tool de ese sub-nicho (el patrón de [ keybound](https://github.com/amurlaniakea/keybound) /\n\n`topowatch`\n\nweightwatch aplica la técnica *output-to-input loop* (arXiv:[2608.11348](https://arxiv.org/abs/2608.11348)):\n\nAdemás ejecuta un conjunto de **muestras canary** (inputs inofensivos que un backdoor típico dispara) y cuenta cuántos producen la firma esperada. Sin datos de entrenamiento ni modelo base limpio: eso es lo que lo hace útil en la práctica.\n\n```\npip install -e \".[dev]\"\nweightwatch --fixture backdoored --json\n```\n\nSalida real del CLI:\n\n```\n{\n  \"fixture\": \"backdoored\",\n  \"verdict\": \"BACKDOOR\",\n  \"severity\": \"high\",\n  \"techniques\": {\n    \"output_to_input_loop\": {\"converged\": true, \"trigger\": \"<BACKDOOR-ACTIVE>\", \"score\": 1.0},\n    \"canary\": {\"fired\": 5, \"total\": 5, \"score\": 1.0}\n  },\n  \"exit_code\": 1\n}\n```\n\nEl MVP valida la **lógica** del escáner, no la detección sobre modelos reales todavía. Lo documento abierto porque importa para quien lo vaya a usar:\n\n`CleanLM`\n\n/ `BackdooredLM`\n\n), no `transformers`\n\n. El fast suite corre sin red ni claves.`SUSPICIOUS`\n\n; la detección white-box (probes tipo Sleeper Agents, arXiv:Esto está en `KNOWN_ISSUES.md`\n\ndel repo, no lo oculto: la frontera entre \"demo determinista\" y \"escaneo de un checkpoint real\" es real y la marco.\n\nHubo un detalle de pulido: en la auditoría en clone limpio faltaba la cabecera de licencia en un `__init__.py`\n\n; se corrigió antes del release. Lo cuento porque forma parte de por qué confío en el número \"15/15\" — alguien más lo revisó, no me lo tomé a mí mismo.\n\nLos papers lo dicen con datos: arXiv:[2608.11348](https://arxiv.org/abs/2608.11348) advierte que \"un usuario sin los datos de entrenamiento ni una referencia limpia no puede detectar\" un modelo con backdoor; arXiv:[2608.11295](https://arxiv.org/abs/2608.11295) muestra que los backdoors en modelos open-weight son indetectables si el trigger no se activa en testing. weightwatch fuerza esa activación. Es el primer paso de una línea de audit-tools para la cadena de suministro de modelos, junto a keybound y topowatch.\n\n`RESEARCH.md`\n\nen el repoSi cargas modelos de terceros, escanea antes. El MVP es determinista y corre sin GPU.", "url": "https://wpnews.pro/news/weightwatch-v0-1-escanea-backdoors-en-modelos-open-weight-antes-de-cargarlos", "canonical_source": "https://dev.to/magopredator/weightwatch-v01-escanea-backdoors-en-modelos-open-weight-antes-de-cargarlos-29kd", "published_at": "2026-08-27 03:26:15+00:00", "updated_at": "2026-08-27 03:48:48.917411+00:00", "lang": "en", "topics": ["artificial-intelligence", "large-language-models", "ai-safety", "developer-tools"], "entities": ["weightwatch", "HuggingFace", "arXiv", "GitHub", "keybound", "topowatch"], "alternates": {"html": "https://wpnews.pro/news/weightwatch-v0-1-escanea-backdoors-en-modelos-open-weight-antes-de-cargarlos", "markdown": "https://wpnews.pro/news/weightwatch-v0-1-escanea-backdoors-en-modelos-open-weight-antes-de-cargarlos.md", "text": "https://wpnews.pro/news/weightwatch-v0-1-escanea-backdoors-en-modelos-open-weight-antes-de-cargarlos.txt", "jsonld": "https://wpnews.pro/news/weightwatch-v0-1-escanea-backdoors-en-modelos-open-weight-antes-de-cargarlos.jsonld"}}