Il boom dei bug di sicurezza trovati dall'intelligenza artificiale. In FreeBSD, Firefox e non solo Anthropic security researcher Nicholas Carlini demonstrated that advanced language models can autonomously discover and exploit software vulnerabilities without human intervention, producing complex exploit chains linking 5-6 vulnerabilities in browsers like Firefox and systems like FreeBSD. The approach has already uncovered approximately 3,000 validated vulnerabilities through specialized contractors, including a 5-year-old SQL injection in Ghost CMS (50,000 GitHub stars) and cryptographic bugs in OpenSSL and wolfSSL, with models able to generate working exploits from binary patches in 2-10 hours. Il boom dei bug di sicurezza trovati dall'intelligenza artificiale. In FreeBSD, Firefox e non solo Un ricercatore di sicurezza di Anthropic ha dimostrato come i modelli linguistici avanzati siano in grado di trovare e sfruttare vulnerabilità software in modo completamente autonomo , senza intervento umano. Non una singola sequenza di tasti è stata digitata: al modello è stato semplicemente chiesto di trovare exploit. Il Salto di Capacità Fino a poco tempo fa, i modelli linguistici potevano eseguire analisi di base su testi. Oggi sono in grado di produrre catene di exploit complesse che collegano 5-6 vulnerabilità, specialmente su browser web con molteplici livelli di protezione. La differenza è abissale: "Non so quante persone al mondo siano in grado di produrre exploit come questi. È un numero ristretto. Ora chiunque voglia causare danni ma non ha le competenze tecniche può usare questi strumenti." Modelli Pubblici vs Privati I modelli dimostrati erano privati Antropic non li ha rilasciati per timore di abusi . Ma i modelli pubblici, accessibili a chiunque, arrivano con 3-12 mesi di ritardo . Ogni progresso storico indica che ciò che oggi richiede un modello privato, domani sarà possibile su un portatile qualunque. Risultati Concreti L'approccio ha già prodotto risultati significativi: wolfSSL — bypass di qualsiasi certificato tramite attacco man-in-the-middle Ghost CMS 50.000 stelle GitHub — SQL injection presente da 5 anni, risolta in 24 ore OpenSSL — bug crittografici complessi, inclusi problemi in AES-OCB e PKCS Circa 3.000 vulnerabilità scoperte e validate attraverso contractor specializzati Cosa Rende gli LLM Così Efficaci? | Capacità | Descrizione | |---|---| Non si annoiano | Sfruttano race condition ripetendo la stessa funzione 500 volte fino a trovare il tempismo giusto | Vanno in profondità | Analizzano ogni singola occorrenza di un'operazione potenzialmente pericolosa | Vanno in ampiezza | Esaminano interi codebase che un umano non avrebbe mai tempo di leggere | Prototipano difese | Testano misure di hardening su 50 vulnerabilità storiche in parallelo | Il Problema del "N-day" Ancora più preoccupante della scoperta di nuove vulnerabilità zero-day è la capacità di estrarre exploit da patch pubblicate. I modelli ora possono analizzare diff binari e produrre un exploit funzionante in 2-10 ore . "Distribuire una patch senza accompagnarla con una disclosure approfondita non è più sufficiente." Attaccante vs Difensore C'è uno squilibrio strutturale: Attaccante — può tollerare falsi positivi un exploit fallito non è un problema Difensore — deve verificare ogni fix proposto dal modello I modelli mentono ancora, e questo è accettabile per l'attacco ma non per la difesa. Il Futuro è Incerto Nicholas è sorprendentemente onesto: "Non so dove andrà a finire. Potremmo finire in un mondo in cui questi modelli riparano tutti i kernel automaticamente... o potrebbero fermarsi esattamente qui. Forse saranno molto più bravi in attacco che in difesa, o viceversa. Il futuro è più incerto oggi di quanto lo sia mai stato nella storia per capire cosa succederà." L'unica certezza è che la capacità di scoprire vulnerabilità cresce esponenzialmente. I modelli chiusi di oggi saranno i modelli a pesi aperti di domani. E il software legacy, software scritto da sviluppatori ormai scomparsi, rimarrà esposto.