Can AI hack? Benchmarking frontier models against real-world web vulnerabilities
19 mag 2026 — 10:30 - 11:00Stage 2
Already registered? Log in now to personalize your experience!

Description
Questo è un intervento tecnico focalizzato sulla misurazione delle capacità offensive di sicurezza integrate nei LLM di frontiera. Piuttosto che basarsi su dichiarazioni dei vendor o su valutazioni sintetiche, abbiamo progettato un benchmark rigoroso e riproducibile: 10 modelli testati su sfide reali di Hack The Box che coprono la OWASP Top 10, con 10 esecuzioni indipendenti per ogni challenge e condizioni identiche per tutti. L’intervento approfondisce la metodologia alla base di questo approccio e analizza i risultati, evidenziando dove i modelli hanno successo e dove invece falliscono.



