Can AI hack? Benchmarking frontier models against real-world web vulnerabilities

19 mag 202610:30 - 11:00
Stage 2

Description

Questo è un intervento tecnico focalizzato sulla misurazione delle capacità offensive di sicurezza integrate nei LLM di frontiera. Piuttosto che basarsi su dichiarazioni dei vendor o su valutazioni sintetiche, abbiamo progettato un benchmark rigoroso e riproducibile: 10 modelli testati su sfide reali di Hack The Box che coprono la OWASP Top 10, con 10 esecuzioni indipendenti per ogni challenge e condizioni identiche per tutti. L’intervento approfondisce la metodologia alla base di questo approccio e analizza i risultati, evidenziando dove i modelli hanno successo e dove invece falliscono.
AI Cybersecurity Summit

HACK THE BOX

Hack The Box è la piattaforma leader per la readiness e l’upskilling in cybersecurity basata su AI, usata da oltre 1.500 organizzazioni. Con laboratori gamificati, simulazioni live e una grande...