Aikido
AIKIDO ARENA

Test prestazionali dei modelli di intelligenza artificiale per la sicurezza informatica

Scopri i migliori modelli per la sicurezza informatica. Testiamo modelli all’avanguardia sulle vulnerabilità presenti nel software reale. Aggiornato man mano che vengono rilasciati nuovi modelli.

Ultimo aggiornamento: 21 agosto 2026

Changelog

2 ottobre 2026
  • Aggiunti i risultati dello Xiaomi MiMo 2.6 Pro
    • È emerso che 25 vulnerabilità su 32 hanno superato il test pass@3, allineandosi a GPT-6.1 Sol, Kimi K3 e GLM 5.3, con una sola in meno rispetto a Opus 5
    • Ha raggiunto una precisione dell'88%, superando tutti i modelli Qwen e DeepSeek
    • Un singolo calcolo ha dato una media del 64,6%; combinandone tre si è arrivati al 78,1%
    • Tutto questo per soli 11,79 dollari per ogni CVE individuato
29 settembre 2026
  • Aggiunti i risultati di Grok 4.7
    • La versione 4.7 ha individuato 3 vulnerabilità che la 4.6 non aveva rilevato in nessuna delle tre esecuzioni, mentre la 4.6 ne ha individuate 2 che la 4.7 non aveva rilevato. Il compromesso riguarda la ripetibilità: la 4.7 ha individuato 18 su 32 in tutte e tre le esecuzioni, contro le 21 su 32 della 4.6. Maggiore copertura a scapito di una leggermente minore coerenza.
  • Aggiunti i risultati di GPT-6 Luna e GPT-6 Sol
    • Abbiamo testato GPT-6 Luna e Sol con il nostro benchmark informatico 32-CVE e i risultati sono stati inaspettati! Luna ha individuato il 53,1%. Sol ha raggiunto il 68,8%.
    • Nessuna delle due ha superato le varianti di GPT-5.6 in termini di recall. Tuttavia, entrambe sono risultate MOLTO più economiche in termini di costo per vulnerabilità individuata: Luna da 3,43 $ a 2,01 $/CVE e Sol da 56,88 $ a 34,18 $/CVE.
11 settembre 2026
  • Aggiunti i risultati di GPT-6 Astra e GLM-5.3 Flash.
Un modello solido è solo l'inizio.

La piattaforma Aikido trasforma il ragionamento in risultati di sicurezza di alta qualità per tutta la tua applicazione, sia che si tratti di Code Security Audit che analizza il tuo codice sorgente, sia che si tratti di Aikido Attack che testa la tua app in esecuzione.

Collaboratori

Debarshi
Ricercatore
Philippe Dourassov
Responsabile dei test di penetrazione basati sull'intelligenza artificiale
Rein Daelman
Cacciatore di bug

Proteggiti oggi stesso:
, in modo rapido e gratuito.

Proteggi il tuo codice, il cloud e l'ambiente di esecuzione in un unico sistema centralizzato. Collega un repository per scoprire cosa individuano gli agenti di ragionamento nel tuo codice.

Nessuna carta di credito richiesta | Risultati della scansione in 32 secondi.
Scelto da oltre 150.000 organizzazioni