Ciberseguretat
apex-flash-1: un caçador de vulnerabilitats amb llicència MIT
Cantina Security va publicar el 4 d'octubre de 2026 un model de 321.000 milions de paràmetres, afinat a partir de GLM-5.3-Flash amb un sol objectiu: trobar vulnerabilitats de programari. Resol 40 de les 60 tasques de la prova que van mesurar els seus propis autors —per damunt del model del qual surt i per sota de Claude Opus 5—, i els pesos són a Hugging Face amb llicència MIT, és a dir, sense demanar permís a ningú.
Rep el resum diari d'IA
Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.
En subscriure-t'hi acceptes rebre el butlletí d'AI Informator. Pots donar-te de baixa quan vulguis.
En resum
- Cantina Security i Yeta Labs van publicar el 4 d'octubre de 2026 apex-flash-1, un model de 321.000 milions de paràmetres entrenat per buscar errors de seguretat.
- Resol 40 de les 60 tasques d'una prova construïda sobre 20 casos de vulnerabilitat reservats. La mesura la publica qui publica el model, no un avaluador independent.
- En aquesta mateixa prova, Claude Opus 5 High resol 43 de 60 i GLM-5.3-Flash, el model del qual parteix apex-flash-1, 36 de 60.
- Es reparteix amb llicència MIT i els pesos són a Hugging Face. La mateixa fitxa avisa que està pensat per treballar a les ordres d'un agent superior, no pel seu compte.
Un model per buscar forats, i sense permís de ningú
apex-flash-1 es va publicar el 4 d'octubre de 2026 a Hugging Face, el repositori on es publiquen models d'IA, i el signen Cantina Security —plataforma i empresa de seguretat de programari que opera una xarxa d'investigadors de vulnerabilitats— al costat de Yeta Labs, de la qual la fitxa del model només dona el compte públic. De Cantina, aquesta mateixa fitxa no diu res més: ni seu, ni propietari, ni mida.
El que fa que la publicació sigui notícia no és la mida del model —321.000 milions de paràmetres— ni el banc de proves que l'acompanya, sinó per a què està entrenat. No és un assistent de programació al qual es pugui demanar, de passada, que miri si un codi té errors: és un model afinat amb l'objectiu explícit de trobar vulnerabilitats en programari aliè.
I es reparteix amb la llicència que menys pregunta. No hi ha formulari, ni revisió d'ús, ni compromís d'explicar a què es dedica el model un cop descarregat. L'únic fre que queda és el cost de posar-lo a funcionar.
40 de 60, i la nota la posa el mateix autor
Veure les dades en una taula
| Claude Opus 5 High | apex-flash-1 | GLM-5.3-Flash (base) | |
|---|---|---|---|
| Tasques resoltes | 43tasques de 60 | 40tasques de 60 | 36tasques de 60 |
La prova és una de sola i la passen tres models. Són 60 tasques preses de 20 casos de vulnerabilitat reservats, i apex-flash-1 en resol 40, un 66,7 % de pass@1: millora el resultat del model del qual parteix i es queda tres tasques per darrere de Claude Opus 5 High, que és el que més en resol dels tres. No el supera.
Qui ha fet la mesura és qui publica el model. Les tres xifres surten de la fitxa d'apex-flash-1, signada per Cantina Security: no són el resultat d'una avaluació independent. Això no les converteix en falses, però les deixa on són, que és en el terreny del que una empresa explica del seu propi producte.
La fitxa sí que detalla el muntatge, i el detall ajuda a calibrar: els objectius corrien en entorns aïllats, uns verificadors comprovaven l'estat final de l'objectiu i es van provar tres modes de vista —whitebox guiat i whitebox enfocat, amb el codi al davant, i blackbox enfocat, a cegues des de fora—.
GLM-5.3-Flash, aprenentatge per reforç i l'arnès de Codex
| Dada | Valor |
|---|---|
| Model base | GLM-5.3-Flash, de Z.ai |
| Paràmetres | 321.000 milions |
| Llicència | MIT |
| Mètode | Post-entrenament amb aprenentatge per reforç |
| Resultat | 40 de 60 tasques (66,7 % de pass@1) |
| Memòria de GPU en BF16 | Uns 640 GB |
| Es pot servir amb | vLLM, SGLang, Transformers i Docker Model Runner |
| On són els pesos | Hugging Face, cantina-security/apex-flash-1 |
El punt de partida és GLM-5.3-Flash, de Z.ai, laboratori xinès d'intel·ligència artificial amb seu a Pequín i la casa dels models GLM: va néixer el 2019 com a transferència de tecnologia de la Universitat Tsinghua i cotitza a la Borsa de Hong Kong des del 8 de gener de 2026; entre els seus accionistes es citen Meituan, Tencent, Ant Group i Xiaomi.
Sobre aquest model, Cantina va fer un post-entrenament amb aprenentatge per reforç en entorns de programari i de protocols semblants als de producció, i ho va fer amb l'arnès d'agent de Codex, d'OpenAI. El matís importa: el model no s'ha entrenat per descriure vulnerabilitats en un text, sinó per buscar-les amb les eines amb què després haurà de treballar.
La resta és logística, i és la part que decideix qui el pot fer servir de debò. Els pesos es publiquen en BF16 i F32, i servir-los en BF16 demana uns 640 GB de memòria de GPU: la llicència no hi posa cap filtre, però el maquinari sí.
La mateixa fitxa posa dos límits
El primer és d'autonomia. La fitxa no ven un investigador que treballi sol: diu que el model està pensat com un treballador especialitzat a les ordres d'un agent superior. Algú, o alguna cosa, l'ha de dirigir i decidir on mira; el 66,7 % es va aconseguir així, no deixant-lo anar contra internet.
El segon és d'abast. L'avaluació cobreix tasques de seguretat basades en text, i la fitxa reconeix que no s'ha mesurat què fa el model amb imatge ni amb vídeo. És un avís dels que convé llegir a l'inrevés: el que està mesurat és exactament el que està mesurat.
El context és el que converteix això en alguna cosa més que una fitxa tècnica. El 30 de setembre de 2026 es va documentar que les salvaguardes de GLM-5.3 fallaven. Quatre dies després, una variant d'aquest mateix model apareix afinada per buscar errors de seguretat i publicada amb la llicència més permissiva que hi ha.
Conclusió
La notícia no és que apex-flash-1 guanyi a ningú, perquè no guanya: en la prova dels seus propis autors es queda tres tasques de seixanta per darrere de Claude Opus 5 High. La notícia és la suma de les dues coses —quedar-se a prop i repartir-se amb llicència MIT—, i que d'aquestes dues l'única que no depèn de la paraula de ningú és la llicència.
Fonts primàries
- Hugging Face — cantina-security/apex-flash-1 (targeta del model) ↗
- MarkTechPost — Can an Open Model Do Security Research? Cantina's apex-flash-1 Solves 40 of 60 Held-Out Bug Tasks (04-10-2026) ↗
- AI Informator — GLM-5.3: el hacker xinès que tothom es pot baixar ↗
- AI Informator — Anthropic documenta nou mesos d'usos abusius de Claude: espionatge rus, extorsió massiva i fàbriques automatitzades d'exploits ↗
Rep el resum diari d'IA
Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.
En subscriure-t'hi acceptes rebre el butlletí d'AI Informator. Pots donar-te de baixa quan vulguis.
Comentaris