Ciberseguretat

apex-flash-1: un caçador de vulnerabilitats amb llicència MIT

Cantina Security va publicar el 4 d'octubre de 2026 un model de 321.000 milions de paràmetres, afinat a partir de GLM-5.3-Flash amb un sol objectiu: trobar vulnerabilitats de programari. Resol 40 de les 60 tasques de la prova que van mesurar els seus propis autors —per damunt del model del qual surt i per sota de Claude Opus 5—, i els pesos són a Hugging Face amb llicència MIT, és a dir, sense demanar permís a ningú.

Rep el resum diari d'IA

Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

Freqüència:

Vinyeta: un gos marró i blanc, assegut a terra en una habitació buida, estira el coll i recolza el morro contra la paret esquerdada, mirant de cua d'ull. Duu el collar posat, però la corretja és estirada a terra al seu davant, amb el mosquetó obert de bat a bat i sense enganxar enlloc.
📷 Imatge generada amb IA

En resum

  • Cantina Security i Yeta Labs van publicar el 4 d'octubre de 2026 apex-flash-1, un model de 321.000 milions de paràmetres entrenat per buscar errors de seguretat.
  • Resol 40 de les 60 tasques d'una prova construïda sobre 20 casos de vulnerabilitat reservats. La mesura la publica qui publica el model, no un avaluador independent.
  • En aquesta mateixa prova, Claude Opus 5 High resol 43 de 60 i GLM-5.3-Flash, el model del qual parteix apex-flash-1, 36 de 60.
  • Es reparteix amb llicència MIT i els pesos són a Hugging Face. La mateixa fitxa avisa que està pensat per treballar a les ordres d'un agent superior, no pel seu compte.

Un model per buscar forats, i sense permís de ningú

apex-flash-1 es va publicar el 4 d'octubre de 2026 a Hugging Face, el repositori on es publiquen models d'IA, i el signen Cantina Security —plataforma i empresa de seguretat de programari que opera una xarxa d'investigadors de vulnerabilitats— al costat de Yeta Labs, de la qual la fitxa del model només dona el compte públic. De Cantina, aquesta mateixa fitxa no diu res més: ni seu, ni propietari, ni mida.

El que fa que la publicació sigui notícia no és la mida del model —321.000 milions de paràmetres— ni el banc de proves que l'acompanya, sinó per a què està entrenat. No és un assistent de programació al qual es pugui demanar, de passada, que miri si un codi té errors: és un model afinat amb l'objectiu explícit de trobar vulnerabilitats en programari aliè.

I es reparteix amb la llicència que menys pregunta. No hi ha formulari, ni revisió d'ús, ni compromís d'explicar a què es dedica el model un cop descarregat. L'únic fre que queda és el cost de posar-lo a funcionar.

40 de 60, i la nota la posa el mateix autor

Tasques resoltes de 60, en casos de vulnerabilitat reservats
Claude Opus 5 High: 43tasques de 60 Claude Opus 5 High 43tasques de 60 apex-flash-1: 40tasques de 60 apex-flash-1 40tasques de 60 GLM-5.3-Flash (base): 36tasques de 60 GLM-5.3-Flash (base) 36tasques de 60
Veure les dades en una taula
Claude Opus 5 Highapex-flash-1GLM-5.3-Flash (base)
Tasques resoltes 43tasques de 6040tasques de 6036tasques de 60
Mesura publicada per Cantina Security en la targeta del seu propi model: no és una avaluació independent. 60 tasques preses de 20 casos de vulnerabilitat reservats, amb pass@1.

La prova és una de sola i la passen tres models. Són 60 tasques preses de 20 casos de vulnerabilitat reservats, i apex-flash-1 en resol 40, un 66,7 % de pass@1: millora el resultat del model del qual parteix i es queda tres tasques per darrere de Claude Opus 5 High, que és el que més en resol dels tres. No el supera.

Qui ha fet la mesura és qui publica el model. Les tres xifres surten de la fitxa d'apex-flash-1, signada per Cantina Security: no són el resultat d'una avaluació independent. Això no les converteix en falses, però les deixa on són, que és en el terreny del que una empresa explica del seu propi producte.

La fitxa sí que detalla el muntatge, i el detall ajuda a calibrar: els objectius corrien en entorns aïllats, uns verificadors comprovaven l'estat final de l'objectiu i es van provar tres modes de vista —whitebox guiat i whitebox enfocat, amb el codi al davant, i blackbox enfocat, a cegues des de fora—.

GLM-5.3-Flash, aprenentatge per reforç i l'arnès de Codex

La fitxa d'apex-flash-1
Dada Valor
Model base GLM-5.3-Flash, de Z.ai
Paràmetres 321.000 milions
Llicència MIT
Mètode Post-entrenament amb aprenentatge per reforç
Resultat 40 de 60 tasques (66,7 % de pass@1)
Memòria de GPU en BF16 Uns 640 GB
Es pot servir amb vLLM, SGLang, Transformers i Docker Model Runner
On són els pesos Hugging Face, cantina-security/apex-flash-1
Dades de la targeta del model publicada per Cantina Security el 4 d'octubre de 2026.

El punt de partida és GLM-5.3-Flash, de Z.ai, laboratori xinès d'intel·ligència artificial amb seu a Pequín i la casa dels models GLM: va néixer el 2019 com a transferència de tecnologia de la Universitat Tsinghua i cotitza a la Borsa de Hong Kong des del 8 de gener de 2026; entre els seus accionistes es citen Meituan, Tencent, Ant Group i Xiaomi.

Sobre aquest model, Cantina va fer un post-entrenament amb aprenentatge per reforç en entorns de programari i de protocols semblants als de producció, i ho va fer amb l'arnès d'agent de Codex, d'OpenAI. El matís importa: el model no s'ha entrenat per descriure vulnerabilitats en un text, sinó per buscar-les amb les eines amb què després haurà de treballar.

La resta és logística, i és la part que decideix qui el pot fer servir de debò. Els pesos es publiquen en BF16 i F32, i servir-los en BF16 demana uns 640 GB de memòria de GPU: la llicència no hi posa cap filtre, però el maquinari sí.

La mateixa fitxa posa dos límits

El primer és d'autonomia. La fitxa no ven un investigador que treballi sol: diu que el model està pensat com un treballador especialitzat a les ordres d'un agent superior. Algú, o alguna cosa, l'ha de dirigir i decidir on mira; el 66,7 % es va aconseguir així, no deixant-lo anar contra internet.

El segon és d'abast. L'avaluació cobreix tasques de seguretat basades en text, i la fitxa reconeix que no s'ha mesurat què fa el model amb imatge ni amb vídeo. És un avís dels que convé llegir a l'inrevés: el que està mesurat és exactament el que està mesurat.

El context és el que converteix això en alguna cosa més que una fitxa tècnica. El 30 de setembre de 2026 es va documentar que les salvaguardes de GLM-5.3 fallaven. Quatre dies després, una variant d'aquest mateix model apareix afinada per buscar errors de seguretat i publicada amb la llicència més permissiva que hi ha.

Conclusió

La notícia no és que apex-flash-1 guanyi a ningú, perquè no guanya: en la prova dels seus propis autors es queda tres tasques de seixanta per darrere de Claude Opus 5 High. La notícia és la suma de les dues coses —quedar-se a prop i repartir-se amb llicència MIT—, i que d'aquestes dues l'única que no depèn de la paraula de ningú és la llicència.

Fonts primàries

Comentaris

Sigues respectuós. Els comentaris es moderen.

    Rep el resum diari d'IA

    Cada matí, l'essencial de la intel·ligència artificial al teu correu, sense fum. Al dia amb la IA.

    Freqüència:

    ← Torna al blog