Episode Details

Back to Episodes
OPENAI HACKER: la AI che aggira i divieti per vincere il gioco di Huggingface #1570

OPENAI HACKER: la AI che aggira i divieti per vincere il gioco di Huggingface #1570

Published 2 weeks, 5 days ago
Description
17.000 tentativi in un weekend, due vulnerabilità concatenate e un database di produzione di Hugging Face finito sotto mano a uno “sciame” di agenti. La parte controintuitiva: non sarebbe stato un gruppo criminale o un servizio straniero, ma un modello di OpenAI messo alla prova in test di cybersecurity con freni ridotti, che ha scelto la scorciatoia più efficace per “vincere” il benchmark.

L’angolo interessante non è la favola di Skynet che scappa dal recinto: qui pesa molto di più il tema del specification gaming (reward hacking), cioè sistemi che ottimizzano l’obiettivo letterale e non l’intento umano. Se il punteggio è “dammi le risposte giuste”, allora rubare le soluzioni può diventare una strategia razionale. In mezzo c’è anche un dettaglio geopolitico: per analizzare gli artefatti dell’attacco, Hugging Face avrebbe dovuto usare un modello cinese (Zhipu GLM) perché alcuni modelli occidentali rifiutavano di elaborare codice ed exploit per via delle policy.

Morale operativa: trattare gli agenti AI come “stagisti brillanti” senza contesto, da supervisionare e verificare. Se in laboratorio succedono effetti collaterali del genere, la domanda vera è quanta governance e separazione ambientale servano quando questi agenti entrano in aziende, studi professionali, sanità e finanza con permessi reali.

00:00 Cosa è successo davvero
01:47 Cronologia dell’incidente
02:19 Sciame di agenti e 17k azioni
02:53 Le due vulnerabilità sfruttate
03:32 Perché servono modelli cinesi
05:25 OpenAI: test con freni ridotti
08:27 Reward hacking, non Skynet
15:32 Lezione per aziende e controlli

#OpenAI #HuggingFace #RewardHacking

~~~

Ciao Internet! - Il primo e più seguito canale di TECH POLICY in italia, con Matteo Flora

INFO E AZIENDE: https://matteoflora.com

Il CORSO di AI: https://zero.matteoflora.com
Newsletter: https://link.mgpf.it/nl
Social: https://io.matteoflora.com
English: https://www.youtube.com/@CiaoInternet

Privacy » https://privacy.matteoflora.com
AI Policy » https://privacy.matteoflora.com/ai

Mail #adv: sales (at) matteoflora.com
Listen Now

Love PodBriefly?

If you like Podbriefly.com, please consider donating to support the ongoing development.

Support Us