Google DeepMind marca con SynthIDBio le proteine progettate dall'IA
Mercoledì 30 settembre il team DeepMind di Google ha pubblicato una ricerca su SynthIDBio, una variante della tecnologia di watermarking SynthID. Il sistema orienta la scelta degli amminoacidi compiuta da ProteinMPNN, lo strumento di progettazione proteica, senza compromettere la funzione della proteina che ne risulta.

Il lavoro, riportato da Ars Technica il 30 settembre, risponde a una lacuna segnalata quasi un anno prima. Il software che analizza le sequenze di DNA per cercare proteine potenzialmente pericolose non riconosce quelle progettate dall'IA. Nessuno le ha caratterizzate abbastanza da dire quali siano una minaccia.
La proposta di DeepMind è marcare i progetti stessi. SynthIDBio usa una chiave, simile a una chiave crittografica, e l'identità degli amminoacidi scelti in precedenza per suggerire il successivo. ProteinMPNN verifica poi se quel suggerimento produce ancora una proteina funzionante. Se funziona, il suggerimento resta; altrimenti viene scartato. Secondo Ars Technica, il sistema inserisce gli amminoacidi di watermark solo quando sono compatibili con una proteina funzionante. Poiché l'orientamento è distribuito lungo tutta la sequenza, il marchio non si può rimuovere senza sapere come è stato codificato.
La chimica non perdona. Le proteine sono costruite con appena 20 amminoacidi. Alcuni sono chimicamente simili, altri portano cariche opposte. Molte proteine hanno regioni in cui sono tollerate sostituzioni limitate e regioni in cui anche una lieve deviazione uccide l'attività.
Sono anche piccole. Una proteina di 500 amminoacidi è considerata piuttosto grande, contro milioni di pixel in un'immagine tipica: c'è molto meno materiale grezzo in cui nascondere un segnale. Ars Technica osserva che non era ovvio che l'approccio SynthID potesse trasferirsi. Il team avrebbe potuto trovare troppo poco spazio per un watermark, o scoprire che stipare informazioni a sufficienza produceva proteine inattive.
Perché il momento conta
Gli strumenti biologici tagliano in due direzioni. Gli stessi metodi di progettazione proteica che hanno prodotto enzimi capaci di digerire la plastica o bloccare proteine di veleno potrebbero in linea di principio essere rivolti verso tossine o proteine virali. La lacuna nello screening è il problema pratico. Un watermark sui progetti affidabili dà a chi fa screening qualcosa da cercare e spinge tutto ciò che non è marcato verso un esame più attento.
SynthID stesso precede questo lavoro. Aggiunge marchi sottili al materiale digitale generato dall'IA influenzando la probabilità di certe scelte compiute dal modello, così l'orientamento finisce distribuito in modo sistematico su tutto l'output. Google lo ha già applicato a testo e immagini, dove sopravvive a esportazioni e ridimensionamenti di base. Applicare la stessa idea a una molecola è un ordine di difficoltà diverso.
Lo strumento di progettazione proteica al centro dell'esperimento, ProteinMPNN, è stato sviluppato dal Baker Lab. David Baker ha condiviso il Premio Nobel con il capo di DeepMind, un dettaglio che Ars Technica include nel suo resoconto della discendenza della ricerca.
ProteinMPNN lavora in due fasi. Un altro strumento descrive prima una configurazione di scheletro adatta al progetto. ProteinMPNN percorre poi quello scheletro e posiziona le catene laterali un amminoacido alla volta. Sceglie ciascuno in base alla sua capacità di adattarsi alla forma, interagire con i vicini e soddisfare altri vincoli, come formare tasche catalitiche o legare un'altra proteina. SynthIDBio interviene durante quel percorso.
L'articolo di Ars Technica è il resoconto più dettagliato del meccanismo pubblicato finora. Un pezzo più breve datato 30 settembre, intitolato "SynthID Bio Watermarks Secure AI Proteins", è apparso tra i titoli recenti che circolano insieme all'articolo di Ars, anche se il testo completo non era disponibile nel materiale esaminato qui. Analytics Insight, intanto, ha pubblicato il 29 settembre un profilo dell'amministratore delegato di DeepMind, Demis Hassabis, inquadrando più ampiamente il lavoro dell'azienda sulla scoperta scientifica. Quel pezzo è contesto, non prova sul metodo di watermarking.
Cosa mostra la copertura circostante
Il dossier contiene anche materiale che non ha nulla a che fare con le proteine, e vale la pena separarlo. Fox News ha riferito il 30 settembre che Tadhg O'Keeffe, professore di archeologia medievale all'University College Dublin, ha scoperto che il 70-80 per cento del castello medievale di Roebuck sopravvive sotto l'intonaco vittoriano all'interno di un edificio del campus. L'UCD ha annunciato la scoperta il 18 settembre. O'Keeffe ha detto a Fox News Digital di aver iniziato a indagare dopo aver studiato acquerelli del XVIII secolo dell'artista Gabriel Beranger. È una storia notevole, e non è una storia di biosicurezza.
Altre due fonti nel dossier sono tecniche e non legate alla progettazione proteica. Una pagina di catalogo su vibecodingdiscover.com, datata 30 settembre, elenca strumenti IA open source per agenti, server MCP, skill e pipeline RAG, tra cui un'alternativa locale a ElevenLabs che copre 646 lingue e un runtime sandbox per agenti autonomi. Materialize ha pubblicato il 29 settembre un post sul blog che descrive il suo terzo tentativo di riversare dati su disco, sostituendo lo swap di Linux con un buffer pool gestito da sé. La tesi è che la latenza della DRAM è di circa 100 nanosecondi mentre le letture locali su NVMe sono decine di microsecondi, qualche centinaio di volte più lente, anche se il divario di banda è più vicino a 10 volte.
Questi due sono inclusi qui perché sono tra gli elementi più freschi del dossier, non perché riguardino il lavoro sulle proteine. La domanda rilevante per il paper di DeepMind è più ristretta: se un watermark possa sopravvivere ai vincoli della chimica delle proteine abbastanza da essere utile a chi fa screening.
Il resoconto di Ars Technica non arriva a dire che il sistema sia stato adottato da qualche ente di screening o impiegato fuori dalla ricerca. Il paper descrive una potenziale soluzione, pubblicata di mercoledì, a un rischio sollevato quasi un anno prima e rimasto irrisolto. Quello che accadrà dipende da se i laboratori e i database che controllano le sequenze alla ricerca di minacce adotteranno lo schema di marcatura, e da se le proteine progettate dall'IA non marcate diventeranno, per impostazione predefinita, un segnale che vale la pena indagare.
Per ora l'affermazione è tecnica più che operativa: un watermark può essere incorporato in una proteina progettata senza compromettere ciò che la proteina fa. Tutto il resto resta aperto.
Fonti
4- 01Google figures out how to watermark AI-designed proteinsEN
- 02Professor discovered lost medieval castle hiding inside a Victorian-era buildingEN
- 03Vibe Coding Discover - A Catalog of AI OSS for Agents, MCP, Skills, RAGEN
- 04Materialize, Out-of-Core: Replacing Swap with a Buffer PoolEN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.