Produzione farmaceutica

Il collo di bottiglia dei dati: limiti attuali dell'IA nella sintesi di piccole molecole

I modelli di scoperta di farmaci basati su IA sono limitati dai dati, non dagli algoritmi: bias di pubblicazione, spazio chimico ristretto, scarsa annotazione.

Mrudula Kulkarni
Di Mrudula Kulkarni
Caporedattore - Pharma Now
5 ago 202612 min di lettura
Il collo di bottiglia dei dati: limiti attuali dell'IA nella sintesi di piccole molecole

Immagina un mondo in cui un modello computazionale propone in pochi secondi una valida sintesi di piccole molecole , comprime anni di lavoro di laboratorio in un pomeriggio e mette in luce spazi chimici nuovi che nessun team umano potrebbe esplorare da solo.

Quel mondo è vicino. Ma non è ancora qui — e la ragione non è l’algoritmo. È nei dati.

In tutta l’industria farmaceutica, gli strumenti basati su AI per la previsione della retrosintesi , la previsione della resa della reazione , e l’ottimizzazione delle proprietà molecolari sono passati da curiosità accademica a priorità dei consiglieri di amministrazione. Eppure, nonostante partnership che attirano titoli e investimenti da miliardi di dollari, la comunità riconosce sempre più una dura verità: i modelli sono buoni quanto le reazioni che li hanno addestrati.

Questo articolo esamina — con rigore scientifico e franchezza — dove si trovano le lacune nei dati, cosa ci dicono le migliori ricerche e cosa devono fare i leader farmaceutici per affrontare il collo di bottiglia.


L’illusione della scala: perché i "Big Data" in chimica sono ingannevolmente piccoli

Cosa mostrano realmente i numeri

Reaxys e SciFinder, i due database di reazioni chimiche dominanti, contengono insieme circa 15–17 milioni di reazioni accumulate nel corso di oltre un secolo di letteratura pubblicata. Questo sembra molto. Per gli standard del deep learning, è modesto.

Per avere un confronto, GPT-3 è stato addestrato su approssimativamente 45 terabyte di testo. L’interezza di Reaxys in formato reazione strutturato occupa una frazione di quel volume — e, cosa critica, è molto meno uniforme nella qualità.



Database


Reazioni circa


Fonte primaria


Bias noto


Reaxys

~14 milioni

Riviste + brevetti

Bias di pubblicazione verso reazioni riuscite

CSD (Cambridge Structural Database)

~1.2 milioni di strutture cristalline

Riviste

Bias verso composti cristallizzabili

USPTO (reazioni brevettuali)

~3.7 milioni

Brevetti USA

Spazio chimico ristretto e guidato dal commercio

ChEMBL

~2.2 milioni di dati bioassay

Letteratura di chimica medicinale

Focalizzato su SAR, contesto sintetico limitato


Tabella 1. Principali database chimici utilizzati nell'addestramento dei modelli AI e loro limitazioni note.

Un'analisi storica del 2019 in Nature Communications (Schwaller et al.) hanno dimostrato che modelli basati su transformer addestrati su dati USPTO potevano prevedere i prodotti delle reazioni con circa il 90% di accuratezza top-1. Ma quegli stessi modelli fallivano sostanzialmente quando testati su reazioni provenienti da classi chimiche poco rappresentate — esattamente quegli scheletri novel che i chimici medicinali hanno più bisogno di esplorare.


I tre problemi di base dei dati

1. Il problema del bias di pubblicazione: soltanto i successi vengono pubblicati

La scienza pubblica ciò che funziona. Una reazione che è fallita 47 volte prima di riuscire al tentativo 48 è tipicamente riportata in letteratura come una trasformazione pulita e ad alto rendimento.

Dati negativi sulle reazioni — condizioni fallite, rese crollate, prodotti secondari inattesi — sono sistematicamente esclusi dalla letteratura pubblicata. Eppure queste informazioni sono proprio ciò di cui i modelli di pianificazione della sintesi (AI synthesis planning) hanno bisogno per apprendere i confini decisionali.

Uno studio del 2021 su Science (Coley et al., MIT) ha rilevato che i modelli addestrati esclusivamente su reazioni "di successo" sovrastimavano la fattibilità di reazioni che coinvolgono substrati stericamente ingombrati del 30–40%.


2. Il problema della rappresentatività: lo spazio chimico è scarsamente campionato

L’universo chimico delle molecole drug-like è stimato in 10^60 composti (Bohacek et al., Med. Res. Rev., 1996). I database attuali coprono forse 10^8 composti noti — una frazione infinitesima.

Più criticamente, ciò che è stato sintetizzato riflette priorità storiche: la chimica medicinale del XX secolo favorì fortemente un insieme ristretto di reazioni (accoppiamento ammidico, amminazione riduttiva, accoppiamento di Suzuki, amminazione Buchwald-Hartwig) che insieme rappresentano una quota sproporzionata della letteratura sulla sintesi di farmaci.

Un’analisi del 2022 su Journal of Medicinal Chemistry (Brown & Boström) ha trovato che soltanto 10 tipi di reazione rappresentano circa il 67% dei passaggi di formazione di legami nelle sintesi di farmaci pubblicate. I modelli AI addestrati su questo corpus sono, di conseguenza, orientati a raccomandare quelle stesse trasformazioni — anche quando percorsi più creativi produrrebbero migliori proprietà molecolari.



Tipo di reazione


% Frequenza nella letteratura di sintesi di farmaci


Formazione del legame ammidico

22.4%

N-alchilazione

8.9%

Amminazione Buchwald-Hartwig

7.6%

Accoppiamento Suzuki-Miyaura

7.1%

Aminazione riduttiva

6.3%

Tutti gli altri tipi di reazione

47.7%


Tabella 2. Frequenza dei tipi di reazione nella letteratura di chimica medicinale (adattata da Brown & Boström, J. Med. Chem., 2022).

Questo crea un circolo vizioso: l'AI raccomanda reazioni familiari, i chimici le eseguono, la letteratura le registra e l'AI si allena su di esse.


3. Il problema della qualità delle annotazioni: input scadente, output scadente

Anche quando i dati sulle reazioni esistono, la loro leggibilità per macchina è spesso scarsa. Uno studio di benchmark del 2020 in ACS Central Science (Schwaller et al.) ha rilevato che oltre 20% delle reazioni estratte dalle banche dati di brevetti conteneva errori nel mappamento degli atomi — il che significa che l'AI non poteva apprendere correttamente quali atomi dei reagenti diventassero quali atomi nei prodotti.

Nomenclatura dei solventi incoerente, stechiometria mancante, assenza di dati sulla temperatura e descrizioni dei reagenti non standardizzate aggravano il problema. Una reazione condotta a "room temperature" in un laboratorio della Florida e a "room temperature" in una struttura dell'Europa settentrionale può comportare una differenza di 10–15°C — una differenza che può essere significativa per trasformazioni sensibili.


Retrosintesi AI: dove il collo di bottiglia fa più male

Retrosintesi guidata dall'AI strumenti — inclusi IBM RXN for Chemistry, REINVENT di AstraZeneca e la piattaforma di Recursion — hanno dimostrato utilità reale per lo spazio chimico ben precedented. La sfida emerge alla frontiera.

Uno studio di benchmark del 2023 in Nature Machine Intelligence (Tu & Coley) ha confrontato cinque principali piattaforme di retrosintesi AI con chimici esperti su un set di prova diversificato di 100 molecole target. Risultati chiave:

  1. Per molecole con alta somiglianza strutturale rispetto ai dati di addestramento (coefficiente di Tanimoto > 0.6): l'AI ha eguagliato i chimici esperti nella qualità delle vie di sintesi nel 71% dei casi.
  2. Per scaffold nuovi (Tanimoto < 0.3): le prestazioni dell'AI sono diminuite al 34% di corrispondenza della qualità delle vie.
  3. I chimici esperti hanno mantenuto approssimativamente il 68% di qualità per scaffold nuovi — dimostrando che il divario nei dati penalizza in modo sproporzionato l'AI rispetto all'esperienza umana per obiettivi nuovi.

L'implicazione per la scoperta di farmaci è diretta: l'AI nella sintesi è più utile quando è meno necessaria (per lo spazio chimico noto) e meno utile quando è più necessaria (per obiettivi nuovi e first-in-class).


Piattaforme come Schrödinger e Recursion operano già al limite di questo stesso problema di dati in oncologia.

→ Leggi: Le principali piattaforme di chimica AI che trasformano l'oncologia delle piccole molecole nel 2026


Il problema dei dati di saggio: collegare struttura e attività

Oltre alla previsione della sintesi, la progettazione di farmaci guidata dall'AI dipende da dati di struttura-attività (SAR) di alta qualità. Qui il collo di bottiglia dei dati assume una forma diversa ma altrettanto seria.

Le campagne di screening ad alto rendimento generano milioni di punti dati — ma sovente testano composti in saggi biochimici che potrebbero non riflettere la biologia cellulare o in vivo. Uno studio del 2022 in PLOS Computational Biology ha stimato che meno del 15% dei valori di IC50 pubblicati è riproducibile in laboratori indipendenti, a causa della variabilità dei saggi, del drift delle linee cellulari e della gestione incoerente dei composti.


Generative AI e il rischio di allucinazioni

AI generativa nel settore farmaceutico introduce un problema di dati distinto: i modelli possono proporre molecole sintetizzabili con difficoltà, pur apparendo chimicamente ragionevoli sulla carta.

I modelli linguistici di grandi dimensioni e le reti neurali a grafi addestrate su stringhe SMILES possono generare nuove strutture molecolari — ma senza vincoli rigidi derivati da dati sulla fattibilità sintetica, spesso propongono percorsi che violano la logica chimica di base o richiedono reagenti che non esistono commercialmente.

Questo non è un fallimento dell'algoritmo — è un fallimento dei dati di addestramento nel codificare sufficientemente i vincoli sintetici.


Cosa stanno facendo le migliori organizzazioni: soluzioni emergenti

Apprendimento federato e condivisione di dati pre-competitiva

Il Pistoia Alliance e il consorzio MELLODDY (un consorzio di 10 aziende che include Novartis, Janssen e Bayer) hanno fatto da pioniere nell'apprendimento automatico federato in chimica che permette ai modelli di addestrarsi su dataset proprietari senza esporre i dati grezzi. Un articolo del 2021 su Nature Intelligenza Macchina ha riportato che i modelli federati hanno superato i modelli aziendali singoli nel 57% dei compiti di predizione.


Sperimentazione ad alta produttività (HTE) come generatrice di dati

Pfizer, Merck e AstraZeneca hanno tutte pubblicato sull'uso di piattaforme di sperimentazione ad alta produttività per generare sistematicamente dati sulle condizioni di reazione — incluse le condizioni fallite — su larga scala. Questo crea dataset curati e internamente coerenti che evitano il bias di pubblicazione della letteratura.


Predizione delle condizioni di reazione e quantificazione dell'incertezza

Gruppi del MIT (laboratorio Coley) e dell'ETH Zurich (gruppo Reymond) stanno sviluppando modelli che non solo predicono le vie di sintesi ma quantificano anche l'incertezza — segnalando quando un passaggio proposto è molto al di fuori della distribuzione di addestramento. Questa capacità di "sapere ciò che non si sa" è sempre più vista come essenziale per un uso responsabile degli strumenti di pianificazione della sintesi basata su AI.


Una migliore infrastruttura dei dati è la soluzione.

Se ciò influisca effettivamente sul valore dell'investimento (ROI) è la domanda più difficile e ancora senza risposta.

→ Leggi: Quantificare il ROI: le piattaforme di chimica AI riducono davvero i costi di R&D farmaceutico?


Un framework per la qualità dei dati per i leader farmaceutici


Dimensione dei dati


Stato attuale


Stato target


Azione chiave


Volume

Moderato (millioni di reazioni)

Alto

Programmi HTE, partnership di dati

Copertura dei dati negativi

Molto bassa (<5% delle reazioni)

Moderata (>20%)

Integrazione ELN, condivisione pre-competitiva

Coerenza delle annotazioni

Bassa-moderata

Alta

Ontologie standardizzate, curazione automatizzata

Diversità dello spazio chimico

Stretto (con bias verso tipi di reazione)

Ampio

Active learning, librerie diversificate per scaffold

Riproducibilità

Bassa (~15–30%)

Alta (>80%)

Standardizzazione dei saggi, validazione inter-laboratorio


Tabella 3. Dimensioni del framework sulla qualità dei dati per la prontezza all'AI nella R&S di piccole molecole.


La strada avanti: colmare il divario

Il collo di bottiglia nei dati in AI per la sintesi di piccole molecole è un problema risolvibile — ma non sarà risolto da una singola azienda, algoritmo o iniziativa di database. Richiede uno sforzo coordinato tra mondo accademico, industria e organismi regolatori per stabilire standard per la raccolta dei dati, incentivare la condivisione di dati negativi e distribuire sperimentazione ad alto rendimento su scala significativa.

Le organizzazioni che investiranno ora nell'infrastruttura dei dati — standardizzando gli ELN, generando dataset HTE e partecipando a consorzi pre-competitivi — deterranno un vantaggio competitivo durevole man mano che AI nella R&S farmaceutica si evolverà. Chi aspetterà che i modelli migliorino senza affrontare i dati sottostanti si ritroverà ad addestrare algoritmi sofisticati sullo stesso substrato impoverito.

Il modello è pronto per imparare. La domanda è se siamo pronti a insegnargli correttamente.


Domande frequenti

D1. L'AI può attualmente sostituire i chimici medicinali nella pianificazione della sintesi?

No. Gli attuali strumenti di pianificazione della sintesi basati su AI supportano i chimici per reazioni ben note ma rendono sistematicamente meno degli esperti umani su spazi chimici nuovi. Il collo di bottiglia dei dati è la ragione principale. L'AI è meglio considerarla un potente co-pilota, non un navigatore autonomo.


D2. La mancanza di dati su reazioni negative è il singolo limite più grande?

È tra i più impattanti, ma non l'unico. Copertura ristretta dello spazio chimico, incoerenze nelle annotazioni e il disallineamento tra dati di saggi in vitro e biologia in vivo sono sfide altrettanto significative per l'AI nella scoperta di farmaci.


D3. Come affrontano la scarsità di dati gli approcci di federated learning?

Il federated learning permette a più organizzazioni di addestrare collaborativamente modelli di machine learning in chimica senza condividere dati proprietari grezzi. Il consorzio MELLODDY ha dimostrato miglioramenti misurabili nelle prestazioni dei modelli usando questo approccio, sebbene permangano significative barriere di governance e tecniche.


D4. Quale ruolo gioca la sperimentazione ad alto rendimento nel risolvere il problema dei dati?

Le piattaforme HTE possono generare migliaia di punti dati a settimana in condizioni controllate e coerenti — incluse condizioni variate sistematicamente che falliscono. Ciò affronta direttamente sia il problema del volume sia il gap dei dati negativi, rendendola uno degli investimenti a più alto ROI che un'organizzazione di R&S farmaceutica possa fare a supporto della progettazione di farmaci guidata dall'AI.


D5. Come dovrebbero i leader farmaceutici dare priorità agli investimenti nei dati per la prontezza all'AI?

Prioritizzare in questo ordine: (1) standardizzazione dei dati ELN e acquisizione macchina-lettibile dei dati sperimentali interni, (2) programmi HTE per la generazione sistematica di dati sulle condizioni di reazione, (3) consorzi pre-competitivi per la condivisione dei dati in aree di interesse reciproco non competitivo, (4) investimento in architetture di IA che quantificano l'incertezza e comunicano la confidenza del modello.

Mrudula Kulkarni
Written by
Mrudula Kulkarni
Caporedattore - Pharma Now

Reporting on the science, business and regulation shaping the pharmaceutical industry.

Discussion

Caricamento della discussione…

Altro in Produzione farmaceutica

Tutti gli articoli →