Pharma-Produktion

Das Daten-Nadelöhr: Aktuelle Grenzen der KI in der Synthese kleiner Moleküle

Modelle zur KI-gestützten Wirkstoffsuche werden durch Daten eingeschränkt, nicht durch Algorithmen, Publikationsbias, engen chemischen Raum und schlechte Annotation.

Mrudula Kulkarni
Von Mrudula Kulkarni
Redaktionsleiter – Pharma Now
5. Aug. 202610 Min. Lesezeit
Das Daten-Nadelöhr: Aktuelle Grenzen der KI in der Synthese kleiner Moleküle

Stellen Sie sich eine Welt vor, in der ein Rechenmodell in Sekunden einen brauchbaren Synthese kleiner Moleküle-Weg vorschlägt, Jahre an Laborarbeit auf einen Nachmittag komprimiert und neue chemische Räume aufdeckt, die kein menschliches Team allein durchqueren könnte.

Diese Welt ist nahe. Aber sie ist noch nicht da – und der Grund ist nicht der Algorithmus. Es sind die Daten.

In der gesamten Pharmaindustrie haben sich KI-gestützte Werkzeuge für Retrosynthese-Vorhersage, Prognose der Reaktionsausbeute, und Optimierung molekularer Eigenschaften vom akademischen Kuriosum zur Vorstandsetage entwickelt. Trotz groß angelegter Partnerschaften und Milliardeninvestitionen erkennt die Community zunehmend eine harte Wahrheit: Die Modelle sind nur so gut wie die Reaktionen, mit denen man sie trainiert hat.

Dieser Artikel untersucht – mit wissenschaftlicher Strenge und Offenheit – wo die Datenlücken liegen, was die beste Forschung aussagt und was Pharma-Leitende tun müssen, um den Engpass zu meistern.


Die Illusion der Größe: Warum "Big Data" in der Chemie trügerisch klein ist

Was die Zahlen tatsächlich zeigen

Reaxys und SciFinder, die beiden dominierenden Reaktionsdatenbanken, umfassen zusammen etwa 15–17 millionen Reaktionen , die sich über mehr als ein Jahrhundert veröffentlichter Literatur angesammelt haben. Das klingt viel. Nach Maßstäben des Deep Learning ist es bescheiden.

Zum Vergleich: GPT-3 wurde auf ungefähr 45 Terabyte Text trainiert. Die gesamte Reaxys-Datenmenge in strukturierter Reaktionsform macht nur einen Bruchteil dieses Volumens aus – und ist, entscheidend, in der Qualität deutlich uneinheitlicher.



Datenbank


Ungef. Reaktionen


Primärquelle


Bekannte Verzerrung


Reaxys

~14 millionen

Journale + Patente

Publikationsverzerrung zugunsten erfolgreicher Reaktionen

CSD (Cambridge Structural Database)

~1.2 million Kristallstrukturen

Fachzeitschriften

Verzerrung zugunsten kristallisierbarer Verbindungen

USPTO (patent reactions)

~3.7 million

US-Patente

Kommerziell getriebener, eng begrenzter chemischer Raum

ChEMBL

~2.2 million Bioassay-Datenpunkte

Literatur der medizinischen Chemie

SAR-fokussiert, begrenzter synthetischer Kontext


Tabelle 1. Wichtige chemische Datenbanken, die beim Training von KI-Modellen verwendet werden, und ihre bekannten Einschränkungen.

Eine wegweisende Analyse aus dem Jahr 2019 in Nature Communications (Schwaller et al.) zeigten, dass auf USPTO-Daten trainierte Transformer-Modelle Reaktionsprodukte mit etwa 90% Top-1-Genauigkeit vorhersagen konnten. Dieselben Modelle versagten jedoch deutlich, wenn sie an Reaktionen aus unterrepräsentierten chemischen Klassen getestet wurden – ausgerechnet die neuartigen Skelettgerüste, die medizinische Chemiker am dringendsten erkunden müssen.


Die drei zentralen Datenprobleme

1. Das Publikations-Bias-Problem: Nur Erfolge schaffen es in den Druck

Die Wissenschaft veröffentlicht, was funktioniert. Eine Reaktion, die 47 Mal fehlschlug, bevor sie beim 48. Versuch gelang, wird in der Fachliteratur typischerweise als saubere, ertragsstarke Transformation berichtet.

Negative Reaktionsdaten — gescheiterte Bedingungen, zusammengebrochene Ausbeuten, unerwartete Nebenprodukte — werden systematisch aus der veröffentlichten Literatur ausgeschlossen. Doch genau diese Informationen benötigen KI-Syntheseplanung-Modelle, um Entscheidungsgrenzen zu lernen.

Eine Studie aus dem Jahr 2021 in Science (Coley et al., MIT) fand heraus, dass Modelle, die ausschließlich auf "erfolgreichen" Reaktionen trainiert wurden, die Durchführbarkeit von Reaktionen mit sterisch gehinderten Substraten um 30–40% überschätzten.


2. Das Repräsentationsproblem: Der chemische Raum ist schlecht abgedeckt

Das chemische Universum der arzneimittelähnlichen Moleküle wird auf etwa 10^60 Verbindungen geschätzt (Bohacek et al., Med. Res. Rev., 1996). Aktuelle Datenbanken decken vielleicht 10^8 bekannte Verbindungen ab — ein verschwindend kleiner Bruchteil.

Noch entscheidender ist, dass das, was synthetisiert wurde, historische Prioritäten widerspiegelt: die Medizinische Chemie des 20. Jahrhunderts bevorzugte stark eine enge Palette von Reaktionen (Amidkupplung, reductive amination, Suzuki-Kupplung, Buchwald-Hartwig-Aminierung), die zusammen einen unverhältnismäßig großen Anteil der Literatur zur Arzneimittel‑Synthese ausmachen.

Eine Analyse aus dem Jahr 2022 im Journal of Medicinal Chemistry (Brown & Boström) ergab, dass nur 10 Reaktionstypen für ungefähr 67% der Bindungsbildungen in veröffentlichten Arzneimittel-Synthesen verantwortlich sind. Auf diesem Korpus trainierte KI-Modelle neigen folglich dazu, dieselben Transformationen zu empfehlen — selbst wenn kreativere Wege bessere molekulare Eigenschaften ergeben würden.



Reaktionstyp


% Häufigkeit in der Literatur zur Arzneimittel‑Synthese


Amidbindung

22.4%

N‑Alkylierung

8.9%

Buchwald‑Hartwig‑Aminierung

7.6%

Suzuki‑Miyaura‑Kupplung

7.1%

Reduktive Aminierung

6.3%

Alle anderen Reaktionstypen

47.7%


Tabelle 2. Häufigkeit von Reaktionstypen in der medizinischen Chemie-Literatur (angepasst nach Brown & Boström, J. Med. Chem., 2022).

Das erzeugt eine Rückkopplungsschleife: Die KI empfiehlt vertraute Reaktionen, Chemiker führen sie aus, die Literatur dokumentiert sie, und die KI lernt daraus.


3. Das Problem der Annotationsqualität: Garbage In, Garbage Out

Selbst wenn Reaktionsdaten vorhanden sind, ist ihre maschinenlesbare Qualität oft schlecht. Eine Benchmark-Studie aus dem Jahr 2020 in ACS Central Science (Schwaller et al.) ergab, dass über 20% der Reaktionen, die aus Patentdatenbanken extrahiert wurden, Fehler in der Atomabbildung enthielten — das heißt, die KI konnte nicht korrekt lernen, welche Atome der Edukte zu welchen Atomen der Produkte wurden.

Inkonsistente Lösungsmittelbenennung, fehlende Stöchiometrie, nicht angegebene Temperaturdaten und nicht standardisierte Reagenzbeschreibungen verschärfen das Problem. Eine Reaktion, die in einem Labor in Florida bei „Raumtemperatur" durchgeführt wird, und eine Reaktion, die in einer nordeuropäischen Einrichtung bei „Raumtemperatur" läuft, können einen Unterschied von 10–15°C aufweisen — ein Unterschied, der für empfindliche Umsetzungen bedeutsam sein kann.


Retrosynthese-KI: Wo der Flaschenhals am stärksten schmerzt

KI-gestützte Retrosynthese-Tools — einschließlich IBM RXN for Chemistry, AstraZeneca's REINVENT und der Plattform von Recursion — haben für gut abgesicherten chemischen Raum echte Nützlichkeit gezeigt. Die Herausforderung tritt an der Grenzeflächen auf.

Eine Benchmark-Studie von 2023 in Nature Machine Intelligence (Tu & Coley) verglich fünf führende Retrosynthese-KI-Plattformen mit Expertenchemikern anhand eines vielfältigen Testsets von 100 Zielmolekülen. Wichtige Erkenntnisse:

  1. Für Moleküle mit hoher struktureller Ähnlichkeit zum Trainingsdatensatz (Tanimoto-Koeffizient > 0,6): erreichte die KI in 71 % der Fälle die gleiche Routengüte wie Expertenchemiker.
  2. Für neuartige Gerüste (Tanimoto < 0,3): sank die KI-Leistung auf 34 % Übereinstimmung der Routengüte.
  3. Expertenchemiker erreichten bei neuartigen Gerüsten etwa 68 % Qualität — was zeigt, dass die Datenlücke die KI im Vergleich zur menschlichen Expertise bei neuartigen Zielen überproportional benachteiligt.

Die Konsequenz für die Wirkstoffforschung ist eindeutig: KI in der Synthese ist am nützlichsten, wenn sie am wenigsten gebraucht wird (bei bekanntem chemischen Raum) und am wenigsten nützlich, wenn sie am dringendsten gebraucht wird (bei neuartigen, First‑in‑Class‑Zielen).


Plattformen wie Schrödinger und Recursion stehen in der Onkologie bereits an der Front dieses konkreten Datenproblems.

→ Lesen: Die wichtigsten KI-Chemieplattformen, die 2026 die Kleinmolekül-Onkologie verändern


Das Problem der Assay‑Daten: Struktur mit Aktivität verbinden

Über die Synthesevorhersage hinaus ist KI‑gestütztes Wirkstoffdesign auf hochwertige Struktur‑Aktivitäts‑Beziehungen (SAR) angewiesen. Hier nimmt der Datenengpass eine andere, aber ebenso ernsthafte Form an.

High‑Throughput‑Screening‑Kampagnen erzeugen Millionen von Datenpunkten — doch sie testen überwiegend Verbindungen in biochemischen Assays, die möglicherweise nicht die zelluläre oder in vivo Biologie widerspiegeln. Eine Studie aus dem Jahr 2022 in PLOS Computational Biology schätzte, dass weniger als 15% der veröffentlichten IC50‑Werte über unabhängige Labors reproduzierbar sind, aufgrund von Assay‑Variabilität, Zelllinien‑Drift und inkonsistenter Handhabung von Verbindungen.


Generative KI und das Halluzinationsrisiko

Generative KI in der Pharma bringt ein eigenes Datenproblem mit sich: Die Modelle können Moleküle vorschlagen, die synthetisch unzugänglich sind, obwohl sie auf dem Papier chemisch plausibel erscheinen.

Große Sprachmodelle und graphbasierte neuronale Netze, die auf SMILES-Strings trainiert wurden, können neuartige Molekülstrukturen erzeugen – aber ohne harte Einschränkungen, die aus Daten zur Synthesepraktikabilität abgeleitet sind, schlagen sie häufig Reaktionswege vor, die grundlegende chemische Logik verletzen oder Reagenzien erfordern, die kommerziell nicht erhältlich sind.

Dies ist kein Versagen des Algorithmus – es ist ein Versagen der Trainingsdaten, die Syntheseeinschränkungen nicht ausreichend zu kodieren.


Was die besten Organisationen tun: Aufkommende Lösungen

Föderiertes Lernen und vorwettbewerblicher Datenaustausch

Die Pistoia Alliance und das MELLODDY-Konsortium (ein Konsortium aus 10 Unternehmen, darunter Novartis, Janssen und Bayer) haben föderierte Machine Learning in der Chemie Ansätze vorangetrieben, die es Modellen erlauben, über proprietäre Datensätze hinweg zu trainieren, ohne Rohdaten offenzulegen. Eine 2021 in Nature Machine Intelligence veröffentlichte Arbeit berichtete, dass föderierte Modelle in 57 % der Vorhersageaufgaben besser abschnitten als Einzelunternehmensmodelle.


High-Throughput-Experimentation (HTE) als Datengeneratoren

Pfizer, Merck und AstraZeneca haben alle über den Einsatz von High-Throughput-Experimentation Plattformen zur systematischen Generierung von Reaktionsbedingungen – einschließlich fehlgeschlagener Bedingungen – in großem Maßstab veröffentlicht. Dies schafft kuratierte, intern konsistente Datensätze, die den Publikationsbias der Fachliteratur umgehen.


Vorhersage von Reaktionsbedingungen und Quantifizierung der Unsicherheit

Gruppen am MIT (Coley-Labor) und an der ETH Zürich (Reymond-Gruppe) entwickeln Modelle, die nicht nur Synthesewege vorhersagen, sondern auch Unsicherheit quantifizieren – und kennzeichnen, wenn ein vorgeschlagener Schritt weit außerhalb der Trainingsverteilung liegt. Diese Fähigkeit, "zu wissen, was man nicht weiß", wird zunehmend als wesentlich für den verantwortungsvollen Einsatz von AI-Syntheseplanung Werkzeugen angesehen.


Bessere Dateninfrastruktur ist die Lösung.

Ob sie den ROI tatsächlich beeinflusst, ist die schwierigere, noch unbeantwortete Frage.

→ Lesen: Den ROI quantifizieren: Reduzieren KI-Chemieplattformen tatsächlich die F&E-Kosten in der Pharmaindustrie?


Ein Datenqualitätsrahmen für Pharma-Führungskräfte


Daten-Dimension


Aktueller Zustand


Zielzustand


Wesentliche Maßnahme


Volumen

Mäßig (Millionen von Reaktionen)

Hoch

HTE-Programme, Datenpartnerschaften

Abdeckung negativer Daten

Sehr niedrig (<5 % der Reaktionen)

Moderat (>20 %)

ELN-Integration, prä-kompetitives Teilen

Annotationenkonsistenz

Niedrig bis moderat

Hoch

Standardisierte Ontologien, automatisierte Kuratierung

Diversität des chemischen Raums

Schmal (reaktionstyp-bias)

Breit

Active Learning, gerüst-diverse Bibliotheken

Reproduzierbarkeit

Niedrig (~15–30%)

Hoch (>80%)

Assay-Standardisierung, Validierung zwischen Laboren


Tabelle 3. Dimensionen des Datenqualitätsrahmens für AI-Bereitschaft in der Forschung und Entwicklung von kleinen Molekülen.


Der Weg vor uns: Die Lücke schließen

Der Datenengpass in AI-Synthese kleiner Moleküle ist ein lösbares Problem – aber es wird nicht von einem einzelnen Unternehmen, Algorithmus oder Datenbankprojekt allein gelöst werden. Es erfordert eine koordinierte Anstrengung von Akademia, Industrie und Aufsichtsbehörden, um Standards für die Datenerfassung zu etablieren, das Teilen negativer Daten zu fördern und HTE auf sinnvollem Umfang einzusetzen.

Die Organisationen, die jetzt in Dateninfrastruktur investieren – ELNs standardisieren, HTE-Datensätze erzeugen und an prä-kompetitiven Konsortien teilnehmen – werden einen nachhaltigen Wettbewerbsvorteil haben, während AI in der pharmazeutischen F&E reift. Wer darauf wartet, dass die Modelle sich verbessern, ohne die zugrunde liegenden Daten zu adressieren, wird feststellen, dass er ausgeklügelte Algorithmen auf dasselbe verarmte Substrat trainiert.

Das Modell ist bereit zu lernen. Die Frage ist, ob wir bereit sind, es richtig zu lehren.


Häufig gestellte Fragen

F1. Kann AI derzeit medizinische Chemiker bei der Syntheseplanung ersetzen?

Nein. Aktuelle AI-Syntheseplanungs-tools unterstützen Chemiker bei gut etablierten Reaktionen, schneiden aber bei neuartigem chemischem Raum deutlich schlechter ab als menschliche Expertinnen und Experten. Der Datenengpass ist der Hauptgrund. AI ist am besten als leistungsfähiger Co-Pilot zu verstehen, nicht als autonomer Navigator.


F2. Ist das Fehlen negativer Reaktionsdaten die einzige größte Einschränkung?

Es gehört zu den einflussreichsten, ist aber nicht die einzige. Schmale Abdeckung des chemischen Raums, Inkonsistenzen in der Annotation und die Diskrepanz zwischen in vitro-Assaydaten und in vivo-Biologie sind ebenso bedeutende Herausforderungen für AI in der Wirkstoffforschung.


F3. Wie adressieren föderierte Lernansätze die Datenknappheit?

Föderiertes Lernen ermöglicht es mehreren Organisationen, gemeinsam Machine Learning in der Chemie Modelle zu trainieren, ohne rohe proprietäre Daten zu teilen. Das MELLODDY-Konsortium zeigte messbare Verbesserungen der Modellleistung mit diesem Ansatz, obwohl bedeutende Governance- und technische Hürden bestehen bleiben.


F4. Welche Rolle spielt High-Throughput-Experimentation bei der Lösung des Datenproblems?

HTE-Plattformen können tausende Datenpunkte pro Woche unter kontrollierten, konsistenten Bedingungen erzeugen – einschließlich systematisch variierter Bedingungen, die fehlschlagen. Dies adressiert direkt sowohl das Volumen- als auch das Defizit negativer Daten und macht es zu einer der Investment mit der höchsten Rendite, die eine Pharma-F&E-Organisation zur Unterstützung von KI-gestütztem Wirkstoffdesign.


F5. Wie sollten Pharma-Führungskräfte Dateninvestitionen für AI-Bereitschaft priorisieren?

Priorisieren Sie in folgender Reihenfolge: (1) Standardisierung von ELN-Daten und maschinenlesbare Erfassung interner experimenteller Daten, (2) HTE-Programme zur systematischen Erzeugung von Reaktionsbedingungen-Daten, (3) vorwettbewerbliche Daten­austausch­konsortien für Bereiche gemeinsamen, nicht wettbewerbsorientierten Interesses, (4) Investitionen in KI-Architekturen zur Quantifizierung von Unsicherheit, die die Modell‑Konfidenz kommunizieren.

Mrudula Kulkarni
Written by
Mrudula Kulkarni
Redaktionsleiter – Pharma Now

Reporting on the science, business and regulation shaping the pharmaceutical industry.

Discussion

Diskussion wird geladen…

Mehr aus Pharma-Produktion

Alle Artikel →