Pharma IT

Die Einführung von Elsa bei der FDA: Regulatorische Bedenken, mögliche Konsequenzen und ein Weg nach vorn

Ein kritischer Blick auf den KI-Rollout der FDA, seine Fallstricke und ein SMART-Rahmenwerk für verantwortungsvolle regulatorische KI in den Lebenswissenschaften.

Dr. Ajaz Hussain & Mr. Ram Balani
Von Dr. Ajaz Hussain & Mr. Ram Balani
Industry Experts
2. Aug. 20259 Min. Lesezeit
Die Einführung von Elsa bei der FDA: Regulatorische Bedenken, mögliche Konsequenzen und ein Weg nach vorn

Im Juni 2025 brachte die U.S. Food and Drug Administration (FDA) Elsa auf den Markt, einen generativen KI-Copiloten, der entwickelt wurde, um regulatorische Arbeitsabläufe zu straffen. Zwar wurde die Einführung anfangs gefeiert, doch zeigte sich schnell, dass Elsas Einsatz kritische Mängel offenbarte – erfundene Zitate, ausgelassene Sicherheitsdaten und Lücken in der Governance. Dieser Artikel untersucht Elsas Schwächen, stellt sie in den Kontext breiterer KI-Governance-Trends und schlägt einen SMART (Specific, Measurable, Achievable, Relevant, Time-bound)-Rahmen vor, um eine verantwortungsvolle KI-Integration in den Life-Sciences-Bereich zu leiten. Basierend auf Erkenntnissen aus „Illuminating the Dark Side of Pharma Algorithms“ bieten wir einen Weg zu transparenter, prüfbarer und ethisch fundierter regulatorischer KI.

 

Einführung: Ein vielversprechender Start, eine problematische Entwicklung

Am 2. Juni 2025 veröffentlichte die FDA eine Pressemitteilung zur agenturweiten Einführung von Elsa und hob hervor, dass das Tool "ahead of schedule and under budget" live gegangen sei, nachdem ein erfolgreicher Pilot abgeschlossen worden war [1]. In einer sicheren GovCloud-Umgebung entwickelt, sollte Elsa dabei helfen, Spontanmeldungen zu Nebenwirkungen zusammenzufassen, Produktinformationen zu vergleichen und Code zu entwerfen – sodass die Prüfer sich auf wissenschaftlich wertvollere Entscheidungen konzentrieren können. Doch bereits Ende Juli berichteten mehrere Medien über die Frustration der Mitarbeitenden aufgrund gefälschter Zitate und fehlender Sicherheitsdaten [2–6].

 

Wenn KI die regulatorische Zuverlässigkeit untergräbt: Fehlermodi

Bedenken hinsichtlich Elsas Zuverlässigkeit traten fast sofort auf, insbesondere in Bezug auf halluzinierte Zitate. Ähnliche Probleme wurden in breiteren LLM-Bewertungen beobachtet, bei denen KI-generierte Inhalte unbegründet Glaubwürdigkeit verleihen und damit Nutzen–Risiko-Bewertungen verzerren, bevor die Fehler entdeckt werden [7, 8]. Während eine formelle FDA-Prüfung noch aussteht, stützt sich unsere Analyse auf diese frühen Bedenken, um kritische Spannungsfelder zwischen technologischer Begeisterung und regulatorischer Verlässlichkeit aufzuzeigen. Nachfolgend skizzieren wir die berichteten potenziellen Fehlermodi.

Tabelle 1. FDA ELSA-Mängel oder Fehltritte & berichtete potenzielle Fehlermodi in den Medien

Die Patientensicherheit ist der Eckpfeiler der FDA-Zulassungsprüfung. Ironischerweise könnte Elsa – konzipiert, um regulatorische Prozesse zu beschleunigen und zu verbessern – neue Risiken in Bezug auf Vertrauen, Transparenz und operative Effizienz eingeführt haben. Bemerkenswert ist, dass Elsa mit der Annahme gesetzlicher Genauigkeit in bestehenden Benchmarks und verantwortlicher menschlicher Aufsicht gestartet wurde. Elsas Einführung – ohne rigorose Tests oder Transparenz – könnte eine "canary in the coal mine" sein und signalisieren, dass selbst führende Institutionen des öffentlichen Gesundheitswesens anfällig für algorithmischen Drift und verschlechterte Entscheidungsfindung sind.

 

Ist die US-KI-Governance für die öffentliche Gesundheit zu lax?

Im Gegensatz zum EU AI Act, der seit 2024 rechtlich bindende Verpflichtungen für Hochrisikosysteme auferlegt [9], betont die US-Politik die Förderung von KI-Innovationen zur Unterstützung der wirtschaftlichen Wettbewerbsfähigkeit und der nationalen Sicherheit [10]. Mangels der im EU-Rahmen vorgesehenen Schutzmaßnahmen wächst die Besorgnis, dass Hochrisiko-KI-Tools ohne rigorose Tests, Transparenz oder Rechenschaftspflicht eingesetzt werden können.

 

Gute linguistische Praktiken (GLP): Sprache als regulatorisches Instrument

In der pharmazeutischen Regulierung kann mehrdeutige oder irreführende Sprache Vertrauen untergraben und die Compliance gefährden. Wir plädieren für GLP nicht nur im Labor, sondern auch für die Sprache – Good Linguistic Practices (GLP) – die strukturierte Verwendung klarer, konsistenter und kontextuell verankerter Sprache in KI-gestützten regulatorischen Arbeitsabläufen [8]. Dazu gehören nicht nur bessere Texte, sondern auch Nachvollziehbarkeit, Validierung und Übereinstimmung mit bestehenden rechtlichen und regulatorischen Standards. GLP geht über Klarheit hinaus; es geht um Verantwortlichkeit.

 

Die Dueling Banjo Methodology: Mensch + KI Zusammenarbeit

Um die Integrität regulatorischer KI zu schützen, empfehlen wir die Dueling Banjo Methodology – ein strukturiertes, iteratives Modell, das die Mensch-KI-Ko-Entwicklung stärkt:

1. Initiales KI-Entwurf: Geführtes RAG-Prompting steuert KI-generierte Antworten, ein FDA Copilot oder genAI-Assistent, der auf www.fda.gov, www.ecfr.gov, etc. Site(s) basiert, zum Beispiel

2. Expertenprüfung & Verfeinerung: Fachexperten beurteilen faktische Genauigkeit und kontextuelle Relevanz. Bereitstellung einer jederzeit verfügbaren Human-in-the-Loop-Volltextsuche in den tatsächlich veröffentlichten FDA.gov-Regelwerken (Guidance-PDFs und 21 CFRs), die direkt aus derselben App-Oberfläche zugänglich ist, um sicherzustellen, dass sich keinerlei genAI-LLM-Bias etablieren kann.

3. KI-Überarbeitung: Das Modell wird mit Expertenfeedback feinabgestimmt, also ein Rückspiel zwischen Maschine und Mensch mit genAI und bei Bedarf Faktenprüfung

4. Endgültige Verifizierung: Ausgaben werden gegen Compliance-Benchmarks auditiert. Dies kann beinhalten, dieselben Prompts und Instruktionen an genAI von einem zweiten fundamentalen LLM-Modell zu benchmarken, abgesehen von Anthropic Claude, das von der FDA für ELSA verwendet wurde.

Dieser Zyklus wird fortgesetzt, bis die KI-generierten Ergebnisse Qualitäts-, Transparenz- und regulatorischen Bereitschaftsstandards entsprechen. Wichtig ist, dass menschliche Prüfer nicht nur im regulatorischen Bereich geschult werden müssen, sondern auch in KI-Prompt-Engineering und Validierungs-Workflows.

 

Model Context Protocol (MCP): Ein regulatorisches Rückgrat

Abbildung 1 zeigt eine moderne Architektur, die SharePoint Online (Hosting von FDA-Dokumenten), eSTARHelper/FDA Copilot (betrieben mit ChatGPT-4.0) und in Microsoft Foundry indizierte Inhalte integriert, alles strukturiert durch das Model Context Protocol (MCP).

Abbildung 1. eSTARHelper’s aktuelle & zukünftige FDA Copilot Tech Stack-Man-Machine mit Human-in-the-Loop, unterstützt von rein autonomen agentischen KI-(a) Tools, (b) Ressourcen und (c) Prompts, unterstützt durch das MCP-Protokoll 

MCP ist ein Open-Source-Standard, der es LLMs ermöglicht, vorhersehbar mit strukturierten Daten, Datenbanken und Werkzeugen zu interagieren – vergleichbar mit einem USB-C-Anschluss für KI. Er unterstützt Plug-and-Play-Zugriff auf validierte Ressourcen, dynamische Kontextinjektion und Echtzeit-Datenverifizierung. Durch die Einbindung von MCP mit Tools wie SmartSearch+ können LLMs wie Elsa zuverlässig auf FDA-Leitlinien und 21 CFR-Vorschriften zugreifen, die von CDER, CBER und CDRH herausgegeben werden.

Während Retrieval-Augmented Generation (RAG) LLM-Antworten mit externen Daten untermauert, beschränkt sie sich auf passive Abfragen. Function calling, eine Fähigkeit, die LLMs wie GPT-4 erlaubt, mit externen APIs oder Softwaretools zu interagieren, ermöglicht es LLMs, bestimmte Aufgaben auszuführen oder Live-Daten abzurufen, verfügt jedoch nicht über ein robustes Kontextmanagement. MCP verbindet beides und ermöglicht strukturiertes Denken, Tool-Aufrufe und vollständige Rückverfolgbarkeit [11]—Eigenschaften, die für die regulatorische Mission der FDA unerlässlich sind. In regulatorischen Kontexten erlaubt diese Fähigkeit LLMs, validierte Datenbanken abzufragen oder regelbasierte Bewertungen durchzuführen und so Antworten auf strukturierter Logik zu gründen — nicht nur auf Sprachgenerierung.

 

Von Blindstellen zu SMART Governance

Aufbauend auf „Illuminating the Dark Side of Pharma Algorithms“ [12] überarbeiten wir das SMART-Framework, um algorithmische Opazität und ethische Blindstellen anzugehen — ein Rahmen, der abstrakte Prinzipien in konkrete Schutzmaßnahmen verwandelt.

 

Spezifität beginnt damit, den Anwendungsbereich von KI-Tools und ihre Entscheidungsgrenzen klar zu definieren. Generative Modelle dürfen nicht ohne ausdrückliche Beschränkungen in wissenschaftliche Bewertung oder regulatorische Interpretation eingreifen. Durch die Abgrenzung dessen, was KI tun kann — und was nicht — können Behörden Übergriffe verhindern und Fachwissen bewahren.

Messbarkeit stellt sicher, dass KI-Ergebnisse an validierten Datensätzen und Compliance-Standards gemessen werden. Dies ermöglicht Prüfern, Halluzinationen, Auslassungen oder Drift frühzeitig zu erkennen, bevor fehlerhafte Ergebnisse regulatorische Entscheidungen beeinflussen. Metriken müssen an der realen Leistungsfähigkeit ausgerichtet sein, nicht nur am internen Modellvertrauen.

Erreichbarkeit erfordert, KI-Fähigkeiten mit den tatsächlichen Arbeitsabläufen und der Ausbildung menschlicher Prüfer in Einklang zu bringen. Tools wie Elsa sollten ergänzen — nicht überfordern — bestehende Prozesse. Unrealistische Erwartungen oder schlecht integrierte Systeme bergen das Risiko von Missbrauch, Frustration und Vertrauensverlust.

Relevanz betont, dass KI menschliche Expertise unterstützen, nicht ersetzen sollte. In Bereichen mit hohen Einsätzen wie der Arzneimittelregulierung sind kontextuelle Nuancen und ethische Bewertung unersetzlich. KI muss so gestaltet sein, dass sie menschliche Entscheidungen verbessert, nicht automatisiert.

Zeitgebundenheit führt regelmäßige Prüfzyklen und Bias-Überwachungsprotokolle ein. KI-Systeme entwickeln sich weiter, und ohne fortlaufende Überwachung können selbst gut trainierte Modelle degradieren oder driften. Geplante Überprüfungen stellen sicher, dass die Leistung mit regulatorischen Standards und Prioritäten des öffentlichen Gesundheitswesens übereinstimmt.

Gemeinsam bilden diese Prinzipien ein belastbares Rückgrat für regulatorische KI. Sie werden durch Praktiken gestärkt, die in „Illuminating the Dark Side of Pharma Algorithms“ hervorgehoben werden, einschließlich ALCOA+-Sorgfalt für Datenherkunft, Erklärbarkeit durch Design und funktionsübergreifende Governance-Gremien. Indem SMART-Governance in die DNA der KI-Implementierung eingebettet wird, können Life-Sciences-Organisationen von reaktiver Aufsicht zu proaktivem Management übergehen — und Warnbeispiele in Benchmarks des Vertrauens verwandeln.

 

Fazit

Der Weg in die Zukunft ist nicht nur technischer Natur — er ist ethisch, sprachlich und institutionell. Elsa mag gestolpert sein, aber mit den richtigen Schutzvorrichtungen kann die nächste Generation regulatorischer KI mit Zuversicht voranschreiten.

Durch die Anwendung eines Human-in-the-Loop-Ansatzes, den wir als Dueling Banjo Methodology beschreiben, mit eSTARHelper’s Implementierung seines genAI FDA Copilot und SmartSearch+, können Pharmafachleute den Nutzen von LLMs im Bereich der regulatorischen Wissenschaft erkunden. Ein solcher Ansatz kann weiter gestärkt werden durch die Nutzung von Standards wie MCP. Dieser Ansatz kann das, was derzeit ein warnendes Beispiel ist, in einen Benchmark für digitales Vertrauen und Führungsstärke im Bereich der öffentlichen Gesundheit verwandeln.

 

Literaturverzeichnis

1. FDA führt agenturweites KI-Tool zur Leistungsoptimierung für das amerikanische Volk ein

| FDA. (Abgerufen 31.07.2025).

2. Die künstliche Intelligenz der FDA soll die Arzneimittelzulassung revolutionieren. Sie erzeugt Nicht existente Studien. | CNN Politics. (Abgerufen 31.07.2025).

3. Die Elsa-KI der FDA halluziniert Studien, sagen Mitarbeiter. Tech Times. (Abgerufen 31.07.2025).

4. Das Elsa-KI-Tool der FDA wirft Fragen zu Genauigkeit und Aufsicht auf—applied Clinical Trials. (Abgerufen 31.07.2025).

5. Die neue KI zur Arzneimittelzulassung der FDA generiert gefälschte Studien: Bericht. Gizmodo. (Abgerufen 31.07.2025).

6. Die KI-Einführung der FDA wirft Fragen zur Einsatzbereitschaft und Rechtmäßigkeit auf. BioSpace. (Abgerufen 31.07.2025).

7. Verbesserung der behördlichen Kommunikation und Entscheidungsfindung mit einer AI/ML FDA Copilot und SmartSearch+. Pharma Now. (Abgerufen 31.07.2025).

8. Auf dem Weg zu guten sprachlichen Praktiken in KI-unterstützten behördlichen Mitteilungen. Pharma Now. (Abgerufen 31.07.2025).

9. AI-Gesetz – Europas digitale Zukunft gestalten. Europäische Union. (Abgerufen 31.07.2025).

10. Barrieren für amerikanische Führungsrolle in der künstlichen Intelligenz beseitigen. The White House. (Abgerufen 31.07.2025).

11. Verbesserung der klinischen Entscheidungsunterstützung und EHR-Einsichten durch LLMs und das Model Context Protocol: Ein Open-Source MCP-FHIR Framework . arXiv:2506.13800 [cs.SE], Juni 2025. (Abgerufen 31.07.2025)12. 

Die dunkle Seite von Pharma-Algorithmen beleuchten. Pharma Now. (Abgerufen 31.07.2025).

ThemenPharma IT
Dr. Ajaz Hussain & Mr. Ram Balani
Written by
Dr. Ajaz Hussain & Mr. Ram Balani
Industry Experts

Reporting on the science, business and regulation shaping the pharmaceutical industry.

Discussion

Diskussion wird geladen…

Mehr aus Pharma IT

Alle Artikel →