Eine Studie von Anthropic und führenden Forschungseinrichtungen zeigt, dass KI Modelle wie Claude oder GPT bei der Suche nach Virus Sequenzen in öffentlichen Datenbanken mit einer Genauigkeit von nur 16,9 % dramatisch... Das Kernproblem ist eine für Menschen gebaute Infrastruktur: Webformulare und inkonsistente Schn...

Create a landscape editorial hero image for this Studio Global article: What do researchers from Anthropic, NCBI, the Broad Institute, and the Chan Zuckerberg Initiative reveal about why AI agents fail at retriev. Article summary: In a collaboration between Anthropic, NCBI, the Broad Institute, and the Chan Zuckerberg Initiative (CZI), researchers demonstrated that state-of-the-art AI agents fail at retrieving biological data from public databases. Topic tags: general, government, academic, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# Artificial Intelligence agents for biological research: a survey. A **.gov** website belongs to an official government organization in the United States. Inclusion in an NLM data" source context "Artificial Intelligence agents for biological research: a survey - PMC" Reference image 2: vis
Eine bahnbrechende Zusammenarbeit zwischen Anthropic, dem NCBI, dem Broad Institute und der Chan Zuckerberg Initiative (CZI) hat ein schmutziges Geheimnis der KI-gestützten Wissenschaft ans Licht gebracht: Die heute leistungsfähigsten KI-Agenten sind für eine so einfache Aufgabe wie das Abrufen viraler DNA-Sequenzen aus einer öffentlichen Datenbank völlig unzuverlässig. Die im Juni 2026 veröffentlichte Studie zeigt, dass Modelle wie Claude Sonnet 4 bei dieser Routineaufgabe eine Genauigkeit von nur 16,9 % erreichten. Der Übeltäter ist jedoch nicht die Intelligenz der KI – es ist die Infrastruktur. Die Datenbanken wurden für Menschen entwickelt, die durch Webformulare klicken, und nicht für autonome Agenten. Durch den Aufbau einer deterministischen Abrufschicht namens gget virus erreichte das Team sofort eine Genauigkeit von nahezu 100 % und bewies damit, dass die Reparatur der Datenleitungen der schnellste Weg zu einer vertrauenswürdigen KI-Biologie ist .
Laura Luebbert und ihre Kollegen umschrieben das Problem mit einer treffenden Analogie: Der Einsatz eines KI-Agenten zur Navigation durch biologische Daten ist wie die Fahrt mit einem modernen Auto durch eine mittelalterliche Stadt – das Auto ist technisch fortschrittlich, aber die Straßen wurden nie für solche Fahrzeuge konzipiert .
Die Forscher testeten mehrere führende KI-Systeme, darunter Claude, GPT-basierte Modelle, Biomni Open Source und Edison Analysis, bei der scheinbar einfachen Aufgabe, virale Sequenzdaten aus der NCBI Virus-Datenbank abzurufen. Diese Datenbank ist eine zentrale Anlaufstelle für Virologen, die Krankheitsausbrüche verfolgen und Diagnostika entwickeln . Die Ergebnisse waren alarmierend.
NCBI Virus und viele andere öffentliche biologische Datenbanken wurden für interaktive, webbrowserbasierte Arbeitsabläufe entwickelt. Wissenschaftler klicken sich durch Filter, prüfen Ergebnisse manuell und verlassen sich auf visuelle Hinweise. Diese Benutzerlogik ist mit autonomen Agenten, die strukturierte, programmatische Befehle erwarten, grundsätzlich inkompatibel .
Das vernichtendste Ergebnis war die Unbeständigkeit der Resultate. Als die Forscher Claude Sonnet 4 dreimal aufforderten, Ebolavirus-Sequenzen abzurufen – basierend auf einer verifizierten Grundgesamtheit von 266 – gab das Modell beim ersten Versuch 106, beim zweiten 15 und beim dritten nur 5 Sequenzen zurück. Der Prompt blieb unverändert, nur das Ergebnis variierte extrem .
Dabei geht es nicht nur um ein paar fehlende Datensätze. In einer Simulation verfälschte eine fehlerhafte Datenabfrage eine phylogenetische Analyse so stark, dass der Ursprung eines Ebola-Ausbruchs auf das Jahr 1922 anstatt auf das korrekte Datum 2014 geschätzt wurde. Die KI hatte die Wissenschaft nicht halluziniert – sie wurde mit einem kaputten Datensatz gefüttert und baute pflichtbewusst eine falsche Schlussfolgerung darauf auf .
Biologische Daten sind über Dutzende von Datenbanken mit inkompatiblen Bezeichnern, unterschiedlichen Metadatenstandards und ohne versionierte Programmierschnittstellen (APIs) verstreut. Softwareentwickler verlassen sich auf Paketmanager und versionierte Endpunkte; Bioinformatiker hingegen schreiben oft Skripte für inkonsistente Web-Schnittstellen, die sich ohne Vorankündigung ändern können .
Anstatt ein noch intelligenteres Modell zu trainieren, baute das Team eine bessere Abrufschicht. gget virus ist ein schlankes, deterministisches Framework, das die Filterlogik von NCBI Virus in ein reproduzierbares, programmatisches System überführt .
Funktionsweise: Es wendet Metadaten-Filter an, bevor die eigentlichen Sequenzen heruntergeladen werden, ruft selektiv nur die passenden strukturierten GenBank-Einträge ab und reduziert so das zu übertragende Datenvolumen bei umfangreichen Abfragen um über 98 % – bei vollständiger Nachvollziehbarkeit der Filterkriterien. Das Ergebnis ist bei jeder Abfrage derselbe Datensatz – eine Eigenschaft, die KI-Agenten dringend benötigen, die die alte Infrastruktur aber nicht liefern konnte .
Die Auswirkungen waren unmittelbar und dramatisch. Als autonome KI-Systeme gget virus als Backend für die Datenabfrage nutzten:
Die Schlussfolgerung ist eindeutig: Der begrenzende Faktor für die KI-gestützte Biologie ist nicht die Schlussfolgerungsfähigkeit der Modelle – es ist der deterministische Datenzugriff. Wenn die richtige Abrufschicht hinzugefügt wird, können heutige Agenten bereits zuverlässige Arbeit leisten .
Die Erfolgsgeschichte von gget virus ist ein Konzeptbeweis für einen viel größeren Wandel. Laut den Forschern ist dieses Muster nicht auf die Virologie beschränkt: Allein das NCBI beherbergt über 30 Datenbanken, die von ähnlichen deterministischen Wrappern profitieren würden .
Biologische Datenbanken müssen sich weiterentwickeln und gut dokumentierte, versionierte APIs mit standardisierten Filtern und reproduzierbaren Abfragesemantiken bereitstellen. Dies ist das Äquivalent zu dem, was Softwareentwickler von Paketmanagern und Versionskontrollsystemen gewohnt sind – eine kritische Infrastruktur, die den Biowissenschaften derzeit fehlt .
In einem parallelen Vorstoß veröffentlichte die Chan Zuckerberg Initiative eine Roadmap, die interoperable, übergreifende biologische Datensätze fordert, die über Kommandozeilenschnittstellen und maschinenlesbare Standards abgefragt werden können. Ihre Vision: eine Welt, in der Wissenschaftler multimodale Daten mit einer einzigen föderierten Abfrage suchen, analysieren und herunterladen können, was KI-skalierte Entdeckungen ohne das aktuelle Abrufchaos ermöglicht .
CZI handelt bereits und entwickelt eine CLI für den föderierten Datenzugriff und initiiert das Billion Cells Project, einen bahnbrechenden Einzelzell-Datensatz, der darauf abzielt, KI-Modelle der nächsten Generation zu trainieren. Das Ziel ist eine grundlegende Infrastruktur, die biologische Daten für Maschinen so zugänglich macht, wie Code-Repositories für Entwickler .
Die Kernaussage – dass veraltete, für Menschen geschaffene Schnittstellen KI-Agenten scheitern lassen – gilt für das gesamte wissenschaftliche Rechnen. Deterministische, programmatische Zugriffsschichten sind kein Luxus, sondern eine Grundvoraussetzung dafür, autonome Systeme zuverlässig in die Forschung einzubinden. Die Lösung liegt nicht im Warten auf ein klügeres Modell, sondern im Ausbau der Straßen.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Eine Studie von Anthropic und führenden Forschungseinrichtungen zeigt, dass KI Modelle wie Claude oder GPT bei der Suche nach Virus Sequenzen in öffentlichen Datenbanken mit einer Genauigkeit von nur 16,9 % dramatisch...
Eine Studie von Anthropic und führenden Forschungseinrichtungen zeigt, dass KI Modelle wie Claude oder GPT bei der Suche nach Virus Sequenzen in öffentlichen Datenbanken mit einer Genauigkeit von nur 16,9 % dramatisch... Das Kernproblem ist eine für Menschen gebaute Infrastruktur: Webformulare und inkonsistente Schnittstellen führen dazu, dass dieselbe KI Anfrage 106, 15 oder 5 Ergebnisse liefert – bei einem Soll von 266 [16].
Die Lösung ist nicht klügere KI, sondern bessere Datenleitungen: Das Tool 'gget virus' macht die Datenabfrage deterministisch und erhöht die Genauigkeit schlagartig auf nahezu 100 Prozent [9].