Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Dreihundert Labormessungen verbessern das virtuelle Screening

Wenige Aktivitätslabels genügten, um die Affinitätsköpfe von Boltz-2 nachzujustieren. Die Treffer tauchten früher im Ranking auf, und das Rescoring ließ sich auf zehn Prozent der Kandidaten begrenzen.

WissenschaftNachrichtHanna VogtVeröffentlicht: 22. September 20265 Min. LesezeitQuellen 2
Dreihundert Labormessungen verbessern das virtuelle Screening

Beim virtuellen Screening geht es darum, aus einer riesigen Bibliothek von Verbindungen jene herauszufischen, die im Labor getestet werden sollten. Das experimentelle Budget ist begrenzt. Deshalb zählt weniger die vollständige Klassifizierung als die Frage, wie früh im Ranking wirklich aktive Moleküle auftauchen. Japanische Autoren prüfen in ihrer Arbeit, ob sich Boltz-2 mit einigen Dutzend bis einigen Hundert Messungen aus einem konkreten Test darauf vorbereiten lässt.

Wie viele Daten reichen

Die Autoren trainierten die Affinitätsköpfe von Boltz-2 nach und gaben dem Modell 40 bis 300 binäre Aktivitätslabels. Bewertet wurde retrospektiv an acht Zielen aus dem MF-PCBA-Datensatz. Bei 300 Messungen stieg die Zahl der aktiven Verbindungen im ersten Prozent des Rankings im geometrischen Mittel um das 1,77-Fache gegenüber der nicht nachtrainierten Variante. Die mittlere Präzision verbesserte sich um das 2,14-Fache. Das Ergebnis hängt vom Ziel ab und davon, wie der Trainingssatz zusammengestellt wurde. Die Autoren sehen darin ein Signal, keine Regel.

Das zweite Experiment betrifft den Rechenaufwand. Statt den gesamten Kandidatensatz mit dem nachtrainierten Kopf neu zu bewerten, beschränkten die Forscher das Rescoring auf etwa zehn Prozent der von Boltz-2 am besten bewerteten Vorschläge. Bei dieser Einschränkung blieb die Trefferausbeute vergleichbar mit dem vollständigen Rescoring. Der praktische Schluss ist einfach: Hat das Modell bereits ein gutes Gespür für die grobe Skala, genügt es, das Ende der Liste nachzujustieren.

Die Autoren schränken selbst ein, dass die Studie retrospektiv ist. Die Labels stammen aus fertigen Datensätzen und nicht aus einem neuen Experiment. Die ermittelten Zahlen beschreiben also das Verhalten der Methode auf bekannten Daten, nicht ihre Wirksamkeit in einem unbekannten Labor. Der praktische Schluss bleibt trotzdem nützlich: Statt ein Modell von Grund auf mit Zehntausenden Messungen zu trainieren, genügt es, die Köpfe auf einem Satz nachzutrainieren, der in das Budget eines einzigen Projekts passt. Der Gewinn bei der Reihenfolge der Kandidaten bleibt.

Datenverarbeitung in der Proteomik

Parallel entwickelt sich die Messseite weiter. In einer anderen Arbeit wurde ProteoEM vorgestellt, eine offene Python-Bibliothek, die die Häufigkeit von Proteinen und Proteoformen anhand von Einzelmolekül-Affinitätsspuren schätzt. Das Problem: Eine unvollkommene und unspezifische Bindung der Sonde führt dazu, dass eine Spur zu mehreren möglichen Identifikationen passt. Statt die Spur einem einzigen Kandidaten zuzuordnen, schlägt der Autor vor, die Unsicherheit gewichtet aufzuteilen. Das geschieht in einem Schema, das die erwartete Glaubwürdigkeit maximiert, mit vorab kalibrierten Antwortindikatoren der Sonde. Nicht unterscheidbare Proteoformen meldet das Modell als Gruppen, statt eine willkürliche Wahl zu erzwingen.

Beide Ansätze verbindet ein Gedanke: In der biomedizinischen Forschung zählt nicht die abstrakte Genauigkeit, sondern wie sich die Entscheidung des Modells auf den nächsten, teuren Schritt im Labor auswirkt. Deshalb zählt bei der Bewertung von Modellen nicht mehr die durchschnittliche Qualität über den gesamten Datensatz, sondern die Arbeit in jenem engen Fenster, auf das es wirklich ankommt.

Kommentare 0

Quellen

2
  1. 01Adapting Boltz-2 with limited experimental activity data improves early enrichment in virtual screeningEN
  2. 02ProteoEM: probabilistic protein abundance estimation from iterative affinity tracesEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Hanna Vogt

Hanna Vogt

Wissenschaft und Gesundheit

Hanna Vogt schreibt für FLASH24 über Wissenschaft und Gesundheit und stützt sich dabei auf Primärstudien, Behördenberichte und Rohdaten statt auf Pressemitteilungen. Bei Zahlen prüft sie Stichprobengrößen, Konfidenzintervalle und ob die zitierte Quelle die Aussage tatsächlich deckt. Für ihre Texte spricht sie mit Studienautorinnen, wartet auf Peer-Review-Fassungen und vergleicht Vorabdrucke mit der finalen Publikation. Dass sie privat Materialphysik verfolgt und mit eigenem Teleskop den Himmel beobachtet, erklärt, warum sie bei Messmethoden und Instrumenten genau nachfragt. Sie publiziert keine Ergebnisse, deren Datengrundlage sie nicht selbst eingesehen hat.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.