Vom KI-Prototyp zum skalierbaren Produkt

Warum beim Deployment nicht nur die Modellgenauigkeit zählt

Eine hohe Genauigkeit des Forschungsprototyps ist ein wichtiger Meilenstein. Für ein erfolgreiches KI-Produkt ist sie jedoch nur der Anfang.
Gerade in der medizinischen Bildverarbeitung entstehen KI-Modelle häufig unter Forschungsbedingungen: Die Datenbasis ist definiert, die Hardware ist leistungsfähig und die Anzahl der zu verarbeitenden Fälle ist überschaubar. Für den späteren Produktivbetrieb gelten jedoch andere Rahmenbedingungen. Ein Modell muss dann zuverlässig, schnell und wirtschaftlich arbeiten und sich in die bestehende Software- und Systemlandschaft integrieren lassen.

Wenn aus einem guten Modell ein teurer Betrieb wird

In der Praxis begegnen uns beispielsweise Segmentierungsprototypen auf Basis von nnU-Net, die auf einem Testdatensatz hervorragende Ergebnisse liefern. Für eine wissenschaftliche Evaluation kann das genau die richtige Lösung sein.
Bei einem kommerziellen Produkt stellen sich jedoch zusätzliche Fragen:

  • Wie viel Arbeitsspeicher und GPU-Speicher benötigt das Modell?
  • Wie lange dauert die Verarbeitung eines Patientenfalls? 
  • Wie viele Fälle können parallel verarbeitet werden? 
  • Und was passiert mit den Infrastrukturkosten, wenn aus zehn Analysen am Tag mehrere Tausend werden?


Ein Modell, das mehrere Gigabyte Speicher benötigt und selbst auf einer leistungsfähigen GPU mehr als fünf Minuten pro Untersuchung erfordert, kann trotz hoher Genauigkeit für ein skalierbares Produkt ungeeignet sein. 
Genau hier liegt eine häufig unterschätzte Herausforderung beim Übergang vom Forschungsprototyp zur Produktentwicklung: Die Anforderungen an ein Modell verändern sich, sobald es nicht mehr nur funktionieren, sondern auchwirtschaftlich betrieben werden soll.
 

Deployment beginnt nicht erst nach der Entwicklung

Ein produktionsreifes KI-System entsteht deshalb nicht allein durch die Auswahl oder das Training eines möglichst leistungsfähigen Modells. Für das Deployment müssen Modell, Datenverarbeitung und Zielplattform als Gesamtsystem betrachtet werden.
Dabei spielen insbesondere vier Faktoren zusammen:

  • Laufzeit: Wie schnell muss ein Fall verarbeitet werden?
  • Ressourcenbedarf: Wie viel CPU-, GPU- und Arbeitsspeicher werden benötigt?
  • Skalierbarkeit: Wie viele Untersuchungen können gleichzeitig verarbeitet werden?
  • Genauigkeit: Welche Qualität muss unter realen Bedingungen zuverlässig erreicht werden?


Für das Deployment können Modelle und Verarbeitungspipelines hinsichtlich dieser Faktoren gezielt optimiert werden. Je nach Anwendung kommen beispielsweise angepasste Modellarchitekturen, optimierte Inferenzverfahren oder effizientere Verarbeitungsschritte zum Einsatz. Dadurch lässt sich der Ressourcenbedarf teilweise erheblich reduzieren. 
Ein wichtiger Faktor ist dabei die Wahl der Hardware. Wenn eine Anwendung zunächst auf leistungsfähige GPUs ausgelegt wurde, kann eine Optimierung unter Umständen den Betrieb auf kostengünstigerer CPU-Infrastruktur ermöglichen. Gerade bei serverbasierten Anwendungen kann dies einen deutlichen Unterschied für die späteren Betriebskosten ausmachen.
Das Ziel ist nicht das maximal komplexe Modell, sondern das passende Verhältnis aus Qualität, Performance und Ressourcenverbrauch.

 

Was Skalierbarkeit mit Kosten zu tun hat

Die Auswirkungen solcher Optimierungen werden besonders deutlich, wenn ein KI-System skaliert werden soll.
Eine Analyse, für die eine GPU mehrere Minuten Rechenzeit benötigt, mag für einen Prototypen akzeptabel sein. Werden jedoch hunderte oder tausende Fälle verarbeitet, beeinflussen Rechenzeit, Hardwarebedarf und Parallelisierung die Infrastrukturkosten unmittelbar.
Schon kleine Optimierungen können sich im laufenden Betrieb deshalb stark auswirken:

  • Ein geringerer Speicherbedarf kann den Einsatz günstigerer Hardware ermöglichen. 
  • Kürzere Inferenzzeiten erhöhen den Durchsatz. 
  • Eine effizientere Pipeline reduziert den Bedarf an parallel betriebenen Ressourcen.


Deployment-Optimierung ist damit nicht nur eine technische Frage. Sie ist auch eine Frage der Wirtschaftlichkeit. Das bedeutet zugleich, dass die Kosten eines KI-Produkts nicht allein durch Training und Entwicklung entstehen. Auch die Anforderungen des späteren Betriebs müssen bereits bei der Produktentwicklung berücksichtigt werden.

 

Produktivbetrieb bedeutet: Das System muss stabil weiter funktionieren

Mit dem ersten Release ist die Arbeit am Deployment natürlich noch nicht abgeschlossen. Medizinische Software läuft über Jahre und muss dabei mit veränderten technischen und regulatorischen Rahmenbedingungen umgehen. Cybersecurity-Anforderungen und Software-Supply-Chain-Themen machen regelmäßige Updates von Bibliotheken und Abhängigkeiten erforderlich.
Das ist besonders bei KI-Anwendungen relevant: Ein Update von Frameworks wie PyTorch oder TensorFlow ist nämlich nicht zwangsläufig ein rein technischer Versionswechsel. Änderungen können sich auf das Modellverhalten, numerische Ergebnisse, Laufzeiten oder den Speicherverbrauch auswirken. Entsprechend müssen Updates kontrolliert und durch Regressionstests abgesichert werden. Auch die technische Dokumentation ist somit für die langfristige Wartbarkeit eines KI-Produkts von Bedeutung. Dazu können beispielsweise Software Bills of Materials (SBOMs) gehören, die Transparenz über eingesetzte Softwarekomponenten und Abhängigkeiten schaffen.

 

Vom funktionierenden Prototyp zur wirtschaftlichen Lösung mit Chimaera

Bei der Entwicklung medizinischer KI geht es deshalb nicht darum, Forschungsmodelle unverändert in eine Produktionsumgebung zu übernehmen. Vielmehr ist eine Weiterentwicklung zu einem System entscheidend, das die Anforderungen des konkreten Produkts erfüllt.
Als Spezialisten für medizinische Bildverarbeitung, Algorithmik und KI verbindet Chimaera Modellverständnis mit Software- und Deployment-Know-how.  Ein besonderer Schwerpunkt unserer Arbeit liegt auf der Überführung von KI-Modellen und Algorithmen in robuste, performante und langfristig wartbare Produktivsysteme. Dabei betrachten wir Modelle und Verarbeitungspipelines nicht isoliert, sondern optimieren sie im Kontext der Zielplattform und des späteren Betriebs.
So unterstützen wir Sie dabei, aus einem leistungsfähigen Forschungsprototyp ein System zu entwickeln, das nicht nur zuverlässig arbeitet, sondern auch mit vertretbarem Ressourcenbedarf skaliert und langfristig wartbar bleibt.

 

Sie haben ein KI-Modell, das den Sprung in den Produktivbetrieb schaffen soll?
 

Wir unterstützen bei der Optimierung von Modellen und Algorithmen für effizientes Deployment – von der Laufzeit- und Ressourcenoptimierung bis zur langfristigen Wartbarkeit.

 

Sprechen Sie mit uns über Ihr KI-Projekt