algolas
← Projekte

AI Infrastructure

Infrastruktur für ein KI-Labor

Reproduzierbare Trainings- und Experimentier-Infrastruktur für ein Forschungsteam, das an eigenen Modellen arbeitet.

Ein KI-Forschungslabor brauchte eine Infrastruktur, mit der Forscher:innen Experimente zuverlässig durchführen, vergleichen und reproduzieren können - ohne sich um Cluster-Verwaltung kümmern zu müssen.

Ausgangslage

Trainingsläufe wurden manuell auf einzelnen Maschinen gestartet. Ergebnisse waren schwer vergleichbar, GPU-Ressourcen wurden ungleichmässig genutzt und es fehlte eine zentrale Übersicht über laufende und abgeschlossene Experimente.

Lösung

  • Orchestrierung von GPU-Workloads über ein gemeinsames Cluster mit Warteschlangen und Priorisierung
  • Zentrales Experiment-Tracking inklusive Metriken, Artefakten und Modellversionen
  • Automatisierte Datenpipelines vom Rohdatensatz bis zum trainingsbereiten Datensatz
  • Self-Service-Tooling, damit Forscher:innen neue Experimente ohne Infrastruktur-Team starten können

Resultat

Kürzere Iterationszyklen, bessere Auslastung der GPU-Kapazität und nachvollziehbare, reproduzierbare Experimente über das gesamte Team hinweg.