Blog

KubeCon 2025 Tag 1 Zusammenfassung: Plattform-Engineering trifft auf KI/ML-Innovation

Bild von Stefan Tsankov
Stefan Zankow
DevOps- und Cloud-Ingenieur
02.04.2025
Lesezeit: 6 Minuten.
Zuletzt aktualisiert am: 03.04.2025

Inhaltsübersicht

Die KubeCon 2025 begann mit zwei bedeutenden Tracks: Platform Engineering und Kubernetes AI/ML. Obwohl beide unterschiedlich sind, betonten sie die wachsende Synergie zwischen skalierbaren internen Plattformen und modernsten KI-Technologien. Die wichtigste Erkenntnis? Eine robuste Plattformstrategie gepaart mit KI-gesteuerter Innovation ist die Zukunft des Cloud-nativen Erfolgs.

 Kubecon 2025 - Cloud-nativ

In den Sitzungen zum Thema Plattform-Engineering wurde betont, wie wichtig es ist, die Plattform wie ein Produkt zu behandeln. Der Ansatz besteht darin, klare Selbstbedienungsschnittstellen anzubieten, die es den Entwicklern ermöglichen, Anwendungen zu erstellen, auszuliefern und auszuführen, ohne sich mit der komplexen Infrastruktur auf niedriger Ebene zu befassen. Mehrere Beispiele aus der Praxis zeigten, wie Unternehmen Reibungsverluste durch die Standardisierung von Arbeitsabläufen verringern und gleichzeitig den Teams die Autonomie lassen, die Plattform für neue Anwendungsfälle anzupassen.

Die wichtigsten Erkenntnisse:

  • Interne Entwicklerplattformen: Bereitstellung einer einheitlichen Schnittstelle, die die Kubernetes-Primitive und andere Infrastrukturdetails abstrahiert
  • Feedback-Schleifen: Halten Sie die Kommunikationskanäle offen, damit die Plattformingenieure die Bedürfnisse der Entwickler verstehen und eine kontinuierliche Verbesserung gewährleisten können.
  • Erkennbarkeit: Dokumentieren Sie kuratierte Dienste, Vorlagen und Werkzeuge, damit Entwickler die Plattformkomponenten schnell finden und nutzen können.

GitOps hat sich zu einem Eckpfeiler der modernen Plattformautomatisierung entwickelt und stellt sicher, dass die Infrastruktur konsistent, versionskontrolliert und leicht wiederherstellbar ist.

Die wichtigsten Erkenntnisse:

  • IaC-Muster (Infrastructure as Code): Organisation der Konfiguration in Git-Repositories, um Änderungen zu isolieren und Peer-Reviews zu erleichtern
  • Automatisierte Rollbacks: Im Falle von Fehlkonfigurationen oder Systemfehlern ist ein Rollback auf einen bekannten guten Zustand trivial
  • Erkennung von Abweichungen und Warnungen: Der kontinuierliche Abgleich stellt sicher, dass jede Abweichung von der "Quelle der Wahrheit" frühzeitig erkannt wird und automatische Korrekturen ausgelöst werden können.

Um große Kubernetes-Umgebungen aufrechtzuerhalten, legen Plattformteams großen Wert auf Beobachtbarkeit. In den Sitzungen wurde erörtert, wie Protokolle, Metriken und Traces zusammengeführt werden, um eine Echtzeitansicht des Clusterzustands zu erhalten. Die Teilnehmer lernten Strategien kennen, um riesige Mengen an Telemetriedaten zu sichten, Anomalien zu identifizieren und Ursachen für Microservices zu finden.

Die wichtigsten Erkenntnisse:

  • Vereinheitlichte Observability Stacks: Integration von Protokollierung, Tracing und Metriken über alle Dienste hinweg für eine durchgängige Transparenz
  • Datenfilterung und Priorisierung: Implementieren Sie eine automatische Filterung, um hochwertige Daten zu ermitteln und Rauschen zu reduzieren.
  • Leistungsanalyse: Nutzen Sie Dashboards und Warnmeldungen zur proaktiven Überwachung, Kapazitätsplanung und Erkennung von Anomalien
Plattform-Engineering und Entwicklererfahrung für Ihr On-Prem-LLM

Auch die Sicherheit stand im Mittelpunkt, insbesondere im Zusammenhang mit der Automatisierung von Compliance-Prüfungen. Die Vorträge konzentrierten sich auf die Einbindung von Sicherheit in CI/CD-Pipelines, das Scannen von Container-Images auf Schwachstellen und die Durchsetzung von Richtlinien als Code, um organisatorische oder gesetzliche Anforderungen einzuhalten.

Die wichtigsten Erkenntnisse:

  • Kontinuierliche Sicherheits-Scans: Integration von Scan-Tools in Container-Registrierungen und Aufbau von Pipelines zur frühzeitigen Erkennung von Problemen
  • Richtlinie-als-Code: Kodierung von Sicherheits- und Compliance-Regeln zur automatischen Durchsetzung und Prüfung
  • Governance-Protokolle: Festlegung klarer Richtlinien für die Reaktion auf Vorfälle und für die Art und Weise, wie Probleme gemeldet und behoben werden

Die parallel zum Plattform-Engineering-Track stattfindenden KI-Sitzungen unterstrichen, wie Kubernetes zu einer grundlegenden Schicht für große Sprachmodelle (LLMs), maschinelles Lernen (ML) und erweiterte Analysen geworden ist. Die Themen reichten von Multi-Cluster-Modell-Serving bis hin zu Hardware-bewusstem Scheduling und vertraulichem Computing.

Die Portabilität und Skalierbarkeit von Kubernetesmachen es zu einem erstklassigen Kandidaten für leistungsstarke KI-Workloads. Die Diskussion konzentrierte sich darauf, wie der Anstieg von LLMs und generativer KI ein Überdenken traditioneller ML-Pipelines und -Ressourcen erfordert und die Grenzen der MLOps-Praktiken verschiebt.

Die wichtigsten Erkenntnisse:

  • LLM-fokussierte Infrastruktur: Container, GPUs und spezielle Planung sorgen für optimale Leistung
  • Sich entwickelnde MLOps: Modellentwicklung, -tests und -bereitstellung werden in Kubernetes-basierten Workflows zunehmend standardisiert
  • Hybride Bereitstellungen: Der Ausgleich zwischen On-Premise- und Cloud-Ressourcen kann sowohl Kosteneffizienz als auch Governance-Vorteile bringen

In Blitzvorträgen wurden neue Lösungen vorgestellt, darunter RAG (retrieval-augmented generation) für die Beantwortung von Fragen und spezielle Gateways für LLM-Inferenzen. Der Schwerpunkt lag auf der Verwaltung der Inferenzlatenz, der horizontalen Skalierung und der Verfolgung von Leistungsmetriken.

Wichtigste Erkenntnisse:

  • RAG in einer Box: Integration von Retrieval-Pipelines mit Microservices zur Verbesserung von Benutzeranfragen und Antworten
  • LLM-Gateways: Entlastung schwerer Inferenzaufgaben durch Proxies, die für Gleichzeitigkeit und Hardwarebeschleunigung optimiert sind
  • Beobachtbarkeit für KI: Instrumentelle Inferenzdienste zur Messung von Echtzeit-GPU-Auslastung, Latenzen und Fehlerraten

Ein tieferer Einblick in das Model Serving stellte KServe als zentrale Lösung für das Hosting großer Modelle in der Produktion vor. Die Referenten sprachen über die Bewältigung von GPU-Beschränkungen, die Orchestrierung von Aktualisierungen über mehrere Cluster hinweg und die Aufrechterhaltung einer konsistenten Entwicklererfahrung.

Wichtigste Erkenntnisse:

  • Optimierte GPU-Nutzung: Automatische Skalierung und fortschrittliche Ressourcenplanung zur effizienten Bewältigung von Spitzenanforderungen
  • Versionskontrolle und Rollbacks: Anwendung von GitOps-ähnlichen Mustern für die Modellversionierung zur Risikominderung bei der Aktualisierung von Produktionssystemen
  • Leistungstelemetrie: Integrieren Sie Echtzeit-Metriken, um Cluster-Ressourcen proaktiv anzupassen und Anomalien zu erkennen

In einigen Sitzungen wurde gezeigt, wie Edge Computing mit zentralisierten Cloud-Implementierungen koexistieren kann, indem Tools wie KubeEdge und WasmEdge eingesetzt werden. Die Möglichkeit, kleinere Inferenzaufgaben am Edge auszuführen und gleichzeitig komplexere Trainings- oder LLM-Aufgaben in die Cloud zu verlagern, trägt zu einem ausgewogenen Verhältnis von Leistung, Kosten und Datenlokalität bei.

Wichtigste Erkenntnisse:

  • Konsistente Sicherheit: Einheitliche Richtliniendurchsetzung vom Edge bis zur Cloud gewährleistet Datenintegrität und Compliance
  • Leichtgewichtige Laufzeiten: Wasm-basierte Container bieten geringen Overhead, ideal für ressourcenbeschränkte Edge-Umgebungen
  • Hybride Orchestrierung: Eine einzige Steuerungsebene kann sowohl verteilte Edge-Geräte als auch große Cloud-Cluster nahtlos verwalten

Eine lebhafte Diskussionsrunde befasste sich mit Best Practices für den Einsatz von KI/ML in großem Maßstab. Community-getriebene Projekte wie Kubeflow dienen als Blaupause für die Pipeline-Automatisierung und das Model Lifecycle Management, aber die Diskussionsteilnehmer betonten auch, wie wichtig es ist, die Lösungen auf die individuellen Bedürfnisse des Unternehmens abzustimmen.

Wichtigste Erkenntnisse:

  • Multi-Mandantenschaft: Nutzung von Kubernetes-Namensräumen und rollenbasierter Zugriffskontrolle für eine sichere, gemeinsam genutzte Umgebung
  • Automatisierung: Implementierung von End-to-End-CI/CD für Datenvorverarbeitung, Training und Bereitstellungspipelines
  • Gemeinschaft und Verwaltung: Zusammenarbeit innerhalb von Open-Source-Gemeinschaften bei gleichzeitiger Einführung von organisatorischen Leitplanken

Die Vorträge zur Kubernetes-Planung konzentrierten sich auf GPU-Workloads und HPC-Integrationen. Die Optimierung von KI-Aufträgen erfordert mehr als die einfache Zuweisung von Pods zu Knoten; fortschrittliche Techniken berücksichtigen die Knoten- und GPU-Topologie für einen besseren Durchsatz.

Wichtigste Erkenntnisse:

  • Topologie-bewusste Planung: Tools wie Kueue berücksichtigen Speicherbandbreite, CPU-Affinität und GPU-Beschränkungen
  • GPU-Freigabe: Dynamische Ressourcenzuweisung (DRA) und spezielle Geräte-Plugins verbessern die GPU-Nutzung
  • HPC + Kubernetes: Hybride HPC- und Kubernetes-Modelle sorgen für ein Gleichgewicht zwischen umfangreichem Batch-Training und flexibler Orchestrierung

Die Wahrung des Datenschutzes und der Modellintegrität ist ein wachsendes Anliegen. Vertrauliches Computing und die Durchsetzung von Richtlinien wurden als entscheidend für sensible oder regulierte Branchen hervorgehoben.

Wichtigste Erkenntnisse:

  • Ende-zu-Ende-Verschlüsselung: Schutz der Daten bei der Übertragung und im Ruhezustand durch Enklaven und sichere Schlüsselverwaltung
  • Richtlinie-als-Code: Definieren Sie KI-Governance-Regeln im Code, um eine einheitliche Durchsetzung über den gesamten ML-Lebenszyklus hinweg zu gewährleisten
  • Vertrauenswürdige Ausführung: Kombinieren Sie Kubernetes-Isolierung mit Schutzmaßnahmen auf Hardware-Ebene für kritische Workloads

Einer der zukunftsweisenden Vorträge befasste sich mit der Frage, wie agentenbasierte KI den Aufwand für die Verwaltung von Kubernetes-Ressourcen verringern kann. Durch die Automatisierung der Generierung und Validierung von IaC-Artefakten könnten Entwicklungsteams die Bereitstellungslebenszyklen beschleunigen, ohne die Zuverlässigkeit zu beeinträchtigen.

Wichtigste Erkenntnisse:

  • Automatisch generiertes YAML: Verwendung von KI-Modellen, um Manifest-Updates vorzuschlagen, während menschliche Kontrollen beibehalten werden
  • Versionskontrolle: Speichern Sie AI-generierte Konfigurationen in Git für Transparenz und schnelle Rollbacks
  • Iterative Verbesserung: KI-Tools lernen aus dem Nutzerfeedback, um Vorschläge im Laufe der Zeit zu verfeinern
Kube-Ressource

Weitere Sitzungen befassten sich mit der Komplexität der gemeinsamen Nutzung von Grafikprozessoren für mehrere Aufgaben sowie mit Best Practices für das Benchmarking von verteiltem ML-Training. HPC-Umgebungen können in die Container-Orchestrierung integriert werden, um die Flexibilität für umfangreiche Berechnungen zu erhöhen.

Wichtigste Erkenntnisse:

  • Pooling von GPU-Ressourcen: Verhinderung von Leerlaufzeiten der GPU durch dynamische Zuweisung von Ressourcen an aktive Aufgaben
  • Wiederholbares Benchmarking: Verwendung standardisierter Metriken und Frameworks zur Bewertung der End-to-End-Trainings- oder Inferenzleistung
  • HPC-Zusammenarbeit: Kombinieren Sie HPC-Job-Scheduler mit Kubernetes für einen einheitlichen Ansatz für KI-Forschung und Produktions-Workloads

Schließlich standen Open-Source-Tools zur Erkennung von Verzerrungen und zur Gewährleistung robuster KI-Systeme im Mittelpunkt des Interesses. Die Vorträge konzentrierten sich auf die Echtzeit-Überwachung von Verzerrungen, die Anonymisierung von Trainingsdaten und die Festlegung von Standards für die Erklärbarkeit.

Wichtigste Erkenntnisse:

  • Erkennung von Verzerrungen: Kontinuierliche Bewertung der Modellergebnisse, um systematische Fehler oder Ungerechtigkeiten zu erkennen
  • Erklärbarkeit: Transparente Modellentscheidungen, insbesondere in sensiblen oder regulierten Bereichen
  • Politik und Governance: Definition von Governance-Rahmenwerken zur Gewährleistung der Einhaltung aktueller und neuer KI-Vorschriften
KubeCon 2025 Tag 1 Zusammenfassung: Plattform-Engineering trifft auf KI/ML-Innovation

Tag 1 der KubeCon 2025 zeigte, dass sich Plattform-Engineering und KI/ML-Betrieb zunehmend gegenseitig verstärken. Die gleichen Prinzipien, die robuste, automatisierte und sichere Plattformen antreiben - GitOps, Beobachtbarkeit, Self-Service, Policy-as-Code - treiben auch Innovationen bei der KI- und ML-Bereitstellung voran. Indem sie sich auf Einfachheit, Skalierbarkeit und Sicherheit konzentrieren, können Teams eine interne Entwicklerplattform aufbauen, die alles von Microservice-Rollouts bis hin zu groß angelegten LLM-Schulungen beschleunigt.

Ganz gleich, ob Ihre Priorität in der Rationalisierung von Entwickler-Workflows oder der Bereitstellung ressourcenintensiver KI-Workloads liegt, die Roadmap beinhaltet:

  1. Automatisieren der Pipeline: Verwendung von GitOps und IaC für reproduzierbare und konsistente Aktualisierungen
  2. Alles beobachten: Instrumentenprotokolle, Metriken und Traces über Dienste und Cluster hinweg für tiefgehende Einblicke
  3. Absicherung durch Design: Integrieren Sie Sicherheitsscans, Richtlinienprüfungen und vertrauliche Datenverarbeitung von Anfang an
  4. Skalierung mit Intelligenz: Nutzen Sie fortschrittliches Scheduling und Ressourcenmanagement für komplexe KI-Workloads
  5. Förderung der Zusammenarbeit: Plattformen als Produkte mit Feedback-Schleifen behandeln, die sowohl Entwickler als auch Datenwissenschaftler befähigen

Die Synergie zwischen Plattform-Engineering und KI kann die Art und Weise, wie Unternehmen Cloud-native Systeme entwickeln und betreiben, neu gestalten. Durch die Verschmelzung bewährter DevOps-Praktiken mit den speziellen Anforderungen von KI/ML können Teams die Grenzen von Geschwindigkeit, Effizienz und Innovation verschieben.

Erfahren Sie mehr über den 2. Tag der KubeCon 2025.

Eine Antwort hinterlassen

Newsletter für Tech-Experten

Signal, kein Rauschen –

direkt in Ihren Posteingang.

Schließen Sie sich mehr als 12.000 Ingenieuren und Führungskräften aus der Wirtschaft an, die Praxisberichte zu SRE, DevOps und Cloud-nativer Zuverlässigkeit erhalten.

Tech-Blogs mit tiefgehenden Einblicken und Fallstudien
Neue Technologien, sorgfältig ausgewählt

Ihre geschäftliche E-Mail-Adresse

Wir gehen respektvoll mit Ihrem Posteingang um. Lesen Sie unsere Datenschutzerklärung.

Mehr Beiträge

Compliance sollte bei der Infrastruktur ansetzen Für iGaming-Betreiber wird Compliance oft mit Audits, Dokumentation, Richtlinien und behördlichen Genehmigungen in Verbindung gebracht. Doch viele der Kontrollmaßnahmen, die zur Einhaltung der MGA-Vorschriften, der PCI-Standards … erforderlich sind,
Lesen
Die sichere Verwaltung von Geheimnissen in Kubernetes stellt eine entscheidende Herausforderung für moderne Cloud-native Umgebungen dar. Anmeldedaten für Anwendungen, Zertifikate, private Schlüssel und Passwörter müssen auf sichere und nachverfolgbare Weise verwaltet werden, ...
Lesen
Kontakt aufnehmen
ITGix bietet Ihnen fachkundige Beratung und maßgeschneiderte DevOps-Services, um Ihr Unternehmenswachstum zu beschleunigen.
Newsletter für
Technik-Experten
Schließen Sie sich 12.000+ Geschäftsführern und Ingenieuren an, die Blogs, e-Books und Fallstudien Fallstudien über neue Technologie erhalten.