Deine Aufgaben mit Perspektiven
- Du begleitest und gestaltest die Transformation unseres KI- und Cloud-Technologie-Umfeldes (Kubernetes onPrem + Cloud und Databricks) und kümmerst dich um die automatisierte Bereitstellung von Cloud-nativen Services mithilfe von Infrastructure-as-code.
- Du pflegst und optimierst die CI/CD Pipelines unserer Teams und implementierst sowie pflegst Monitoring-, Logging- und Alerting-Lösungen (z.B. Prometheus, Grafana, CheckMK).
- Du übernimmst Verantwortung für das Deployment und den Betrieb von Container-Applikationen und sorgst für eine zuverlässige Orchestrierung (GPU-Ressourcenmanagement).
- Du bist zuständig im Incident- und Problemmanagement im Rahmen des 2nd-Levelsupport / Schnittstelle zum Herstellersupport und stellst die Betriebssicherheit, Auslieferungsgeschwindigkeit sowie die Qualität über den gesamten Produktlebenszyklus hinweg sicher.
- Du arbeitest eng mit den Entwicklungsteams zusammen, um SRE-Prinzipien zu etablieren und sicherheitsrelevante Aspekte in der Infrastruktur zu berücksichtigen.