Sie bauen Ihren eigenen Agenten für die Incident-Behebung?

Sie bauen Ihren eigenen Agenten für die Incident-Behebung?

Sie bauen Ihren eigenen Agenten für die Incident-Behebung?

Claude Code für SRE

Claude Code oder KI-SRE-Agent: selbst bauen oder kaufen?

Hyground ist ein KI-SRE-Agent, der in Ihrem Cluster läuft. Er beginnt mit der Untersuchung, sobald ein Alert ausgelöst wird, nutzt nur die Berechtigungen, die Ihr Admin freigibt, protokolliert jeden Tool-Aufruf und stützt sich auf Ihre Runbooks. Claude Code ist ein Coding-Agent, der auf dem Rechner eines Engineers läuft und auf alles zugreifen kann, was dieser Rechner erreicht.

Claude Code für SRE

Claude Code oder KI-SRE-Agent: selbst bauen oder kaufen?

Hyground ist ein KI-SRE-Agent, der in Ihrem Cluster läuft. Er beginnt mit der Untersuchung, sobald ein Alert ausgelöst wird, nutzt nur die Berechtigungen, die Ihr Admin freigibt, protokolliert jeden Tool-Aufruf und stützt sich auf Ihre Runbooks. Claude Code ist ein Coding-Agent, der auf dem Rechner eines Engineers läuft und auf alles zugreifen kann, was dieser Rechner erreicht.

Claude Code für SRE

Claude Code oder KI-SRE-Agent: selbst bauen oder kaufen?

Hyground ist ein KI-SRE-Agent, der in Ihrem Cluster läuft. Er beginnt mit der Untersuchung, sobald ein Alert ausgelöst wird, nutzt nur die Berechtigungen, die Ihr Admin freigibt, protokolliert jeden Tool-Aufruf und stützt sich auf Ihre Runbooks. Claude Code ist ein Coding-Agent, der auf dem Rechner eines Engineers läuft und auf alles zugreifen kann, was dieser Rechner erreicht.

Im direkten Vergleich

Hyground vs Claude Code: ein KI-SRE-Agent und ein Coding-Agent

Hyground ist für den On-Call-Einsatz entwickelt, Claude Code für das gemeinsame Programmieren mit einem Engineer am Rechner.

Angaben zu Claude Code laut Dokumentation von Anthropic, abgerufen am 25. September 2026. Die Einstufungen "Research Preview" und "Beta" stammen von Anthropic.
Was der On-Call-Betrieb brauchtHygroundClaude Code
Worauf der Agent zugreifen kannNur auf die Systeme, die Ihr Admin anbindet, mit den Rechten, die Ihr Admin festlegt, nie über die persönlichen Konten eines Engineers. Die Zugangsdaten bleiben in den Adaptern und gelangen nie in die Sandbox des Agenten.Seine Shell-Befehle laufen mit den eigenen Rechten des Engineers. Selbst in der optionalen Sandbox dürfen Befehle standardmäßig Dateien mit Zugangsdaten wie ~/.aws/credentials und ~/.ssh lesen, und sie übernehmen die Tokens aus der Shell. Was ausgeführt wird, entscheiden Berechtigungsregeln und im Auto-Modus ein Klassifikator.
Wie eine Untersuchung startetVon selbst, sobald ein Alert-Webhook eingeht, nach Zeitplan oder aus Slack, Teams, E-Mail oder der Web-App.Auf Prompt eines Engineers oder aus einem Skript oder CI-Job heraus. Routines, noch eine Research Preview, nehmen API-Aufrufe Ihres Monitoring-Tools an.
Wo der Agent läuftIn Ihrem Kubernetes-Cluster, installiert per Helm-Chart: EKS, AKS, GKE, OpenShift, K3s oder on-premises.Auf einem Laptop, einem CI-Runner oder in einer Cloud-Session auf der Infrastruktur von Anthropic. Cloud-Sessions auf Ihren eigenen Runnern gibt es als Beta.
Was beim Modellanbieter ankommtPrompts und Tool-Ergebnisse gehen nur an das Modell Ihrer Wahl, und Hyground erhält sie nie. Mit einem selbst gehosteten Modell verlassen keine Betriebsdaten die eigene Infrastruktur.Prompts und Tool-Ergebnisse gehen an Anthropic, Amazon Bedrock, Google Vertex AI oder Microsoft Foundry. Anthropics eigene API bietet Inferenz global oder nur in den USA.
Änderungen in der ProduktionStandardmäßig nur lesend. Änderungen an der Infrastruktur sind erst möglich, wenn Sie sie aktivieren.Gesteuert über Berechtigungsregeln. Der Auto-Modus blockiert Produktions-Deployments standardmäßig, garantiert laut Anthropic aber keine Sicherheit.
Wissen über Ihre SystemeRunbooks und Dokumentation aus Confluence, Git und hochgeladenen Dateien, dazu Team-Skills und der Rückgriff auf frühere Sessions.CLAUDE.md-Dateien, Skills und alles, was der Engineer in die Session mitbringt.
Was protokolliert wirdJede Nachricht, jeder Tool-Aufruf und jedes Ergebnis wird pro Session gespeichert und lässt sich exportieren. Die Plattform schreibt das Audit-Log, nicht der Agent.Lokale Transkripte pro Nutzer, Verlauf der Cloud-Sessions, OpenTelemetry-Export und im Enterprise-Plan eine Compliance API.
Wer ihn nutzen kannDas ganze Team, über Slack, Teams, E-Mail oder die Web-App, mit Anmeldung über Ihr Single Sign-on.Engineers mit einem Claude-Seat oder API-Zugang und einem eingerichteten Client.
Welche Modelle er nutzen kannModelle jedes Anbieters über LiteLLM, Claude eingeschlossen, oder ein Modell, das Sie selbst hosten.Nur Claude. Anthropic unterstützt es nicht, Claude Code auf andere Modelle umzuleiten.
PreismodellPreis nach Größe der Infrastruktur, nicht nach Nutzerlizenzen. Die Modell-Tokens rechnen Sie mit Ihrem Anbieter ab.Pro Seat oder pro Token.

Das Sicherheitsrisiko

Claude Code läuft mit den Produktionszugängen auf Ihrem Laptop

On-Call heißt, Logs, Alerts und Tickets zu lesen, die andere Menschen und Systeme schreiben, und das auf einem Rechner mit Produktionszugangsdaten.

Warum Hyground

Was ein KI-SRE-Agent leistet und ein Coding-Agent nicht

Die Bausteine für den On-Call-Einsatz: fertig entwickelt und in Ihrem Cluster in Betrieb.

Selbst bauen oder kaufen

Was ein SRE-Agent auf Basis von Claude in Aufbau und Betrieb kostet

Die Tokens stehen auf der Rechnung, doch den größten Teil der Kosten eines selbst gebauten Agenten macht die Entwicklungsarbeit rundherum aus.

KostenHygroundEigenbau auf Claude
Modell-TokensPro Token an den Modellanbieter Ihrer Wahl, im Rahmen Ihres eigenen Vertrags.Pro Token an Anthropic oder Ihren Cloud-Anbieter. Im SREGym-Benchmark verbrauchte Claude Code 1,81-mal so viele Tokens wie ein speziell entwickelter SRE-Agent mit demselben Modell.
AufbauEin Pilot in Ihrem Cluster. Weitere Konnektoren, die Sie brauchen, bauen unsere Engineers während der Einführung gemeinsam mit Ihnen.Unsere Schätzung: 5 bis 7 Senior Engineers für etwa ein Jahr, bis der Agent produktionsreif ist.
Laufender BetriebHyground liefert die Releases und pflegt die Integrationen.Ein festes Team für Modell-Upgrades, Änderungen an MCP und APIs sowie neue Integrationen.
Qualität der Antworten prüfenWir benchmarken Open-Weight-Modelle laufend und validieren jeden Modellanbieter.Ein Testset aus Ihren früheren Incidents, das nach jeder Änderung am Modell oder an den Prompts erneut läuft.
Security-ReviewEine einzige Plattform, standardmäßig nur lesend und nach ISO/IEC 27001:2022 zertifiziert, mit einem Jailbreak-Schutz für sechs Angriffskategorien, einem separaten Alert-Injection-Prüfer und Secrets, die geschwärzt werden, bevor das Modell sie sieht.Ein neues System mit Lesezugriff auf die Produktion, das von Grund auf geprüft werden muss. Seine Eingaben wie Logs, Alerts und Tickets sind nicht vertrauenswürdig.
PreismodellPreis nach Größe der Infrastruktur, nicht nach Nutzerlizenzen. Angebot auf Anfrage.Tokens, Hosting und Gehälter für die Entwicklung.

Der Weg zum Eigenbau

Was die SRE-Agent-Cookbooks von Anthropic liefern und was der Produktivbetrieb zusätzlich braucht

Anthropic hat zwei Anleitungen für SRE-Agenten veröffentlicht, eine auf Basis des Claude Agent SDK, eine auf Basis von Claude Managed Agents. Beide sind ein guter Ausgangspunkt, und beide benennen, was sie Ihnen überlassen.

Quelle: Claude Cookbook und Dokumentation zu Managed Agents von Anthropic, abgerufen am 25. September 2026.
CookbookThe site reliability agentSRE incident responder
BasisClaude Agent SDKClaude Managed Agents (Beta)
Veröffentlicht16. Februar 202610. April 2026
Was es tutUntersucht eigenständig einen Incident, findet die Ursache, spielt einen Fix ein und dokumentiert das Ergebnis.Nimmt eine Alarmierung entgegen, liest die Logs und öffnet einen Pull Request, der das befolgte Runbook zitiert.
TestsystemEin lokaler Docker-Stack mit einem eingebauten Fehler: ein Datenbank-Connection-Pool, der von 20 Verbindungen auf 1 reduziert ist. Alerts und Deployments sind simuliert.PagerDuty, GitHub und Datadog werden durch lokale Dateien simuliert, und das Infrastruktur-Repository besteht aus einem einzigen Manifest.
SchutzmechanismenShell-Befehle nur für docker, Validierungs-Hooks und ein eigener Schritt, damit ein Mensch die Diagnose vor jedem Fix prüfen kann.Ein Skill, der das Patchen laufender Ressourcen verbietet und jeden Fix über einen Pull Request leitet.
Was Ihnen bleibtMCP-Server für Kubernetes, Slack, Confluence und Ihren Observability-Stack, dazu das Wissen über Ihre Infrastruktur, das dem Agenten fehlt.Die Simulationen durch GitHub MCP, einen Freigabe-Button in Slack und echte Logs ersetzen. Dienste, die nur in Ihrem eigenen Netz erreichbar sind, brauchen selbst gebaute Tools. MCP-Tunnel dorthin sind eine Research Preview.

Was wir ergänzen würden, bevor wir den Agenten On-Call-tauglich nennen

Laut Managed-Agents-Cookbook ist der Agent nach diesen drei Ersetzungen "bereit für On-Call". Wir würden vorher vier Dinge ergänzen: eine Service-Identität mit begrenzten Rechten statt API-Keys in der Umgebung, eine Prüfung eingehender Alerts auf Prompt Injection, den Zugriff auf Ihre Runbooks und früheren Incidents sowie Tests anhand Ihrer eigenen Incident-Historie, die bei jedem Modellwechsel erneut laufen.

Die Entscheidung

Wann Sie Hyground einsetzen und wann Sie selbst auf Claude aufbauen

Eine Anmerkung zu Claude Code

Was Claude Code besser kann

Für die Arbeit direkt am Rechner ist Claude Code das bessere Werkzeug. Er schreibt den Fix als Pull Request oder als Konfigurationsänderung zur Prüfung und bindet Datadog, Sentry, PagerDuty und Grafana über deren offizielle MCP-Server an. In SREGym, einem Benchmark der UIUC und der University of Toronto vom Juli 2026, erreichte Claude Code die höchste End-to-End-Erfolgsquote der getesteten Agenten, vor Codex und vor einem speziell entwickelten SRE-Agenten mit demselben Modell. Über Anthropics Routines, die noch als Research Preview laufen, kann ein Monitoring-Tool Claude Code starten.

FAQ

Claude Code und KI-SRE-Agenten: häufige Fragen

Worin unterscheidet sich ein KI-SRE-Agent von Claude Code?

Ein KI-SRE-Agent wie Hyground ist für den On-Call-Einsatz entwickelt. Er startet, sobald ein Alert ausgelöst wird, arbeitet mit den Rechten, die Ihr Admin festlegt, protokolliert jeden Schritt und stützt sich auf Ihre Runbooks. Claude Code ist ein Coding-Agent, der eine Untersuchung startet, wenn ein Engineer ihn beauftragt, und zwar mit dessen Rechten. Seine Stärke liegt darin, den Fix zu schreiben.

Kann ich Claude Code als SRE-Agenten einsetzen?

Ja, wenn ein Engineer danebensitzt. Soll Claude Code selbstständig On-Call übernehmen, müssen Sie die Alert-Trigger, eine Service-Identität, einen Audit-Trail und das Wissen über Ihre Systeme selbst aufbauen. Die Routines von Anthropic, über die ein Monitoring-Tool eine Session starten kann, sind noch eine Research Preview. Datadog, Sentry, PagerDuty und Grafana bindet Claude Code über MCP an.

Ist Claude Code im Produktivbetrieb ein Sicherheitsrisiko?

Es kann eines sein. Claude Code hat Zugriff auf alles, was der Rechner des Engineers erreicht, und selbst in seiner optionalen Sandbox dürfen Befehle standardmäßig Dateien mit Zugangsdaten wie ~/.aws/credentials und ~/.ssh lesen. Anthropic bietet Deny-Regeln, Managed Settings und einen Klassifikator, der Produktions-Deployments standardmäßig blockiert. Laut Anthropic garantiert der Auto-Modus aber keine Sicherheit, und der Hersteller rät davon ab, nicht vertrauenswürdige Inhalte direkt an Claude weiterzuleiten. Logs, Alerts und Tickets sind genau solche Inhalte.

Was entsteht mit Anthropics Cookbook "The site reliability agent", und reicht das für den Produktivbetrieb?

Es beschreibt einen Agenten auf Basis des Agent SDK, der einen lokalen Docker-Stack untersucht, einen eingebauten Fehler findet und ihn behebt. Laut Anthropic bräuchte der Produktivbetrieb MCP-Server für Kubernetes, Slack, Confluence und Ihren Observability-Stack, dazu Wissen über Ihre Infrastruktur, das der Agent nicht hat. Als Vorlage für einen Eigenbau eignet es sich.

Claude Agent SDK oder Claude Code: worauf sollte ein SRE-Agent aufbauen?

Das Agent SDK ist die Agentenschleife von Claude Code als Bibliothek für Python oder TypeScript und damit die Basis, auf der man einen Dienst baut. Claude Code ist das interaktive Werkzeug. In beiden Fällen betreiben Sie langlebige Agentenprozesse und bauen Trigger, Zugriffskontrolle und Protokollierung selbst.

Kann Hyground Claude-Modelle nutzen?

Ja. Hyground bindet sein Modell über LiteLLM an. Hyground läuft also mit Claude über Anthropic, Amazon Bedrock oder Google Vertex AI, ebenso mit OpenAI, Gemini, Azure OpenAI oder einem Modell, das Sie selbst hosten. Für den vollen Funktionsumfang braucht es ein Modell auf dem aktuellen Stand der Technik.

Funktioniert Hyground mit Claude Code?

Ja. Hyground bietet einen optionalen MCP-Server, über den sich Claude Code, Cursor, GitHub Copilot und Kiro verbinden können. Engineers können Hyground-Untersuchungen aus ihrem Coding-Agenten starten und einsehen, und jede Session bleibt ihrem Single-Sign-on-Login zugeordnet.

Kann Claude Code air-gapped oder on-premises laufen?

Die CLI läuft auf Ihren eigenen Rechnern, braucht aber immer einen Claude-Endpoint: die API von Anthropic, Amazon Bedrock, Google Vertex AI oder Microsoft Foundry. Andere Modelle unterstützt Anthropic nicht, einen Offline-Modus dokumentiert der Hersteller ebenfalls nicht. Hyground läuft in Ihrem Cluster und kann mit einem selbst gehosteten Modell vollständig air-gapped betrieben werden.

Was kostet es, einen KI-SRE-Agenten selbst auf Basis von Claude zu bauen?

Die Tokens sind der kleinere Teil der Kosten. Wir schätzen den Aufwand auf 5 bis 7 Senior Engineers für etwa ein Jahr bis zur Produktionsreife, danach braucht es ein festes Team, das mit den Änderungen an Modellen, MCP und APIs Schritt hält. Hyground berechnet den Preis nach Größe der Infrastruktur, nicht nach Nutzerlizenzen, und die Modell-Tokens rechnen Sie direkt mit Ihrem Anbieter ab.

Nutzt Anthropic Claude für SRE im Produktivbetrieb?

Die Engineers von Anthropic nutzen Claude Code bei Incidents und berichten von handfesten Erfolgen: Fragen zum Kontrollfluss beantworten sie während eines Incidents dreimal so schnell. Ein Reliability Engineer von Anthropic sagte im März 2026 auf der QCon London, Claude übernehme die Incident-Response des Teams nicht, weil das Modell Korrelation mit Kausalität verwechsle.

Weiterlesen

Mehr zur Frage: selbst bauen oder kaufen?

Hyground in Aktion erleben