Agentic Engineering Reifegradmodell

Von der einzelnen Aufgabe zum adaptiven Produktsystem

Die sieben Level beschreiben die größte Einheit, die sich verlässlich delegieren lässt. Sie messen weder Modellintelligenz noch die Anzahl installierter Tools. Jede Stufe braucht eigene Evidenz, Grenzen und menschliche Verantwortung.

Die kurze These

Autonomie wächst nicht durch Behauptung. Sie wächst, wenn ein kleinerer Loop wiederholt funktioniert, sichtbar scheitert und sicher fortgesetzt oder gestoppt werden kann.

Die Progression

Jede Stufe erweitert den verlässlich geschlossenen Loop.

Höhere Level bauen auf belegten niedrigeren Leveln auf. Bewertet wird jeder konkrete Entscheidungsbereich getrennt, nicht das Team als Ganzes. Wo Rechte, Recovery oder Evidenz schwächer sind, begrenzt diese Dimension die sichere Stufe.

  1. 01

    Level 1: direkt begleitete Aufgabe

    System
    Ein Agent unterstützt eine klar begrenzte Aufgabe in einer Sitzung.
    Mensch
    Ein Mensch beschreibt die Aufgabe, liefert Kontext und prüft das Ergebnis direkt.
    Mindestevidenz
    Eine repräsentative Aufgabe gelingt unter direkter Aufsicht.
  2. 02

    Level 2: wiederholbares Verfahren

    System
    Versionierte Anweisungen oder Skills stabilisieren eine wiederkehrende Methode.
    Mensch
    Ein Mensch wählt das Verfahren, überwacht die Ausführung und bewertet wiederholte Ergebnisse.
    Mindestevidenz
    Wiederholte Durchläufe schlagen unstrukturiertes Prompting an relevanten Beispielen.
  3. 03

    Level 3: lebendes Repository

    System
    Kontext, Entscheidungen, Prüfungen und Lernen bleiben über Sitzungen hinweg erhalten.
    Mensch
    Menschen verantworten Absicht und wesentliche Entscheidungen. Agenten pflegen begrenzte Repository-Artefakte.
    Mindestevidenz
    Kontext, Verantwortliche, schnelle Prüfungen, vollständige Gates und Lernen sind auffindbar.
  4. 04

    Level 4: evidenzbasiertes System

    System
    Quellen und Werkzeuge liefern nachvollziehbare Evidenz und kontrollierte externe Aktionen.
    Mensch
    Menschen setzen Zugriffs- und Autoritätsgrenzen und entscheiden folgenreiche externe Wirkungen.
    Mindestevidenz
    Quellen, Rechte, Aktualität, Fehlerpfade und Audit-Nachweise sind explizit.
  5. 05

    Level 5: zustandsbehafteter Workflow

    System
    Ein begrenzter End-to-End-Workflow hält Zustand, wartet gezielt, versucht erneut, erholt sich oder stoppt.
    Mensch
    Menschen gestalten Grenzen und übernehmen Ausnahmen, statt jeden nächsten Schritt zu terminieren.
    Mindestevidenz
    Wiederholte Läufe sind beobachtbar, wiederherstellbar, gleichen verpassten Fortschritt ab, sind wo nötig idempotent, sicher stoppbar und an Outcomes bewertet.
  6. 06

    Level 6: regelbasierter Wertstrom

    System
    Das System führt Signale innerhalb klarer Ziele und Risikogrenzen bis zu Produktionsevidenz und der nächsten Entscheidung.
    Mensch
    Menschen steuern Ziele und Risiken, behalten Veto und Incident-Verantwortung und greifen bei Ausnahmen ein.
    Mindestevidenz
    Isolation, Policy- und Qualitätsgates, Rollback, Audit, Incident Ownership, Produktionsfeedback und wirksame Aufsicht sind belegt.
  7. 07

    Level 7: adaptives Produktsystem

    System
    Das System wählt innerhalb eines begrenzten Entscheidungsraums Probleme, Experimente und Investitionen aus vertrauenswürdigen Signalen und lernt aus Outcomes.
    Mensch
    Menschen verantworten Strategie, Budgets, Entscheidungsräume, Abbruchkriterien und das Stopprecht.
    Mindestevidenz
    Level-6-Kontrollen, vertrauenswürdige Produktsignale, Daten- und Experimentgrenzen, Budgets, Abbruchkriterien und menschlich verantwortete Investitionsentscheidungen sind belegt.

Kein Statusmodell

Nicht jede Arbeit muss Level 7 erreichen.

Eine klar begrenzte Aufgabe ist auf Level 1 richtig aufgehoben. Ein wiederkehrender Workflow kann auf Level 5 vollständig sein. Entscheidend ist nicht die höchste Zahl, sondern ob Delegation, Risiko und Evidenz zur Aufgabe passen.

Mehr als Technik

Ab Level 5 verändert Autonomie das Arbeitssystem.

Verantwortung wird neu geschnitten.

Menschen führen weniger Einzelschritte aus. Sie gestalten Ziele, Regeln, Entscheidungskompetenz, Ausnahmen und Eskalation.

Evidenz ersetzt Freigabetheater.

Tests, Richtlinien, Beobachtbarkeit, Rollback und Outcome-Signale tragen Routineentscheidungen. Menschen prüfen neue Semantik und materielles Risiko.

Produkt, Delivery und Betrieb werden ein Loop.

Signale werden eingeordnet, als kleine Experimente umgesetzt, im Betrieb beobachtet und für die nächste Investitionsentscheidung genutzt.

Beleg und Zielbild

Die Grenze zwischen heute und morgen bleibt sichtbar.

Mein öffentliches Agentic Engineering Harness belegt wiederverwendbare Methoden, Skills, Regeln und Prüfungen. Die private Implementierung belegt den Betrieb über reale Repositories. Value Pipeline ist das kommerzielle Zielbild für Level 7 und noch in Entwicklung.

Agentic-Arbeitsmodell ansehen

Welcher Loop ist in deinem System heute wirklich delegierbar?

Wir starten nicht bei Level 7. Wir starten bei einem wiederkehrenden Engpass, einer klaren Grenze und der kleinsten Stufe, die messbar mehr Wirkung schafft.