Die vier Stufen von KI-Integration

Nicht jede KI-Integration ist eine agentische Applikation. Die folgende Einteilung ist unser eigenes Erklärmodell, kein Branchenstandard. Sie hilft beim Einordnen und ist identisch mit der in KI-Agenten und ChatGPT im Vergleich:

Stufe 1: KI-Assistent. Ein eigenständiges Werkzeug: manuelle Eingabe, manuelle Auslösung, das Ergebnis geht zurück an den Menschen. Typisch: ein Chat im Browser, Copilot in Word. Kein Agent, aber für viele Betriebe der Einstieg.

Stufe 2: KI-Funktion in Software. KI ist als Baustein in eine Applikation eingebettet. Ein Textvorschlag im CRM, eine automatische Kategorisierung von E-Mails, ein Anomalie-Alert im ERP. Hierher gehört auch die Verarbeitung größerer Datenmengen im Hintergrund: der Nacht-Batch, der Lieferantenrechnungen analysiert und Abweichungen markiert. Ausgelöst wird durch eine Nutzeraktion oder einen Zeitplan; entschieden wird vom Menschen.

Stufe 3: KI-Workflow. Mehrere Schritte in Sequenz: Daten einlesen, analysieren, priorisieren, Bericht erstellen. Der Mensch gibt das Ziel vor und prüft das Ergebnis, Zwischenschritte laufen automatisch. Für viele gut gebaute KI-Applikationen ist das heute die passende Stufe.

Stufe 4: Agentische Applikation. Das System verfolgt ein Ziel eigenständig über mehrere Werkzeuge und Datenquellen hinweg, trifft Zwischenentscheidungen nach definierten Regeln und eskaliert nur bei Ausnahmen an den Menschen. Das Ziel wird einmal gesetzt, der Weg dorthin ist autonom.

Was eine agentische Applikation konkret unterscheidet

Drei Merkmale, die Stufe 4 von Stufe 3 unterscheiden:

Eigene Werkzeugnutzung. Die Applikation entscheidet selbstständig, welche Werkzeuge sie für einen Schritt braucht. Nicht: Der Entwickler hat die Sequenz hartcodiert. Sondern: Das System wählt aus einem definierten Werkzeugset den richtigen nächsten Schritt.

Persistentes Ziel. Die Applikation arbeitet auf ein Ziel hin, auch wenn Zwischenergebnisse unerwartet sind. Wenn eine Schnittstelle nicht antwortet, probiert sie eine Alternative. Wenn ein Dokument nicht gefunden wird, sucht sie nach Äquivalenten. Das ist kein starres Skript. Es ist eine Zielstruktur.

Definierter Eskalationspfad. Das System weiß, wann es eskalieren soll. Nicht jede Ausnahme ist vorhersehbar, aber die Klassen von Ausnahmen (außerhalb des definierten Rahmens, Konfidenz unter Schwellwert, menschliche Genehmigung erforderlich) sind definiert. Bei Eskalation stoppt das System, benachrichtigt und wartet.

Anti-Pattern: Eine agentische Applikation ohne Eskalationspfad ist kein Fortschritt, sondern ein Risiko. Ein System, das bei unerwarteten Eingaben einfach weitermacht, produziert im besten Fall unsinnige Ergebnisse, im schlechtesten Fall folgenreiche Fehler, ohne dass ein Mensch eingreifen konnte.

Drei Anwendungsfälle, die im Mittelstand produktionsreif sind

Ein Hinweis vorweg: Die folgenden Abläufe lassen sich teilweise auch als Stufe-3-Workflow bauen. Wiederholung allein belegt keinen Agentenbedarf: Ein wiederkehrender Ablauf mit festen Regeln ist oft mit klassischer Automatisierung günstiger und robuster gelöst. Stufe 4 lohnt dort, wo der Weg zum Ziel nicht vorab festgelegt werden kann.

Ausschreibungs-Monitoring für projektbasierte Betriebe. Ein Bauunternehmen, ein Planungsbüro, ein IT-Dienstleister: Alle haben dieselbe Herausforderung: Ausschreibungsplattformen, Vergabemarktplatz und regionale Bekanntmachungen manuell zu überwachen kostet Zeit. Eine agentische Applikation überwacht täglich, klassifiziert nach Relevanz (Branche, Region, Volumen, Vergabeform), extrahiert Fristen und Anforderungen und erstellt eine priorisierte Liste. Die Entscheidung, ob und wie zu bieten ist, bleibt beim Menschen. Der Aufwand für die Vorselektion entfällt.

Controlling-Reporting mit Anomalie-Erkennung. Das Closing-Team schließt den Monat ab, ERP-Daten sind verfügbar. Die Applikation zieht die Daten aus ERP und Banksystem, konsolidiert nach Kostenstellen, berechnet Abweichungen gegen Plan und Vorjahr, bewertet sie nach vordefinierten Schwellwerten und erstellt den Management-Report inklusive Kommentar für Abweichungen über Schwellwert. Der Controller prüft, ergänzt wo nötig und gibt frei.

Bankreporting für kapitalmarktnahe Mittelständler. Quartalsweises Compliance-Reporting an die Hausbank: strukturiertes Einsammeln der aktuellen Zahlen aus ERP und Banksystem, Berechnung der vereinbarten Financial Covenants, Formatierung nach dem vereinbarten Template, Versand, mit dokumentiertem Protokoll für jeden Berechnungsschritt. Wie viel Zeit das spart, hängt daran, wie strukturiert die Ausgangsdaten vorliegen; miss das im Pilot, statt es zu schätzen.

Wann sich Stufe 4 rechnet

Nicht jeder Prozess ist ein Kandidat für Stufe 4. Die Entscheidungsmatrix:

Ja zu agentischer Applikation, wenn:

  • Der Prozess ist wiederkehrend (mindestens wöchentlich)
  • Mehrere Datenquellen sind beteiligt
  • Die Entscheidungslogik ist explizit beschreibbar, der Weg zum Ziel aber nicht vorab festlegbar
  • Der manuelle Aufwand je Durchlauf ist erheblich: Rechne den konkreten Wert aus, statt eine Schwelle zu übernehmen
  • Fehler im Prozess sind erkennbar und kategorisierbar

Nein zu agentischer Applikation, wenn:

  • Der Prozess läuft seltener als monatlich
  • Der Ablauf ist vollständig durch feste Regeln beschreibbar, dann reicht ein Workflow
  • Die Entscheidungslogik ist stark kontextabhängig und nicht explizit beschreibbar
  • Das Ergebnis erfordert menschliches Urteil ohne definierte Regeln
  • Der Aufwand für Setup und Wartung übersteigt die Einsparung im betrachteten Zeitraum

Die Faustregel: Wenn ein neuer Mitarbeiter den Prozess nach einer schriftlichen Anleitung ohne Rückfragen ausführen könnte, ist er ein Kandidat für Automatisierung. Ob Workflow oder Agent, entscheidet die Frage, ob der Weg zum Ziel jedes Mal derselbe ist.

Die Rolle des Menschen in Stufe 4

Agentische Applikationen ersetzen keine Menschen. Sie verlagern deren Aufgabe: weg von der manuellen Ausführung, hin zur Überwachung, Konfiguration und Ausnahme-Entscheidung.

Das ist nicht trivial. Es bedeutet, dass Mitarbeitende neue Fähigkeiten brauchen: das System zu konfigurieren, Eskalationen richtig zu beurteilen, Ergebnisse zu validieren statt zu produzieren. Diese Verschiebung muss aktiv begleitet werden. Sie passiert nicht automatisch, nur weil die Technik da ist.

Für die Compliance-Perspektive lohnt der Blick auf die Rollen: Art. 14 EU AI Act verpflichtet die Anbieter, Hochrisiko-Systeme so zu gestalten, dass eine wirksame menschliche Aufsicht möglich ist. Was du als Betreiber tun musst, steht in Art. 26: die Aufsicht kompetenten Personen zuweisen, den Betrieb beobachten und die automatisch erzeugten Protokolle aufbewahren. Eine sauber gebaute agentische Applikation mit definierten Eskalationspunkten und Protokollierung schafft dafür die Voraussetzungen. Die Pflichten selbst erfüllst du durch Zuweisung, Beobachtung und Dokumentation.

Protokollierung als Grundausstattung

Eine agentische Applikation ohne Protokoll ist nicht produktionsreif. Was protokolliert werden muss:

  • Welches Ziel wurde gesetzt, von wem, wann
  • Welche Werkzeuge wurden in welcher Reihenfolge eingesetzt
  • Welche Zwischenergebnisse wurden erzeugt
  • Welche Entscheidungen wurden getroffen (mit Konfidenz-Wert, falls verfügbar)
  • Welche Eskalationen wurden ausgelöst, und wie wurden sie behandelt
  • Was ist das finale Ergebnis

Zwei Anforderungen gehören dabei auseinandergehalten: Manipulationsschutz heißt, dass Einträge nachträglich nicht änderbar sind und Zugriffe auf berechtigte Rollen begrenzt bleiben. Aufbewahrung ist etwas anderes: Löschfristen werden gesondert festgelegt und dokumentiert. Ein manipulationsgeschütztes Protokoll ist kein Grund, Daten unbegrenzt zu behalten.

Der Trail ist nicht primär für Behörden. Er ist für den Betrieb. Wenn etwas schiefläuft, braucht das Team einen Nachvollzug. Wenn das System optimiert werden soll, braucht das Team Daten. Wenn ein Audit kommt, hat das Team Nachweise.

Der Business Case

Nach unserer Erfahrung amortisieren sich die Entwicklungskosten einer produktionsreifen agentischen Applikation in der Größenordnung von sechs bis achtzehn Monaten, bei wöchentlichen Prozessen eher am unteren Ende, bei monatlichen eher am oberen. Das ist ein Erfahrungswert, keine Zusage: Er setzt voraus, dass der Prozess klar definiert ist und das Setup nicht durch unklare Anforderungen vervielfacht wird. Rechne den Fall mit deinen eigenen Zahlen durch, bevor du entscheidest.

Ein Unterschied zur klassischen Software-Entwicklung ist beobachtbar: Anpassungen an der Logik (neue Schwellwerte, neue Datenquellen, neue Formate) liegen in agentischen Systemen häufiger in der Konfigurationsschicht als im Code. Was früher ein Entwickler-Ticket war, kann dann ein Konfigurationsschritt werden.

Wie AthenaRun baut

Wir bauen agentische Applikationen nach drei Prinzipien:

Definierter Scope vor erstem Code. Welche Prozessschritte übernimmt der Agent, welche nicht? Welche Werkzeuge hat er, welche nicht? Welche Entscheidungen trifft er, welche eskaliert er? Das ist nicht bürokratisch. Das ist die Grundlage dafür, dass das System korrekt funktioniert und korrekt überwacht werden kann.

Protokollierung als Architektur-Entscheidung. Nicht als nachträgliches Feature. Das bedeutet: manipulationsgeschützte Protokollierung von Anfang an, exportierbar, für interne Teams lesbar, mit festgelegten Löschfristen. Das unterstützt die Nachvollziehbarkeit und die Erfüllung einschlägiger Nachweispflichten. Kompetenzmaßnahmen nach Art. 4 EU AI Act, Rollenklärung, Risikoeinstufung und weitere rechtliche Anforderungen werden davon getrennt umgesetzt.

Iterative Delivery. Erste Version: Stufe 3. Zweite Version: Stufe 4 mit manueller Freigabe an kritischen Stellen. Dritte Version: vollständig agentisch mit bewährtem Eskalationspfad. Nicht alles auf einmal. Erst beweisen, dass das System zuverlässig ist, dann die Autonomie erhöhen.

Wenn du wissen willst, welche deiner Prozesse heute schon Stufe-4-Kandidaten sind: Erstgespräch buchen, 30 Minuten, kostenfrei.

Stand: 16.09.2026 · AthenaRun GmbH, Frankfurt am Main


Weiterlesen im Wissen-Hub