Warum ein KI-Agent ein eigenes Lastenheft braucht

80 Prozent der befragten Unternehmen haben erlebt, dass ihre KI-Agenten Dinge getan haben, die niemand wollte. Das zeigt eine globale Befragung, die SailPoint im Mai 2025 veröffentlicht hat. Ein Lastenheft für einen KI-Agenten legt deshalb nicht nur fest, was der Agent erledigen soll, sondern genauso, was er nie tun darf.

Bei einem fest programmierten Ablauf sind die Schritte vorgegeben. Ein KI-Agent entscheidet selbst, welchen Schritt er als Nächstes geht. Das Lastenheft legt den Rahmen fest, in dem er das darf.

Die Zahlen aus der Befragung von 353 IT- und Sicherheitsfachleuten sind konkret: 39 Prozent der Befragten berichten von Zugriffen auf Systeme, für die der Agent nicht gedacht war, 23 Prozent davon, dass sich ein Agent Zugangsdaten hat entlocken lassen. Gleichzeitig berichten nur 44 Prozent von Richtlinien, mit denen sie ihre Agenten absichern. SailPoint verkauft Lösungen für Identitätssicherheit, die Studie hat also einen Absender mit Interesse. Trotzdem deuten die Zahlen auf eine Lücke zwischen Einsatz und Absicherung von Agenten hin.

Unklare Anforderungen sind kein neues Problem. Beim Agenten kann seine Autonomie ihre Folgen verstärken. Er wählt seine Werkzeuge selbst und arbeitet nicht in jedem Fall gleich. Was er tatsächlich tun kann, hängt von seinen Zugängen, Funktionen, Freigaben und technischen Grenzen ab. Was einen Agenten überhaupt von einem Chatbot unterscheidet, erklärt KI-Agenten vs. ChatGPT.

Lastenheft und Pflichtenheft beim KI-Agenten

Für diesen Ratgeber trennen wir die beiden Dokumente so: Im Lastenheft hältst du fest, was du vom Auftragnehmer erwartest. Im Pflichtenheft beschreibt der Auftragnehmer, wie und womit er diese Anforderungen umsetzen will.

  • Lastenheft: liegt in deiner Verantwortung. Welche Aufgabe der Agent übernimmt, mit welchen Daten, in welchen Grenzen und woran du erkennst, dass er gut arbeitet.
  • Pflichtenheft: kommt vom Auftragnehmer. Modell, Architektur, Anbindung der Werkzeuge, Betrieb.
  • Das Modell legst du nur mit gutem Grund fest. „Mit Modell X von Anbieter Y“ ist zunächst eine Lösung, keine Anforderung. Gibt es einen sachlichen Grund, etwa eine bestehende Integration oder eine Vertragsvorgabe, gehört das Modell als Randbedingung hinein. Dasselbe gilt für andere Bedingungen, die du wirklich stellst, etwa Hosting in der EU oder keine Nutzung deiner Daten für das Training.

Rechtlich zählt, was im Vertrag als Leistung beschrieben ist. Bei einem Werkvertrag ist die vereinbarte Beschaffenheit nach § 633 BGB ein Maßstab für Sachmängel. Rechtsmängel werden gesondert beurteilt. Die Abnahme nach § 640 BGB kann wegen unwesentlicher Mängel nicht verweigert werden.

Lasten- oder Pflichtenheft können als vereinbarte Leistungsbeschreibung in den Vertrag einbezogen werden. Für den KI-Agenten heißt das: Eine messbare Zielquote kann Streit darüber vorbeugen, was „gut genug“ ist. Fehlt sie, gelten die übrigen vertraglichen und gesetzlichen Maßstäbe. Die Vertragsseite gehört in juristische Hände, das Lastenheft in deine.

Es gibt eine berechtigte Gegenposition. KI-Projekte ändern ihre Anforderungen, sobald der Agent auf echte Daten trifft, und ein vierzigseitiges Lastenheft kann zum Beruhigungsmittel ohne Entscheidung werden. Die Antwort darauf ist nicht, auf das Lastenheft zu verzichten, sondern es in Stufen zu schreiben: Stufe 1 mit festem Umfang, echten Testfällen und klarer Abgrenzung, alles andere bewusst später.

Was in ein Lastenheft für einen KI-Agenten gehört

Die ersten beiden Abschnitte kennst du aus jedem Lastenheft für Software. Viele der übrigen Themen auch, beim Agenten richtest du sie aber zusätzlich auf seinen Handlungsspielraum aus.

  1. Aufgabe und Ergebnis. Ein Satz: Welcher Vorgang, was kommt hinein, was soll herauskommen? „Der Agent prüft Eingangsrechnungen gegen Bestellung und Lieferschein und legt ein Prüfergebnis an“ ist eine Aufgabe. „Der Agent optimiert die Buchhaltung“ ist keine.
  2. Ist-Prozess und Mengengerüst. Wie viele Vorgänge pro Monat, wie lange dauert einer heute, wie oft passieren Fehler? Mit diesen Zahlen schätzt du den Nutzen ab und misst später die Verbesserung. Die Abnahme selbst kannst du auch über die erwarteten Ergebnisse festlegen.
  3. Autonomiestufe. Schlägt der Agent nur vor, bereitet er vor und ein Mensch entscheidet, oder handelt er selbst bis zu einer festgelegten Grenze? Welche Stufe sich wann rechnet, beschreibt Agentische Applikationen im Mittelstand.
  4. Werkzeuge und Rechte. Liste jedes System auf, auf das der Agent zugreift, und ob er dort nur liest oder auch schreibt. Die OWASP-Liste der größten Risiken für LLM-Anwendungen (2025) führt das Risiko „Excessive Agency“ auf zu viele Funktionen, zu weitreichende Rechte und zu viel Eigenständigkeit zurück. Hier begrenzt du die Rechte. Funktionen und Eigenständigkeit regelst du über Autonomiestufe, Grenzen und Freigaben. Alle drei muss die Umsetzung technisch durchsetzen.
  5. Wissensquellen. Welche Dokumente und Daten darf der Agent verwenden, welche ausdrücklich nicht, und wer hält sie aktuell? Arbeitet der Agent mit einer Preisliste, die für den Vorgang nicht gilt, kann das Ergebnis falsch sein, auch wenn er richtig rechnet.
  6. Regeln und Grenzen. Jede Regel mit Bedingung, Folge und Hinweisstufe. Dazu eine Liste dessen, was der Agent nie tun darf, zum Beispiel Zahlungen auslösen, Verträge kündigen oder Kunden etwas zusagen. Im Zweifel geht der Vorgang an einen Menschen.
  7. Freigaben und Eskalation. Wann muss ein Mensch entscheiden, welche Rolle ist zuständig, wer vertritt, und was passiert, wenn nach Fristablauf niemand reagiert? Wie ein Governance-Rahmen mit Rollen, Freigaben und Protokollierung aussieht, haben wir separat beschrieben.
  8. Qualität und Abnahme. Ein Agent arbeitet nicht in jedem Fall gleich. Lege deshalb ein Testset aus echten, anonymisierten Fällen fest, eine Zielquote und Fehlerklassen, für die null Toleranz gilt. Die ISO/IEC 25059:2023 beschreibt ein Qualitätsmodell für KI-Systeme. Laut ISO kannst du damit unter anderem prüfen, ob deine Qualitätsanforderungen vollständig sind.
  9. Nachvollziehbarkeit. Für jeden Vorgang muss sichtbar sein, welche Quelle der Agent genutzt, welches Werkzeug er aufgerufen und was er entschieden hat. Lege fest, wie lange das Protokoll aufbewahrt wird und wer es einsehen darf.
  10. Recht und Compliance. Datenschutz gehört nach Art. 25 DSGVO in die Technikgestaltung, dazu Hosting-Ort und Auftragsverarbeitung. Kann der Agent Leistung oder Verhalten einzelner Beschäftigter auswerten, bestimmt der Betriebsrat nach § 87 BetrVG mit (Abs. 1 Nr. 6). Nach dem EU AI Act klärst du, in welche Risikoklasse der Einsatz fällt. Soll der Agent direkt mit Menschen interagieren, muss der Anbieter nach Art. 50 grundsätzlich sicherstellen, dass sie spätestens bei der ersten Interaktion vom KI-Einsatz erfahren, sofern er nicht offensichtlich ist.
  11. Kosten und Betrieb. Was darf ein Vorgang kosten, wie schnell muss das Ergebnis da sein, wer überwacht den Agenten? Nach jedem Modellwechsel läuft das Testset erneut, damit Verhaltensänderungen möglichst vor dem Tagesgeschäft auffallen. Woran der Schritt in den Betrieb oft hängt, zeigt Warum KI-Piloten nicht in den Produktivbetrieb kommen.
  12. Abgrenzung. Was Stufe 1 bewusst nicht macht und was später kommt.

Zu Punkt 10 zwei Präzisierungen, denn die rechtliche Einordnung hängt vom konkreten Einsatz ab. Zeigt ein System Auswertungen nur zusammengefasst an, schließt das eine Eignung zur Leistungskontrolle nicht sicher aus.

Nicht jede Berechnung oder Einstufung ist automatisch eine Bonitätsbewertung. Bewertet ein KI-System aber die Kreditwürdigkeit natürlicher Personen, kann es unter die Hochrisikoregeln des AI Act fallen. Die einschlägigen Bestimmungen für Anhang III gelten grundsätzlich ab 2. Dezember 2027. Zweck, Ausnahmen und Übergangsregeln sind im Einzelfall zu prüfen. Auch eine geänderte Zweckbestimmung kann die Pflichten für das betroffene KI-System verändern. Lass diese Einordnung fachkundig prüfen.

So erstellst du das Lastenheft in fünf Schritten

Ein gutes Lastenheft entsteht nicht am Schreibtisch einer einzelnen Person. Diese Reihenfolge hilft dir, Regeln und Grenzen einzusammeln, bevor sie im Projekt fehlen.

  1. Einen Vorgang wählen. Nicht „KI für den Vertrieb“, sondern ein konkreter, wiederkehrender Vorgang mit messbarem Aufwand. Ein Agent für einen Prozess ist ein Projekt, ein Agent für alles ist eine Hoffnung.
  2. Echte Fälle sammeln. Ein paar Dutzend Vorgänge aus den letzten Wochen, anonymisiert und mit den Sonderfällen. Sie werden später dein Testset für die Abnahme.
  3. Regeln und Grenzen mit dem Fachbereich aufschreiben. Jede Regel bekommt eine Quelle: Wer hat sie genannt, wo steht sie schon? Welche Befragungs- und Beobachtungstechniken es dafür gibt, fasst der frei zugängliche IREB-Lehrplan (englisch) zusammen.
  4. Rechte mit der IT festlegen. System für System: Welcher Zugang, nur lesen oder auch schreiben, mit welchem Konto? Was nicht auf dieser Liste steht, bekommt der Agent nicht.
  5. Gegenlesen und freigeben. Fachbereich, IT, Datenschutz und bei Bedarf der Betriebsrat lesen gegen. Danach gibt die verantwortliche Person frei, und das Dokument bekommt eine Versionsnummer.

Fünf Fehler, die ein KI-Agenten-Projekt teuer machen

  • Die Technik steht drin, die Aufgabe nicht. „Wir wollen einen Agenten mit RAG und Modell X“ legt die Lösung fest, bevor klar ist, welcher Vorgang besser werden soll.
  • Zu viele Rechte, „damit er flexibel ist“. Jeder Zugang, den der Agent nicht braucht, ist ein Risiko ohne Nutzen.
  • Die Abnahme verlangt pauschal „fehlerfrei“. Kein Testset beweist, dass ein Agent dauerhaft fehlerlos arbeitet. Eine Zielquote plus Fehlerklassen mit null Toleranz lässt sich dagegen abnehmen.
  • Es gibt keinen Weg zum Menschen. Ohne klaren Eskalationsweg kann der Agent ungewollt weiterarbeiten oder stecken bleiben.
  • Regeln bleiben im Kopf. Was die Sachbearbeiterin weiß, kennt der Agent nur, wenn es ihm zugänglich ist: als dokumentierte Regel oder über eine Rückfrage beim Fachbereich. Was passiert, wenn solches Wissen das Haus verlässt, beschreibt Wenn Herr Müller in Rente geht.

Kurz beantwortet

Braucht ein KI-Agent ein anderes Lastenheft als normale Software? Die Grundstruktur ist dieselbe. Besonders genau musst du beim Agenten Autonomiestufe, Werkzeuge und Rechte, Grenzen und Eskalation beschreiben. Für die Abnahme brauchst du wie bei jeder Software Testfälle, beim Agenten am besten aus echten Vorgängen.

Kann ich das Lastenheft mit KI schreiben? Die Gliederung und das Aufräumen: ja. Auch für Regeln, Grenzen und Testfälle kann KI Vorschläge machen. Prüfen und freigeben müsst sie aber du und dein Fachbereich, anhand eurer eigenen Quellen.

Ist das Lastenheft rechtlich bindend? Nicht automatisch. Bindend wird es, wenn es Vertragsbestandteil ist, zum Beispiel als Anlage zum Werkvertrag nach § 631 BGB.

Wie genau muss die Zielquote sein? So genau, dass sie sich zählen lässt: Anzahl richtiger Ergebnisse im Testset, getrennt nach Fehlerklassen. „Meistens richtig“ lässt sich nicht abnehmen.

Was sich ändert, wenn KI-Agenten deinen Agenten bauen

Seit GitHub am 2. September 2025 das Spec Kit veröffentlicht hat, steht die Spezifikation auch in der Entwicklung mit KI wieder im Zentrum: Coding-Agenten bekommen erst eine Spezifikation und schreiben dann Code. Die Spec-Kit-Dokumentation listete am 25. September 2026 Integrationen für über 30 Coding-Agenten. Microsoft vergleicht Spec-driven Development (2025) mit klassischen Anforderungsdokumenten. Dein Lastenheft wird damit zum Eingangsdokument, das eine Maschine liest.

Bei einer unklaren Anforderung fragen Menschen wie Agenten mal nach, mal treffen sie eine Annahme. Entscheidend ist, ob du diese Annahme siehst, bevor gebaut wird.

Ob du mit AthenaRun planst oder mit einem anderen Partner: Diese vier Anforderungen kannst du an den ganzen Weg von der Spezifikation bis zum Betrieb stellen.

  • Jede Regel bekommt eine Quelle. Halte fest, aus welcher Dokumentstelle oder fachlichen Auskunft sie stammt. Verlange, dass sich jede Regel bis in Umsetzung und Test zurückverfolgen lässt.
  • Rechtliche Vorgaben kommen vor den Bau. Lass die relevanten Vorgaben von deinen zuständigen Fachleuten prüfen, bevor gebaut wird, nicht erst nach dem Go-live.
  • Ein Mensch gibt frei. Lege fest, wer die Anforderungen freigibt, bevor die Umsetzung beginnt.
  • Das Wissen bleibt verfügbar. Vereinbare, wie Entscheidungen und Projektkontext dokumentiert und aktuell gehalten werden, damit beim Test und im Betrieb noch dieselbe Anforderung gilt wie im Lastenheft. Wie ein solches Gedächtnis aufgebaut sein kann, beschreibt Warum KI-Agenten ein Gedächtnis brauchen.

Für dich als Auftraggeber heißt das: Wie genau dein Lastenheft sein muss, hängt von Aufgabe und Risiko ab. Regeln brauchen Bedingung und Folge, Rechte brauchen eine Liste, und die Abnahme braucht echte Fälle.

Vorlage: Lastenheft für einen KI-Agenten

Kopier die Gliederung in dein Dokument und füll sie Abschnitt für Abschnitt. Die Stichworte unter jeder Überschrift sind die Fragen, die dein Auftragnehmer sonst stellen würde.

LASTENHEFT KI-AGENT: [Name des Vorgangs]
Auftraggeber: ___        Verantwortlich: ___
Stand: ___               Version: ___

1   Aufgabe und Ergebnis
    Vorgang, Eingang, Ergebnis, in einem Satz

2   Ist-Prozess und Mengengerüst
    Vorgänge pro Monat, Dauer heute, Fehlerquote heute

3   Autonomiestufe
    schlägt vor / bereitet vor, Mensch entscheidet /
    handelt selbst bis Grenze ___

4   Werkzeuge und Rechte
    Je System: Zugang, nur lesen oder schreiben, Konto

5   Wissensquellen
    Erlaubt, ausdrücklich nicht erlaubt, wer pflegt

6   Regeln und Grenzen
    Je Regel: Nummer, Bedingung, Folge, Hinweisstufe, Quelle
    Nie erlaubt: ___

7   Freigaben und Eskalation
    Auslöser, Rolle, Vertretung, Frist, was nach Fristablauf

8   Qualität und Abnahme
    Testset (Anzahl Fälle), Zielquote, Fehlerklassen,
    null Toleranz für: ___

9   Nachvollziehbarkeit
    Protokollinhalt, Aufbewahrung, Einsicht

10  Recht und Compliance
    Personenbezogene Daten, Hosting-Ort, Betriebsrat,
    Risikoklasse nach AI Act, Hinweis an Menschen

11  Kosten und Betrieb
    Kosten pro Vorgang, Antwortzeit, Überwachung,
    Testlauf nach Modellwechsel

12  Abgrenzung
    Nicht in Stufe 1 / später / offene Punkte

Weiterlesen im Wissen-Hub

Welche Zahlen es zum KI-Einsatz im Mittelstand gibt, sammelt KI im Mittelstand 2026: Statistiken und Fakten. Welche Bruchstellen Digitalisierungsprojekte gefährden, beschreibt Warum Digitalisierungsprojekte im Mittelstand scheitern. Und wann eine Fachabteilung selbst bauen darf, klärt Schatten-IT oder gesteuerte Eigenentwicklung?.