Der Begriff agentische KI wird für Suche, Chat, KI-Schritte in Workflows, Coding-Werkzeuge und autonom handelnde Systeme verwendet. Diese Unschärfe ist betrieblich problematisch. Architektur, Einkauf und Risikofunktionen sprechen sonst über dieselbe Bezeichnung, aber über verschiedene Systeme.

Eine belastbare Einordnung beginnt deshalb mit beobachtbaren Eigenschaften. Produktnamen kommen erst danach.

Der operative Sechs-Punkte-Test

1. Ziel

Das System übernimmt ein Ergebnis, das über eine einzelne Antwort hinaus besteht. Es erkennt notwendige Schritte und kann den Abschluss bewerten. Eine Frage zu beantworten bleibt Assistenz. Eine Lieferantenausnahme zu lösen kann fortlaufende Arbeit verlangen.

2. Werkzeuge

Das System wählt Fähigkeiten wie Suche, API, Workflow, Code, Nachricht oder anderen Agenten aus und ordnet sie an. Ein immer gleich aufgerufener Connector ist Automation. Agentisches Verhalten steigt mit der Entscheidung über Werkzeug und Reihenfolge.

3. Zustand

Über Schritte oder Ereignisse bleibt relevante Information erhalten: bereits versuchte Wege, fehlende Belege, offene Entscheidungen und bestehende Zusagen. Zustand ist keine unbegrenzte Langzeiterinnerung. Er braucht Zweck, Grenze und Steuerung.

4. Befugnis

Das System darf Daten, Systeme oder Personen beeinflussen. Das Spektrum reicht vom Entwurf bis zur selbstständigen Ausführung. Diese Eigenschaft bestimmt einen großen Teil des Risikos. Ein verfügbares Werkzeug muss nicht automatisch freigegeben sein.

5. Rückmeldung

Werkzeugergebnisse, Fehler, geänderte Bedingungen oder menschliche Antworten beeinflussen den nächsten Schritt. Mechanische Wiederholung ist etwas anderes als ein Alternativweg oder eine Eskalation bei sinkender Sicherheit.

6. Verantwortung

Ein benannter Eigentümer definiert Ergebnis, Grenzen, Evaluation, Monitoring, Incident Response und Stop-Entscheidung. Verantwortung geht nie auf das Modell über.

Der Test verlangt keine maximale Ausprägung in jedem Punkt. Er beschreibt das reale System und damit die erforderliche Evidenz.

Vier Stufen der Delegation

Stufe 0, Assist, erzeugt oder findet Inhalte, während der Nutzer jeden Schritt steuert. Zusammenfassung und fundierte Suche gehören hierher.

Stufe 1, Recommend, sammelt Evidenz und schlägt Entscheidung oder Aktion vor. Ein Mensch führt sie aus.

Stufe 2, begrenztes Handeln, lässt das System innerhalb klarer Grenzen Schritte und Werkzeuge wählen. Definierte Folgen und Ausnahmen benötigen menschliche Freigabe.

Stufe 3, ergebnisorientierter Betrieb, startet oder führt Arbeit durch Ereignisse fort, passt mehrere Schritte an und erledigt erlaubte Aktionen mit begrenztem Eingriff. Monitoring, Eindämmung und Wiederherstellung werden Service-Anforderungen.

Die Skala ist keine Reifeleiter. Mehr Delegation ist nur sinnvoll, wenn ihr Nutzen zusätzliche Varianz und Kontrollkosten rechtfertigt.

Beispiel: Ausnahme bei Lieferantenrechnung

Eine Chat-Lösung erklärt auf Nachfrage die Richtlinie. Sie ist Assist. Ein Empfehlungssystem liest Rechnung und Bestellung, markiert Unterschiede und schlägt die nächste Aktion vor. Es ist Recommend.

Ein begrenzter Agent wählt Datenquellen, fordert fehlende Belege an, bereitet eine Korrektur vor und routet materielle Abweichungen zur Freigabe. Er handelt auf Stufe 2.

Ein System auf Stufe 3 überwacht neue Ausnahmen, kontaktiert erlaubte interne Rollen, behandelt temporäre Integrationsfehler, bucht kleine Korrekturen innerhalb einer Delegationsgrenze und eskaliert Anomalien. Dafür braucht es dauerhaften Zustand, klare Identität, protokollierte Werkzeugaufrufe, Kostenkontrolle, Ausnahmequeue und getestetes Stop-Verhalten.

Alle vier pauschal Rechnungsagent zu nennen würde entscheidende Unterschiede verdecken.

Kontrollen an die riskante Eigenschaft koppeln

Ein fortbestehendes Ziel benötigt Abbruchbedingungen. Werkzeugwahl braucht Allowlist, Abhängigkeitsverantwortung und Ergebnisvalidierung. Zustand verlangt Aufbewahrungs-, Zugriffs- und Korrekturregeln. Befugnis benötigt Minimalrechte, folgenbezogene Freigabe und Transaktionsschutz. Rückmeldung braucht Retry-Grenzen und Schleifenerkennung. Verantwortung verlangt Eigentum, Telemetrie, Evaluation und Incident Response.

Microsofts Agent Design Framework trennt entsprechend Ziel, Trigger, Tools, Wissen, Orchestrierung, Anweisung, Governance und Evaluation. Für compliance-getriebene, weitreichende oder unumkehrbare Schritte empfiehlt es deterministische Flows oder Topics. Ein Agent darf also bewusst vorhersehbare Teilprozesse enthalten.

Wann kein Agent gebaut werden sollte

Prompt oder Suche passen, wenn Menschen hauptsächlich Information benötigen und die Steuerung behalten. Ein deterministischer Workflow passt zu stabilen Eingaben, Regeln und Sequenzen. Eine Anwendung passt zu persistenten Datensätzen, strukturierter Interaktion und sichtbarem Status.

Ein Agent wird interessant, wenn Fälle variieren, der nächste Schritt von Ergebnissen abhängt, mehrere Werkzeuge infrage kommen und vollständige Vorabmodellierung zu spröde wäre. Delegiert werden trotzdem nur Entscheidungen, deren Varianz messbar und begrenzbar ist.

Autonomie ist weder Intelligenz noch Geschäftswert. Eine streng kontrollierte Empfehlung kann wirtschaftlich besser sein als ein autonomer Prozess mit hohem Ausnahmeaufwand.

Aus dem Begriff einen Designnachweis machen

Jeder Vorschlag dokumentiert die sechs Eigenschaften, Delegationsstufe, menschliche Grenzen, Fehlerfolgen und Freigabeevidenz. Ohne diese Angaben ist die Architektur nicht bereit für Beschaffung oder Umsetzung.

Amplified Pi nutzt den Nachweis, um Ambition in ein betreibbares Muster zu übersetzen. Das Ergebnis kann Agent, Workflow, Anwendung oder Kombination sein. Richtig ist das einfachste System, das den gewünschten Nutzen mit einem beherrschbaren Kontrollmodell liefert.