
CodeAct
CodeAct ist ein Prinzip für KI-Agenten, bei dem das Modell seine Aktionen nicht als Text oder Liste beschreibt, sondern direkt als ausführbaren Programmcode formuliert. Das macht den Agenten flexibler und zuverlässiger, weil Code präziser ist als natürliche Sprache und sich Schritte darin leicht zusammenfassen und wiederverwenden lassen.
Wenn eine KI eine Aufgabe erledigen soll — zum Beispiel eine Datei umbenennen oder eine Tabelle auswerten —, muss sie irgendwie beschreiben, was sie tun will. Bei vielen Systemen passiert das in einer festen Liste von Befehlen: „Schritt 1: Datei öffnen“, „Schritt 2: Wert berechnen“. CodeAct geht einen anderen Weg. Das Modell schreibt stattdessen echten Programmcode, meist in Python, und lässt ihn direkt ausführen. Das Ergebnis kommt zurück, und das Modell schreibt den nächsten Code — so lange, bis die Aufgabe fertig ist.
Warum Code besser ist als eine Befehlsliste
Eine feste Befehlsliste ist starr. Wenn der Entwickler bestimmte Aktionen nicht vorgesehen hat, kann der Agent sie nicht ausführen. Code kennt diese Grenze nicht: Wer Python schreiben kann, kann damit fast beliebige Abläufe beschreiben — Schleifen, Bedingungen, Funktionsaufrufe.
Dazu kommt ein praktischer Vorteil: Mehrere Schritte lassen sich in einer einzigen Funktion zusammenfassen. Statt zehn Einzelbefehle nacheinander zu schicken, schreibt der Agent eine kompakte Routine. Das spart Kommunikation zwischen Modell und Umgebung und macht den Ablauf schneller und robuster.
Code ist außerdem eindeutig. Natürliche Sprache lässt Interpretationsspielraum — „lösche die alten Dateien“ könnte vieles bedeuten. Eine Python-Zeile hingegen macht exakt das, was drinsteht. Fehler treten früher auf und sind leichter zu finden.
Der Ablauf eines CodeAct-Agenten
Der Agent bekommt eine Aufgabe in natürlicher Sprache. Er übersetzt sie in ein kurzes Code-Schnipsel und schickt diesen an eine Laufzeitumgebung — einen sicheren Bereich, in dem Code ausgeführt werden darf. Die Umgebung liefert das Ergebnis oder eine Fehlermeldung zurück.
Das Modell liest das Ergebnis und entscheidet: Ist die Aufgabe erledigt? Wenn nicht, schreibt es den nächsten Code-Schnipsel. Dieser Kreislauf läuft so lange, bis das Ziel erreicht ist oder der Agent feststellt, dass er nicht weiterkommt. Der Agent hat damit ein echtes Gedächtnis über mehrere Schritte hinweg, weil Variablen aus früherem Code in der Laufzeitumgebung erhalten bleiben.
Ein wichtiger Unterschied zu rein sprachbasierten Agenten: CodeAct-Agenten können tatsächlich rechnen. Wenn ein Nutzer fragt, wie viel Prozent eine Zahl gestiegen ist, schreibt der Agent keine Schätzung — er führt die Berechnung aus und gibt das exakte Ergebnis zurück.
CodeAct in Produkten und Forschung
Das Prinzip taucht unter verschiedenen Namen in realen Produkten auf. OpenAIs ChatGPT nutzt mit dem „Code Interpreter“ (früher Advanced Data Analysis) eine sehr ähnliche Logik: Das Modell schreibt Python-Code, führt ihn aus und zeigt das Ergebnis — etwa ein Diagramm oder eine Auswertung einer hochgeladenen Tabelle.
Den Begriff CodeAct selbst prägte ein Forschungsteam der Universität Illinois in einer Studie von 2024. Die Forscher verglichen Agenten, die mit Textbefehlen arbeiten, mit solchen, die Code schreiben — und stellten fest, dass CodeAct-Agenten bei komplexen Aufgaben mit mehreren Schritten deutlich besser abschnitten. Die Studie wurde schnell von der Industrie aufgegriffen.
Auch Agentensysteme wie OpenDevin oder verschiedene Open-Source-Frameworks für autonome Softwareentwicklung bauen auf CodeAct auf. Wer in Zukunft von einem KI-Agenten hört, der selbstständig Code schreibt, testet und verbessert, hat es wahrscheinlich mit einer Variante dieses Prinzips zu tun.