Das ist der entscheidende Unterschied zu vielen herkömmlichen KI-Anwendungen. Dort lassen sich zwar häufig Prompts, Tools oder Integrationen konfigurieren. Das grundlegende Ausführungsmodell bleibt jedoch beim Anbieter. Harness versucht, auch diese Ebene konfigurierbar zu machen.
Für Forschungs- und Infrastrukturteams ist das interessant: Ein Modell kann ausgetauscht werden, ohne die gesamte Anwendung neu zu bauen. Ebenso lassen sich Tools, Speicher, Sandbox oder die Logik für mehrstufige Aufgaben anpassen.
Die Entwicklervorschau enthält vier vorkonfigurierte Modi. Sie sind weniger vier getrennte Produkte als vier Ausgangskonfigurationen derselben Laufzeit.
Der Standardmodus ist die vollständige Coding-Agent-Umgebung. Er kombiniert Dateibearbeitung, Shell-Zugriff, Suche, Skills, Planung, Ziele, Subagenten und Workflows für allgemeine Softwareaufgaben.
Im Codemodus stellt Harness Werkzeuge über eine codeorientierte Schnittstelle bereit. Das Modell kann mehrere Operationen in einem TypeScript-Programm zusammenfassen. Das kann effizienter sein als eine lange Folge einzelner Tool-Aufrufe, wenn mehrere verwandte Aktionen ohnehin gemeinsam ausgeführt werden sollen.
Der Minimalmodus beschränkt die Umgebung bewusst auf eine persistente Shell und ein Werkzeug zur Dateibearbeitung. Diese reduzierte Ausstattung eignet sich vor allem für kontrollierte Modellauswertungen und Tests unter möglichst wenigen vorgegebenen Fähigkeiten.
Der Creatormodus richtet sich an Entwickler, die eigene Presets erstellen. Er ergänzt die Laufzeitinspektion und Experimente mit Plugins im Arbeitsspeicher. So lässt sich untersuchen, wie verschiedene Komponenten zu neuen Agenten-Konfigurationen kombiniert werden können.
Harness setzt stark auf Nachvollziehbarkeit. Alles, was das Modell sieht und tut, wird in einem nur erweiterbaren Ereignisstrom aufgezeichnet. Dazu gehören System-Prompts, Schlussfolgerungen, Tool-Aufrufe und deren Ergebnisse, die Planung von Subagenten sowie eingefügte Kontextinformationen. Dieselbe Ereignishistorie dient zum Suchen, Wiedergeben, Fortsetzen und Abzweigen einer Sitzung.
Das kann die Fehlersuche deutlich erleichtern. Wenn ein Agentenlauf scheitert, steht eine wesentlich vollständigere Aufzeichnung der verwendeten Informationen und Aktionen zur Verfügung. Über eine Verzweigung lässt sich zudem von einem früheren Punkt aus ein neues Experiment starten, ohne den gesamten Lauf zu wiederholen.
Die umfassende Protokollierung bringt aber Risiken mit sich. Sitzungsdaten können vertrauliche Prompts, Quellcode, Tool-Ausgaben oder versehentlich preisgegebene Zugangsdaten enthalten. Wer Harness produktiv einsetzen möchte, sollte deshalb Regeln für Aufbewahrung, Zugriff, Schwärzung sensibler Inhalte und den Betrieb von Sandboxes festlegen.
DeepSeek Harness wird häufig zusammen mit Claude Code und OpenAI Codex genannt. Die drei Angebote stehen jedoch nicht ganz auf derselben Ebene.
| Aspekt | DeepSeek Harness | Claude Code und OpenAI Codex |
|---|---|---|
| Primäres Produkt | Offenes Framework beziehungsweise Laufzeit | Integrierte Coding-Agent-Produkte |
| Modellauswahl | Auf Austauschbarkeit durch Adapter und Plugins ausgelegt | Stärker auf die jeweiligen Anbieter-Modelle und Dienste zugeschnitten |
| Erweiterbarkeit | Auch zentrale Komponenten wie Agenten-Schleife und Speicher sind austauschbar | Erweiterungen und Tools vorhanden, die Kernorchestrierung bleibt stärker produktgesteuert |
| Betrieb | Selbst betreibbar und untersuchbar, aber mit mehr Integrationsaufwand | Komfortablerer Einstieg und stärker verwaltetes Betriebsmodell |
| Nachvollziehbarkeit | Ereignisbasierte, nur erweiterbare Sitzungsaufzeichnung | Sitzungsverläufe und Tool-Spuren je nach Produkt, aber nicht dieselbe austauschbare Laufzeitarchitektur |
Die Wahl ist daher relativ klar:
Eine offenere Architektur macht Harness nicht automatisch zum besseren Coding-Assistenten. Der eigentliche Vergleich lautet: extensible Laufzeit gegen stärker vorgegebenes Produkt. Entscheidend wird sein, ob der zusätzliche Gestaltungsspielraum den höheren technischen Aufwand rechtfertigt.
Das Projekt erhielt unmittelbar nach seiner Veröffentlichung außergewöhnlich viel Aufmerksamkeit. Berichte nennen mehr als 20.000 GitHub-Sterne innerhalb von ungefähr einer bis eineinhalb Stunden. Am 17. August 2026 soll das Repository mehr als 141.000 Sterne erreicht haben.
Diese Zahlen sind bemerkenswert, müssen aber vorsichtig eingeordnet werden. GitHub-Sterne messen vor allem Aufmerksamkeit, Neugier und Lesezeichen – nicht aktive Installationen, erfolgreiche Aufgaben, Sicherheit, Zuverlässigkeit oder die langfristige Kapazität der Maintainer. Auch Vergleiche mit dem Wachstum von Grok-1 hängen davon ab, wie Projekte und Zeiträume gemessen werden. Sie sollten deshalb als berichtete Vergleiche und nicht als endgültige Branchenrekorde verstanden werden.
Die belastbarste Schlussfolgerung lautet: Es gibt großes Interesse an einem offeneren Stack für KI-Agenten. Daraus folgt jedoch nicht, dass Harness bereits produktionsreif ist.
Die MIT-Lizenz gilt für den Framework-Code, nicht für die Inferenz des verwendeten Modells. Agenten-Laufzeiten übertragen Systemanweisungen, Tool-Ergebnisse, Richtlinien und angesammelten Sitzungsverlauf häufig über mehrere Modellaufrufe hinweg.
Falls Berichte über ungefähr 47.600 nicht zwischengespeicherte Eingabetokens pro Interaktion zutreffen, könnten Kontextmenge und Wiederholungen spürbare Kosten- und Latenzfaktoren sein. Diese Zahl ist durch die stärksten verfügbaren Quellen allerdings nicht unabhängig bestätigt. Die tatsächliche Rechnung hängt unter anderem von Modellwahl, Cache-Treffern, Kontextkürzung, Ausführlichkeit der Tools und der Zahl der Agenten-Iterationen ab.
Auch der Modellanbieter spielt eine Rolle. Zeitgleich mit der Veröffentlichung von Harness wurde DeepSeek V4-Pro mit einer Umstellung auf Haupt- und Nebenzeiten bei der API-Abrechnung verbunden. Berichte nennen für V4-Pro zu Spitzenzeiten 3,96 US-Dollar pro einer Million Ausgabetokens – gegenüber zuvor 0,87 US-Dollar.
Das zeigt den wichtigen Unterschied zwischen offenem Framework und kostenpflichtigem Modellzugriff: Harness kann die technische Abhängigkeit von einem Anbieter verringern, macht die Nutzung von DeepSeeks API aber nicht automatisch günstig.
DeepSeek bezeichnet Harness ausdrücklich als Entwicklervorschau und weist darauf hin, dass sich zentrale Plugins und APIs weiter verändern werden. Für erste Tests sollten Entwickler daher Versionen festschreiben, Plugin-Abhängigkeiten sperren, Experimente isolieren, Updates vor dem Rollout prüfen und einen Rückweg zu einer funktionierenden Version bereithalten.
Berichte über Probleme mit frühen Drittanbieter-Plugins und zahlreiche Plugin-Vorschläge können auf ein schnell entstehendes Ökosystem hindeuten. Die konkreten Zahlen sind hier jedoch nicht ausreichend belegt, um daraus belastbare Messwerte abzuleiten. Die allgemeine technische Konsequenz ist klar: Jede zusätzliche Erweiterungsschnittstelle erzeugt neue Aufgaben bei Kompatibilität, Berechtigungen und Sicherheit.
Gerade weil Harness Shell, Dateisysteme und andere Umgebungen mit einem Modell verbindet, sollten Sandboxing und Rechtevergabe nicht als Nebensache behandelt werden. Ein Plugin-Ökosystem braucht nachvollziehbare Herkunft, Versionierung und Tests – sonst wird die versprochene Austauschbarkeit schnell zum zusätzlichen Angriffs- und Ausfallpunkt.
DeepSeek Harness ist vor allem deshalb relevant, weil es die Agenten-Laufzeit selbst als offene, eigenständige Engineering-Schicht behandelt. Das Cordis-basierte Plugin-System und die nur erweiterbare Sitzungsaufzeichnung geben Entwicklern ungewöhnlich viel Kontrolle darüber, wie ein Agent schlussfolgert, handelt, Zustand speichert und überprüft werden kann.
Für Forschende, Infrastrukturteams und Entwickler, die eigene Agentensysteme zusammensetzen wollen, ist das ein überzeugender Ansatz. Weniger attraktiv ist Harness für Teams, die schlicht einen zuverlässigen Coding-Assistenten mit möglichst wenig Einrichtungs- und Betriebsaufwand suchen.
Kurzfristig dürfte Harness Claude Code oder Codex nicht einfach ersetzen. Seine wahrscheinlichere Rolle ist die einer offenen Alternative für Teams, die Komfort gegen Modellportabilität, Nachvollziehbarkeit und Kontrolle eintauschen. Ob daraus eine dauerhafte Plattform wird, hängt von stabilen APIs, der Qualität der Plugins, klaren Sicherheitsgrenzen, guter Dokumentation und dem tatsächlichen Betriebsaufwand nach der ersten Demo ab.