Better Harness ist ein Open Source Reviewer für den Workflow rund um Coding Agents: Er findet belegte Lücken, schlägt klar abgegrenzte Reparaturen vor und lässt sich erneut ausführen. Das Framework verbindet Harness Engineering Praktiken, die Bewertung eines fünfgliedrigen Arbeitszyklus und ausführbare Integrationen...
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: What is Alibaba Cloud Qoder’s Better Harness, open-sourced on GitHub on July 28, 2026, and how does its three-layer framework—covering Harne. Article summary: Better Harness is Qoder’s MIT-licensed, open-source reviewer and improvement loop for the environment around coding agents—not merely a benchmark of an agent’s answer on one task. It maps project setup and real agent act. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Better Harness ist ein Open-Source-Projekt von Qoder, das den Arbeitsablauf rund um einen Coding Agent überprüft und verbessert. Es bewertet also nicht bloß eine einzelne Modellantwort oder einen Code-Diff. Im Fokus stehen Projektvorgaben, Kontrollmechanismen, Validierungswege, Agent-Konfigurationen und – sofern verfügbar – Aufzeichnungen realer Agent-Sitzungen. Ziel ist es, Schwachstellen im Workflow zu belegen, eine begrenzte Reparatur vorzuschlagen und deren Wirkung in einem späteren Durchlauf überprüfbar zu machen. 1
2
4
Laut zeitgenössischen Berichten wurde das Projekt am 28. Juli 2026 auf GitHub als Open Source veröffentlicht. 5
Ein Coding Agent arbeitet nie isoliert. Seine Ergebnisse hängen auch von Repository-Anweisungen, Spezifikationen, Werkzeugen, Berechtigungen, Skripten, Tests, Review-Vorgaben, Release-Prüfungen und menschlichen Übergaben ab. Qoder bezeichnet diese Umgebung als Harness. Dazu können etwa Regeln, Skills, Hooks, Plug-ins, Konnektoren, Testbefehle und Schritte für menschliche Reviews gehören. 2
Das ist ein wichtiger Unterschied: Auch ein leistungsfähiges Modell liefert unzuverlässige Ergebnisse, wenn die umgebenden Prozesse unklar oder schlecht beobachtbar sind. Ein Repository kann beispielsweise Tests enthalten, ohne festzulegen, wann der Agent sie ausführen soll. Es kann Regeldateien geben, die der Agent in der Praxis nicht nutzt. Oder Erkenntnisse aus fehlgeschlagenen Aufgaben gehen nach Ende einer Sitzung verloren. Better Harness soll solche operativen Schwachstellen sichtbar machen – statt die bloße Existenz einer Konfigurationsdatei mit einem funktionierenden Prozess zu verwechseln. 1
4
5
Qoder beschreibt Better Harness als dreistufiges Framework, das Engineering-Praktiken, ein Bewertungsmodell und eine ausführbare Umsetzung verbindet. 5
Die erste Ebene umfasst die Mechanismen, die die Agent-Arbeit prägen: Sitzungs- und CLI-Muster, Beobachtbarkeit, Regeln, Skills, MCP-Konfiguration, Speicherfunktionen, Hooks und Automatisierung. 5
Praktisch geht es dabei um Fragen wie:
Zu Beginn kartiert Better Harness die aktuelle Umgebung: Ziele, Kontext, Ausführungseinstiege, Feedback-Schleifen, Auslieferungsmechanismen und die Erfassung von Lernerfahrungen. 1
Die zweite Ebene übersetzt diese Praktiken in eine Bewertung von fünf zusammenhängenden Dimensionen: Aufgabenverständnis, kontrollierte Ausführung, Validierung von Änderungen, zuverlässige Auslieferung und Erfassung von Lernerfahrungen. 1
4
Damit verschiebt sich die zentrale Frage von „Hat der Agent plausiblen Code erzeugt?“ zu: Kann der gesamte Workflow wiederholt Änderungen hervorbringen, die verständlich, kontrolliert, validiert, auslieferbar und durch frühere Erfahrungen besser informiert sind?
Das Modell soll Bruchstellen in diesem Ablauf identifizieren – etwa einen fehlenden Mechanismus, eine nicht verbundene Integration, einen nie ausgeführten Schritt oder unzureichende Belege für das Ergebnis. 1
Die dritte Ebene bringt Praktiken und Bewertungsmodell in reale Projekte. Better Harness läuft über einen Coding Agent, sammelt Projekt- und gegebenenfalls Sitzungsnachweise und erstellt priorisierte, überprüfbare nächste Schritte. 4
Die aktuellen Projektmaterialien nennen Unterstützung für zehn Host-Adapter. In Berichten zum Start wurden unter anderem Claude Code, Codex, Qoder und Cursor als unterstützte Coding-Agent-Umgebungen genannt. 5
6
Der Adapterumfang kann sich ändern. Wer eine bestimmte Integration benötigt, sollte deshalb die aktuelle Adapter-Dokumentation prüfen. Für OpenClaw belegen die vorliegenden Quellen keine Unterstützung.
Ein Kernmerkmal ist die Trennung von Datensammlung und abschließender Bewertung. Nach Angaben von Qoder sammelt der Hauptablauf zunächst Rohdaten und übergibt sie anschließend an drei unabhängige, nur lesende Sub-Agents, bevor die Ergebnisse zusammengeführt werden. 1
Diese drei Perspektiven sind:
So lässt sich besser unterscheiden zwischen einem vorgesehenen Prozess und einem beobachteten Prozess. Projekt- und Konfigurationsdaten können belegen, dass eine Fähigkeit vorhanden ist. Sitzungsdaten können dagegen zeigen, ob sie bei einer konkreten Aufgabe auch angemessen eingesetzt wurde. 1
4
Das zentrale Prinzip lautet: Die Existenz eines Artefakts ist kein Beweis für seine Wirksamkeit.
Ein automatisiertes Testpaket im Repository zeigt zunächst nur, dass die technische Möglichkeit besteht. Es belegt nicht, dass ein Agent nach einer Änderung die relevanten Tests ausgeführt, das Ergebnis richtig eingeordnet und dadurch eine fehlerhafte Auslieferung verhindert hat. Dasselbe gilt für Regeln, Hooks, Skills oder Freigabeschranken. 1
5
Better Harness soll die Nachweiskette deshalb ausdrücklich sichtbar halten. Berichte übersetzen belegte Lücken in priorisierte Findings mit Auswirkung, erwartetem Ergebnis, begrenzter Reparatur und Akzeptanzprüfungen. Fehlende Nachweise bleiben sichtbar, statt stillschweigend in eine scheinbar sichere Bewertung einzugehen. 4
6
Für Teams wird ein Finding damit konkret überprüfbar:
Better Harness ist nicht als einmaliger Audit gedacht, sondern als iterativer Ablauf:
Das ist die Grundlage des Anspruchs auf kontinuierliche Verbesserung. Das Werkzeug kann zeigen, dass sich ein Workflow verändert hat und ob neue Nachweise eine bessere Bewertung stützen. Es beweist jedoch nicht automatisch, dass eine Reparatur in jedem Projekt oder jeder Host-Umgebung bessere Agent-Ergebnisse verursacht hat. Qoder betont beobachtete Evidenz und explizite Einschränkungen, statt Veränderungen von Bewertungen als Kausalbeweis auszugeben. 4
6
Zum Start wurde berichtet, dass das Framework in einer ersten Übung bei 30 realen GitHub-Projekten eingesetzt wurde. 5 Das sollte als explorative Anwendung verstanden werden, nicht als kontrollierter Nachweis dafür, dass Better Harness jeden Coding Agent oder jedes Repository verbessert.
Die vorliegende Primärdokumentation stützt das Evidenzmodell, die Struktur der Findings und den iterativen Reparaturablauf. Sie liefert jedoch nicht genügend Details, um Auswahl der 30 Projekte, Bewertungsprotokoll oder zusammengefasste Resultate unabhängig zu beurteilen. Das ist wichtig, wenn Better Harness mit formalen Benchmarks verglichen oder daraus weitreichende Leistungsversprechen abgeleitet werden sollen. 1
4
Qoders übergeordnetes Argument: Harness Engineering soll zur Qualitätsinfrastruktur für KI-gestützte Softwareentwicklung werden – mit gemeinsamer Sprache für Workflow-Kontrollen, beobachtbaren Nachweisen, vergleichbaren Auslieferungsdimensionen und wiederholbaren Verbesserungszyklen. 1
2
Better Harness liefert dafür eine praktische Umsetzung. Teams können damit die Bedingungen rund um Agent-Arbeit in unterstützten Umgebungen prüfen, über Evidenz statt über Eindrücke sprechen und testen, ob eine vorgeschlagene Workflow-Reparatur auch in späteren Durchläufen Bestand hat. Der Wert des Werkzeugs liegt nicht in einer Garantie für bessere Ergebnisse, sondern in einem disziplinierteren Verfahren, das Agent-Workflows überprüfbar, begutachtbar und widerlegbar macht. 4
6
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
Better Harness ist ein Open Source Reviewer für den Workflow rund um Coding Agents: Er findet belegte Lücken, schlägt klar abgegrenzte Reparaturen vor und lässt sich erneut ausführen.
Better Harness ist ein Open Source Reviewer für den Workflow rund um Coding Agents: Er findet belegte Lücken, schlägt klar abgegrenzte Reparaturen vor und lässt sich erneut ausführen. Das Framework verbindet Harness Engineering Praktiken, die Bewertung eines fünfgliedrigen Arbeitszyklus und ausführbare Integrationen für unterstützte Agent Umgebungen.
Entscheidend ist der Nachweis: Dass Tests, Regeln oder Hooks vorhanden sind, bedeutet noch nicht, dass ein Agent sie tatsächlich sinnvoll eingesetzt hat.