Zum Inhalt springen

Deterministische AI Code Review

Dein KI-Reviewer übersieht 44× mehr Bugs als ein Parser.

Unslop ist das deterministische Review-Gate für KI-generierten Code. Es fängt, was LLM-Reviewer übersehen — an jedem Pull Request, im Terminal und im Editor.

Dieselben Dateien, zwei Reviewer: Ein Cloud-LLM fand 44× weniger Probleme als ein deterministischer Scan. Wir haben das Gate auf die Seite gebaut, die gewinnt.[1]

Das einzige AI-Code-Gate, das keine KI fragt, ob die KI sich geirrt hat.

Die Forschung, in Zahlen

Gestützt auf unabhängige, publizierte Forschungsdaten. Alle Quellen im Footer.

weniger Probleme findet ein LLM-Judge als ein deterministischer Scan derselben Dateien[1]
44×
mehr schwerwiegende Schwachstellen pro Datei in KI-generiertem Code[1]
1,80×
Schwachstellen pro Sample, wenn sich „Verbessere diesen Code“-Runden stapeln[3]
2,1 → 6,2
der LLM-„Selbstkorrekturen“ machten den Code tatsächlich sicherer[3]
27 %
Test-Pass-Rate vs. echte Defekterkennung — die Coverage-Illusion[4]
96,2 % vs. 63,7 %
forschungsbasierte Regeln treiben die Unslop-Engine an
119

01

Der Judge ist kompromittiert

Ein LLM kann nicht dein CI-Gate sein.

Die Forschung ist deutlich: Auf identischen Aufgaben erreichen deterministische Checks Precision 1,00; LLM-Judges schaffen 0,50–0,67 — einen Münzwurf. Ändere die Sampling-Temperatur, und das Urteil ändert sich mit. Das ist kein Gate. Das ist ein Spielautomat.

Schlimmer: Die Fehler sind lautlos. LLM-Judges unterzählen die gefährlichsten Bugs — Scheitern, das wie Erfolg aussieht — im Verhältnis 44 zu 1.

Quellen[1][2][9]

02

Es akkumuliert

„Einfach neu generieren“ macht Code schlechter.

Über Refinement-Runden gemessen steigt die Schwachstellendichte auf 2,1 → 4,7 → 6,2 pro Sample. Jede Runde. Selbst mit Security-Prompts.

Und KI schreibt nicht nur Bugs — sie erfindet Dependencies. 205.474 halluzinierte Paketnamen, 43 % davon wiederkehrend. Eine fertige Supply-Chain-Angriffsfläche.

Quellen[3][8][7]

03

Die Engine

Deterministisch, wo es zählt. KI, wo sie hilft.

Unsere proprietäre Engine erledigt mechanische Prüfungen maschinell — mit perfekter Precision, wo LLM-Judges bei 0,67 enden. Dahinter: 119 Regeln, destilliert aus publizierter Forschung dazu, wie KI-Code wirklich scheitert.

Sie passt sich deiner Codebase an und setzt Kontext nur dort ein, wo er messbar hilft — und hebt die Fix-Quote von 34,4 % auf 87,1 %. Wir veröffentlichen die Ergebnisse, nicht das Rezept.

Quellen[2][13][14]

Der Vergleich

LLM-Judge vs. deterministisches Gate

LLM-Judge vs. deterministisches Gate
PrüfungLLM-JudgeUnslop
Halluzinierte APIs und Imports[2]Precision 0,50–0,67Precision 1,00
Lautlose Fehler[1]Um 44 zu 1 unterzähltDeterministisch gefangen
Stabilität des Urteils[9]Schwankt mit der Sampling-TemperaturGleicher Input, gleiches Urteil
Fix-Anleitung[3][13]„Verbessere diesen Code“ — Schwachstellen steigen auf 2,1 → 6,2Nennt die verletzte Regel — Fix-Quote 34,4 % → 87,1 %

Einwandbehandlung

Vier Einwände, vier Messungen

„Aber unsere Tests sind grün.“

Bis zu 77 % der KI-geschriebenen Testmethoden prüfen nichts. Hohe Coverage, schwache Erkennung. Grünes CI ist kein Urteil.[5][6]

„Wir prompten es auf Sicherheit.“

Security-Prompting änderte in Java nichts — und in C zeigten sich +41–42 % mehr Schwachstellen. Ein Prompt ist kein Control.[12]

„Der Demo-Code lief doch.“

100 % der generierten OAuth-Beispiele hatten das Client-Secret hartkodiert. KI-Code ist ein Happy-Path-Generator.[10][11]

„Unser Agent hat Guardrails.“

Bis zu 98,6 % der realen Agent-Denylists waren umgehbar. Agents brauchen härtere Gates, nicht weichere.[15][16]

Plattform

Eine Engine. Jede Oberfläche.

Vom Pull Request übers Terminal bis in den Editor.

Rule Engine
119 forschungsbasierte Regeln. Deterministische Urteile. Die KI erklärt — sie entscheidet nie.
PR-Gate
Native GitHub App. Findings erscheinen als Check Runs an jedem Pull Request.
Codebase-Verständnis
Die Engine passt sich den Konventionen deines Repos an — automatisch.
Revisions-Tracking
Jede Revision wird erneut geprüft. Sinkende Qualität lässt den Build scheitern.
CLI & Editor
Scanne lokale Änderungen mit der unslop-CLI. Prüfe und übernimm Fixes in VS Code.
Webhook-Sicherheit
Jeder GitHub-Webhook wird HMAC-verifiziert.
Verschlüsselung
Tokens werden at rest mit AES-256-GCM verschlüsselt.
Ehrliche Grenzen
Nichts blockt 100 % aller KI-Schwachstellen. Wir dokumentieren unsere Lücken — Anbieter, die das nicht tun, verkaufen Slop.

FAQ

Häufig gestellte Fragen

Speichert oder trainiert ihr auf unserem Quellcode?

Nein, beides nicht. Die Repository-Indizierung extrahiert nur die API-Oberfläche — exportierte Signaturen, Interfaces, Typdefinitionen — niemals Implementierungscode. Reviews arbeiten auf dem Diff der Änderung, geladen zum Review-Zeitpunkt. Die Inferenz läuft auf Google Vertex AI, dessen Bedingungen Training auf Kunden-Prompts ausschließen, gepinnt auf die EU-Region (europe-west3) — mit einer dokumentierten Ausnahme: Das Pro-Eskalationsmodell läuft derzeit auf Vertex’ globalem Endpoint, bis Google es in der EU bereitstellt. GitHub-Tokens werden at rest mit AES-256-GCM verschlüsselt.

Bremst das unsere CI/CD oder blockiert es unsere Merges?

Nein. Der Webhook wird sofort bestätigt, das Review läuft asynchron als nativer GitHub Check Run — parallel zu deiner CI, nie in deinem Build. Der Worst Case (volle Drei-Modell-Eskalation) ist hart auf 300 Sekunden begrenzt; die meisten Reviews sind in einem Durchlauf fertig. Nur CRITICAL-Findings lassen den Check fehlschlagen; Hinweise enden als neutral und können keinen Merge blockieren. Ob der Check überhaupt required ist, bleibt deine Branch-Protection-Entscheidung.

Muss mein Team ein weiteres Dashboard lernen?

Nein. Findings landen dort, wo dein Team ohnehin arbeitet: als Check Runs und Review-Kommentare am Pull Request, im Terminal über die unslop CLI — sie difft deine getrackten Änderungen gegen die Merge-Base, ganz ohne Konfiguration — und in VS Code, wo Fixes geprüft und übernommen werden, ohne den Editor zu verlassen. Das Dashboard ist für Konfiguration und Billing da, nicht für die tägliche Arbeit.

Ist das nur ein weiterer lauter KI-Reviewer?

Nein. Urteile kommen aus 119 deterministischen Regeln — das LLM erklärt Findings, es entscheidet sie nie. Jeder Modell-Call läuft mit Temperature 0: Derselbe Diff ergibt immer dasselbe Urteil. Und jedes Draft-Finding muss einen blinden Verifikations-Pass überstehen, bevor es deinen PR erreicht.

Was passiert, wenn Unslop selbst ausfällt?

Deine PRs hängen nicht. Jeder Fehlerpfad schließt den Check Run explizit: Ein abgestürztes Review endet als Failure mit dem Grund im Check-Output, ein übersprungenes Review (Quota, deaktiviertes Repository) postet einen abgeschlossenen Check, der sagt warum — niemals ein ewiges „Expected — waiting for status“. Ist der Check als required markiert, greifen weiterhin die normalen Branch-Protection-Overrides von GitHub.

Das einzige AI-Code-Gate, das keine KI fragt, ob die KI sich geirrt hat.

Unslop deinen nächsten Pull Request. Fakten statt Vibes.