Zum Hauptinhalt springen
AI

JEV und Claude Code: der Agentic Coding Review Loop 2026

JEV ist ein kleines, schnelles Entscheidungsmodell von TypeSafe AI, das im Agent-Loop als System-1-Klassifikator arbeitet. Was JEV kann, wie es Claude Code ergänzt, wie das lokale MCP-Plugin jev-review funktioniert und warum das Muster für Build- und Review-Pipelines im Mittelstand relevant wird.

JEV und Claude Code: der Agentic Coding Review Loop 2026
Photo by Igor Omilaev on Unsplash

Stand: September 2026. Im September 2026 hat das US-Startup TypeSafe AI nach zwei Jahren Stealth-Phase sein erstes Modell vorgestellt: JEV. In den Tagen danach taucht der Begriff in jeder KI-Feedbackschleife auf, in jedem Coding-Agent-Thread und in mehreren TechCrunch-Artikeln. JEV ist ein kleines, schnelles Entscheidungsmodell, das im Loop mit großen Coding-Agents wie Claude Code oder Codex arbeitet. Dieser Beitrag erklärt, was JEV konkret kann, wie das lokale MCP-Plugin jev-review funktioniert und warum das Muster für Build- und Review-Pipelines im Mittelstand relevant wird.

TL;DR

  • JEV ist ein System-1-Entscheidungsmodell. JEV beantwortet typisierte Fragen mit validierten strukturierten Antworten.
  • JEV routet und scored Skills. Skills sind Prozeduren; JEV wählt aus, bewertet und klassifiziert sie.
  • JEV ergänzt Claude Code. Claude Code bleibt das Gehirn (System 2), JEV ist der schnelle Filter davor (System 1).
  • jev-review ist das passende MCP-Plugin. Lokal installierbar mit einem Befehl, liefert strukturierte Quality-Scores 1-10 mit Confidence und Delta.
  • Die Gründer haben OpenAI-Hintergrund. Diogo Almeida hat bei OpenAI RLHF und InstructGPT mit-erfunden - die Methoden hinter ChatGPT.
  • Die Kosten sind drastisch niedriger. In der TypeSafe-Demo: 150 PR-Kommentare für 0,01 USD statt mehrerer Dollar mit einem großen Modell.

Was ist JEV?

JEV ist ein kleines, schnelles Modell, das TypeSafe AI nach zwei Jahren Entwicklungszeit im September 2026 vorgestellt hat. JEV nimmt einen State plus eine typisierte Frage entgegen und liefert eine validierte strukturierte Antwort. Das Eingabe-Schema schließt offene Fragen aus - das ist die technische Grundlage für halluzinationsfreie Ausgaben.

Die Ausgabe folgt immer einer von drei Primitives:

  • Choice - Auswahl aus vorgegebenen Optionen ("A, B oder C?").
  • Score - Bewertung nach einer geordneten Rubrik ("1 bis 5 nach Kriterium X").
  • Noul - 0 oder 1 für Ja/Nein-Fragen, optional mit Confidence zwischen 0 und 1.

Zusätzlich liefert JEV auf Wunsch einen Confidence-Wert. Bei niedriger Confidence oder bei konsequentenreichen Entscheidungen gibt das System die Frage an System 2 weiter - den großen Coding-Agent oder den Menschen.

System 1 versus System 2 - die zentrale Analogie

TypeSafe positioniert JEV bewusst als System One Model, in Anlehnung an die gleichnamige Unterscheidung aus der Kognitionspsychologie von Daniel Kahneman. System One steht für schnelles, paralleles, automatisiertes Denken - Mustererkennung, Instinkt, einfache Klassifikation. System Two steht für langsames, serielles, bewusstes Denken - Planung, Abstraktion, mehrdeutige Probleme.

Übersetzt in die KI-Welt:

RolleSystem 1System 2
Typischer VertreterJEVClaude Code, Codex, GPT-5
ReaktionszeitMillisekundenSekunden bis Minuten
Kosten pro AufrufCent-BruchteileCent bis Dollar
Ausgabestrukturierte Antwortfreier Text, Code, Erklärungen
Typischer EinsatzRouting, Klassifikation, Vor-ScreeningPlanen, Coden, Refaktorieren
StärkeKonsistenz, Geschwindigkeit, Kostenmehrdeutige Probleme, kreative Lösungen
Schwächestarr bei unerwarteten Fällenteuer, langsam, varianzanfällig

JEV routet, scored und klassifiziert im Vorfeld und entscheidet, ob der teuere Agent überhaupt aktiv werden soll. Das senkt Kosten drastisch und erhöht gleichzeitig die Konsistenz, weil JEV für wiederkehrende Entscheidungen keine Varianz pro Aufruf einführt.

Die Rolle von JEV im Agent-Stack

Wer Coding-Agents mit Claude Code oder Codex aufbaut, kennt zwei typische Bausteine: Chatbots für offene Konversation und Skills als wiederverwendbare Prozeduren. JEV bedient eine dritte Rolle - den schnellen Klassifikator, der vor jedem teuren Agent-Aufruf die einfache Frage beantwortet.

Die wichtigsten Eigenschaften im Vergleich:

  • Validierte Ausgabe statt freier Text. JEV wählt aus den angebotenen Optionen oder Rubriken - das Ausgabe-Schema schließt freie Erfindungen aus.
  • Vertrauenswürdigkeit in Pipelines. Ein Agent kann JEV-Ausgaben ohne Bedenken weiterverarbeiten, ohne einen Parser oder ein zweites LLM zur Validierung dazwischenzuschalten.
  • Auditierbarkeit. Eingabe und Ausgabe sind beide strukturiert - Sie können später exakt nachvollziehen, warum JEV welche Entscheidung getroffen hat.
  • Skill-Routing auf Skala. In großen Projekten existieren Hunderte von Skills. JEV wählt aus 182 Skills die drei bis fünf passenden aus, bevor der Agent überhaupt aktiv wird.
  • Diff-Screening. Vor jedem Commit prüft JEV die Änderung: schwächt sie Tests, vergrößert sie die Risiko-Oberfläche, ist die Verifikation stark genug? Antwort in 200 Millisekunden statt in 30 Sekunden.
  • Comment-Screening. Qualitative Linting-Aufgaben ("Ist dieser Kommentar noch aktuell? Passt er zum Code?") lassen sich mit JEV deutlich billiger lösen als mit einem großen Modell.

Im TypeSafe-Benchmark (n = 488 Requests mit Haiku) sank die Quote der falsch geladenen Skills von 16,8 % ohne JEV auf 7,3 % mit JEV. Bei Anfragen, für die kein Skill passt, wurden unnötige Loads von 9,8 % auf 4,0 % reduziert - der Agent verschwendet also weniger Tokens für sinnlose Aktionen.

Die drei JEV-Primitives in der Praxis

Wer JEV produktiv einsetzen will, schreibt seine Aufgabenstellung als Choice, Score oder Noul. Drei vereinfachte Beispiele aus der TypeSafe-Dokumentation:

1. Choice für Skill-Routing.

State: { "available_skills": ["postgres-tuning", "redis-cache", "rate-limit", "logging"] }
Question: "Welcher Skill passt zur aktuellen Anfrage 'API antwortet langsam'?"
Type: choice
Options: ["postgres-tuning", "redis-cache", "rate-limit", "logging"]
→ Output: { "answer": "redis-cache", "confidence": 0.82 }

2. Score für Diff-Screening.

State: { "diff": "<unified diff mit 240 geänderten Zeilen, 12 Dateien>", "test_coverage_before": 0.71, "test_coverage_after": 0.69 }
Question: "Wie stark schwächt dieser Diff die Test-Coverage?"
Type: score
Rubric: { "1": "keine Auswirkung", "5": "kritische Schwächung" }
→ Output: { "answer": 2, "confidence": 0.74 }

3. Noul für Sicherheits-Check.

State: { "code": "<function evaluateExpression(userInput)>", "language": "javascript" }
Question: "Enthält dieser Code eine ungeprüfte dynamische Code-Ausführung (eval, Function-Constructor oder gleichwertig)?"
Type: noul
→ Output: { "answer": 1, "confidence": 0.97 }

In allen drei Fällen ist die Ausgabe ein festes JSON-Schema. Der empfangende Code weiß exakt, wie er sie zu parsen hat - ein LLM zur Extraktion ist nicht mehr nötig.

Die Gründer: TypeSafe AI und der ChatGPT-Miterfinder

TypeSafe AI hat drei Gründer. Diogo Almeida steht im Mittelpunkt der öffentlichen Aufmerksamkeit: er hat bei OpenAI die Methoden mit-erfunden, die ChatGPT zu ChatGPT machen.

  • Diogo Almeida (CEO). Mit-Erfinder von RLHF (Reinforcement Learning from Human Feedback) und InstructGPT bei OpenAI. Diese beiden Verfahren bilden die Grundlage für ChatGPT und GPT-4. Vor OpenAI war er bei Google Brain. In einem öffentlichen LinkedIn-Post formuliert er selbst: "After co-inventing ChatGPT, I spent 2 years in stealth building..." TechCrunch titelte am 18. September 2026 "A new kind of AI model from a ChatGPT inventor is thrilling developers" - das ist die treffende Formulierung.
  • Erik Gafni. Co-Founder, Rolle in der öffentlichen Kommunikation bislang zurückhaltend.
  • Sasha Sheng. Co-Founder, ebenfalls zurückhaltend in der öffentlichen Kommunikation.

Das Trainingsverfahren hinter JEV heißt RLCD und schlägt laut TypeSafe RLHF in mehreren Benchmarks. Details veröffentlicht TypeSafe schrittweise über den eigenen Blog (Introducing System One Models and Jev) und über die Conference-Auftritte des Teams. Wer die wissenschaftliche Grundlage bewerten will, liest diese Primärquellen statt Marketing-Aussagen zu wiederholen.

Eine offene Frage bleibt der Maintainer des jev-review-Repos: das GitHub-Repo läuft unter dem Handle NiazMorshed2007, der Username deutet auf einen bangladeschischen Entwickler hin. Öffentliche Hintergrundinformationen - etwa berufliche Stationen oder Firma - sind online nicht ohne weiteres auffindbar. Das Repo selbst hat zum Stand September 2026 rund 184 Stars, 16 Forks, MIT-Lizenz und wird über GitHub verteilt (kein npm-Publish). Wer das Plugin einsetzt, behält die Aktivität des Maintainers im Auge, weil das Projekt noch jung ist.

jev-review: das lokale MCP-Plugin

Das MCP-Plugin jev-review übersetzt die JEV-Idee in einen wiederverwendbaren Agent-Workflow: Coding-Agents können ihren eigenen Code mit JEV bewerten lassen, ohne für jeden Review-Aufruf eine eigene Prompt-Logik zu schreiben. Das Plugin läuft komplett lokal, nur die Review-Anfrage geht an die JEV-API.

Voraussetzungen

  • Node.js 20 oder höher
  • JEV-API-Key von der TypeSafe-Console
  • Ein unterstützter Client: Claude Code, Codex, Cursor oder OpenCode

Installation in einer Zeile

export JEV_API_KEY="your-key"
npx plugins add NiazMorshed2007/jev-review --target claude-code

Danach den Client neu starten und den Agent mit jev-review arbeiten lassen.

Alternative manuelle MCP-Konfiguration für Claude Code

claude mcp add --scope user jev-review -- node /pfad/zu/jev-review/dist/server.js

Alle Clients starten dasselbe dist/server.js lokal über stdio. In OpenCode taucht das Tool je nach Konfiguration als jev-review_jev_review auf.

Das Tool jev_review

Das Plugin stellt ein einziges Tool bereit: jev_review. Pflichtfelder sind mindestens eines aus task, diff, files oder repositoryContext. Optional kann previousEvaluation mit der vorherigen JEV-Antwort übergeben werden, damit das Tool Deltas und Regressions berechnen kann. Es findet keine automatische Repo-Erkennung statt - nur was explizit übergeben wird, geht an die JEV-API.

Der Feedback-Loop in der Praxis

  1. Task verstehen und Repository inspizieren.
  2. Eine kohärente Änderung implementieren.
  3. jev_review mit fokussiertem Kontext aufrufen (Baseline).
  4. Selbst inspizieren und Hypothese zu schwachen Dimensionen bilden.
  5. Kleinste gerechtfertigte Verbesserung machen, dann jev_review erneut mit previousEvaluation aufrufen.
  6. Wiederholen, bis die Anforderungen erfüllt sind - und nicht bis der Score perfekt ist.

Korrektheit schlägt Score-Optimierung. Score-Gaming durch Scope-Erweiterung, Spekulations-Architektur oder mechanisches File-Splitting verfehlt den Zweck. Bei ausbleibender Verbesserung eines gezielten Scores ist die Diagnose zu hinterfragen, nicht der Code kosmetisch zu bearbeiten.

Qualitäts-Dimensionen, die jev-review bewertet

Immer bewertet (bei ausreichendem Kontext): Korrektheit, kognitive Komplexität, Lesbarkeit, Modularität, Kopplung, Änderbarkeit, Abstraktionsqualität, Projektstruktur, Duplikation, Wartbarkeit, Testqualität, Zuverlässigkeit, Sicherheit, Konsistenz und Dokumentation. Nur bei relevanter Evidenz: Performance, Skalierbarkeit, Kompatibilität, Observability. Pro Dimension liefert JEV: Score (1-10), Confidence (0-1), Delta zum vorherigen Lauf, Liste der Regressions, Rubric-Hints.

Datenschutz

Der API-Key wird nur lokal im Authorization-Header an https://api.typesafe.ai/v1/systemone gesendet. Es findet kein Logging des Keys statt. Die Review-Anfrage verlässt Ihre Maschine - prüfen Sie vor produktivem Einsatz die Privacy-Policy von TypeSafe AI. Sensible Repositories (Kundenstammdaten, Quellcode mit Geheimnissen) bereinigen Sie vor der Übertragung oder bewerten sie über lokale Modelle.

Was JEV für Vibecoder und Nutzer von Claude bedeutet

JEV ist eine Routing- und Klassifikationsschicht zwischen Agent und bestehenden Tools. Konkrete Einsatzfälle, die wir in unseren Kundenprojekten prüfen:

  • Ticket-Triage im Helpdesk. Eingehende Kundenanfragen in Echtzeit nach Dringlichkeit, Thema und benötigtem Skillset klassifizieren, bevor ein Mitarbeiter das Ticket sieht. Das senkt die First-Response-Time und verteilt die Last gleichmäßig.
  • Skill-Routing im Chatbot. Aus den über 80 dokumentierten Bot-Intents den richtigen Intent für eine neue Anfrage in unter 50 Millisekunden bestimmen - billiger und konsistenter als jeder LLM-Aufruf pro Nachricht.
  • PR-Screening in CI. Vor jedem Pull-Request JEV die Änderung auf Test-Schwächung, neue Risiko-Oberfläche und Verifikationsstärke prüfen lassen. Nur bei hoher JEV-Confidence (oder klarer Score-Verschlechterung) wird der teuere Coding-Agent eingeschaltet.
  • Rechnungs- und Beleg-Vor-Screening. Eingehende Belege (siehe unseren Beitrag zu KI-Dokumenten-Verarbeitung mit Docling) auf Vollständigkeit, Pflichtfelder und Plausibilität prüfen, bevor ein Mensch drüberschaut.

Die Rechnung ist in jedem Fall gleich: ein billiger JEV-Aufruf pro Anfrage plus nur dann ein teurer Agent-Aufruf, wenn die Antwort nicht eindeutig ist. In unseren Pilotprojekten erwarten wir eine Reduktion der LLM-Kosten um 60 bis 90 %, ohne dass die Antwortqualität für die Endnutzer leidet.

Wann JEV nicht passt

  • Bei freier, unstrukturierter Eingabe. Offene Freitext-Aufgaben ("Schreibe eine Marktanalyse für unser SaaS-Produkt") brauchen die Flexibilität eines großen Modells.
  • Bei instabiler Rubrik. Wer die Bewertungskriterien stündlich ändert, hat einen höheren Trainings- und Prompt-Aufwand als den Nutzen aus JEV.
  • Bei absoluter Geheimhaltung. JEV-Anfragen verlassen die Maschine - streng vertrauliche Repositories brauchen ein lokales Modell oder Air-Gap-Setup.
  • Bei sehr kleinem Volumen. JEV lohnt sich ab etwa 1.000 Klassifikations-Aufrufen pro Monat. Darunter ist die manuelle oder regelbasierte Lösung billiger.

Häufige Fragen

Die wichtigsten Antworten finden Sie oben in den FAQ-Boxen weiter oben im Beitrag. Wenn Ihre Frage dort nicht beantwortet wird, erreichen Sie uns über das Kontaktformular oder in einem kostenlosen Erstgespräch.

Nächste Schritte

In einem kostenlosen 30-Minuten-Erstgespräch prüfen wir gemeinsam, welche JEV-Anwendungsfälle in Ihrem Betrieb sinnvoll sind. Wir analysieren das Volumen Ihrer häufigen Klassifikations-Entscheidungen (Ticket-Triage, Beleg-Prüfung, Bot-Routing), kalkulieren die Kostenersparnis gegenüber dem Status quo und skizzieren einen Pilot-Setup-Plan. Bei Interesse schreiben Sie uns einfach über das Kontaktformular oder buchen direkt einen Termin.

Fragen & Antworten

Häufige Fragen zum Thema

JEV ist ein kleines, schnelles Entscheidungsmodell des US-Startups TypeSafe AI, das im September 2026 nach zwei Jahren Stealth-Phase veröffentlicht wurde. JEV liefert validierte strukturierte Antworten auf typisierte Fragen - zum Beispiel "Wähle aus A, B, C", "Bewerte nach Rubrik 1-5" oder "Ja/Nein mit Confidence". JEV ist als System-1-Komponente gedacht, die in Agent-Loops häufige, begrenzte Entscheidungen in Millisekunden trifft und nur bei niedriger Confidence an den großen Coding-Agent (System 2, etwa Claude Code) eskaliert.

TypeSafe AI wurde von Diogo Almeida, Erik Gafni und Sasha Sheng gegründet. Diogo Almeida hat bei OpenAI RLHF (Reinforcement Learning from Human Feedback) und InstructGPT mit-erfunden - die Verfahren, die ChatGPT und GPT-4 zugrunde liegen. Vor OpenAI war er bei Google Brain. Nach zwei Jahren im Stealth-Modus hat TypeSafe im September 2026 JEV als erstes öffentliches Modell vorgestellt. Die Trainingsmethode heißt RLCD und schlägt laut TypeSafe RLHF in mehreren Benchmarks.

jev-review ist ein local-first MCP-Plugin des Maintainers NiazMorshed2007 auf GitHub, das die JEV-Idee als wiederverwendbaren Review-Workflow für Coding-Agents kapselt. Voraussetzungen: Node.js 20 oder höher, ein JEV-API-Key von console.typesafe.ai und ein unterstützter Client (Claude Code, Codex, Cursor oder OpenCode). Installation in einer Zeile: erst den API-Key setzen ("export JEV_API_KEY="your-key""), dann "npx plugins add NiazMorshed2007/jev-review --target claude-code" ausführen und den Client neu starten. Alternativ fügen Sie das Plugin manuell als MCP-Server hinzu ("claude mcp add --scope user jev-review -- node /pfad/zu/jev-review/dist/server.js"). Das Plugin läuft komplett lokal, nur die Review-Anfrage geht an die JEV-API.

Claude Code und Codex bleiben System-2-Agenten, die mehrdeutige Aufgaben verstehen, planen und Code schreiben oder reparieren. JEV ergänzt sie um eine schnelle System-1-Komponente, die vor jeder teuren Agent-Aktion die einfache Frage beantwortet: ist diese Änderung riskant, welcher Skill passt, ist das ein Sicherheitsproblem, soll der Agent überhaupt eingreifen. In der TypeSafe-Demo screente der Maintainer 150 PR-Kommentare in 9,3 Sekunden für rund 0,01 USD. Der gleiche Durchlauf mit einem großen Modell kostet zwei bis drei Zehnerpotenzen mehr.

jev-review liefert strukturierte Scores (1-10) mit Confidence-Wert pro Dimension. Immer bewertet: Korrektheit, kognitive Komplexität, Lesbarkeit, Modularität, Kopplung, Änderbarkeit, Abstraktionsqualität, Projektstruktur, Duplikation, Wartbarkeit, Testqualität, Zuverlässigkeit, Sicherheit, Konsistenz und Dokumentation. Performance, Skalierbarkeit, Kompatibilität und Observability fließen nur dann ein, wenn genug Evidenz im übergebenen Diff oder Kontext liegt. Pro Aufruf nennt das Tool Delta-Werte und Regressions gegenüber der vorherigen Evaluation - so entsteht eine messbare Verbesserungs-Schleife statt subjektiver Reviewer-Meinungen.

Die Preise liegen im Cent-Bereich pro Anfrage. In der Demo screente Ray Amjad 150 Code-Kommentare in 9,3 Sekunden für rund 0,01 USD. Eine vollständige Code-Smell-Analyse über circa 28 Millionen Input-Tokens kostete rund 1,19 USD. Der gleiche Durchlauf mit einem großen Modell wie Claude Opus oder GPT-5 liegt im zwei- bis dreistelligen Dollar-Bereich. Der JEV-API-Key ist über die TypeSafe-Console erhältlich, eine Mindestabnahme oder ein Abo sind zum Start nicht nötig. Konkrete Preise und ein ggf. nötiges Token-Kontingent erfragen Sie direkt bei TypeSafe AI, da sich das Pricing-Modell im September 2026 noch in der Konsolidierung befindet.

TypeSafe AI positioniert JEV als "System One Model" in Anlehnung an die gleichnamige Unterscheidung aus der Kognitionspsychologie (Daniel Kahneman). System One steht für schnelles, paralleles, automatisiertes Denken - Instinkt, Mustererkennung, einfache Klassifikation. System Two steht für langsames, serielles, bewusstes Denken - Planung, Abstraktion, mehrdeutige Probleme. In der KI-Welt entspricht System Two dem großen Coding-Agent (Claude Code, Codex), System One dem kleinen Klassifikator (JEV). JEV routet, scored, klassifiziert und entscheidet; der große Agent plant und schreibt. Das senkt Kosten drastisch und erhöht gleichzeitig die Konsistenz, weil JEV für wiederkehrende Entscheidungen keine Varianz pro Aufruf einführt.

JEV selbst ist ein Modell und richtet sich an Entwickler und KI-Integratoren. Für nicht-technische Anwender wird JEV über eingebettete Produkte und Agent-Workflows interessant. Konkrete Beispiele aus der TypeSafe-Doku: automatisches Sortieren eingehender Support-Tickets, Klassifikation von Bewerbungen nach vordefinierten Kriterien, Vor-Screening von Rechnungen auf Vollständigkeit, Bewertung von Kundenfeedback nach Rubriken. In allen Fällen definiert das Unternehmen Rubriken und Regeln einmal, dann läuft JEV als schneller Klassifikator im Hintergrund. Die endgültige Entscheidung bleibt beim Menschen - JEV liefert Vorschläge mit Confidence-Werten.
Nico Zeier
Verfasst von
Nico Zeier
IT Professional and AI Engineer

Spezialisiert auf KI-Lösungen, autonome AI-Agents und produktive IT-Infrastruktur. Hält die Bytes-Commerce-Plattform am Laufen - vom ersten Pilot-KI-Agenten bis zum produktiven Workflow im Mittelstand.

Bereit für den nächsten Schritt?

Lassen Sie uns Ihr Projekt besprechen

Vereinbaren Sie ein unverbindliches Erstgespräch mit unseren Experten. Wir analysieren Ihre Anforderungen und entwickeln eine Lösung, die zu Ihrem Team passt.