Stand: September 2026. Im September 2026 hat das US-Startup TypeSafe AI nach zwei Jahren Stealth-Phase sein erstes Modell vorgestellt: JEV. In den Tagen danach taucht der Begriff in jeder KI-Feedbackschleife auf, in jedem Coding-Agent-Thread und in mehreren TechCrunch-Artikeln. JEV ist ein kleines, schnelles Entscheidungsmodell, das im Loop mit großen Coding-Agents wie Claude Code oder Codex arbeitet. Dieser Beitrag erklärt, was JEV konkret kann, wie das lokale MCP-Plugin jev-review funktioniert und warum das Muster für Build- und Review-Pipelines im Mittelstand relevant wird.
TL;DR
- JEV ist ein System-1-Entscheidungsmodell. JEV beantwortet typisierte Fragen mit validierten strukturierten Antworten.
- JEV routet und scored Skills. Skills sind Prozeduren; JEV wählt aus, bewertet und klassifiziert sie.
- JEV ergänzt Claude Code. Claude Code bleibt das Gehirn (System 2), JEV ist der schnelle Filter davor (System 1).
- jev-review ist das passende MCP-Plugin. Lokal installierbar mit einem Befehl, liefert strukturierte Quality-Scores 1-10 mit Confidence und Delta.
- Die Gründer haben OpenAI-Hintergrund. Diogo Almeida hat bei OpenAI RLHF und InstructGPT mit-erfunden - die Methoden hinter ChatGPT.
- Die Kosten sind drastisch niedriger. In der TypeSafe-Demo: 150 PR-Kommentare für 0,01 USD statt mehrerer Dollar mit einem großen Modell.
Was ist JEV?
JEV ist ein kleines, schnelles Modell, das TypeSafe AI nach zwei Jahren Entwicklungszeit im September 2026 vorgestellt hat. JEV nimmt einen State plus eine typisierte Frage entgegen und liefert eine validierte strukturierte Antwort. Das Eingabe-Schema schließt offene Fragen aus - das ist die technische Grundlage für halluzinationsfreie Ausgaben.
Die Ausgabe folgt immer einer von drei Primitives:
- Choice - Auswahl aus vorgegebenen Optionen ("A, B oder C?").
- Score - Bewertung nach einer geordneten Rubrik ("1 bis 5 nach Kriterium X").
- Noul - 0 oder 1 für Ja/Nein-Fragen, optional mit Confidence zwischen 0 und 1.
Zusätzlich liefert JEV auf Wunsch einen Confidence-Wert. Bei niedriger Confidence oder bei konsequentenreichen Entscheidungen gibt das System die Frage an System 2 weiter - den großen Coding-Agent oder den Menschen.
System 1 versus System 2 - die zentrale Analogie
TypeSafe positioniert JEV bewusst als System One Model, in Anlehnung an die gleichnamige Unterscheidung aus der Kognitionspsychologie von Daniel Kahneman. System One steht für schnelles, paralleles, automatisiertes Denken - Mustererkennung, Instinkt, einfache Klassifikation. System Two steht für langsames, serielles, bewusstes Denken - Planung, Abstraktion, mehrdeutige Probleme.
Übersetzt in die KI-Welt:
| Rolle | System 1 | System 2 |
|---|---|---|
| Typischer Vertreter | JEV | Claude Code, Codex, GPT-5 |
| Reaktionszeit | Millisekunden | Sekunden bis Minuten |
| Kosten pro Aufruf | Cent-Bruchteile | Cent bis Dollar |
| Ausgabe | strukturierte Antwort | freier Text, Code, Erklärungen |
| Typischer Einsatz | Routing, Klassifikation, Vor-Screening | Planen, Coden, Refaktorieren |
| Stärke | Konsistenz, Geschwindigkeit, Kosten | mehrdeutige Probleme, kreative Lösungen |
| Schwäche | starr bei unerwarteten Fällen | teuer, langsam, varianzanfällig |
JEV routet, scored und klassifiziert im Vorfeld und entscheidet, ob der teuere Agent überhaupt aktiv werden soll. Das senkt Kosten drastisch und erhöht gleichzeitig die Konsistenz, weil JEV für wiederkehrende Entscheidungen keine Varianz pro Aufruf einführt.
Die Rolle von JEV im Agent-Stack
Wer Coding-Agents mit Claude Code oder Codex aufbaut, kennt zwei typische Bausteine: Chatbots für offene Konversation und Skills als wiederverwendbare Prozeduren. JEV bedient eine dritte Rolle - den schnellen Klassifikator, der vor jedem teuren Agent-Aufruf die einfache Frage beantwortet.
Die wichtigsten Eigenschaften im Vergleich:
- Validierte Ausgabe statt freier Text. JEV wählt aus den angebotenen Optionen oder Rubriken - das Ausgabe-Schema schließt freie Erfindungen aus.
- Vertrauenswürdigkeit in Pipelines. Ein Agent kann JEV-Ausgaben ohne Bedenken weiterverarbeiten, ohne einen Parser oder ein zweites LLM zur Validierung dazwischenzuschalten.
- Auditierbarkeit. Eingabe und Ausgabe sind beide strukturiert - Sie können später exakt nachvollziehen, warum JEV welche Entscheidung getroffen hat.
- Skill-Routing auf Skala. In großen Projekten existieren Hunderte von Skills. JEV wählt aus 182 Skills die drei bis fünf passenden aus, bevor der Agent überhaupt aktiv wird.
- Diff-Screening. Vor jedem Commit prüft JEV die Änderung: schwächt sie Tests, vergrößert sie die Risiko-Oberfläche, ist die Verifikation stark genug? Antwort in 200 Millisekunden statt in 30 Sekunden.
- Comment-Screening. Qualitative Linting-Aufgaben ("Ist dieser Kommentar noch aktuell? Passt er zum Code?") lassen sich mit JEV deutlich billiger lösen als mit einem großen Modell.
Im TypeSafe-Benchmark (n = 488 Requests mit Haiku) sank die Quote der falsch geladenen Skills von 16,8 % ohne JEV auf 7,3 % mit JEV. Bei Anfragen, für die kein Skill passt, wurden unnötige Loads von 9,8 % auf 4,0 % reduziert - der Agent verschwendet also weniger Tokens für sinnlose Aktionen.
Die drei JEV-Primitives in der Praxis
Wer JEV produktiv einsetzen will, schreibt seine Aufgabenstellung als Choice, Score oder Noul. Drei vereinfachte Beispiele aus der TypeSafe-Dokumentation:
1. Choice für Skill-Routing.
State: { "available_skills": ["postgres-tuning", "redis-cache", "rate-limit", "logging"] }
Question: "Welcher Skill passt zur aktuellen Anfrage 'API antwortet langsam'?"
Type: choice
Options: ["postgres-tuning", "redis-cache", "rate-limit", "logging"]
→ Output: { "answer": "redis-cache", "confidence": 0.82 }
2. Score für Diff-Screening.
State: { "diff": "<unified diff mit 240 geänderten Zeilen, 12 Dateien>", "test_coverage_before": 0.71, "test_coverage_after": 0.69 }
Question: "Wie stark schwächt dieser Diff die Test-Coverage?"
Type: score
Rubric: { "1": "keine Auswirkung", "5": "kritische Schwächung" }
→ Output: { "answer": 2, "confidence": 0.74 }
3. Noul für Sicherheits-Check.
State: { "code": "<function evaluateExpression(userInput)>", "language": "javascript" }
Question: "Enthält dieser Code eine ungeprüfte dynamische Code-Ausführung (eval, Function-Constructor oder gleichwertig)?"
Type: noul
→ Output: { "answer": 1, "confidence": 0.97 }
In allen drei Fällen ist die Ausgabe ein festes JSON-Schema. Der empfangende Code weiß exakt, wie er sie zu parsen hat - ein LLM zur Extraktion ist nicht mehr nötig.
Die Gründer: TypeSafe AI und der ChatGPT-Miterfinder
TypeSafe AI hat drei Gründer. Diogo Almeida steht im Mittelpunkt der öffentlichen Aufmerksamkeit: er hat bei OpenAI die Methoden mit-erfunden, die ChatGPT zu ChatGPT machen.
- Diogo Almeida (CEO). Mit-Erfinder von RLHF (Reinforcement Learning from Human Feedback) und InstructGPT bei OpenAI. Diese beiden Verfahren bilden die Grundlage für ChatGPT und GPT-4. Vor OpenAI war er bei Google Brain. In einem öffentlichen LinkedIn-Post formuliert er selbst: "After co-inventing ChatGPT, I spent 2 years in stealth building..." TechCrunch titelte am 18. September 2026 "A new kind of AI model from a ChatGPT inventor is thrilling developers" - das ist die treffende Formulierung.
- Erik Gafni. Co-Founder, Rolle in der öffentlichen Kommunikation bislang zurückhaltend.
- Sasha Sheng. Co-Founder, ebenfalls zurückhaltend in der öffentlichen Kommunikation.
Das Trainingsverfahren hinter JEV heißt RLCD und schlägt laut TypeSafe RLHF in mehreren Benchmarks. Details veröffentlicht TypeSafe schrittweise über den eigenen Blog (Introducing System One Models and Jev) und über die Conference-Auftritte des Teams. Wer die wissenschaftliche Grundlage bewerten will, liest diese Primärquellen statt Marketing-Aussagen zu wiederholen.
Eine offene Frage bleibt der Maintainer des jev-review-Repos: das GitHub-Repo läuft unter dem Handle NiazMorshed2007, der Username deutet auf einen bangladeschischen Entwickler hin. Öffentliche Hintergrundinformationen - etwa berufliche Stationen oder Firma - sind online nicht ohne weiteres auffindbar. Das Repo selbst hat zum Stand September 2026 rund 184 Stars, 16 Forks, MIT-Lizenz und wird über GitHub verteilt (kein npm-Publish). Wer das Plugin einsetzt, behält die Aktivität des Maintainers im Auge, weil das Projekt noch jung ist.
jev-review: das lokale MCP-Plugin
Das MCP-Plugin jev-review übersetzt die JEV-Idee in einen wiederverwendbaren Agent-Workflow: Coding-Agents können ihren eigenen Code mit JEV bewerten lassen, ohne für jeden Review-Aufruf eine eigene Prompt-Logik zu schreiben. Das Plugin läuft komplett lokal, nur die Review-Anfrage geht an die JEV-API.
Voraussetzungen
- Node.js 20 oder höher
- JEV-API-Key von der TypeSafe-Console
- Ein unterstützter Client: Claude Code, Codex, Cursor oder OpenCode
Installation in einer Zeile
export JEV_API_KEY="your-key"
npx plugins add NiazMorshed2007/jev-review --target claude-code
Danach den Client neu starten und den Agent mit jev-review arbeiten lassen.
Alternative manuelle MCP-Konfiguration für Claude Code
claude mcp add --scope user jev-review -- node /pfad/zu/jev-review/dist/server.js
Alle Clients starten dasselbe dist/server.js lokal über stdio. In OpenCode taucht das Tool je nach Konfiguration als jev-review_jev_review auf.
Das Tool jev_review
Das Plugin stellt ein einziges Tool bereit: jev_review. Pflichtfelder sind mindestens eines aus task, diff, files oder repositoryContext. Optional kann previousEvaluation mit der vorherigen JEV-Antwort übergeben werden, damit das Tool Deltas und Regressions berechnen kann. Es findet keine automatische Repo-Erkennung statt - nur was explizit übergeben wird, geht an die JEV-API.
Der Feedback-Loop in der Praxis
- Task verstehen und Repository inspizieren.
- Eine kohärente Änderung implementieren.
jev_reviewmit fokussiertem Kontext aufrufen (Baseline).- Selbst inspizieren und Hypothese zu schwachen Dimensionen bilden.
- Kleinste gerechtfertigte Verbesserung machen, dann
jev_reviewerneut mitpreviousEvaluationaufrufen. - Wiederholen, bis die Anforderungen erfüllt sind - und nicht bis der Score perfekt ist.
Korrektheit schlägt Score-Optimierung. Score-Gaming durch Scope-Erweiterung, Spekulations-Architektur oder mechanisches File-Splitting verfehlt den Zweck. Bei ausbleibender Verbesserung eines gezielten Scores ist die Diagnose zu hinterfragen, nicht der Code kosmetisch zu bearbeiten.
Qualitäts-Dimensionen, die jev-review bewertet
Immer bewertet (bei ausreichendem Kontext): Korrektheit, kognitive Komplexität, Lesbarkeit, Modularität, Kopplung, Änderbarkeit, Abstraktionsqualität, Projektstruktur, Duplikation, Wartbarkeit, Testqualität, Zuverlässigkeit, Sicherheit, Konsistenz und Dokumentation. Nur bei relevanter Evidenz: Performance, Skalierbarkeit, Kompatibilität, Observability. Pro Dimension liefert JEV: Score (1-10), Confidence (0-1), Delta zum vorherigen Lauf, Liste der Regressions, Rubric-Hints.
Datenschutz
Der API-Key wird nur lokal im Authorization-Header an https://api.typesafe.ai/v1/systemone gesendet. Es findet kein Logging des Keys statt. Die Review-Anfrage verlässt Ihre Maschine - prüfen Sie vor produktivem Einsatz die Privacy-Policy von TypeSafe AI. Sensible Repositories (Kundenstammdaten, Quellcode mit Geheimnissen) bereinigen Sie vor der Übertragung oder bewerten sie über lokale Modelle.
Was JEV für Vibecoder und Nutzer von Claude bedeutet
JEV ist eine Routing- und Klassifikationsschicht zwischen Agent und bestehenden Tools. Konkrete Einsatzfälle, die wir in unseren Kundenprojekten prüfen:
- Ticket-Triage im Helpdesk. Eingehende Kundenanfragen in Echtzeit nach Dringlichkeit, Thema und benötigtem Skillset klassifizieren, bevor ein Mitarbeiter das Ticket sieht. Das senkt die First-Response-Time und verteilt die Last gleichmäßig.
- Skill-Routing im Chatbot. Aus den über 80 dokumentierten Bot-Intents den richtigen Intent für eine neue Anfrage in unter 50 Millisekunden bestimmen - billiger und konsistenter als jeder LLM-Aufruf pro Nachricht.
- PR-Screening in CI. Vor jedem Pull-Request JEV die Änderung auf Test-Schwächung, neue Risiko-Oberfläche und Verifikationsstärke prüfen lassen. Nur bei hoher JEV-Confidence (oder klarer Score-Verschlechterung) wird der teuere Coding-Agent eingeschaltet.
- Rechnungs- und Beleg-Vor-Screening. Eingehende Belege (siehe unseren Beitrag zu KI-Dokumenten-Verarbeitung mit Docling) auf Vollständigkeit, Pflichtfelder und Plausibilität prüfen, bevor ein Mensch drüberschaut.
Die Rechnung ist in jedem Fall gleich: ein billiger JEV-Aufruf pro Anfrage plus nur dann ein teurer Agent-Aufruf, wenn die Antwort nicht eindeutig ist. In unseren Pilotprojekten erwarten wir eine Reduktion der LLM-Kosten um 60 bis 90 %, ohne dass die Antwortqualität für die Endnutzer leidet.
Wann JEV nicht passt
- Bei freier, unstrukturierter Eingabe. Offene Freitext-Aufgaben ("Schreibe eine Marktanalyse für unser SaaS-Produkt") brauchen die Flexibilität eines großen Modells.
- Bei instabiler Rubrik. Wer die Bewertungskriterien stündlich ändert, hat einen höheren Trainings- und Prompt-Aufwand als den Nutzen aus JEV.
- Bei absoluter Geheimhaltung. JEV-Anfragen verlassen die Maschine - streng vertrauliche Repositories brauchen ein lokales Modell oder Air-Gap-Setup.
- Bei sehr kleinem Volumen. JEV lohnt sich ab etwa 1.000 Klassifikations-Aufrufen pro Monat. Darunter ist die manuelle oder regelbasierte Lösung billiger.
Häufige Fragen
Die wichtigsten Antworten finden Sie oben in den FAQ-Boxen weiter oben im Beitrag. Wenn Ihre Frage dort nicht beantwortet wird, erreichen Sie uns über das Kontaktformular oder in einem kostenlosen Erstgespräch.
Nächste Schritte
In einem kostenlosen 30-Minuten-Erstgespräch prüfen wir gemeinsam, welche JEV-Anwendungsfälle in Ihrem Betrieb sinnvoll sind. Wir analysieren das Volumen Ihrer häufigen Klassifikations-Entscheidungen (Ticket-Triage, Beleg-Prüfung, Bot-Routing), kalkulieren die Kostenersparnis gegenüber dem Status quo und skizzieren einen Pilot-Setup-Plan. Bei Interesse schreiben Sie uns einfach über das Kontaktformular oder buchen direkt einen Termin.
Fragen & Antworten