
Hi {{FIrst name}},
396 API-Calls. 1.266 Entscheidungen. Median 324 Millisekunden. Kosten für die komplette Bauphase: 0,0107 Dollar.
Das sind keine Zahlen aus einem Launch-Tweet. Die stehen in den usage-Feldern meiner eigenen Calls, nachdem ich letzte Woche Jev in zwei Werkzeuge eingebaut hab.
Spoiler: Das Spannendste war nicht die Geschwindigkeit. Es waren die Stellen, an denen es schiefging.
Dein Agent schreibt einen Aufsatz, um „Ja" zu sagen
Schau dir einen typischen Agent-Loop an. Ein Research-Agent sammelt Quellen, ein Writer schreibt, irgendwer prüft. Dazwischen hängen lauter kleine Fragen. Reichen die Quellen? Wer ist als Nächstes dran? Darf das live?
Jede dieser Gabelungen ist heute ein vollwertiger LLM-Call. Das Modell denkt laut nach, produziert eine Begründung, und am Ende parst du ein einziges Wort aus dem Freitext.
Du bezahlst einen Aufsatz. Dich interessiert nur die letzte Zeile.
Und es wird nicht besser, wenn Tokens billiger werden. Das ist Jevons Paradox von 1865: Effizientere Dampfmaschinen haben den Kohleverbrauch nicht gesenkt, er ist gestiegen. Genau so läuft es mit Tokens. Sie werden billiger, wir bauen längere Loops, und die Rechnung bleibt gleich.
Die Entscheider-Schicht
Jev ist nach genau diesem Paradox benannt. TypeSafe AI nennt es ein System-One-Modell. Du schickst einen Zustand und vorher definierte Fragen, zurück kommen typisierte Antworten mit Wahrscheinlichkeiten. Text generiert es keinen.
Preis: 0,042 Dollar pro Million Input-Tokens. Output wird gar nicht berechnet.
Damit zerfällt jeder Agent in drei Schichten. Das große Sprachmodell generiert, also recherchiert, plant und schreibt. Jev entscheidet, also routet, bewertet, gibt frei oder eskaliert. Und Code führt aus.
Meine Regel dafür ist super simple: Sobald man zählt oder vergleicht, gehört es in den Code. Jev beantwortet nur das, was ein Mensch lesen müsste.
In n8n heißt das: Überall, wo heute ein LLM-Node nur ein Wort für den nächsten IF- oder Switch-Node ausspuckt, sitzt eigentlich eine Entscheidung. Genau da gehört Jev hin.
Dafür kennt Jev genau drei Fragetypen. Choice wählt eine Option aus einer Liste, die du vorgibst. Score ordnet etwas auf einer Skala ein, die du in Worten beschreibst. Noul beantwortet eine Ja-Nein-Frage als Wahrscheinlichkeit.
Mega smart daran: Du kannst beliebig viele Fragen in einen einzigen Call packen. Alle schauen parallel auf denselben Zustand, und die Antwortzeit ändert sich dadurch kaum. Genau deshalb lag mein Schnitt am Ende bei rund 0,0000084 Dollar pro Entscheidung.
Mein Gate: fünf Fragen, bevor ein Agent Text ändert
Mein erster Build war ein Gate. Ein CRO-Agent schlägt Textänderungen auf einer Website vor, und bevor so eine Änderung rausgeht, muss jemand entscheiden: direkt live oder erst ein Mensch?
Jev bekommt in einem einzigen Call das Element, den Aktionstyp, den alten und den neuen Text. Dann beantwortet es fünf Fragen. Betrifft die Änderung Preise? Betrifft sie Rechtliches? Macht sie ein neues Versprechen? Klingt sie werblicher? Und wie tief greift sie ein?
Jev sagt dabei nie „live" oder „Mensch". Das entscheidet eine kleine Funktion im Code, mit Schwellen pro Aktionstyp. Preisbezug über 0,3 geht an mich. Rechtsbezug über 0,3 auch.
Getestet hab ich das mit 36 Fällen, zwölf davon bewusst gefährlich. Neue Garantie, geänderte Kündigungsfrist, erfundene Kundenzahl. Ergebnis: Keine einzige gefährliche Änderung ist durchgerutscht. Laufzeit für alle 36 Fälle: 1,74 Sekunden.
Das Beste daran: Aus „Jetzt testen" wurde „Jetzt kostenlos testen", und Jev hat beim Preisbezug 0,71 gemeldet. „Kostenlos" ist eine Preisaussage, auch ohne Zahl oder Euro-Zeichen. Eine Regex hätte das glatt durchgewunken.
Kein Fehler, keine Exception, nur selbstbewusster Müll
Jetzt der Teil, den du in keinem Hype-Thread liest.
Bei meinem zweiten Build, einer SEO-Triage, sind beim ersten Lauf alle Seitenabrufe fehlgeschlagen. Die Zusammenfassungen waren leer. Jev hat daraufhin völlig korrekt gesagt: Diese Seiten beantworten die Suchanfrage nicht. Plötzlich sollten 106 von 117 Zeilen eine eigene Seite bekommen.
Keine Fehlermeldung. Kein 500er. Die Tabelle füllte sich, der Fortschrittsbalken lief durch. Es sah aus wie Erfolg.
Das ist die Kehrseite eines Modells mit garantiertem Schema. Bei Müll-Input bekommst du keinen Fehler. Du bekommst eine wohlgeformte falsche Antwort.
Und noch was, das ich erst im Smoke-Test gemerkt hab: Ja-Nein-Fragen liefern bei Jev überhaupt keine Confidence. Einige virale Anleitungen der letzten Woche behaupten das Gegenteil. Wer sein Schema aus Guides zusammenrät, baut Code auf Felder, die es nicht gibt.
Mein Learning: Input prüfen, bevor Jev ihn sieht. Und ein Plausibilitäts-Check auf das Ergebnis. 106 neue Seiten aus 117 Zeilen können nicht stimmen.
Hoffe euch hilft bisschen daraus aus meinen Helfer zu lernen.
Happy Building
Sascha
Das komplette Gate zum Nachbauen
Im morgigen Member Newsletter gehe ich tiefer:
die fünf Fragen und die Gate-Funktion als Copy-Paste-Vorlage
meine Schwellentabelle und warum alle vier Fehler an ihr lagen
der Smoke-Test und ein Prompt für deinen eigenen Gabelungs-Audit
Dieses fortgeschrittene Tutorial ist exklusiv für Premium-Mitglieder verfügbar. Du erhältst:
Fertigen Blueprint zum Kopieren
Zugang zu allen künftigen Premium-Tutorials
Wenn du dich bereit fühlst, dann kann ich dir folgendermaßen helfen:
1) KI ohne Team - 40+ Unternehmer sind schon dabei. Die KI Agenten Community für Menschen die was umsetzen wollen. Fertige KI-Systeme, die du lädst und sofort einsetzt. Jede Woche neue. Von Leuten, die damit ihr eigenes Geschäft betreiben.
2) KI Agenten Management Framework Paperclip - Das One-Click-Deployment für Paperclip. Mach dir selbst keinen Kopf mehr um das technische Setup. Lass den Agenten einfach für dich arbeiten. => Mit SASCHA10 bekommst du auch Rabatt im Checkout.
3) Lead-Gen-System für dein SaaS Produkt - ich habe ein Lead-Gen-System, das auf KI und den aktuellsten Marketing-Trends basiert und dir nachhaltig Leads generiert.



