Jev, die KI, die entscheidet statt zu schreiben: mein Test gegen GPT
🇮🇹 Italiano • 🇬🇧 English • 🇪🇸 Español • 🇫🇷 Français • 🇧🇷 Português
Seit ChatGPT da ist, sind die Modelle, über die alle reden, Chatbots: Du stellst eine Frage, und sie antworten mit Text. Am 15. September ist das erste seiner Art erschienen, das keiner ist. Es heißt Jev, TypeSafe AI hat es gebaut, und es kann kein einziges Wort schreiben: Es trifft Entscheidungen und sagt dir zu jeder, wie sicher es sich ist. Seine Macher versprechen einen Workflow, der 193-mal schneller ist als mit einem Frontier-LLM. So ein Versprechen musste ich prüfen: 105 Kunden-E-Mails für eine kaufmännische Software, sechs Modelle, zwei Sprachen und ein Vergleich nur zwischen Modellen, die genauso viele Fehler machen wie Jev. Hier liest du, wie es ausgegangen ist, mit Methode, Tabellen und Delphi-Code.
Wenn du ein LLM in eine Unternehmensanwendung eingebaut hast, hast du es früher oder später für eine kleine Entscheidung benutzt: welche Abteilung diese E-Mail bekommt, welche Art von Dokument gerade hereingekommen ist, ob der Kunde verärgert ist. Das funktioniert. Aber jede Entscheidung kostet ein, zwei Sekunden plus Output-Tokens, und bei zehntausend E-Mails am Tag werden Zeit und Rechnung zum Problem.
Am 15. September hat TypeSafe AI Jev vorgestellt, ein Modell, das kein einziges Wort schreiben kann und nur Entscheidungen zurückgibt. Auf der Homepage wirbt TypeSafe mit einem Workflow, der 193,6-mal schneller und 444,6-mal billiger ist als mit einem Frontier-LLM. Ich habe darüber in Folge 7 des Podcasts “while true do;” (auf Italienisch) gesprochen und dort versprochen, Methode, Tabellen und Delphi-Code hier zu veröffentlichen.
Was Jev ist
Du gibst ihm einen Kontext, den TypeSafe state nennt (den Text einer E-Mail, einen Datensatz), und einige typisierte Fragen. Es gibt drei Fragetypen:
- choice: eine von bis zu 255 Optionen wählen, jede in Worten beschrieben;
- score: den Text auf einer Skala mit 2 bis 10 Stufen einordnen;
- noul: eine Ja/Nein-Frage, deren Antwort die Wahrscheinlichkeit für Ja ist.
Du bekommst nie Text zurück, den du interpretieren musst. Du bekommst die gewählte Option, die Wahrscheinlichkeitsverteilung über alle Optionen und eine Konfidenz. Alle Fragen werden in einem einzigen Durchlauf berechnet, deshalb ändert eine zusätzliche Frage die Antwortzeit kaum. Der Listenpreis liegt bei 0,042 Dollar pro Million Input-Tokens, für den Output zahlst du nichts.
Seit dem 18. September gibt es Jev auch auf OpenRouter, über den Endpoint POST /api/v1/systemone. Den habe ich verwendet: Mit einem einzigen Key rufst du sowohl Jev als auch die LLMs auf, mit denen du es vergleichst, und jede Zeitmessung enthält denselben Umweg über OpenRouter.
Der Aufruf aus Delphi
Der Aufruf ist ein POST mit JSON-Body, also reichen THTTPClient und System.JSON, ein SDK brauchst du nicht. Das ist der Request aus JevTriage_en, dem Demoprogramm: drei Fragen zu einer E-Mail, eine pro Typ.
// The three questions for Jev: department (choice), frustration (score), urgency (noul).
function BuildJevRequest(const AModel, AEmail: string): string;
begin
var lRoot := TJSONObject.Create;
try
lRoot.AddPair('model', AModel);
lRoot.AddPair('state', AEmail);
var lQuestions := TJSONObject.Create;
lRoot.AddPair('questions', lQuestions); // from here on lRoot owns it
var lDepartments := TJSONObject.Create;
lDepartments.AddPair('administration', 'Invoices, payments, charges, refunds');
lDepartments.AddPair('technical support', 'Program errors, freezes and malfunctions');
lDepartments.AddPair('sales', 'Quotes, new modules, licenses, training');
lDepartments.AddPair('other', 'None of the above'); // always include the fallback option
lQuestions.AddPair('department', TJSONObject.Create
.AddPair('type', 'choice')
.AddPair('instructions', 'Which department should handle this email?')
.AddPair('criteria', lDepartments));
var lLevels := TJSONArray.Create;
lLevels.Add('Calm, states the facts');
lLevels.Add('Annoyed but polite');
lLevels.Add('Very angry, harsh tone');
lQuestions.AddPair('frustration', TJSONObject.Create
.AddPair('type', 'score')
.AddPair('instructions', 'How frustrated is the customer?')
.AddPair('criteria', lLevels));
lQuestions.AddPair('urgent', TJSONObject.Create
.AddPair('type', 'noul')
.AddPair('instructions', 'Is the request urgent or does it have a close deadline?'));
Result := lRoot.ToJSON;
finally
lRoot.Free;
end;
end;
Das ist die englische Version der Demo. Im Zip liegt auch das italienische Original, JevTriage, denn bei einem italienischen Softwarehaus kommen diese E-Mails auf Italienisch an. Wenn du mit System.JSON arbeitest und nachlesen willst, wie die Fluent-API funktioniert und wem welches Objekt gehört, hilft dir der vollständige Leitfaden zu JSON in Delphi.
Die Antwort liest du mit GetValue<T> und einem Pfad: answers.department.choice, answers.department.confidence, answers.urgent.noul. Dann entscheidet der Code über das Routing, nicht das Modell. Er vergleicht dazu die Konfidenz mit zwei Schwellenwerten:
// Routing is decided by the code, not by the model: confidence is just a number to compare.
function RouteByConfidence(const ADepartment: string; AConfidence: Double): string;
begin
if (ADepartment = 'other') or (AConfidence < HUMAN_THRESHOLD) then
Result := 'to an operator (a person decides)'
else if AConfidence >= AUTO_THRESHOLD then
Result := Format('automatic to "%s"', [ADepartment])
else
Result := Format('to "%s" with caution (needs confirmation)', [ADepartment]);
end;
AUTO_THRESHOLD ist 0,85 und HUMAN_THRESHOLD ist 0,5. Weiter unten siehst du, dass 0,85 optimistisch ist.
Vier E-Mails, ein echter Lauf
JevTriage_en schickt dieselben vier E-Mails an Jev und an google/gemini-2.5-flash-lite, das ein JSON mit denselben drei Feldern schreiben soll. Das ist die vollständige Ausgabe eines echten Laufs von heute:
Email 1: "Good morning, this month you charged the fee for the management software twice to our company card. Could you reverse the second charge? Thanks, Marta Rossi"
Jev (typesafe/jev-1.13-20260917) in 455 ms
department: administration (confidence 1.00)
administration=1.00 other=0.00 technical support=0.00 sales=0.00
frustration: 0.04 of 2 (confidence 0.95)
0=0.96 1=0.04 2=0.00
urgent: no (probability of yes 0.21)
routing: automatic to "administration"
LLM (google/gemini-2.5-flash-lite) in 1101 ms
department: administration, frustration: 1, urgent: true (no probabilities, no confidence)
Email 2: "Since this morning, whenever I print an invoice the program closes with a memory access error. I have forty invoices to send out by tonight, I don't know what to do anymore!!!"
Jev (typesafe/jev-1.13-20260917) in 373 ms
department: technical support (confidence 0.99)
technical support=1.00 sales=0.00 administration=0.00 other=0.00
frustration: 1.75 of 2 (confidence 0.62)
0=0.00 1=0.25 2=0.75
urgent: yes (probability of yes 0.98)
routing: automatic to "technical support"
LLM (google/gemini-2.5-flash-lite) in 715 ms
department: technical support, frustration: 2, urgent: true (no probabilities, no confidence)
Email 3: "Hello, we are a firm with twelve workstations and we would like a quote for the warehouse module and for staff training. No rush."
Jev (typesafe/jev-1.13-20260917) in 365 ms
department: sales (confidence 1.00)
sales=1.00 other=0.00 administration=0.00 technical support=0.00
frustration: 0.00 of 2 (confidence 1.00)
0=1.00 1=0.00 2=0.00
urgent: no (probability of yes 0.04)
routing: automatic to "sales"
LLM (google/gemini-2.5-flash-lite) in 524 ms
department: sales, frustration: 0, urgent: false (no probabilities, no confidence)
Email 4: "Hi, I just wanted to tell you that yesterday's course was really useful. See you soon!"
Jev (typesafe/jev-1.13-20260917) in 401 ms
department: other (confidence 0.82)
other=0.87 administration=0.00 technical support=0.00 sales=0.13
frustration: 0.00 of 2 (confidence 1.00)
0=1.00 1=0.00 2=0.00
urgent: no (probability of yes 0.02)
routing: to an operator (a person decides)
LLM (google/gemini-2.5-flash-lite) in 575 ms
department: other, frustration: 0, urgent: false (no probabilities, no confidence)
Email Jev ms LLM ms Jev token in/out LLM token in/out Jev cost LLM cost
1 455 1101 460 / 84 113 / 18 $0.0000193 $0.0000185
2 373 715 467 / 82 121 / 19 $0.0000196 $0.0000197
3 365 524 459 / 81 110 / 18 $0.0000193 $0.0000182
4 401 575 450 / 81 104 / 18 $0.0000189 $0.0000176
Total 1594 2915 $0.0000771 $0.0000740
Costs come from OpenRouter's usage.cost field (in credits, 1 credit = 1 USD).
Timings include the hop through OpenRouter.
Die erste E-Mail meldet eine doppelte Abbuchung und ist ruhig geschrieben. Laut Flash Lite ist der Kunde verärgert und die Anfrage dringend. Jev hält sie für ruhig und nicht dringend und liefert die Wahrscheinlichkeiten gleich mit.
Die vierte E-Mail ist ein Dankeschön, und hier sind sich die beiden einig: other, ruhig, nicht dringend. Jev wählt other mit einer Konfidenz von 0,82, und der Code schickt die E-Mail an einen Mitarbeiter, wie bei jedem other, egal wie hoch die Konfidenz ist.
Bei den Kosten liegt Jev mit drei Fragen gleichauf mit Flash Lite, sogar eine Spur darüber: Der Request an Jev hat rund 460 Input-Tokens, der an das LLM rund 110. Jevs Preisvorteil ist der kostenlose Output, und bei drei kurzen Antworten lässt sich am Output wenig sparen. Vier E-Mails beweisen allerdings nichts, und Flash Lite ist das günstigste Modell auf der Liste. Deshalb habe ich JevBench geschrieben.
Der Benchmark: 105 E-Mails, sechs Modelle
Der Benchmark erledigt dieselbe Arbeit im großen Maßstab, nach diesen Regeln:
- 105 Kunden-E-Mails an ein Softwarehaus, das kaufmännische Software herstellt: doppelte Abbuchungen, vom SDI (dem italienischen Austauschsystem für elektronische Rechnungen) abgelehnte Rechnungen, Lohnabrechnungen, die sich nicht berechnen lassen, Angebotsanfragen, Kündigungen, Spam, Phishing. 61 davon sind absichtlich schwierig: Sarkasmus, verhaltener Ärger, Verneinungen (“es ist nicht dringend, aber bis morgen früh…”), eine Anfrage, die im PS eines Newsletters steckt;
- 25 Fragen pro E-Mail (Abteilung, Programmmodul, Frustration, Dringlichkeit, Erstattungswunsch, Kündigungsdrohung, sensible Daten und so weiter), gestellt in Gruppen zu 3, 10 und 25 pro Aufruf;
- sechs Modelle über OpenRouter: Jev 1.13, Gemini 2.5 Flash Lite, GPT-5.6 Luna, GPT-5.6 Terra, Gemini 3.1 Pro, DeepSeek V4 Pro. Dieselben Anweisungen für alle, kein Prompt-Tuning;
- Balanced Accuracy als Hauptmetrik, mit 95%-Bootstrap-Konfidenzintervallen. Die einfache Accuracy belohnt ein Modell, das immer “nein” antwortet: Hier käme ein Modell, das immer die häufigste Klasse nennt, auf 84% einfache und 41% Balanced Accuracy;
- erst die Qualität, dann die Zeiten: Geschwindigkeit und Kosten vergleiche ich nur zwischen Jev und dem günstigsten LLM, das genauso viele Fehler macht wie Jev oder weniger. Ein zehnmal billigeres Modell, das jede dritte E-Mail falsch einordnet, taugt nicht als Ersatz für Jev.
Ein Modell von Anthropic fehlt, und das nicht aus Trotz: Die erwarteten Antworten hat Claude Opus 5 geschrieben und geprüft, und ein Modell derselben Familie hätte bei den Grenzfällen einen Vorsprung. Die Regeln für die Labels habe ich festgelegt und den umstrittensten Fall selbst entschieden; die übrigen umstrittenen Fälle hat dasselbe Modell in meinem Auftrag entschieden, und niemand hat jedes Label von Hand nachgeprüft.
Der Haupttest läuft auf Englisch, weil Jev laut TypeSafe auf Englisch am besten abschneidet und ich es nicht benachteiligen wollte, ohne das dazuzusagen. Danach habe ich ihn auf Italienisch wiederholt.
Wer versteht mehr
Jede Zelle sagt dir, wie viel ein Modell bei den 105 englischen E-Mails verstanden hat, bei der jeweiligen Zahl von Fragen pro Aufruf. Die Spalten sind nicht drei Läufe desselben Tests: “3 Entscheidungen” heißt die ersten drei Fragen (Abteilung, Frustration, Dringlichkeit), “10” die ersten zehn, “25” alle. Jede Spalte bringt neue Fragen dazu, manche davon schwieriger, und deshalb fällt Jev von 97,2 auf 94,8: Bei 25 ist auch die Auswirkung des Problems auf den Kunden dabei, und dort kommt Jev nur auf 68%.
Die Zahl ist die Balanced Accuracy in Prozent. Für jede Frage wird jede mögliche Antwort getrennt bewertet: Bei “dringend” nimmst du den Anteil der dringenden E-Mails, die das Modell als dringend erkannt hat, und den Anteil der nicht dringenden, die es als nicht dringend erkannt hat, und bildest den Mittelwert. Dann mittelst du über alle Fragen. So zählt eine seltene Antwort genauso viel wie eine häufige. Ein Modell, das auf “dringend” immer “nein” antwortet, liegt bei 88 von 105 E-Mails richtig, kommt hier aber auf 50. Gibst du auf jede Frage immer die häufigste Antwort, kommst du auf 34,4 bei 3 Entscheidungen, 39,4 bei 10 und 41,4 bei 25. Das ist die Untergrenze, mit der du die Werte in der Tabelle vergleichen solltest.
In eckigen Klammern steht das 95%-Konfidenzintervall. Ich habe es berechnet, indem ich die 105 E-Mails 2.000-mal zufällig neu gezogen habe (Bootstrap): Mit einer anderen Stichprobe ähnlicher E-Mails würde das Ergebnis fast immer in diesem Bereich landen. Je breiter das Intervall, desto ungenauer die Zahl, und bei 3 Fragen ist es breit, weil jeder Fehler mehr Gewicht hat. Um zu entscheiden, ob ein LLM besser oder schlechter als Jev ist, reicht es allerdings nicht, auf überlappende Intervalle zu schauen: Ich habe jedes Modell E-Mail für E-Mail mit Jev verglichen, auf denselben Bootstrap-Stichproben, und es zählen nur Unterschiede, deren Konfidenzintervall die Null nicht enthält.
| Modell | 3 Entscheidungen | 10 Entscheidungen | 25 Entscheidungen |
|---|---|---|---|
| Jev 1.13 | 94.3 [91.3; 96.8] | 97.2 [96.0; 98.1] | 94.8 [93.3; 96.1] |
| Gemini 2.5 Flash Lite | 82.2 [76.3; 88.0] | 87.8 [84.4; 90.8] | 90.1 [87.9; 92.0] |
| GPT-5.6 Luna | 90.2 [86.0; 94.0] | 96.5 [95.1; 97.8] | 95.7 [94.3; 97.0] |
| GPT-5.6 Terra | 89.9 [85.5; 94.1] | 96.9 [95.5; 98.2] | 96.0 [94.8; 97.2] |
| Gemini 3.1 Pro | 92.0 [86.8; 96.6] | 97.6 [96.2; 98.8] | 97.1 [96.0; 98.1] |
| DeepSeek V4 Pro | 92.9 [89.1; 96.2] | 96.6 [94.9; 98.0] | 94.6 [92.9; 96.1] |
Mit 3 und mit 10 Entscheidungen pro Aufruf ist kein LLM so viel besser als Jev, dass sich der Abstand vom Rauschen unterscheiden ließe. Bei 25 schlägt es nur Gemini 3.1 Pro, um 2,3 Punkte [0,9; 3,7]. Flash Lite ist auf jeder Stufe schlechter, sein Ausrutscher bei den vier E-Mails vorhin war also kein Pech.
Kein Modell hat in den 2.835 Aufrufen des Benchmarks ungültiges JSON geliefert, 1.890 auf Englisch und 945 auf Italienisch. Mit heutigen Modellen sind Schemafehler selten, du brauchst also andere Gründe, um Jev zu wählen.
Wie viel schneller, wie viel billiger
Jev antwortet in etwa einer Drittelsekunde und braucht mit 3 Fragen genauso lange wie mit 25: im Mittel 320, 341 und 337 ms. Die LLMs dagegen müssen jede Antwort ausschreiben und werden langsamer: GPT-5.6 Terra geht von 1.397 auf 2.338 ms, Gemini 3.1 Pro von 4.625 auf 7.151.
Diese Tabelle vergleicht für den englischen Lauf Jev mit dem günstigsten LLM, dessen Genauigkeit auf der jeweiligen Stufe der von Jev entspricht:
| Entscheidungen | Referenz-LLM | LLM minus Jev [95%-Intervall] | Zeit LLM / Jev | Kosten LLM / Jev |
|---|---|---|---|---|
| 3 | DeepSeek V4 Pro | -1.4 [-4.6; +1.4] | 8.5x | 14.0x |
| 10 | GPT-5.6 Luna | -0.7 [-2.1; +0.7] | 4.1x | 4.9x |
| 25 | GPT-5.6 Luna | +1.0 [-0.6; +2.5] | 5.6x | 2.8x |
Das Kostenverhältnis habe ich mit den heutigen Preisen von OpenRouter berechnet, es ändert sich also, sobald sich ein Preis ändert. Die Zeiten enthalten den Weg über OpenRouter, der von hier aus hin und zurück 20 bis 30 ms kostet (Median 20 ms im englischen Lauf, 28 im italienischen).
Vergleichst du Jev stattdessen mit einem Frontier-Modell, werden die Zahlen größer. Tausend E-Mails mit 25 Fragen kosten mit Jev 0,08 Dollar, mit GPT-5.6 Terra 2,17 und mit Gemini 3.1 Pro 11,82, und Gemini braucht außerdem 21-mal so lange wie Jev. Einundzwanzigmal ist immer noch weit weg von 193, zeigt aber, woher die Zahlen von TypeSafe kommen: Sie vergleichen Jev mit Frontier-Modellen.
Auf Italienisch
Auf Italienisch habe ich den Test mit Jev und den beiden OpenAI-Modellen wiederholt:
| Entscheidungen | Jev: Englisch / Italienisch | Referenz-LLM (IT) | Zeit LLM / Jev (IT) | Kosten LLM / Jev (IT) |
|---|---|---|---|---|
| 3 | 94.3 / 92.4 | GPT-5.6 Luna | 4.4x | 4.4x |
| 10 | 97.2 / 96.9 | GPT-5.6 Luna | 5.5x | 5.4x |
| 25 | 94.8 / 95.0 | GPT-5.6 Luna | 8.2x | 3.3x |
Jevs Qualität bleibt da, wo sie auf Englisch war. Der einzige Unterschied, der statistisch standhält, liegt bei 3 Entscheidungen, 1,9 Punkte [0,6; 3,7]. Die LLMs werden auf Italienisch dagegen langsamer, weil dieselbe E-Mail mehr Tokens braucht: Bei 25 Entscheidungen geht GPT-5.6 Luna von 1.886 auf 2.864 ms, Jev von 337 auf 348.
Die englischen E-Mails sind eine LLM-Übersetzung italienischer Originale, die ihrerseits ein LLM geschrieben hat. Ein Unterschied zwischen den Sprachen kann also auch von der Übersetzung kommen. Das Skript build_en.py prüft, dass jede übersetzte E-Mail die erwarteten Antworten des Originals behält, den Stil kann es aber nicht prüfen.
Konfidenz: “kann nicht halluzinieren”?
TypeSafe sagt, Jev könne nicht halluzinieren. Für die Form stimmt das: Es liefert kein Feld, nach dem du nicht gefragt hast, und keine Option, die es nicht gibt. Urteilsfehler gibt es trotzdem. Fragst du etwas, das nicht im Text steht, kann es nicht “weiß ich nicht” antworten: Es verteilt die Wahrscheinlichkeit auf die Optionen, die du ihm gegeben hast, und wählt eine davon. Deshalb ist die Option other im Code oben Pflicht.
Schützen kann dich die Konfidenz. Die Tabelle zeigt Jevs choice- und score-Antworten bei 25 Entscheidungen, gruppiert nach angegebener Konfidenz:
| Konfidenz | Antworten | Mittlere Konfidenz | Richtig (Englisch) | Richtig (Italienisch) |
|---|---|---|---|---|
| unter 0.50 | 59 | 0.36 | 40.7% | 32.8% |
| 0.50 bis 0.70 | 100 | 0.60 | 50.0% | 43.8% |
| 0.70 bis 0.85 | 102 | 0.78 | 59.8% | 54.9% |
| 0.85 bis 0.95 | 98 | 0.90 | 77.6% | 71.7% |
| 0.95 und darüber | 481 | 0.99 | 96.5% | 96.6% |
(Anzahl der Antworten und mittlere Konfidenz stammen aus dem englischen Lauf.)
Ab 0,95 ist die Konfidenz verlässlich. In der Mitte ist Jev optimistisch: Wenn es 0,90 sagt, liegt es in etwas mehr als drei von vier Fällen richtig. Die Konfidenz steigt mit der Genauigkeit, sie ist also nützlich, aber die Schwelle musst du anhand deiner eigenen Daten messen. Mit diesen Zahlen würde die 0,85 in JevTriage_en eine ganze Reihe falscher Antworten automatisch durchlassen: In meinen Daten liegt die sinnvolle Schwelle, um ohne Bestätigung zu handeln, bei 0,95.
Was der Test nicht beweist
Der Test gilt für eine Aufgabe: Kunden-E-Mails für eine italienische kaufmännische Software, dieselben Anweisungen für alle. Er sagt dir nicht, wie sich die Modelle in anderen Domänen schlagen, was die LLMs mit einem sorgfältig ausgearbeiteten Prompt oder ein paar Beispielen erreichen würden, und auch nicht, wie stark das Ergebnis von einem Lauf zum nächsten schwankt, denn es gibt nur einen Lauf. Die schwierigen E-Mails sind absichtlich überrepräsentiert, deshalb liegen die absoluten Prozentwerte unter dem, was du bei echtem E-Mail-Aufkommen sehen würdest. Und die erwarteten Antworten hat ein LLM geschrieben, kein Team aus Menschen mit Kaffee und viel Geduld.
Zwei Dinge musst du entscheiden, bevor du es überhaupt ausprobierst. Heute ist Jev nur eine Cloud-API im Early Access, ohne veröffentlichte Gewichte und ohne On-Premise-Installation: Die E-Mails deiner Kunden verlassen deine Infrastruktur und gehen an ein Start-up, das nach zwei Jahren im Verborgenen erst vor einer Woche an die Öffentlichkeit gegangen ist. Und die Konfiguration legt typesafe/jev-1.13 fest, nicht den Alias jev-latest, weil die Konfidenzschwellen für genau eine Version gelten.
Herunterladen und ausprobieren
Der Code liegt hier: jev-delphi-demo.zip. Darin findest du die Demo auf Englisch (JevTriage_en) und auf Italienisch (JevTriage), JevBench, den Datensatz auf Italienisch und Englisch, die vollständigen Ergebnisse mit den CSV-Dateien und bench/METODOLOGIA.md, das jede methodische Entscheidung viel ausführlicher erklärt als dieser Artikel.
Du brauchst Delphi 13 (es sollte auch mit 12 und 11 laufen, aber das habe ich nicht ausprobiert), die Quellen von DelphiMVCFramework für MVCFramework.DotEnv, das die .env-Datei liest, und einen OpenRouter-Key mit etwas Guthaben. Kopiere .env.example nach .env, trag deinen Key ein und kompiliere:
call "C:\Program Files (x86)\Embarcadero\Studio\37.0\bin\rsvars.bat"
msbuild JevTriage_en.dproj /p:Config=Debug /p:Platform=Win64
JevTriage_en.exe
JevTriage_en kostet weniger als einen Cent. Mit sechs Modellen macht JevBench 1.890 Aufrufe pro Sprache und läuft gut eine Stunde. Der englische Lauf hat etwa 3,5 Dollar gekostet, der italienische mit drei Modellen und 945 Aufrufen etwa 0,9. Bevor du ihn startest, probier JevBench.exe --selftest aus: Das erzeugt alle Reports aus erfundenen Ergebnissen, ohne ein Modell aufzurufen. Bei jedem unbekannten Argument bricht das Programm ab, ein Tippfehler startet also keinen kostenpflichtigen Lauf.
Für den Teil “so sehe ich das”, also wo ich es in eine Unternehmensanwendung einbauen würde und wo nicht, hör dir Folge 7 von “while true do;” an (auf Italienisch). Um das Jevons-Paradoxon, nach dem Jev benannt ist, geht es in den Folgen 4 und 5, ebenfalls auf Italienisch. Die offizielle Dokumentation von Jev findest du unter docs.typesafe.ai.
Häufig gestellte Fragen
Was ist Jev von TypeSafe AI? Jev ist ein Modell, das TypeSafe AI “System One” nennt: Es erzeugt keinen Text, sondern nimmt einen Kontext und einige typisierte Fragen (choice, score, noul) entgegen und liefert für jede die Antwort, die Wahrscheinlichkeitsverteilung über die Optionen und eine Konfidenz. Es wurde am 15. September 2026 vorgestellt und wird über eine API genutzt, entweder direkt bei TypeSafe oder über OpenRouter.
Ist Jev wirklich 200-mal schneller als ein LLM? Im Benchmark von Daniele Teti mit 105 E-Mails für eine kaufmännische Software war Jev 4- bis 8-mal schneller als das günstigste LLM mit derselben Genauigkeit und etwa 20-mal schneller als Gemini 3.1 Pro. Die Zahlen des Herstellers (193-mal schneller) stammen aus Workflows, die TypeSafe selbst ausgewählt hat, und vergleichen Jev mit Frontier-Modellen.
Macht Jev weniger Fehler als GPT und Gemini? Mit 3 und 10 Entscheidungen pro Aufruf schlägt keines der getesteten LLMs Jev bei der Balanced Accuracy. Mit 25 Entscheidungen ist nur Gemini 3.1 Pro besser, um etwa 2 Punkte. Gemini 2.5 Flash Lite ist auf jeder Stufe schlechter.
Ist die Konfidenz von Jev verlässlich? Im oberen Bereich ja: Oberhalb von 0,95 lag Jev in 96,5% der Fälle richtig. Im mittleren Bereich ist es zu optimistisch: Wenn es etwa 0,90 angibt, liegt es in 77,6% der Fälle richtig. Die Schwelle, ab der ein Fall an einen Menschen geht, musst du deshalb anhand deiner eigenen Daten festlegen.
Wie ruft man Jev aus Delphi auf? Mit einem JSON-POST an den Endpoint /api/v1/systemone von OpenRouter, mit THTTPClient und System.JSON aus der RTL. Der vollständige Code samt Benchmark steht auf danieleteti.it zum Download bereit.
Wer hat die erwarteten Antworten des Benchmarks geschrieben? Die erwarteten Antworten hat Claude Opus 5 geschrieben und geprüft. Daniele Teti hat die Regeln festgelegt und den umstrittensten Fall entschieden; die übrigen umstrittenen Fälle hat dasselbe Modell in seinem Auftrag entschieden, und niemand hat jedes Label von Hand nachgeprüft. Deshalb ist im Vergleich kein Modell von Anthropic dabei.
Comments
comments powered by Disqus