Jev, l'IA qui décide sans écrire : je l'ai mise à l'épreuve face à GPT
🇮🇹 Italiano • 🇬🇧 English • 🇪🇸 Español • 🇩🇪 Deutsch • 🇧🇷 Português
Depuis l'arrivée de ChatGPT, les modèles dont tout le monde parle sont des chatbots : tu leur poses une question et ils te répondent en écrivant. Le 15 septembre est sorti le premier de son espèce qui n'en est pas un. Il s'appelle Jev, TypeSafe AI l'a construit, et il ne sait pas écrire un seul mot : il prend des décisions et, pour chacune, il te dit à quel point il en est sûr. Ses créateurs promettent un workflow 193 fois plus rapide qu'avec un LLM de pointe. Une telle promesse méritait d'être vérifiée, et je l'ai fait : 105 e-mails de clients d'un logiciel de gestion, six modèles, deux langues, et une comparaison uniquement entre modèles qui font autant d'erreurs que Jev. Voici comment ça s'est passé, avec la méthode, les tableaux et le code Delphi.
Si tu as mis un LLM dans une application de gestion, tu t’en es servi tôt ou tard pour une petite décision : à quel service envoyer cet e-mail, quel type de document vient d’arriver, si le client est en colère. Ça marche. Mais chaque décision coûte une ou deux secondes, plus les tokens de sortie, et à dix mille e-mails par jour, le temps et la facture deviennent le problème.
Le 15 septembre, TypeSafe AI a annoncé Jev, un modèle incapable d’écrire le moindre mot, qui ne renvoie que des décisions. Sur sa page d’accueil, l’éditeur revendique un workflow 193,6 fois plus rapide et 444,6 fois moins cher qu’avec un LLM de pointe. J’en ai parlé dans l’épisode 7 du podcast « while true do; » (en italien), où j’ai promis de publier ici la méthode, les tableaux et le code Delphi.
Ce qu’est Jev
Tu lui donnes un contexte, que TypeSafe appelle state (le texte d’un e-mail, un enregistrement), et des questions typées. Il y a trois types :
- choice : choisir une option parmi 255 au plus, chacune décrite par un texte ;
- score : placer le texte sur une échelle de 2 à 10 niveaux ;
- noul : une question fermée, oui ou non, et la réponse est la probabilité du oui.
Tu ne récupères jamais un texte à interpréter. Tu reçois l’option choisie, la distribution de probabilité sur toutes les options et une confiance. Jev calcule toutes les questions en une seule passe, donc en ajouter une ne change presque rien au temps de réponse. Le prix catalogue est de 0,042 dollar par million de tokens en entrée, et tu ne paies pas la sortie.
Depuis le 18 septembre, Jev est aussi sur OpenRouter, sur l’endpoint POST /api/v1/systemone. C’est ce que j’ai utilisé : avec une seule clé, tu appelles à la fois Jev et les LLM avec lesquels tu le compares, et chaque mesure de temps inclut le même passage par OpenRouter.
L’appeler depuis Delphi
L’appel est un POST avec un corps JSON, donc THTTPClient et System.JSON suffisent, sans SDK. Voici la requête de JevTriage_en, le programme de démo : trois questions sur un e-mail, une par type.
// The three questions for Jev: department (choice), frustration (score), urgency (noul).
function BuildJevRequest(const AModel, AEmail: string): string;
begin
var lRoot := TJSONObject.Create;
try
lRoot.AddPair('model', AModel);
lRoot.AddPair('state', AEmail);
var lQuestions := TJSONObject.Create;
lRoot.AddPair('questions', lQuestions); // from here on lRoot owns it
var lDepartments := TJSONObject.Create;
lDepartments.AddPair('administration', 'Invoices, payments, charges, refunds');
lDepartments.AddPair('technical support', 'Program errors, freezes and malfunctions');
lDepartments.AddPair('sales', 'Quotes, new modules, licenses, training');
lDepartments.AddPair('other', 'None of the above'); // always include the fallback option
lQuestions.AddPair('department', TJSONObject.Create
.AddPair('type', 'choice')
.AddPair('instructions', 'Which department should handle this email?')
.AddPair('criteria', lDepartments));
var lLevels := TJSONArray.Create;
lLevels.Add('Calm, states the facts');
lLevels.Add('Annoyed but polite');
lLevels.Add('Very angry, harsh tone');
lQuestions.AddPair('frustration', TJSONObject.Create
.AddPair('type', 'score')
.AddPair('instructions', 'How frustrated is the customer?')
.AddPair('criteria', lLevels));
lQuestions.AddPair('urgent', TJSONObject.Create
.AddPair('type', 'noul')
.AddPair('instructions', 'Is the request urgent or does it have a close deadline?'));
Result := lRoot.ToJSON;
finally
lRoot.Free;
end;
end;
C’est la version anglaise de la démo. Le zip contient aussi l’original en italien, JevTriage, puisque c’est en italien que ces e-mails arrivent chez un éditeur de logiciels italien. Si tu travailles avec System.JSON et que tu veux revoir l’API fluide et savoir qui est propriétaire de quoi, il y a le guide complet du JSON en Delphi.
Tu lis la réponse avec GetValue<T> et un chemin : answers.department.choice, answers.department.confidence, answers.urgent.noul. Ensuite c’est le code, pas le modèle, qui décide du routage en comparant la confiance à deux seuils :
// Routing is decided by the code, not by the model: confidence is just a number to compare.
function RouteByConfidence(const ADepartment: string; AConfidence: Double): string;
begin
if (ADepartment = 'other') or (AConfidence < HUMAN_THRESHOLD) then
Result := 'to an operator (a person decides)'
else if AConfidence >= AUTO_THRESHOLD then
Result := Format('automatic to "%s"', [ADepartment])
else
Result := Format('to "%s" with caution (needs confirmation)', [ADepartment]);
end;
AUTO_THRESHOLD vaut 0,85 et HUMAN_THRESHOLD 0,5. Tu verras plus bas que 0,85 est optimiste.
Quatre e-mails, une vraie exécution
JevTriage_en envoie les quatre mêmes e-mails à Jev et à google/gemini-2.5-flash-lite, à qui il demande d’écrire un JSON avec les trois mêmes champs. Voici la sortie complète d’une vraie exécution faite aujourd’hui :
Email 1: "Good morning, this month you charged the fee for the management software twice to our company card. Could you reverse the second charge? Thanks, Marta Rossi"
Jev (typesafe/jev-1.13-20260917) in 455 ms
department: administration (confidence 1.00)
administration=1.00 other=0.00 technical support=0.00 sales=0.00
frustration: 0.04 of 2 (confidence 0.95)
0=0.96 1=0.04 2=0.00
urgent: no (probability of yes 0.21)
routing: automatic to "administration"
LLM (google/gemini-2.5-flash-lite) in 1101 ms
department: administration, frustration: 1, urgent: true (no probabilities, no confidence)
Email 2: "Since this morning, whenever I print an invoice the program closes with a memory access error. I have forty invoices to send out by tonight, I don't know what to do anymore!!!"
Jev (typesafe/jev-1.13-20260917) in 373 ms
department: technical support (confidence 0.99)
technical support=1.00 sales=0.00 administration=0.00 other=0.00
frustration: 1.75 of 2 (confidence 0.62)
0=0.00 1=0.25 2=0.75
urgent: yes (probability of yes 0.98)
routing: automatic to "technical support"
LLM (google/gemini-2.5-flash-lite) in 715 ms
department: technical support, frustration: 2, urgent: true (no probabilities, no confidence)
Email 3: "Hello, we are a firm with twelve workstations and we would like a quote for the warehouse module and for staff training. No rush."
Jev (typesafe/jev-1.13-20260917) in 365 ms
department: sales (confidence 1.00)
sales=1.00 other=0.00 administration=0.00 technical support=0.00
frustration: 0.00 of 2 (confidence 1.00)
0=1.00 1=0.00 2=0.00
urgent: no (probability of yes 0.04)
routing: automatic to "sales"
LLM (google/gemini-2.5-flash-lite) in 524 ms
department: sales, frustration: 0, urgent: false (no probabilities, no confidence)
Email 4: "Hi, I just wanted to tell you that yesterday's course was really useful. See you soon!"
Jev (typesafe/jev-1.13-20260917) in 401 ms
department: other (confidence 0.82)
other=0.87 administration=0.00 technical support=0.00 sales=0.13
frustration: 0.00 of 2 (confidence 1.00)
0=1.00 1=0.00 2=0.00
urgent: no (probability of yes 0.02)
routing: to an operator (a person decides)
LLM (google/gemini-2.5-flash-lite) in 575 ms
department: other, frustration: 0, urgent: false (no probabilities, no confidence)
Email Jev ms LLM ms Jev token in/out LLM token in/out Jev cost LLM cost
1 455 1101 460 / 84 113 / 18 $0.0000193 $0.0000185
2 373 715 467 / 82 121 / 19 $0.0000196 $0.0000197
3 365 524 459 / 81 110 / 18 $0.0000193 $0.0000182
4 401 575 450 / 81 104 / 18 $0.0000189 $0.0000176
Total 1594 2915 $0.0000771 $0.0000740
Costs come from OpenRouter's usage.cost field (in credits, 1 credit = 1 USD).
Timings include the hop through OpenRouter.
Le premier e-mail signale un double débit, sur un ton calme. Pour Flash Lite, le client est agacé et la demande est urgente. Jev dit calme et pas urgent, et il le dit avec les probabilités à côté.
Le quatrième e-mail est un mot de remerciement, et là les deux sont d’accord : other, calme, pas urgent. Jev choisit other avec une confiance de 0,82, et le code envoie l’e-mail à un opérateur, comme il le fait pour tout other, quelle que soit la confiance.
Côté coût, sur trois questions, Jev coûte autant que Flash Lite, et même un poil plus : la requête vers Jev compte environ 460 tokens en entrée, celle vers le LLM environ 110. L’avantage tarifaire de Jev, c’est la sortie gratuite, et avec trois réponses courtes il y a peu de sortie à économiser. Quatre e-mails ne prouvent rien, cela dit, et Flash Lite est le modèle le moins cher de la liste : c’est pour ça que j’ai écrit JevBench.
Le benchmark : 105 e-mails, six modèles
Le benchmark fait le même travail à grande échelle, avec ces règles :
- 105 e-mails de clients d’un éditeur de logiciels de gestion : doubles débits, factures rejetées par le SDI (le système italien d’échange des factures électroniques), bulletins de paie qui ne se calculent pas, demandes de devis, résiliations, spam, phishing. 61 sont volontairement difficiles : sarcasme, frustration contenue, négations (« ce n’est pas urgent, mais d’ici demain matin… »), une demande cachée dans le PS d’une newsletter ;
- 25 questions par e-mail (service, module de l’application, frustration, urgence, demande de remboursement, menace de partir, données sensibles, etc.), posées par groupes de 3, 10 et 25 par appel ;
- six modèles via OpenRouter : Jev 1.13, Gemini 2.5 Flash Lite, GPT-5.6 Luna, GPT-5.6 Terra, Gemini 3.1 Pro, DeepSeek V4 Pro. Mêmes instructions pour tous, aucun réglage du prompt ;
- la balanced accuracy (exactitude équilibrée) comme métrique principale, avec des intervalles de confiance bootstrap à 95%. L’accuracy simple récompense un modèle qui répond toujours « non » : ici, un modèle qui donne toujours la classe la plus fréquente obtiendrait 84% d’accuracy simple et 41% de balanced accuracy ;
- d’abord la qualité, ensuite les temps : je compare vitesse et coût seulement entre Jev et le LLM le moins cher qui fait autant d’erreurs que Jev, ou moins. Un modèle dix fois moins cher qui se trompe sur un e-mail sur trois ne peut pas remplacer Jev.
Il n’y a aucun modèle Anthropic, et ce n’est pas un parti pris : les réponses attendues ont été écrites et relues par Claude Opus 5, et un modèle de la même famille partirait avec un avantage sur les cas limites. J’ai fixé moi-même les règles d’étiquetage et tranché le cas le plus contesté ; les autres cas contestés ont été tranchés par le même modèle à ma place, et personne n’a revérifié chaque étiquette à la main.
Le test principal est en anglais, parce que TypeSafe dit que Jev donne le meilleur de lui-même en anglais et je ne voulais pas le désavantager sans le dire. Ensuite je l’ai relancé en italien.
Qui comprend le mieux
Chaque case indique à quel point un modèle a compris les 105 e-mails en anglais, avec ce nombre de questions par appel. Les colonnes ne sont pas trois exécutions du même test : « 3 décisions » désigne les trois premières questions (service, frustration, urgence), « 10 » les dix premières, « 25 » toutes. Chaque colonne ajoute de nouvelles questions, dont certaines plus difficiles, et c’est pour ça que Jev descend de 97,2 à 94,8 : à 25, on trouve aussi l’impact du problème sur le client, où Jev plafonne à 68%.
Le chiffre est la balanced accuracy, en pourcentage. Pour chaque question, chaque réponse possible est évaluée séparément : pour « urgent », tu prends la part des e-mails urgents que le modèle a reconnus comme urgents et la part des non urgents qu’il a reconnus comme non urgents, et tu fais la moyenne des deux. Ensuite tu fais la moyenne sur toutes les questions. Comme ça, une réponse rare pèse autant qu’une réponse courante. Un modèle qui répond toujours « non » à « urgent » a raison pour 88 e-mails sur 105, mais obtient 50 ici. Si tu donnes toujours la réponse la plus fréquente à chaque question, tu obtiens 34,4 à 3 décisions, 39,4 à 10 et 41,4 à 25 : c’est le plancher à garder en tête en lisant le tableau.
Les crochets contiennent l’intervalle de confiance à 95%. Je l’ai calculé en rééchantillonnant au hasard les 105 e-mails 2 000 fois (bootstrap) : avec un autre échantillon d’e-mails semblables, le résultat tomberait presque toujours dans cette plage. Plus l’intervalle est large, moins le chiffre est précis, et avec 3 questions il est large parce que chaque erreur pèse plus. Pour dire si un LLM est meilleur ou moins bon que Jev, en revanche, regarder si les intervalles se chevauchent ne suffit pas : j’ai comparé chaque modèle à Jev e-mail par e-mail, sur les mêmes rééchantillonnages, et seuls comptent les écarts dont l’intervalle de confiance, calculé sur la différence, exclut zéro.
| Modèle | 3 décisions | 10 décisions | 25 décisions |
|---|---|---|---|
| Jev 1.13 | 94.3 [91.3; 96.8] | 97.2 [96.0; 98.1] | 94.8 [93.3; 96.1] |
| Gemini 2.5 Flash Lite | 82.2 [76.3; 88.0] | 87.8 [84.4; 90.8] | 90.1 [87.9; 92.0] |
| GPT-5.6 Luna | 90.2 [86.0; 94.0] | 96.5 [95.1; 97.8] | 95.7 [94.3; 97.0] |
| GPT-5.6 Terra | 89.9 [85.5; 94.1] | 96.9 [95.5; 98.2] | 96.0 [94.8; 97.2] |
| Gemini 3.1 Pro | 92.0 [86.8; 96.6] | 97.6 [96.2; 98.8] | 97.1 [96.0; 98.1] |
| DeepSeek V4 Pro | 92.9 [89.1; 96.2] | 96.6 [94.9; 98.0] | 94.6 [92.9; 96.1] |
À 3 comme à 10 décisions par appel, aucun LLM ne fait mieux que Jev avec un écart qu’on puisse distinguer du bruit. À 25, seul Gemini 3.1 Pro le bat, de 2,3 points [0,9 ; 3,7]. Flash Lite est moins bon à tous les niveaux, donc son faux pas sur les quatre e-mails de tout à l’heure n’était pas de la malchance.
Aucun modèle n’a renvoyé de JSON cassé sur les 2 835 appels du benchmark, 1 890 en anglais et 945 en italien. Avec les modèles actuels, les erreurs de schéma sont rares : pour choisir Jev, il te faut d’autres raisons.
Combien plus rapide, combien moins cher
Jev répond en un tiers de seconde environ et met le même temps avec 3 questions ou avec 25 : 320, 341 et 337 ms en moyenne. Les LLM, eux, doivent écrire chaque réponse, et ils ralentissent : GPT-5.6 Terra passe de 1 397 à 2 338 ms, Gemini 3.1 Pro de 4 625 à 7 151.
Ce tableau, pour l’exécution en anglais, compare Jev au LLM le moins cher dont l’exactitude équivaut à celle de Jev à chaque niveau :
| Décisions | LLM de référence | LLM moins Jev [IC 95%] | Temps LLM / Jev | Coût LLM / Jev |
|---|---|---|---|---|
| 3 | DeepSeek V4 Pro | -1.4 [-4.6; +1.4] | 8.5x | 14.0x |
| 10 | GPT-5.6 Luna | -0.7 [-2.1; +0.7] | 4.1x | 4.9x |
| 25 | GPT-5.6 Luna | +1.0 [-0.6; +2.5] | 5.6x | 2.8x |
J’ai calculé le rapport de coût sur les prix OpenRouter du jour, donc il change dès qu’un prix change. Les temps incluent le trajet par OpenRouter, qui depuis chez moi coûte entre 20 et 30 ms aller-retour (médiane de 20 ms dans l’exécution en anglais, 28 dans celle en italien).
Si tu compares plutôt Jev à un modèle de pointe, les écarts se creusent. Mille e-mails avec 25 questions coûtent 0,08 dollar avec Jev, 2,17 avec GPT-5.6 Terra et 11,82 avec Gemini 3.1 Pro, qui met d’ailleurs 21 fois plus de temps que Jev. Vingt et une fois, on reste loin de 193, mais ça montre d’où viennent les chiffres de TypeSafe : ils comparent Jev avec des modèles de pointe.
En italien
En italien, j’ai relancé le test avec Jev et les deux modèles OpenAI :
| Décisions | Jev : anglais / italien | LLM de référence (IT) | Temps LLM / Jev (IT) | Coût LLM / Jev (IT) |
|---|---|---|---|---|
| 3 | 94.3 / 92.4 | GPT-5.6 Luna | 4.4x | 4.4x |
| 10 | 97.2 / 96.9 | GPT-5.6 Luna | 5.5x | 5.4x |
| 25 | 94.8 / 95.0 | GPT-5.6 Luna | 8.2x | 3.3x |
La qualité de Jev reste au niveau de l’anglais. Le seul écart statistiquement significatif est à 3 décisions, 1,9 point [0,6 ; 3,7]. Les LLM, en revanche, ralentissent en italien, parce que le même e-mail demande plus de tokens : à 25 décisions, GPT-5.6 Luna passe de 1 886 à 2 864 ms, alors que Jev passe de 337 à 348.
Les e-mails en anglais sont une traduction, faite par un LLM, d’originaux italiens écrits par un LLM. Un écart entre les langues peut donc venir aussi de la traduction. Le script build_en.py vérifie que chaque e-mail traduit garde les réponses attendues de l’original, mais il ne peut pas vérifier le style.
La confiance : « il ne peut pas halluciner » ?
TypeSafe dit que Jev ne peut pas halluciner. C’est vrai pour la forme : il ne te renverra pas un champ que tu n’as pas demandé ni une option qui n’existe pas. Les erreurs de jugement, elles, restent. Si tu lui demandes quelque chose que le texte ne dit pas, il ne peut pas répondre « je ne sais pas » : il répartit la probabilité sur les options que tu lui as données et en choisit une. C’est pour ça que l’option other du code plus haut n’est pas facultative.
Ce qui te protège, c’est la confiance. Le tableau montre les réponses de Jev aux questions choice et score, à 25 décisions, regroupées par confiance annoncée :
| Confiance | Réponses | Confiance moyenne | Correctes (anglais) | Correctes (italien) |
|---|---|---|---|---|
| moins de 0.50 | 59 | 0.36 | 40.7% | 32.8% |
| de 0.50 à 0.70 | 100 | 0.60 | 50.0% | 43.8% |
| de 0.70 à 0.85 | 102 | 0.78 | 59.8% | 54.9% |
| de 0.85 à 0.95 | 98 | 0.90 | 77.6% | 71.7% |
| 0.95 et plus | 481 | 0.99 | 96.5% | 96.6% |
(Le nombre de réponses et la confiance moyenne viennent de l’exécution en anglais.)
Au-dessus de 0,95, la confiance tient. Au milieu, Jev est optimiste : quand il dit 0,90, il a raison un peu plus de trois fois sur quatre. La confiance monte avec le taux de bonnes réponses, donc elle est utile, mais tu dois mesurer le seuil sur tes propres données. Avec ces chiffres, le 0,85 de JevTriage_en laisserait passer automatiquement pas mal de réponses fausses : sur mes données, le seuil raisonnable pour agir sans confirmation est 0,95.
Ce que ça ne prouve pas
Le test vaut pour une seule tâche : des e-mails de clients d’un logiciel de gestion italien, avec les mêmes instructions pour tous. Il ne te dit pas comment les modèles s’en sortent dans d’autres domaines, ce que les LLM obtiendraient avec un prompt soigné ou quelques exemples, ni combien le résultat varie d’une exécution à l’autre, parce qu’il n’y a qu’une exécution. J’ai délibérément surreprésenté les e-mails difficiles, donc les pourcentages absolus sont plus bas que ce que tu verrais sur du trafic réel. Et les réponses attendues, c’est un LLM qui les a écrites, pas une équipe de personnes avec du café et beaucoup de patience.
Il y a deux choses à décider avant même de l’essayer. Aujourd’hui, Jev n’est disponible qu’en API cloud, en accès anticipé, sans poids publiés ni installation sur site : les e-mails de tes clients sortent de ton infrastructure et partent chez une startup sortie de l’ombre il y a une semaine, après deux ans de travail discret. Et la configuration fixe typesafe/jev-1.13, pas l’alias jev-latest, parce que les seuils de confiance valent pour une version précise.
Télécharger et essayer
Le code est ici : jev-delphi-demo.zip. Dedans, tu trouves la démo en anglais (JevTriage_en) et en italien (JevTriage), JevBench, le jeu de données en italien et en anglais, les résultats complets avec les CSV, et bench/METODOLOGIA.md, qui explique chaque choix bien plus longuement que cet article.
Il te faut Delphi 13 (ça devrait marcher aussi sur 12 et 11, mais je n’ai pas essayé), les sources de DelphiMVCFramework pour MVCFramework.DotEnv, qui lit le fichier .env, et une clé OpenRouter avec un peu de crédit. Copie .env.example en .env, ajoute ta clé et compile :
call "C:\Program Files (x86)\Embarcadero\Studio\37.0\bin\rsvars.bat"
msbuild JevTriage_en.dproj /p:Config=Debug /p:Platform=Win64
JevTriage_en.exe
JevTriage_en coûte moins d’un centime. Avec six modèles, JevBench fait 1 890 appels par langue et tourne une bonne heure. L’exécution en anglais a coûté environ 3,5 dollars ; celle en italien, avec trois modèles et 945 appels, environ 0,9. Avant de le lancer, essaie JevBench.exe --selftest, qui produit tous les rapports sur des résultats inventés sans appeler aucun modèle. Tout argument inconnu arrête le programme, donc une faute de frappe ne déclenche pas une exécution payante.
Pour la partie « voilà comment je vois les choses », où je le mettrais dans une application de gestion et où je ne le mettrais pas, écoute l’épisode 7 de « while true do; » (en italien). Le paradoxe de Jevons, qui a donné son nom à Jev, est traité dans les épisodes 4 et 5 (en italien). La documentation officielle de Jev est sur docs.typesafe.ai.
Questions fréquentes
Qu’est-ce que Jev de TypeSafe AI ? Jev est un modèle que TypeSafe AI appelle « System One » : il ne génère pas de texte, il reçoit un contexte et des questions typées (choice, score, noul) et renvoie pour chacune la réponse, la distribution de probabilité sur les options et une confiance. Il a été annoncé le 15 septembre 2026 et s’utilise par API, directement chez TypeSafe ou via OpenRouter.
Jev est-il vraiment 200 fois plus rapide qu’un LLM ? Dans le benchmark de Daniele Teti sur 105 e-mails d’un logiciel de gestion, Jev a été 4 à 8 fois plus rapide que le LLM le moins cher d’exactitude équivalente, et environ 20 fois plus rapide que Gemini 3.1 Pro. Les chiffres de l’éditeur, 193x, viennent de workflows choisis par TypeSafe et comparent Jev avec des modèles de pointe.
Jev fait-il moins d’erreurs que GPT et Gemini ? À 3 et à 10 décisions par appel, aucun des LLM testés ne bat Jev en balanced accuracy. À 25 décisions, seul Gemini 3.1 Pro fait mieux, d’environ 2 points. Gemini 2.5 Flash Lite est moins bon à tous les niveaux.
La confiance de Jev est-elle fiable ? Dans le haut de l’échelle, oui : au-dessus de 0,95, Jev a eu raison 96,5% du temps. Dans la tranche intermédiaire, il est trop optimiste : quand il annonce environ 0,90, il a raison 77,6% du temps. Le seuil au-dessous duquel un cas part vers une personne doit donc être réglé sur tes propres données.
Comment appeler Jev depuis Delphi ? Avec un POST JSON vers l’endpoint /api/v1/systemone d’OpenRouter, en utilisant THTTPClient et System.JSON de la RTL. Le code complet, benchmark compris, se télécharge sur danieleteti.it.
Qui a écrit les réponses attendues du benchmark ? Les réponses attendues ont été écrites et relues par Claude Opus 5. Daniele Teti a fixé les règles et tranché le cas le plus contesté ; les autres cas contestés ont été tranchés par le même modèle à sa place, et personne n’a revérifié chaque étiquette à la main. C’est pour cette raison qu’il n’y a aucun modèle Anthropic dans la comparaison.
Comments
comments powered by Disqus