Das langsame Modell lag öfter richtig. Das schnelle hat mehr verdient.

Arne Kellmann ·

Zwei der drei Modelle in diesem Versuch haben bessere Calls abgegeben als das dritte. Das dritte hat pro Call dreimal so viel verdient. Es war nicht klüger. Es hat in einer Viertelsekunde geantwortet.

Das ist ein Replay, kein Live-Konto, und in den Zahlen unten stecken keine Gebühren. Lies bis zum Ende, bevor du irgendetwas daraus schließt. Der Punkt ist keine Handelsstrategie. Der Punkt ist eine Messung, was Latenz wert ist, wenn die Welt sich weiterbewegt, während ein Modell nachdenkt.

Wer dahintersteht. Jev ist das erste Modell von TypeSafe AI, einem Labor in San Francisco, das am 15. September 2026 mit einer 40-Millionen-Dollar-Seed-Runde unter Führung von DCVC aus dem Stealth kam. Gründer sind Diogo Almeida, zuvor Forscher bei OpenAI, mit Erik Gafni und Sasha Sheng. Auf X: @typesafeai und @CompleteSkeptic. Ich stehe in keiner Beziehung zur Firma; der API-Key ist ein normaler Early-Access-Key, und jeden Call in diesem Post habe ich selbst bezahlt.

Der Aufbau

Alle drei liefen an jedem Punkt parallel, kein Modell sah einen anderen Markt.

Latenz

Modell p50 p90 Mittel
Jev 1.13.0 252 ms 538 ms 330 ms
GPT-5.4 nano 1.574 ms 2.289 ms 1.739 ms
GPT-6 Astra 2.609 ms 4.526 ms 2.987 ms

Faktor zehn. Das war erwartet. Was es mit dem Geld macht, nicht.

Latenz pro Entscheidung Latenz pro Entscheidung Echte Round-Trip-Zeit pro Call, gemessen während des Replays. 0 s1 s2 s3 s4 s5 sJev 1.13.0252 msGPT-5.4 nano1574 msGPT-6 Astra2609 msBalken = Median · Strich = 90. Perzentil · je 506 Calls, Round-Trip aus Frankfurt
Median und 90. Perzentil pro Modell, je 506 Calls.

Wer richtig lag

Trefferquote ist der Anteil der Richtungs-Calls, bei denen der Preis 30 Sekunden später auf der gerufenen Seite stand.

Modell Richtungs-Calls Trefferquote nach 30 s
Jev 408 54,2 %
GPT-5.4 nano 414 58,5 %
GPT-6 Astra 295 59,7 %

Astra ist das genaueste und das vorsichtigste: An 210 von 506 Punkten sagte es hold. Jev ist das schießfreudigste und das ungenaueste. Als Quiz gewertet gewinnt Astra.

Wer Geld verdient hat

Jetzt die Zahl, auf die es ankommt. Nimm nur die 258 Punkte, an denen alle drei Modelle denselben Richtungs-Call gaben. Gleiche Entscheidung, gleiche Richtung, gleicher Moment. Der einzige Unterschied ist, wann die Order das Orderbuch erreicht.

Einstieg bei Bruttoergebnis pro Call
Jevs Fill, ~250 ms 2,45 bps
Fix 300 ms 2,42 bps
Fix 1 s 1,11 bps
nanos Fill, ~1,6 s 0,96 bps
Fix 2 s 0,82 bps
Astras Fill, ~2,6 s 0,80 bps
Fix 5 s 0,47 bps
Fix 10 s 0,38 bps
Gleicher Call, späterer Fill: was Warten kostet Gleicher Call, späterer Fill: was Warten kostet Bruttoergebnis pro Call an den 258 Punkten, an denen alle drei Modelle übereinstimmten, nach Ankunft der Order im Orderbuch. Ohne Gebühren. 01230.25 s0.5 s1 s2 s5 s10 sVerzögerung nach der Entscheidung (log-Skala)bpsJev Fill · 2.45 bpsnano Fill · 0.96 bpsAstra Fill · 0.80 bps
Dieselben 258 Entscheidungen, später gefüllt. Die Kurve ist der Preis des Nachdenkens.

Zwei Drittel der Kante sind weg, wenn Astras Antwort ankommt. Bei 30 Prozent dieser gemeinsamen Calls hatte sich der Preis vor Astras Fill bereits einen vollen Basispunkt in die gerufene Richtung bewegt. Der Markt wartet nicht, bis das Reasoning fertig ist.

Auf den eigenen Calls bei eigener Latenz, pro Richtungs-Call: Jev 1,47 bps, nano 1,04 bps, Astra 0,88 bps. Das ungenaueste Modell, zuerst gefüllt, liegt vorn. Nicht, weil es mehr gesehen hat. Weil es da war.

Öfter richtig, oder besser bezahlt Öfter richtig, oder besser bezahlt Das genaueste Modell verdiente pro Call am wenigsten. Das ungenaueste, zuerst gefüllt, am meisten. Trefferquote nach 30 s, eigene CallsJev54.2 %nano58.5 %Astra59.7 %Brutto-bps pro Call, eigener FillJev1.47 bpsnano1.04 bpsAstra0.88 bps
Eigene Calls, eigene Latenz. Links Genauigkeit, rechts Geld.

Die Konfidenz hat ihren Job gemacht

Jev liefert zu jedem Choice eine Konfidenz. Während des Laufs habe ich nichts damit gemacht. Danach:

Jev-Konfidenz Calls Trefferquote Pro Call bei eigenem Fill
unter 0,5 232 48,3 % 0,43 bps
0,5 und höher 176 62,3 % 2,84 bps

Unter 0,5 ist es ein Münzwurf, und es sagt das auch. Ab 0,5 ist es so genau wie Astra und trotzdem in einer Viertelsekunde gefüllt. Handle nur die sichere Hälfte, und das Ergebnis pro Call bei Jevs Latenz ist 2,84 bps. Dieselben Calls bei Astras Latenz gefüllt: 1,00 bps. Das ist der ganze Artikel in einer Zeile.

Die Konfidenz war ehrlich Die Konfidenz war ehrlich Unter 0,5 ein Münzwurf, und es sagt das. Ab 0,5 so genau wie Astra bei einem Zehntel der Latenz. Trefferquote nach 30 sKonfidenz < 0,548.3 %Konfidenz ≥ 0,562.3 %Brutto-bps pro Call bei Jevs FillKonfidenz < 0,50.43 bpsKonfidenz ≥ 0,52.84 bpsJevs 408 Richtungs-Calls, geteilt nach der zurückgegebenen Konfidenz. 232 unter 0,5, 176 darüber.
Jevs 408 Richtungs-Calls, geteilt nach zurückgegebener Konfidenz.

Der mögliche Gewinn, in Zahlen

Die Tabellen oben sind pro Call. Hier ist der Tag.

Auf den 258 Trades, bei denen alle drei Modelle übereinstimmten, gefüllt bei der eigenen Latenz jedes Modells und 30 Sekunden später geschlossen:

Gefüllt bei Bruttoergebnis des Tages Bei 10.000 $ pro Trade Bei 100.000 $ pro Trade Bei 1 Mio. $ pro Trade
Jev, ~250 ms 631 bps 631 $ 6.310 $ 63.100 $
nano, ~1,6 s 248 bps 248 $ 2.480 $ 24.800 $
Astra, ~2,6 s 207 bps 207 $ 2.070 $ 20.700 $

Die Latenzprämie, Jevs Fill gegen Astras auf identischen Trades, beträgt 424 bps für den Tag: 1,64 bps pro Call, Standardfehler 0,20, Bootstrap-95-Prozent-Intervall 1,25 bis 2,03. Jevs Fill war bei 77 Prozent der Calls der bessere. Das ist kein Rauschen. Es ist dieselbe Entscheidung, die das Orderbuch zwei Sekunden früher erreicht, 258 Mal.

Der mögliche Gewinn: dieselben 258 Trades, drei Fill-ZeitpunkteDer mögliche Gewinn: dieselben 258 Trades, drei Fill-ZeitpunkteKumuliertes Bruttoergebnis über den Tag, in Basispunkten des Nominals pro Trade. Ohne Gebühren, Papier-Fills.-100020040060000:0006:0012:0018:0024:00Tageszeit, UTCbps631 bps248 bps207 bpsJev-Fill, ~250 msnano-Fill, ~1,6 sAstra-Fill, ~2,6 s
Dieselben Trades, drei Fill-Zeitpunkte. Der Abstand der Linien ist der Preis des Wartens.

Jetzt die Gebühren, denn sie entscheiden, ob davon irgendetwas Geld ist:

Gebühr pro Seite Jev-Fill, Tag netto Astra-Fill, Tag netto Prämie
0 bps (Maker-Rebate, internalisierter Flow) +631 +207 +424
1 bps +115 −309 +424
2 bps −401 −825 +424
10 bps (Kraken Taker, hohes Volumen) −4.529 −4.953 +424
26 bps (Kraken Taker, Basis) −12.785 −13.209 +424

Zwei Dinge fallen heraus. Erstens: Zu Retail-Gebühren ist die Strategie ein Weg, schnell Geld zu verlieren, und schnell sein verlangsamt nur den Verlust. Zweitens: Die Prämie selbst kümmert sich nicht um Gebühren. Sie beträgt 424 bps in jeder Zeile, weil beide Seiten dieselben 258 Mal handeln. Geschwindigkeit ist gleich viel wert, ob der Desk profitabel ist oder nicht. Was Geschwindigkeit nicht kann: aus einer schlechten Kante eine gute machen.

Wo es Geld ist: ein Desk, der schon nahe null Kosten handelt, Maker-only, mit Rebate oder internalisiert. Für diesen Desk war an diesem Tag, bei 100.000 $ pro Clip, der Unterschied zwischen einem 250-ms-Entscheider und einem 2,6-Sekunden-Entscheider 4.240 $. Bei 1 Mio. $: 42.400 $. An einem Tag. Aus demselben Signal. Beschränkt auf Jevs sichere Hälfte, 176 Calls, bringt der Tag 500 bps bei Jevs Fill und 175 bps bei Astras Latenz: Die sichere Teilmenge behält den Großteil der Kante und senkt die Trade-Zahl um ein Drittel, genau das, was ein gebührenzahlender Desk braucht.

Größter Drawdown der Jev-Kurve im Tagesverlauf: 107 bps. Keine glatte Linie. Ein Tag.

Was es gekostet hat

Modell Tokens Preis
Jev 320.826 rein, Output kostenlos 0,013 $
GPT-5.4 nano 190.889 0,04 $
GPT-6 Astra 125.061 rein, 18.905 raus 2,20 $

Fünfhundert Entscheidungen für einen Cent, oder für zwei Dollar. Bei zehn Entscheidungen pro Sekunde ist das eine ein Geschäft und das andere eine Rechnung.

Jetzt das kalte Wasser

Nichts davon ändert die Form der Einstiegstabelle. Was auch immer deine Kante ist, sie zerfällt sekündlich, und ein Modell, das drei davon braucht, startet von einem schlechteren Preis.

Wo das gilt

Trading ist das Beispiel, weil es jede Millisekunde einen Preis hat. Die Form ist allgemein. Jede Entscheidung, bei der sich die Welt bewegt, während du entscheidest, hat eine Einstiegstabelle wie die oben:

Dafür ist „das genauere Modell“ die falsche Frage. Die Frage ist: genau genug bei der Latenz, in der die Entscheidung lebt. Eine Viertelsekunde und eine Konfidenz, die man schwellen kann, decken mehr davon ab, als man denkt.

Das Replay-Skript sind 150 Zeilen Node: den Tag holen, in Sekunden schneiden, den Zustand bauen, drei APIs fragen, den Fill nachschlagen. Wer es auf einem eigenen Tag laufen lassen will: Die Jev-Doku ist die einzige ungewöhnliche Abhängigkeit.