Das langsame Modell lag öfter richtig. Das schnelle hat mehr verdient.
Arne Kellmann ·
Zwei der drei Modelle in diesem Versuch haben bessere Calls abgegeben als das dritte. Das dritte hat pro Call dreimal so viel verdient. Es war nicht klüger. Es hat in einer Viertelsekunde geantwortet.
Das ist ein Replay, kein Live-Konto, und in den Zahlen unten stecken keine Gebühren. Lies bis zum Ende, bevor du irgendetwas daraus schließt. Der Punkt ist keine Handelsstrategie. Der Punkt ist eine Messung, was Latenz wert ist, wenn die Welt sich weiterbewegt, während ein Modell nachdenkt.
Wer dahintersteht. Jev ist das erste Modell von TypeSafe AI, einem Labor in San Francisco, das am 15. September 2026 mit einer 40-Millionen-Dollar-Seed-Runde unter Führung von DCVC aus dem Stealth kam. Gründer sind Diogo Almeida, zuvor Forscher bei OpenAI, mit Erik Gafni und Sasha Sheng. Auf X: @typesafeai und @CompleteSkeptic. Ich stehe in keiner Beziehung zur Firma; der API-Key ist ein normaler Early-Access-Key, und jeden Call in diesem Post habe ich selbst bezahlt.
Der Aufbau
- Der Tag: 15. September 2026, BTC/USD Spot auf Kraken. 132.800 Trades mit Millisekunden-Zeitstempeln aus der öffentlichen API. Tagesspanne 4,5 Prozent, einer der wilderen Tage des Monats.
- Die Momente: 446 Punkte, an denen etwas passierte, eine Fünf-Sekunden-Bewegung von mindestens 8 Basispunkten oder ein Trade-Schub mit dem Vierfachen der Tagesrate, mindestens 20 Sekunden auseinander. Dazu 60 ruhige Punkte als Kontrolle. 506 Entscheidungen.
- Der Zustand: dasselbe JSON für jedes Modell an jedem Punkt. Renditen der letzten 1, 5, 15, 30, 120 und 300 Sekunden in Basispunkten, Trade-Anzahl und Volumen der letzten fünf Sekunden gegen den Tagesdurchschnitt, Kaufanteil, Spanne der letzten 30 Sekunden. Nichts aus der Zukunft.
- Die Frage: buy, sell oder hold für die nächsten 30 Sekunden, wobei buy heißt „eher steigt als fällt, um mehr als 2 bps“.
- Die Entscheider: Jev 1.13.0, gefragt als ein Choice plus ein Noul. GPT-6 Astra und GPT-5.4 nano, gefragt nach derselben Antwort als JSON, Reasoning-Aufwand auf der niedrigsten Stufe, die die API akzeptiert, damit jedes so schnell läuft, wie es kann.
- Der Fill: Eine Entscheidung zum Zeitpunkt t wird zum ersten echten Trade nach t plus der gemessenen Latenz dieses Modells gefüllt. Ausstieg bei t plus 30 Sekunden. Jede Latenz ist der echte Round-Trip aus Frankfurt, pro Call gemessen.
Alle drei liefen an jedem Punkt parallel, kein Modell sah einen anderen Markt.
Latenz
| Modell | p50 | p90 | Mittel |
|---|---|---|---|
| Jev 1.13.0 | 252 ms | 538 ms | 330 ms |
| GPT-5.4 nano | 1.574 ms | 2.289 ms | 1.739 ms |
| GPT-6 Astra | 2.609 ms | 4.526 ms | 2.987 ms |
Faktor zehn. Das war erwartet. Was es mit dem Geld macht, nicht.
Wer richtig lag
Trefferquote ist der Anteil der Richtungs-Calls, bei denen der Preis 30 Sekunden später auf der gerufenen Seite stand.
| Modell | Richtungs-Calls | Trefferquote nach 30 s |
|---|---|---|
| Jev | 408 | 54,2 % |
| GPT-5.4 nano | 414 | 58,5 % |
| GPT-6 Astra | 295 | 59,7 % |
Astra ist das genaueste und das vorsichtigste: An 210 von 506 Punkten sagte es hold. Jev ist das schießfreudigste und das ungenaueste. Als Quiz gewertet gewinnt Astra.
Wer Geld verdient hat
Jetzt die Zahl, auf die es ankommt. Nimm nur die 258 Punkte, an denen alle drei Modelle denselben Richtungs-Call gaben. Gleiche Entscheidung, gleiche Richtung, gleicher Moment. Der einzige Unterschied ist, wann die Order das Orderbuch erreicht.
| Einstieg bei | Bruttoergebnis pro Call |
|---|---|
| Jevs Fill, ~250 ms | 2,45 bps |
| Fix 300 ms | 2,42 bps |
| Fix 1 s | 1,11 bps |
| nanos Fill, ~1,6 s | 0,96 bps |
| Fix 2 s | 0,82 bps |
| Astras Fill, ~2,6 s | 0,80 bps |
| Fix 5 s | 0,47 bps |
| Fix 10 s | 0,38 bps |
Zwei Drittel der Kante sind weg, wenn Astras Antwort ankommt. Bei 30 Prozent dieser gemeinsamen Calls hatte sich der Preis vor Astras Fill bereits einen vollen Basispunkt in die gerufene Richtung bewegt. Der Markt wartet nicht, bis das Reasoning fertig ist.
Auf den eigenen Calls bei eigener Latenz, pro Richtungs-Call: Jev 1,47 bps, nano 1,04 bps, Astra 0,88 bps. Das ungenaueste Modell, zuerst gefüllt, liegt vorn. Nicht, weil es mehr gesehen hat. Weil es da war.
Die Konfidenz hat ihren Job gemacht
Jev liefert zu jedem Choice eine Konfidenz. Während des Laufs habe ich nichts damit gemacht. Danach:
| Jev-Konfidenz | Calls | Trefferquote | Pro Call bei eigenem Fill |
|---|---|---|---|
| unter 0,5 | 232 | 48,3 % | 0,43 bps |
| 0,5 und höher | 176 | 62,3 % | 2,84 bps |
Unter 0,5 ist es ein Münzwurf, und es sagt das auch. Ab 0,5 ist es so genau wie Astra und trotzdem in einer Viertelsekunde gefüllt. Handle nur die sichere Hälfte, und das Ergebnis pro Call bei Jevs Latenz ist 2,84 bps. Dieselben Calls bei Astras Latenz gefüllt: 1,00 bps. Das ist der ganze Artikel in einer Zeile.
Der mögliche Gewinn, in Zahlen
Die Tabellen oben sind pro Call. Hier ist der Tag.
Auf den 258 Trades, bei denen alle drei Modelle übereinstimmten, gefüllt bei der eigenen Latenz jedes Modells und 30 Sekunden später geschlossen:
| Gefüllt bei | Bruttoergebnis des Tages | Bei 10.000 $ pro Trade | Bei 100.000 $ pro Trade | Bei 1 Mio. $ pro Trade |
|---|---|---|---|---|
| Jev, ~250 ms | 631 bps | 631 $ | 6.310 $ | 63.100 $ |
| nano, ~1,6 s | 248 bps | 248 $ | 2.480 $ | 24.800 $ |
| Astra, ~2,6 s | 207 bps | 207 $ | 2.070 $ | 20.700 $ |
Die Latenzprämie, Jevs Fill gegen Astras auf identischen Trades, beträgt 424 bps für den Tag: 1,64 bps pro Call, Standardfehler 0,20, Bootstrap-95-Prozent-Intervall 1,25 bis 2,03. Jevs Fill war bei 77 Prozent der Calls der bessere. Das ist kein Rauschen. Es ist dieselbe Entscheidung, die das Orderbuch zwei Sekunden früher erreicht, 258 Mal.
Jetzt die Gebühren, denn sie entscheiden, ob davon irgendetwas Geld ist:
| Gebühr pro Seite | Jev-Fill, Tag netto | Astra-Fill, Tag netto | Prämie |
|---|---|---|---|
| 0 bps (Maker-Rebate, internalisierter Flow) | +631 | +207 | +424 |
| 1 bps | +115 | −309 | +424 |
| 2 bps | −401 | −825 | +424 |
| 10 bps (Kraken Taker, hohes Volumen) | −4.529 | −4.953 | +424 |
| 26 bps (Kraken Taker, Basis) | −12.785 | −13.209 | +424 |
Zwei Dinge fallen heraus. Erstens: Zu Retail-Gebühren ist die Strategie ein Weg, schnell Geld zu verlieren, und schnell sein verlangsamt nur den Verlust. Zweitens: Die Prämie selbst kümmert sich nicht um Gebühren. Sie beträgt 424 bps in jeder Zeile, weil beide Seiten dieselben 258 Mal handeln. Geschwindigkeit ist gleich viel wert, ob der Desk profitabel ist oder nicht. Was Geschwindigkeit nicht kann: aus einer schlechten Kante eine gute machen.
Wo es Geld ist: ein Desk, der schon nahe null Kosten handelt, Maker-only, mit Rebate oder internalisiert. Für diesen Desk war an diesem Tag, bei 100.000 $ pro Clip, der Unterschied zwischen einem 250-ms-Entscheider und einem 2,6-Sekunden-Entscheider 4.240 $. Bei 1 Mio. $: 42.400 $. An einem Tag. Aus demselben Signal. Beschränkt auf Jevs sichere Hälfte, 176 Calls, bringt der Tag 500 bps bei Jevs Fill und 175 bps bei Astras Latenz: Die sichere Teilmenge behält den Großteil der Kante und senkt die Trade-Zahl um ein Drittel, genau das, was ein gebührenzahlender Desk braucht.
Größter Drawdown der Jev-Kurve im Tagesverlauf: 107 bps. Keine glatte Linie. Ein Tag.
Was es gekostet hat
| Modell | Tokens | Preis |
|---|---|---|
| Jev | 320.826 rein, Output kostenlos | 0,013 $ |
| GPT-5.4 nano | 190.889 | 0,04 $ |
| GPT-6 Astra | 125.061 rein, 18.905 raus | 2,20 $ |
Fünfhundert Entscheidungen für einen Cent, oder für zwei Dollar. Bei zehn Entscheidungen pro Sekunde ist das eine ein Geschäft und das andere eine Rechnung.
Jetzt das kalte Wasser
- Keine Gebühren. Krakens Taker-Gebühr liegt in der Basisstufe bei 26 bps pro Seite. Jede Zahl oben ist einstellig. An diesem Tag, in dieser Frequenz, mit Market Orders verlieren alle drei Modelle Geld, und Jev am schnellsten, weil es am meisten handelt. Das ist eine Messung von Latenz, keine Strategie.
- Der Fill ist optimistisch. Erster Trade nach dem Zeitstempel, unbegrenzte Größe, keine Warteschlange, kein Impact. Echte Fills sind schlechter, auch für das langsame Modell.
- Ein Tag, ein Markt. 258 gemeinsame Calls reichen, um die Form zu sehen, nicht, um darauf zu bauen. Ein ruhiger Tag würde weniger zeigen; die Kontrollpunkte zeigten fast nichts.
- Latenz vom Schreibtisch. Colocated wären alle drei schneller, und das Verhältnis würde eher breiter als enger.
Nichts davon ändert die Form der Einstiegstabelle. Was auch immer deine Kante ist, sie zerfällt sekündlich, und ein Modell, das drei davon braucht, startet von einem schlechteren Preis.
Wo das gilt
Trading ist das Beispiel, weil es jede Millisekunde einen Preis hat. Die Form ist allgemein. Jede Entscheidung, bei der sich die Welt bewegt, während du entscheidest, hat eine Einstiegstabelle wie die oben:
- ein Gebot in einer Echtzeit-Werbeauktion, wo der Slot nach 100 ms weg ist,
- eine Betrugsprüfung bei einer Zahlung, wo der Kunde nach drei Sekunden abbricht,
- eine Route für eine Support-Nachricht, während der Absender noch tippt,
- ein Rate-Limit oder ein Block auf einen Request, der schon bedient wird.
Dafür ist „das genauere Modell“ die falsche Frage. Die Frage ist: genau genug bei der Latenz, in der die Entscheidung lebt. Eine Viertelsekunde und eine Konfidenz, die man schwellen kann, decken mehr davon ab, als man denkt.
Das Replay-Skript sind 150 Zeilen Node: den Tag holen, in Sekunden schneiden, den Zustand bauen, drei APIs fragen, den Fill nachschlagen. Wer es auf einem eigenen Tag laufen lassen will: Die Jev-Doku ist die einzige ungewöhnliche Abhängigkeit.