Blog · Wissen & Einblicke

Jev von TypeSafe AI: Das erste „System-1-Modell“ im Vergleich zu ChatGPT & Claude

TypeSafe AI hat mit Jev ein neues Modell-Konzept vorgestellt: keine Textgenerierung, sondern typisierte Wahrscheinlichkeits-Entscheidungen – bis zu 190-mal schneller und günstiger als GPT & Claude. Ein Vergleich.

Veröffentlicht am 21. September 2026 5 Min. Lesezeit Aktualisiert am 21.09.2026

Am 15. September 2026 hat das bis dahin unbekannte KI-Labor TypeSafe AI aus San Francisco sein erstes Produkt vorgestellt – und dabei gleich eine neue Modellkategorie ausgerufen: das „System-1-Modell“. Das erste dieser Art heißt Jev, TypeSafe kam mit rund 40 Millionen US-Dollar Seed-Finanzierung (angeführt von DCVC) aus dem Stealth-Modus, und Mitgründer Diogo Almeida ist kein Unbekannter: Der ehemalige OpenAI-Forscher zählt zu den Miterfindern von RLHF (Reinforcement Learning from Human Feedback), also genau der Trainingsmethode, mit der ChatGPT groß wurde. Innerhalb von 24 Stunden nutzten laut Vercel bereits knapp 13 % aller zahlenden AI-Gateway-Teams das neue Modell – mehr als doppelt so viele wie beim bisherigen Rekordhalter, der GPT-5.6-Familie. Grund genug, genauer hinzuschauen: Was kann Jev, was klassische Sprachmodelle wie GPT oder Claude nicht können – und wofür ist es (noch) nicht geeignet?

Was ist ein „System-1-Modell“?

Klassische Sprachmodelle wie ChatGPT, Claude oder Gemini erzeugen Antworten autoregressiv: Wort für Wort, jeweils basierend auf allen vorherigen Wörtern. Das macht sie flexibel – sie können Texte schreiben, Code erzeugen, Zusammenhänge erklären – aber auch vergleichsweise langsam und teuer, sobald man sie nur für einfache Ja/Nein- oder Auswahl-Entscheidungen innerhalb einer Software einsetzen will. Jev geht einen anderen Weg: Es erzeugt keinen Fließtext, sondern beantwortet vorab definierte, typisierte Fragen in einem einzigen parallelen Durchgang – als Wahrscheinlichkeit oder Konfidenzwert statt als Wort. TypeSafe nennt das in Anlehnung an die Psychologie „System 1“ (schnelles, intuitives Entscheiden) im Gegensatz zum „System 2“ der klassischen, Schritt-für-Schritt „denkenden“ LLMs.

Wie funktioniert Jev technisch?

Statt mit klassischem RLHF trainiert TypeSafe sein Modell mit einer eigens entwickelten Methode namens „Reinforcement Learning for Calibrated Decisions“ (RLCD), die auf kalibrierte, ehrliche Wahrscheinlichkeiten statt auf möglichst überzeugend klingende Antworten optimiert. Entwicklerinnen und Entwickler stellen Jev dabei einen strukturierten Zustand („State“, z. B. ein Support-Ticket oder ein Datensatz) sowie eine von drei Fragetypen zur Verfügung: eine Ja/Nein-Frage, eine Auswahl aus fest definierten Optionen oder eine Position auf einer Skala. Zustand und Frage müssen dabei zusammen in rund 32.000 Tokens passen. Der Preis dafür: Jev kann keine freien Texte, keinen Code und keine Zusammenfassungen schreiben – es ist bewusst auf typisierte, vorab bekannte Antworträume beschränkt.

Tempo und Kosten im Vergleich

Genau diese Beschränkung macht Jev laut TypeSafe extrem schnell und günstig:

  • Antwortzeit: 70–500 Millisekunden, verglichen mit 3–329 Sekunden bei aktuellen Spitzenmodellen für vergleichbare Aufgaben.
  • Preis: 0,042 US-Dollar je Million Input-Tokens, Output-Tokens sind kostenlos – gegenüber 0,20 bis 10 US-Dollar je Million Tokens bei führenden LLMs.
  • Kosten pro Einzelentscheidung: rund 0,0004 US-Dollar, gegenüber 0,03 bis 0,18 US-Dollar bei vergleichbaren Abfragen über GPT- oder Claude-Modelle.

In der Summe kommt TypeSafe in eigenen Benchmarks auf einen Faktor von bis zu 190x schneller und 440x günstiger – wobei das Unternehmen selbst einräumt, dass es sich dabei um die oberen Enden der gemessenen Spannbreite handelt.

Wie genau ist Jev wirklich?

Bei der reinen Treffergenauigkeit zeigt sich ein differenzierteres Bild. Auf einem eigenen 4-Workflow-Benchmark erreicht Jev laut TypeSafe eine Genauigkeit von 67,8 % – nahezu gleichauf mit GPT-5.6 Terra (67,9 %), aber spürbar hinter GPT-5.6 Sol (74,1 %) und Claude Opus 5 (73,1 %). Jev ist also nicht grundsätzlich „intelligenter“ als aktuelle Spitzenmodelle, sondern tauscht einen kleinen Teil der Genauigkeit gegen ein Vielfaches an Geschwindigkeit und einen Bruchteil der Kosten. Unabhängige Benchmarks, die diese Werte bestätigen, stehen bislang noch aus.

Wofür eignet sich Jev – und wofür nicht?

TypeSafe positioniert Jev explizit für hochfrequente, wiederkehrende Entscheidungen mit klar begrenztem Antwortraum: das automatische Einsortieren von Support-Anfragen, das Bewerten von Inhalten, das Filtern von KI-generierten Texten auf Richtlinienverstöße oder die Klassifikation großer Datenmengen. Öffentliche Demos reichen von einem Doom-spielenden Bot (rund 10 Anfragen pro Sekunde für etwa 7 US-Dollar pro Stunde) bis zu einem „Wikiracing“-Experiment mit sehr vielen möglichen Entscheidungsoptionen.

Klar begrenzt sind dagegen die Fähigkeiten: Jev zählt und rechnet unzuverlässig, vergleicht Datums- und Zeitangaben nur eingeschränkt korrekt, kann keine Texte, Zusammenfassungen oder Code erzeugen und wird bei mehrstufigen, indirekten Schlussfolgerungen ungenauer. Hinzu kommt: Jev liefert keine sprachliche Begründung für seine Entscheidungen – für Nachvollziehbarkeit und Audits ist das eine echte Einschränkung. Und ob sich der aktuelle, sehr niedrige Preis nach der Early-Access-Phase halten lässt, ist ebenfalls offen.

Was bedeutet das für Marketing- und Business-Teams?

Für die klassischen Aufgaben, die Teilnehmende in Weiterbildungen wie KI – Künstliche Intelligenz im Marketing lernen – Texten, Konzipieren, Kampagnen entwickeln, mit Kundinnen und Kunden kommunizieren – bleiben ChatGPT, Claude & Co. die richtige Wahl: Jev kann keinen einzigen Satz schreiben. Interessant wird Jev dort, wo Marketing- und Vertriebsteams ohnehin bereits Automatisierung aufbauen: etwa um eingehende Leads automatisch zu bewerten, KI-generierte Werbetexte vor der Veröffentlichung auf Markenrichtlinien zu prüfen oder Kundenanfragen in Sekundenbruchteilen an die richtige Abteilung weiterzuleiten. Wer solche Workflows im Rahmen einer Weiterbildung wie dem Certified KI Marketing Automation Manager (FH) aufbaut, bekommt mit Modellen wie Jev perspektivisch einen günstigen zusätzlichen Baustein – als Ergänzung zu den generativen Modellen, nicht als deren Ersatz.

Fazit

Jev eröffnet mit dem „System-1-Modell“ eine eigene, spannende Kategorie neben den bekannten generativen Sprachmodellen: kein Ersatz für ChatGPT oder Claude, sondern ein spezialisiertes Werkzeug für schnelle, günstige Entscheidungen im Hintergrund von Software und Automatisierung. Die explosionsartige Nutzung innerhalb der ersten 24 Stunden zeigt, dass dafür echter Bedarf besteht. Ob sich das Modell auch außerhalb kontrollierter Demos und Benchmarks in der Praxis bewährt, müssen unabhängige Tests und die kommenden Monate erst noch zeigen.

Jetzt starten

Dieses Wissen praktisch anwenden.

Alle Kurse ansehen Beratung anfragen

Weitere Beiträge

Alle ansehen