Grundlagen

Decision-Modelle: KI, die nur entscheidet

Jev, OpenAIs Decisions API und offene Nachbauten liefern Wahrscheinlichkeiten statt Text. Wofür das taugt, was es kostet und wo eure Daten dabei landen.

In vielen Anwendungen soll ein Sprachmodell nichts schreiben. Es soll sagen, ob ein Ticket dringend ist, in welche Abteilung eine Mail gehört oder ob eine Antwort die Richtlinie verletzt. Trotzdem lässt man dafür meist ein Chatmodell Text erzeugen und liest die Entscheidung anschließend wieder heraus.

Mitte September hat TypeSafe AI mit Jev ein Modell vorgestellt, das diesen Umweg weglässt. Was daran neu war, steht in unserer News vom 16.09.2026. Drei Wochen später ist aus dem einen Produkt eine Klasse geworden: OpenAI hat eine eigene Schnittstelle dafür, Amazon-Ingenieure haben ein offenes Modell veröffentlicht, und auf Hugging Face liegen Nachbauten zum Selbsthosten. Wer heute eine Entscheidung per API will, hat die Wahl zwischen vier Wegen, und welcher passt, hängt an den eigenen Daten.

Was ein Decision-Modell ist

Ein Decision-Modell bekommt einen Text, eine oder mehrere Fragen dazu und für jede Frage eine feste Antwortform. Zurück kommt ein Wert mit Wahrscheinlichkeiten. Die Anbieter benutzen dafür fast dieselben drei Formen:

AntwortformBei JevBei OpenAIBeispiel
Ja-Wahrscheinlichkeit zwischen 0 und 1noulpredicateDrückt die Nachricht Dringlichkeit aus?
Auswahl aus vorgegebenen OptionenchoicechoiceWelche Abteilung ist zuständig?
Stufe auf einer SkalascorescoreWie verärgert klingt der Kunde?

So sieht eine Anfrage an Jev aus, das Beispiel stammt aus dem Quick start von TypeSafe:

curl -X POST https://api.typesafe.ai/v1/systemone \
  -H "Authorization: Bearer $TYPESAFE_API_KEY" \
  -H "Content-Type: application/json" \
  -d @- <<'EOF'
  {
    "state": "Hi, I've been trying to connect my Stripe account for 3 days and the integration keeps failing. I'm losing sales. Please help ASAP.",
    "model": "jev-latest",
    "questions": {
      "urgency": {
        "type": "noul",
        "instructions": "Does this message express urgency?"
      }
    }
  }
EOF

Bei einer Auswahlfrage enthält die Antwort die gewählte Option und die Verteilung über alle Optionen:

"department": {
  "type": "choice",
  "choice": "technical",
  "confidence": 0.78,
  "probabilities": { "technical": 0.85, "sales": 0.0, "billing": 0.15 }
}

Gegenüber einem Chatmodell mit Structured Outputs entfällt das Erzeugen von Text, zu jeder Option kommt eine Wahrscheinlichkeit mit, und mehrere Fragen laufen in einer Anfrage parallel. OpenAI zieht die Grenze selbst: Decisions für Wahrscheinlichkeit, Auswahl und Skala, Structured Outputs für Objekte nach eigenem Schema, etwa extrahierte Felder oder eine geschriebene Begründung.

Gegenüber einem klassischen Klassifikator, den man auf eigene Daten trainiert, stehen die Kategorien in der Anfrage. Eine neue Kategorie ist eine neue Zeile im Request, ein Trainingslauf entfällt. Dafür kann ein gut trainierter eigener Klassifikator bei einer festen Aufgabe genauer und billiger sein. Ein neutraler Vergleich der beiden Wege auf denselben Daten ist uns nicht bekannt.

Wie ein Modell per API in den eigenen Code kommt, erklären wir unter KI per API.

Wofür es taugt und wofür nicht

Die belegten Einsatzfelder haben eines gemeinsam: Es gibt eine überschaubare Menge möglicher Antworten, und es fallen viele gleichartige Entscheidungen an.

  • Routing: Tickets, Mails oder Anfragen der richtigen Stelle zuordnen. Mit diesem Beispiel arbeiten die Dokumentationen von TypeSafe und OpenAI. Wie Anfragen zwischen ganzen Modellen verteilt werden, steht unter Modellrouter.
  • Klassifizieren und Priorisieren: Labels vergeben, Spam erkennen, Dringlichkeit einschätzen.
  • Guardrails: Eingaben und Ausgaben eines Agenten prüfen, bevor etwas passiert. Laut TechCrunch war das einer der ersten Einsätze der Modellklasse.
  • Moderation: Inhalte gegen eine Richtlinie in Klartext prüfen.
  • Bewertung in Evals: Als Prüfer, der Agenten-Ausgaben mit bestanden oder nicht bestanden beurteilt. Belegt ist bisher vor allem, dass das Urteil bei Wiederholung stabil ausfällt.
  • Reranking: Eine Trefferliste aus der Suche neu sortieren, indem das Modell jeden Treffer bewertet.

Die Grenzen führt TypeSafe auf einer eigenen Seite mit dem Titel "Jev 1.13 jaggedness" selbst auf. Das Modell zählt nicht zuverlässig und rechnet nicht, es tut sich schwer mit Datumsvergleichen und mit Schlüssen über mehrere Stufen. Lange Eingaben voller Nebensachen verschlechtern das Ergebnis. Text im Eingabefeld, der das Modell gezielt beeinflussen soll, kann die Antwort verschieben. Und bei Auswahlfragen neigt es zur Option, die zuerst genannt wird.

Dazu kommt eine Eigenschaft der ganzen Klasse: Es gibt keine Begründung. Simon Willison fasst das zusammen mit dem Satz "Black boxes are back in fashion" und warnt vor Verzerrungen, etwa wenn Bewerbungen gerankt werden. Wer eine Entscheidung gegenüber Betroffenen erklären muss, etwa bei einer Sperre oder einer Ablehnung, braucht mehr als eine Zahl. Trifft ein System solche Entscheidungen über Menschen ohne menschliche Prüfung, können in der EU außerdem die Regeln der DSGVO zu automatisierten Einzelentscheidungen einschlägig sein. Das klärt ihr mit euren Datenschutzbeauftragten, bevor die erste Zeile Code entsteht.

Vier Wege, eine Entscheidung zu bekommen

Für Teams im deutschsprachigen Raum entscheidet zuerst, welche Daten durch das Modell laufen.

Preis je Mio. Input-TokenVerarbeitungDatenschutzEinschränkungen
Jev (TypeSafe AI)0,042 DollarUSAAuftragsverarbeitungsvertrag mit Standardvertragsklauseln, kein Training auf Kundendaten, Zero Data Retention nur für Enterprisekeine EU-Region, nur Text, Englisch am stärksten
OpenAI Decisions API0,10 Dollar, in regionalen Endpunkten 10 Prozent mehrUSA oder EuropaEuropa nur nach Freischaltung und mit Zero Data Retention oder angepasster MissbrauchsüberwachungPublic Beta, nur gpt-6-luna, Bilder nur als Base64
eu/jev (Bevelites GmbH, München)0,037 Euro (37 Euro je Milliarde)Hetzner, DeutschlandAuftragsverarbeitungsvertrag per Selbstbedienung, Hetzner als einziger Unterauftragsverarbeiter für die API-InhalteAnfragen laufen nacheinander, 60 pro Minute, höchstens acht Fragen und zehn Optionen
Selbst hosteneigene Hardwareeigene Infrastrukturvollständig in eurer HandLizenz und Herkunft des Modells prüfen, siehe unten

Abgerechnet wird bei allen drei Diensten nach Eingabe-Token, bei Jev und OpenAI kostet die Ausgabe ausdrücklich nichts.

Jev wird laut Datenschutzerklärung in den USA gehostet, eine EU-Region nennt TypeSafe nicht. Den Auftragsverarbeitungsvertrag gibt es, damit steht die Übermittlung auf einer vertraglichen Grundlage, vermieden ist sie nicht. Gestartet ist Jev als Early Access mit Warteliste.

OpenAI kostet knapp das Zweieinhalbfache und kann dafür Bilder verarbeiten. Die Verarbeitung in Europa ist an Bedingungen geknüpft: Ihr braucht eine Freischaltung und eine der Sonderregelungen zur Datenaufbewahrung, das läuft über den Vertrieb. Für Bilder in der EU-Region kommt eine weitere Freigabe dazu. Konto- und Abrechnungsdaten fallen nicht unter die Zusage.

eu/jev ist der Versuch, die Lücke zu füllen: eine zu Jev kompatible Schnittstelle auf einem Server in Deutschland, betrieben von einer kleinen Münchner Firma mit Impressum und veröffentlichtem Auftragsverarbeitungsvertrag. Dahinter läuft ein offenes Modell. Das Angebot ist offen dokumentiert und für große Mengen nicht ausgelegt: Anfragen werden nacheinander abgearbeitet. Der Vertrag schließt besondere Kategorien personenbezogener Daten und Verarbeitungen mit hohem Risiko aus, bezeichnet sich selbst nicht als Zertifizierung und sichert weder Plattenverschlüsselung noch Backups zu. Die Zusage, nichts zu speichern, bezieht sich auf Datenbank und Logs; flüchtige Zwischenspeicher sind ausgenommen, eine sofortige Löschung nach jeder Antwort wird nicht versprochen. Für einen ersten Versuch mit eigenen deutschen Texten liegt das Angebot nahe, als tragende Säule eines Produkts ist es zu wenig.

Selbst hosten: zwei Fallen

Offene Decision-Modelle gibt es inzwischen einige, und mehrere stehen unter Apache 2.0. Wer aus Gründen der Datenhoheit selbst betreiben will, sollte zwei Dinge prüfen, bevor er herunterlädt.

ModellLizenz laut ModellkarteHardware laut AnbieterAnmerkung
autotrust/JEV-27BApache 2.0eine GPU mit 80 GBaus Jev-Ausgaben destilliert
autotrust/GEV-26B-DecideApache 2.0eine GPU mit 80 GBBasis Gemma 4, Herkunft der Trainingsdaten nur teilweise benannt
Strands Decider 2BApache 2.0Median 115 ms auf einer RTX 3090laut TechCrunch von Amazon-Ingenieuren entwickelt, ein gehosteter Dienst dazu ist nicht bekannt
Musubi PolicyLM-1.7BApache 2.0GPU mit 24 GB oder CPUnur Moderation, bis zu 16 Kategorien je Richtlinie
openjev/openjevCC BY-NC 4.0keine Angabeohne gesonderte Lizenz nicht kommerziell nutzbar

Die Lizenzfalle. Die Namen ähneln sich, die Lizenzen nicht. openjev/openjev steht unter einer Lizenz, die kommerzielle Nutzung ohne gesonderte Vereinbarung ausschließt. Ein anderes Repository mit fast gleichem Namen steht unter MIT. Maßgeblich ist immer die Modellkarte des konkreten Repositorys.

Die Herkunftsfalle. Die beliebtesten Nachbauten tragen "JEV" im Namen und haben mit TypeSafe nichts zu tun, das steht so auf den Karten. JEV-27B beschreibt sich dort als Schüler von Jev 1.13, trainiert auf dessen Ausgaben. TypeSafes Kundenvertrag untersagt Kunden, mit den Ausgaben des Dienstes ein Modell zu trainieren, das ihn nachahmt. Laut Modellkarte stammen die Daten von einem Dritten und liefen über einen Zwischenanbieter. Ob das Verbot diesen Fall erfasst, ist offen. Für eure Lieferantenbewertung heißt das: Die Apache-Lizenz auf dem Modell beantwortet nicht, ob jemand anderes Ansprüche darauf erheben könnte.

Die Rechnung "selbst hosten ist billiger" stimmt nicht pauschal. Der unabhängige Vergleich JevBench setzt für JEV-27B auf gemieteter Hardware gut das Sechsfache der Jev-Kosten an, für ein kleineres 12B-Modell dagegen etwas weniger als bei Jev. Für den Eigenbetrieb spricht dann vor allem die Kontrolle über die Daten.

Wie gut die Entscheidungen sind

Unabhängig gemessen ist bisher wenig.

TypeSafes eigene Workflow-Evals sehen Jev im Mittel bei 67,8 Prozent, etwa gleichauf mit OpenAIs günstigem Chatmodell Luna (66,8) und unter den teuren Modellen mit 73 bis 74 Prozent. Die Decisions API ist in diesem Vergleich nicht enthalten. Gemessen wird die Übereinstimmung mit Labels, die TypeSafe aus den Antworten zweier großer Sprachmodelle gebildet hat, also ohne menschlich geprüfte Referenz. Der Gewinn liegt bei Preis und Tempo: 0,4 Sekunden und ein Bruchteil eines Cents je Fall, wo die teuren Modelle dort 23 bis 38 Sekunden brauchen.

Der JevBench ist ein kleines, privat betriebenes Projekt und wechselt seine Version häufig. Er sieht Jev vor den offenen Nachbauten von autotrust, obwohl deren Modellkarten das Gegenteil nahelegen. Ein zweiter kleiner Vergleich von einer Einzelperson hat die Reihenfolge der Optionen gemischt: Bei 64 Optionen änderte Jev in 14,6 Prozent der Fälle seine Antwort, bei gleicher Reihenfolge in 4,3 Prozent.

Zwei Details aus den Dokumentationen helfen bei der Einordnung. Der Wert confidence ist bei Jev aus der Verteilung berechnet und beschreibt, wie eindeutig sie ausfällt. Ob die Antwort stimmt, sagt er nicht. OpenAI macht zur Kalibrierung keine Zusage und rät, Schwellen anhand eigener gelabelter Beispiele festzulegen.

Bevor ein Decision-Modell in einem Ablauf entscheidet, braucht ihr deshalb eine eigene kleine Messung.

PromptClaude Code · Decision-Modell an eigenen Daten messen

Schreib ein Python-Skript, das ein Decision-Modell gegen unsere gelabelten Beispiele prüft. Eingabe ist eine CSV mit den Spalten text und label, die Kategorien stehen in kategorien.txt, eine je Zeile. Für jede Zeile stellt das Skript die Auswahlfrage mit diesen Kategorien und speichert gewählte Option und Wahrscheinlichkeiten. Jede Zeile läuft fünfmal mit zufällig gemischter Reihenfolge der Optionen. Gib am Ende aus: Trefferquote über alle Läufe, gesamt und je Kategorie, Anteil der Zeilen, bei denen sich die Antwort durch das Mischen ändert, und eine Tabelle, wie oft die Antwort stimmt und wie viele Zeilen darüber liegen, wenn die höchste Wahrscheinlichkeit über 0,5, 0,7 und 0,9 liegt. Kapsel den API-Aufruf in einer Funktion, damit ich den Anbieter tauschen kann.

Mit 200 Beispielen aus eurem Posteingang, bei vielen Kategorien entsprechend mehr, wisst ihr danach mehr als aus allen Herstellerzahlen: ob das Modell eure Sprache und euren Fachjargon versteht, wie stabil es ist und ab welcher Schwelle ihr ihm trauen könnt. Alles darunter geht an einen Menschen oder an ein größeres Modell. Anonymisiert die Beispiele vorher oder messt gleich bei einem Anbieter, der zu euren Daten passt. Wo sich diese Zweiteilung bei den Kosten bemerkbar macht, steht in KI-Kosten im Team senken.

Was das für dich heißt

Quellen25