Die eine Jev-Alternative gibt es nicht.
Zumindest keine, die sich belegen lässt. Trotzdem gibt es für jeden Einsatzfall eine sinnvolle Wahl, und ich sage dir bei jeder, was ich davon halte.
Du nutzt Jev oder hast es geprüft und jetzt suchst du Ersatz, weil Datenschutz, deutscher Text oder Selbstbetrieb zählen. Die üblichen Listen sortieren nach Selbstbetrieb und teils nach GitHub-Sternen. Gehostete Dienste und Deutsch fehlen dort fast immer. Mich hat genau das gestört, denn ich nutze Jev selbst in meinen eigenen KI-Agenten.
Kurz zur Erklärung:
Jev von TypeSafe AI schreibt keinen Text. Es beantwortet Fragen zu einem Zustand, den du mitschickst, und wählt dabei aus vorgegebenen Optionen. Mehr dazu findest du in den Anwendungsfällen für Jev.
Grundlage dieses Artikels ist eine Dokumentenrecherche zu rund 50 Projekten. Keine der 16 Alternativen habe ich selbst ausprobiert. Jev kenne ich aus dem Alltag, die anderen aus Dokumentation, Repositories, Modellkarten und Preisseiten. Was du hier als meine Meinung liest, ist deshalb eine Einschätzung auf Quellenbasis und kein Testergebnis.
Nach dem Lesen weißt du, welche der 16 Optionen zu deinem Einsatzfall passt. Du siehst, wo die Datenlage für deutschen Text und Datenschutz endet, und du weißt, wie du vor dem Wechsel auf deinen eigenen Fällen testest.
- Einen belegten universellen Ersatz für Jev gibt es nicht, aus 16 Optionen entscheidet der Einsatzfall.
- Der Preis ist selten der Wechselgrund, denn die gehosteten Jev-nahen Dienste liegen bei 0,035 bis 0,042 $ je Million Eingabetokens.
- Teste vor dem Wechsel mit deinen eigenen Fällen, gegen höchstens drei Alternativen und ein unverändertes Basismodell.
Welche Jev-Alternative passt zu deinem Einsatzfall?
Eine Alternative, die überall besser ist als Jev, kann ich dir nicht nennen.
Das ist keine Ausrede. Keine der Quellen liefert einen Beleg, der über den Einsatzfall des Anbieters hinausreicht. Ein Vergleich gilt immer nur für die Kombination aus Modell, Laufzeit und Anbieter. Darum bekommst du von mir keine Rangliste, dafür für jeden Einsatzfall einen Vertreter und meine Einschätzung dazu:
- Vertrauliche Daten und deutsche Texte: Privatemode Decisions. Hier würde ich zuerst hinschauen, weil der Anbieter als Einziger deutsche Zahlen und eine prüfbare Verarbeitung nennt.
- Gehosteter Dienst, nah an Jev: milliseconds.ai deckt Auswahl, Bewertung und Extraktion ab.
- Viele offene Modelle per API ausprobieren: Codiv, solange du es als Experiment behandelst.
- Der niedrigste gelistete Preis: Djev, mit Einladungscode und einigen Vorbehalten.
- Große GPU, Bilder und sehr langer Kontext: Surogate Rune.
- Jev-Schnittstelle behalten und selbst betreiben: Kev, wahlweise auch über OpenRouter. Das wäre mein pragmatischer Weg.
- Deutsche Aufgaben auf eigener Hardware: Standard One nennt Deutsch unter den Trainingssprachen.
- Viele Optionen mit gemeinsamem Kontext: Mapika Decider erlaubt bis zu 255 Optionen je Frage.
- Englisch auf einer einzelnen GPU: JevK5 mit Jev-Schnittstelle.
- Mehrere Fragen über denselben Text oder dieselben Bilder: Intern-Decision.
- Prüfen, ob ein unverändertes Basismodell reicht: Cygnet. Damit würde ich jeden Test beginnen.
- Wahrscheinlichkeiten direkt aus einem Basismodell lesen: SemIf.
- Eine Entscheidung dauerhaft gleich treffen: AnyJev, wenn du geprüfte Beispiele sammelst.
- Feste deutsche Kategorien mit eigenen Beispielen: SetFit.
- Wechselnde Kategorien ohne Trainingsdaten: GLiClass.
- Felder und Entitäten statt Urteile: GLiNER2.5.
Wie unterschiedlich die 16 wirklich sind, siehst du am besten nebeneinander. Achte dabei auf die Spalte zu Deutsch. Bei den meisten steht dort „Unbekannt“.
Alle 16 Jev-Alternativen auf einen Blick
Die Tabelle hat Lücken, und die sind Absicht.
Wo etwas nicht belegt ist, steht „k. A.“ oder „Unbekannt“ in der Zelle. Ein erfundener Wert wäre schlimmer als eine ehrliche Lücke. Oben steht Jev als Referenz, darunter die 16 Optionen. Du kannst nach jeder Spalte sortieren und nach Kategorie filtern.
| Jev | API | Gehostet | 0,042 $/Mio. | Englisch primär | k. A. | Referenz | k. A. |
| Privatemode Decisions | API + Proxy | Gehostet | 0,20 €/Mio. | Ja | MIT | Nein | k. A. |
| milliseconds.ai | API | Gehostet | 0,04 $/Mio. | Unbekannt | Kommerziell | Teilweise | k. A. |
| Codiv | Plattform | Gehostet | Kostenlos | Unbekannt | Apache-2.0 | Ja | Experiment |
| Djev | API | Gehostet, Einladung | 0,035 $/Mio. | Unbekannt | Apache-2.0 | Nein | Preview |
| Surogate Rune | Modell | Selbst (96 GB) | Open Source | Unbekannt | Apache-2.0 | Teilweise | k. A. |
| Kev | Modell | Selbst / OpenRouter | Open Source | Unbekannt | Apache-2.0 | Ja | k. A. |
| Standard One | Modell | Selbst (SGLang) | Open Source | Ja | Apache-2.0 | Ja | k. A. |
| Mapika Decider | Modelle | Selbst | Open Source | Unbekannt | Apache-2.0 | Ja | k. A. |
| JevK5 | Modell | Selbst (1 GPU) | Open Source | Nein | Apache-2.0 | Ja | k. A. |
| Intern-Decision | Modell | Selbst (Bibliothek) | Open Source | Unbekannt | Apache-2.0 | Nein | k. A. |
| Cygnet | Framework | Selbst (vLLM) | Open Source | Unbekannt | MIT | Teilweise | k. A. |
| SemIf | Framework | Selbst / Browser | Open Source | Unbekannt | MIT | k. A. | Forschung |
| AnyJev | Bibliothek | Selbst (vLLM) | Open Source | Unbekannt | Apache-2.0 | Nein | Forschung |
| SetFit | Framework | Selbst trainieren | Open Source | Teilweise | Apache-2.0 | Nein | k. A. |
| GLiClass | Klassifikator | Selbst | Open Source | Unbekannt | Apache-2.0 | Nein | k. A. |
| GLiNER2.5 | Extraktion | Selbst (CPU, GPU) | Open Source | Teilweise | Apache-2.0 | Nein | k. A. |
k. A. heißt: Die Quelle nennt dazu keine Angabe. Preise gelten je Million Eingabetokens laut Anbieter, Privatemode in Euro zuzüglich Umsatzsteuer, ohne Wechselkurs. Bei Deutsch heißt „Ja“, dass Anbieter oder Modellkarte Deutsch nennen, und „Unbekannt“, dass die Quellen keinen Beleg liefern. „Ja“ bei Jev-API ist eine Herstellerangabe.
Bevor es an die einzelnen Optionen geht, sage ich dir, woher meine Meinung kommt. Sie hat mit meinen eigenen Agenten zu tun.
Warum ich Jev selbst nutze, und was ich von einem Ersatz erwarte
Ich nutze Jev nicht als Entscheider, sondern als zusätzliche, beratende Einschätzung.
In meinen eigenen KI-Agenten läuft Jev an mehreren Stellen mit, zum Beispiel hier:
- Faktencheck für Content: Bei Newsletter-Entwürfen prüft zuerst ein festes Skript Zahlen und Belege. Zusätzlich vergleicht Jev eine verlinkte Behauptung mit einem lokal gespeicherten Snapshot der Quelle, aber nur, wenn die Adresse exakt passt und genug Beleg vorliegt. Fehlt der Beleg, steht dort „nicht beurteilt“ statt „unbelegt“.
- E-Mail-Agent: Beim Sortieren meines Postfachs schätzt Jev anhand eines kurzen Auszugs ein, ob eine Mail eine persönliche Antwort verlangt, eine konkrete Frist nennt oder ein allgemeiner Werbe-Pitch ist. Absenderadresse, Header und Anhänge bekommt der Dienst nicht.
- Meeting-Digest: Jev prüft, ob eine Zusage aus einer Meeting-Zusammenfassung im Transkript an genau dieser Zeitmarke gedeckt ist.
- Executor-Agent: Bei der Abnahme einer Aufgabe bewertet Jev jedes Kriterium unter „Fertig wenn“ als belegt, unbewiesen oder widerlegt.
Überall gilt dieselbe Regel. Jev liefert einen Hinweis, entschieden wird anderswo, beim Faktencheck, im Meeting-Digest und beim Executor sogar von festen Prüfungen. Feste Konfidenzschwellen zwischen 0,75 und 0,80 bestimmen, ob ein Punkt zur Prüfung markiert wird.
Daraus ergeben sich meine Maßstäbe für eine Alternative. Ich frage nicht zuerst nach dem besten Benchmark. Ich frage, ob die Schnittstelle bleibt, ob ich der Konfidenz trauen kann und ob die Kosten bei vielen kleinen Anfragen nicht ins Gewicht fallen. Für jede Option unten sage ich dir, wie sie an diesen Fragen abschneidet, soweit die Quellen das hergeben.
Mit diesem Maßstab gehe ich jetzt die 16 Optionen durch, sortiert in vier Gruppen. Los geht es mit den gehosteten.
1. Privatemode Decisions

Fangen wir mit denen an, bei denen du nichts betreiben musst. Es sind vier gehostete Dienste, und nur einer hat deutsche Zahlen.
Der eine mit deutschen Zahlen heißt Privatemode Decisions. Die Bibliothek von Edgeless Systems arbeitet mit einem lokalen Proxy, darunter läuft GLM-5.3-Flash. Ein nachtrainiertes Jev-Modell steckt nicht drin.
Die Eingabe kostet laut Anbieter 0,20 € je Million Tokens, die Ausgabe 0,65 €, jeweils zuzüglich Umsatzsteuer. Beim Datenschutz beschreibt der Anbieter Ende-zu-Ende-Verschlüsselung und eine Attestierung der Verarbeitung.
- Der Anbieter veröffentlicht einen Benchmark mit fünf deutschen Datensätzen. Auf 28 gemeinsam beantwortbaren Datensätzen fand er keinen signifikanten Genauigkeitsunterschied zu Jev.
- Die Ausführung ist laut Anbieter Ende-zu-Ende verschlüsselt, und die Attestierung der Umgebung wird vor dem Senden geprüft.
- Bis zu 191 Optionen je Frage, bis zu 1 Mio. Tokens Kontext und Bilder neben dem Text sind dokumentiert.
- Der Anbieter nennt rund 150 ms je Entscheidung inklusive Netz. Ein Anbieterlauf aus Deutschland maß im Median 180 ms gegenüber 264 ms für Jev.
Sind vertrauliche Daten oder deutsche Texte im Spiel, schau hier zuerst hin. Was mich stört, ist, dass alle Belege vom Anbieter selbst kommen. Ich würde sie mit meinen eigenen Fällen nachprüfen, bevor ich etwas umbaue.
2. milliseconds.ai

Dazu passt milliseconds.ai, wenn du erst einmal ausprobieren willst. Das Modell decision-machine-1 kommt dem Umfang von Jev nahe. Es beantwortet laut Anbieter Ja-Nein-Fragen, klassifiziert, bewertet und zieht Felder aus Text und Bildern.
Die Eingabe kostet 0,04 $ je Million Tokens, die Ausgabe ist frei. Für die Produktion brauchst du mindestens 10 $ Guthaben. Gegenüber Jev mit 0,042 $ ist der Preisabstand klein und für sich kein Wechselgrund.
- Ein Modell deckt Ja-Nein-Fragen, Klassifikation, Bewertung, Antworten aus Quellen, Extraktion, Entitäten und Verifikation ab.
- Testschlüssel bekommen 125 Mio. freie Eingabetokens im Monat, erneuert monatlich.
- Text und Bilder werden verarbeitet.
- Die Ausgabe ist kostenlos, und freie Testtokens werden nach Angaben des Anbieters nicht vom Produktionsverbrauch abgezogen.
Ich würde milliseconds.ai als gehosteten Vergleich nehmen, allein wegen des großzügigen Testschlüssels. Ob deutscher Text gut klappt, kann ich dir nicht sagen, dafür gibt es keine belegten Werte.
3. Codiv

Bleibt noch Codiv, eine Plattform mit mehreren Modellen hinter einer Jev-kompatiblen Schnittstelle. Zu den Modellen zählen OpenJev 0.1, Laya 1.0, Verdict 1.4, CLM 0.1 und JevK5 0.2. Mit OpenJev ist razorback16/openjev gemeint, denn es gibt mehrere Projekte mit diesem Namen. Laut Anbieter genügt es, die Basis-URL zu wechseln.
Jeder Schlüssel darf 60 Anfragen je Minute stellen, dazu kommen 100 Millionen System-One-Tokens je Konto, ohne Karte.
Zum Datenschutz schreibt Codiv in der Datenschutzerklärung, dass die gesendeten Inhalte nicht gespeichert werden. Das ist eine Angabe des Anbieters. Prüf vor vertraulicher Nutzung den Vertrag.
- Laut Anbieter genügt ein Wechsel der Basis-URL, die Python- und TypeScript-SDKs von TypeSafe laufen unverändert.
- Hinter einem Schlüssel liegen OpenJev 0.1, Laya 1.0, Verdict 1.4, CLM 0.1 und JevK5 0.2.
- Jedes Konto bekommt 100 Mio. System-One-Tokens ohne Karte.
- Die Datenschutzerklärung sagt, gesendete Inhalte würden nicht gespeichert (Anbieterangabe).
Für mich ist Codiv ein Ort zum Vergleichen, nicht zum Betreiben. Auf einen Produktivbetrieb würde ich mich nach dem Stand der Quellen nicht verlassen.
4. Djev

Am günstigsten ist Djev, ein Research Preview, der nur auf Einladung läuft. Die Implementierung ist offen (Davipar/djev-dev, Apache-2.0) und nutzt DiffusionGemma mit vLLM. Der ausgewiesene Preis liegt bei 0,035 $ je Million Eingabetokens, die Ausgabe ist kostenlos.
- Der ausgewiesene Preis liegt mit 0,035 $ je Million Eingabetokens unter Jev (0,042 $) und milliseconds.ai (0,04 $), die Ausgabe ist kostenlos.
- Als Zustand gehen Text, JSON und Bilder, Optionen können selbst Bilder sein, und die Oberfläche kann Kamerabilder als Live-Frames auswerten.
- Eine Anfrage darf bis zu 32 Fragen, 20.000 Zeichen Zustand und sechs Bildanhänge enthalten.
- Die Implementierung ist offen (Apache-2.0) und läuft auf DiffusionGemma mit vLLM.
Der Preis reizt mich, der Rest bremst mich. Ohne Einladungscode kommst du nicht hinein, und dass Anfragen mindestens sieben inaktive Tage auf dem Server bleiben, würde ich bei vertraulichen Daten nicht akzeptieren.
5. Surogate Rune

Wer die Daten gar nicht erst an einen Dritten schicken will, betreibt selbst. Kontrolle klingt nach Freiheit, in der Praxis ist es eine Wartungsaufgabe, so wie bei jedem LLM, das du lokal betreibst.
Für den Selbstbetrieb gibt es keinen Tarif, und Betriebskosten tauchen hier nicht auf, denn belegte Zahlen dazu liegen nicht vor. Bei den Laufzeiten gilt außerdem Vorsicht, denn die Entscheidungsschnittstelle von Ollama gibt es in Version 0.35.0 nur als Vorabversion. Du solltest sie nicht als stabiles Feature voraussetzen.
Als Nächstes kommt Surogate Rune v3 von Invergent, ein offenes Modell mit 26B Parametern, davon 4B aktiv, unter Apache-2.0. Dazu gibt es laut SDK eine gehostete API, einen öffentlichen Tarif nennen die Quellen aber nicht.
- Eine Anfrage liefert in einem Vorwärtsdurchlauf eine Wahl mit Wahrscheinlichkeiten über alle Optionen, dazu Noul und Score.
- Das Modell hat 262k Tokens Kontext und nimmt Text, strukturierte Daten und Bilder mit Text.
- Der Hersteller nennt 90 bis 180 ms je Entscheidung auf einer RTX PRO 6000 ohne Netzwerkweg und 0,18 s bei einer Bildentscheidung.
- Optionales „Denken“ bis 512 Tokens greift nur bei Fragen, bei denen das Modell unter 70 % sicher ist (Herstellerangabe).
Ich lese „4B aktiv“ nicht als „läuft auf meinem Laptop“. Wenn du keine große GPU hast, spar dir den Aufwand.
6. Kev

Wer die Jev-Schnittstelle behalten will, greift zu Kev, einer Modellfamilie auf Basis von Qwen3.5 in den Größen 0,8B, 4B und 9B. Laut Readme kommt Kev-27B dazu. Der Code steht unter Apache-2.0, laut Readme gilt das auch für die Qwen-Basismodelle. Die Trainingsdaten haben eigene Lizenzen.
Kev läuft auf Nvidia-Grafikkarten und auf Apple Silicon. Über OpenRouter gibt es Kev-4B beim Anbieter SiliconFlow für 0,042 $ je Million Eingabetokens bei 8k Kontext.
Beim Server lohnt ein zweiter Blick. Er ist standardmäßig offen. Eine Authentifizierung gibt es, sie ist aber optional und wird über die Variable KEV_API_KEY eingeschaltet.
- Das Readme sagt, das TypeSafe Python SDK laufe gegen einen Kev-Server unverändert.
- Es gibt vier Größen von 0,8B für den Laptop bis 27B für eine 80-GB-Karte, Startempfehlung ist Kev-4B.
- NVIDIA und Apple Silicon sind dokumentiert, ein eigener HTTPS-Endpunkt auf Modal ist ein Befehl und skaliert auf null.
- Über OpenRouter läuft Kev-4B seit dem 25.09.2026 bei SiliconFlow für 0,042 $ je Million Eingabetokens mit 8K Kontext.
Wenn du mich fragst, ist Kev der pragmatischste Weg, falls deine Jev-Integration bleiben soll und nur das Modell wechselt. Den offenen Server würde ich vor dem ersten Einsatz absichern.
7. Standard One

Und Deutsch? Standard One nennt es unter neun Trainingssprachen. Das Modell gibt es als 8B- und 3B-Variante auf Basis von Ministral 3, aktuell in Version 2 vom 26. September 2026, und es steht unter Apache-2.0. Es verarbeitet bis zu 8.192 Tokens und 26 Optionen.
Die Modellkarte nennt Schwächen selbst. Die deutschen Messwerte auf der Herstellerseite stammen von Version 1.1, nicht von Version 2. Sie arbeiten außerdem mit anderen Optionsmengen als die Jev-Werte. Ein Vergleich wäre schief.
- Deutsch gehört zu den neun Trainingssprachen, die Modellkarte listet de.
- Die Karte weist Basismodell, Adapter, zusammengeführte Gewichte und Server als Apache-2.0 aus, aktuell ist v2 vom 26.09.2026.
- Ein vorgeschalteter jev-adapter stellt /v1/systemone bereit, mit 8.192 Tokens und bis zu 26 Optionen.
- Der Hersteller nennt Schwächen selbst, das erleichtert die Testplanung, weil du weißt, wo du zuerst nachmessen musst.
Für deutsche Aufgaben mit wechselnden Regeln auf eigener Hardware ist Standard One mein erster Kandidat. Fachsprache würde ich separat testen.
8. Mapika Decider

Bei vielen Optionen wird Mapika Decider relevant. Choice akzeptiert 2 bis 255 Optionen, Score 2 bis 10 Stufen und die Hauptmodelle nehmen bis zu 32k Kontext. Die Lizenz ist Apache-2.0, die Modellkarte ist englisch.
Die aktuellen Stände 2B v11 und 4B v2.1 haben laut den Autoren nicht alle Freigaberegeln erfüllt. Ältere Versionen bleiben unter Tags erreichbar.
- Choice akzeptiert 2 bis 255 Optionen, Score 2 bis 10 Stufen.
- decide_batch bewertet viele Zustände mit vielen Fragen in einem Aufruf.
- Die Request-Form entspricht Jev (POST /v1/systemone), im Prozess oder über HTTP.
- Mit abstain_below=t gibt eine Entscheidung unter der Konfidenzschwelle None zurück.
Mapika ist einen Test wert, wenn du viele Optionen über einen gemeinsamen Kontext abfragst und Englisch reicht. Dass die Autoren ihre Freigaberegeln offenlegen, halte ich für ehrlich. Es ist aber auch eine Warnung.
9. JevK5

JevK5 stammt von allebee und ist nicht mit TypeSafe verbunden. Es gibt die Modelle JevK5-4B v0.3 und JevK5-9B v0.3.3 unter Apache-2.0. Der Server nimmt die TypeSafe-Form von /v1/systemone entgegen.
- Die Lizenz ist Apache-2.0, und die Readme nennt rund 9 GB GPU-Speicher für 4B und rund 19 GB für 9B in bf16.
- Der Server akzeptiert die TypeSafe-Form von /v1/systemone mit den drei Typen.
- Bis zu 16 Optionen werden in einem Durchlauf bewertet, mehr Optionen in mehreren Durchläufen.
- Für v0.3 legt der Entwickler die Trainingsdaten offen. Es sind nur Trainingssplits, ohne MMLU und MMLU-Pro, RACE-Anteile sind entfernt (Herstellerangabe).
Für deutsche Texte fällt JevK5 raus, da gibt es nichts zu deuteln. Für englische Entscheidungen auf einer einzelnen GPU mit rund 9 GB Speicher ist es einen Versuch wert.
10. Intern-Decision

Intern-Decision von InternLM gibt es in den Größen 0,8B, 2B und 4B auf Basis von Qwen3.5. Es ist eine lokale Bibliothek mit einer DecisionEngine, kein abgesicherter Produktionsserver. Mehrere typisierte Fragen laufen über denselben Zustand.
- Mehrere typisierte Fragen laufen über denselben Zustand, die Felder teilen sich einen kausalen Vorwärtsdurchlauf.
- Der Hersteller nennt für 4B 90,02 % Durchschnittsgenauigkeit über sieben Suiten gegenüber 88,74 % für Jev, mit dem Hinweis, dass Protokolle und Umfang abweichen.
- Die mittlere lokale Latenz beträgt 44,16 ms auf einer RTX 4090, in derselben Herstellertabelle steht Jev mit 109,70 ms. Die Messbedingungen unterscheiden sich.
- Bis zu acht Bilder pro Anfrage sind möglich, Training, Inferenz und Kalibrierung liegen als Code vor, die Gewichte sind Apache-2.0.
Die Herstellerzahlen klingen gut. Eine gehostete API gegen ein lokales Modell zu stellen, ist aber nicht sauber vergleichbar. Ich würde sie als Anlass zum Nachmessen lesen, nicht als Grund zum Wechsel.
11. Cygnet

Bevor du Hardware bestellst, kommt die unbequeme Frage, ob deine Aufgabe vielleicht etwas viel Einfacheres löst. Deshalb gehört in jeden Vergleich ein Kontrollarm, also eine Variante ohne Spezialmodell, gegen die du die anderen misst. Die nächsten drei Einträge sind genau das.
Cygnet von Blockbrain setzt auf ein unverändertes Gemma-4-12B-it ohne Fine-Tuning und läuft mit dem Standard-vLLM. Es verarbeitet bis zu 26 Optionen und 16.384 Tokens Kontext. Kalibriert wurde es auf 241 selbst erzeugten Beispielen, nicht auf den öffentlichen JevBench-Aufgaben.
- Es braucht kein Fine-Tuning und läuft mit dem unveränderten vLLM 0.30.0.
- Die Kalibrierung (T = 3,4) stammt von 241 selbst erzeugten Beispielen, die öffentlichen JevBench-Aufgaben dienten nur zum Messen.
- Der Autorenlauf zählt 203 von 231 öffentlichen JevBench-Aufgaben richtig (87,9 %), bei 0,050 bis 0,066 s Median-Latenz auf einer 48-GB-Karte.
- Jede Entscheidung erzeugt nur ein Ausgabetoken, die Kosten hängen fast nur an den Eingabetokens.
Nimm Cygnet als Maßstab für deine Tests. Kommt ein aufwendiger Nachbau auf deinen Fällen nicht an das heran, was Cygnet mit einer unveränderten Basis schafft, brauchst du ihn nicht.
12. SemIf

SemIf von TheoLeeCJ liest die Wahrscheinlichkeiten für Optionen direkt aus Basismodellen aus und steht unter MIT-Lizenz. Das Projekt hieß früher OpenJev und ist ausdrücklich nicht mit TypeSafe verbunden.
- Es liest die Wahrscheinlichkeiten für vorgegebene Optionen direkt aus einem Basismodell, ein eigenes Training ist nicht nötig.
- Backends gibt es für CUDA, Apple MLX, PyTorch/MPS und CPU über llama.cpp mit GGUF, dazu eine Browser-Demo.
- Auf Apple Silicon laufen parallele Entscheidungen über einen gemeinsamen Zustand.
- Andere Projekte bauen darauf auf, JevK5 nutzt ausdrücklich die Optionsauswertung von SemIf.
SemIf ist der Kontrollarm für alle, die es klein und ohne Nachtraining wollen. Mich überzeugt vor allem, dass andere Projekte darauf aufbauen. Die Kalibrierung musst du trotzdem selbst prüfen.
13. AnyJev

AnyJev kommt von Nokia Applied Research zusammen mit Tencent Hunyuan. Es ist eine Python-Bibliothek, die Kalibrierungsschichten auf unveränderte Basismodelle legt, unter Apache-2.0. Der Status lautet Forschung.
- Die Stufen L0 (ohne Labels, mit Optionsrotation), L1 (Temperatur) und L2 (kleiner Kopf) arbeiten auf einem unveränderten Basismodell.
- Für L2 nennt die Readme 100 bis 300 gelabelte Beispiele und „one closed-form solve“.
- Fertige Köpfe für fünf Qwen3-Modelle liegen bei, 23 Köpfe je Modell in einer Datei von 1,8 bis 4,4 MB.
- Die adaptive Rotation kommt mit 7,2 statt 18 Rotationen bei einer bescheinigten Abweichung von 1 % aus (Autorenwert).
AnyJev passt, wenn du eine Entscheidung dauerhaft gleich treffen lassen willst und dafür geprüfte Beispiele sammelst. Für einmalige, ständig wechselnde Fragen ist es mir zu schwergewichtig.
14. SetFit

Bei festen Kategorien kann ein Klassifikator reichen. Das ist die schlichteste Lösung, und sie wird oft unterschätzt.
SetFit von Hugging Face arbeitet als Few-Shot-Framework auf Basis von Sentence Transformers mit mehrsprachigen Basismodellen. Laut Dokumentation genügen schon „only 8 labeled examples“, du brauchst allerdings eigene Labels und eine saubere Datenaufteilung. Neue Kategorien bedeuten erneutes Training.
- Auf dem Sentiment-Datensatz Customer Reviews genügen laut Dokumentation „only 8 labeled examples“ je Klasse.
- Das Framework kommt ohne Prompts aus („prompt-free“) und braucht keine großen Modelle wie T0, Llama oder GPT-4.
- Mit einem mehrsprachigen Sentence-Transformer-Checkpoint lassen sich Texte in mehreren Sprachen klassifizieren.
- Training und Inferenz sind laut Dokumentation typischerweise eine Größenordnung schneller als bei großen Modellen.
Bei festen deutschen Kategorien, die sich selten ändern, würde ich immer zuerst fragen, ob ich wirklich ein Entscheidungsmodell brauche. Ein Klassifikator ist dann die ehrlichere Lösung.
15. GLiClass

GLiClass von Knowledgator arbeitet mit Zero-Shot-Klassifikation. Die Labels gibst du erst zur Laufzeit an, die Lizenz ist Apache-2.0. Für allgemeine, regelbezogene Urteile taugt es nicht als Ersatz.
- Die Labels gibst du erst zur Laufzeit an, ein Training auf deinen Kategorien entfällt (Zero-Shot).
- Mehrfachklassifikation mit Schwellenwert ist eingebaut (classification_type='multi-label', threshold).
- Für lange Texte gibt es Chunk-Strategien wie SlidingWindowStrategy und EveryNTokensStrategy.
Wechseln deine Kategorien oft und hast du keine Trainingsdaten, ist GLiClass der leichteste Start. Für Urteile nach Regeln würde ich es nicht nehmen. Zu Geschwindigkeit, Größe und Genauigkeit nennt die Readme keine konkreten Zahlen.
16. GLiNER2.5 multilingual

GLiNER2.5 multilingual von Fastino ist ein Extraktions- und Klassifikationsmodell mit 287M Parametern auf Basis von mDeBERTa-v3-base. Die Karte nennt nur „Multilingual“, Deutsch steht nicht ausdrücklich darin.
- Ein Modell liefert Entitäten, Klassifikation, strukturierte Records und Relationen.
- Es hat 287M Parameter und rund 594 MB Gewichte, lokal ohne externe API.
- Die Familie gibt es auch als 74M- und 194M-Variante (englisch) mit derselben API.
- Die Karte nennt Apache-2.0 und eine Fenstergröße von max_len=4096 sowie einen Abschnitt für lange Dokumente.
Willst du keine Ja-Nein-Urteile, sondern Felder aus Text, gehört GLiNER2.5 auf deine Liste. Ob es deutsche Geschäftsdokumente gut liest, musst du selbst prüfen. Damit steht die Auswahl, und es bleibt die Frage nach Deutsch und Datenschutz.
Wie gut klappt deutscher Text, und wo bleiben deine Daten?
Auf Deutsch gibt es genau eine Zahlenreihe, und sie stammt von einem Anbieter.
Deutscher Text im Vergleich
Jev nennt Englisch als primäre Trainingssprache und rät, andere Sprachen auf eigenen Inhalten zu testen. Direkte deutsche Vergleichszahlen liefert nur ein Anbieterbenchmark von Privatemode, also von einem Beteiligten. Er enthält fünf deutsche Datensätze. Die Grafik zeigt die Trefferquoten von Jev und Privatemode in Prozent. Jev steht jeweils oben, Privatemode darunter.
Eine einheitliche Richtung gibt es nicht. Bei zwei Aufgaben liegt Jev vorn, bei drei Privatemode. Die Streuung der Wiederholungen liegt bei Jev zwischen 0,2 und 0,9 Prozentpunkten, bei Privatemode zwischen 0,0 und 1,3. Einen Abstand wie 1,3 Prozentpunkte bei Massive Intent würde ich deshalb nicht überbewerten.
Ich lese das so, dass fünf Aufgaben eines beteiligten Anbieters kein Gleichwertigkeitsnachweis sind. Sie sind aber mehr, als es für jede andere Option gibt.
Für die übrigen Kandidaten fehlen deutsche Messwerte. Standard One nennt Deutsch als Trainingssprache. Wer Entitäten und Felder aus deutschen Texten holen will, findet in GLiNER2.5 multilingual ein Modell, dessen Karte „Multilingual“ nennt, Deutsch aber nicht ausdrücklich. Und „mehrsprachig“ ist keine Qualitätsgarantie für deutsche Geschäftsdokumente.
Datenschutz und Betriebsort
Beim Thema LLM-Datenschutz zählt vor allem, wo deine Daten verarbeitet werden. Privatemode beschreibt eine attestierte Verarbeitung, die sich laut Anbieter aus der Ferne überprüfen lässt. Codiv schreibt in der Datenschutzerklärung, dass es die gesendeten Inhalte nicht speichert. Djev speichert angenommene Anfragen dagegen mindestens sieben inaktive Tage. Das sind Herstellerangaben.
Bei Kev über OpenRouter läuft deine Anfrage über zwei Zwischenstationen, OpenRouter und SiliconFlow. Der Selbstbetrieb hält die Daten im Haus. Rechtskonform macht er deinen Einsatz aber nicht automatisch. Für vertrauliche Inhalte würde ich deshalb zuerst Privatemode oder den Selbstbetrieb prüfen und alles andere hintanstellen.
Nehmen wir an, du hast dich entschieden. Dann fangen die eigentlichen Probleme erst an.
Was beim Wechsel wirklich schiefgeht
Wer Jev ersetzen will, denkt zuerst an den Preis. Aber der Preis trägt den Wechsel selten.
Preis pro Token ist nicht Preis pro Fall
Die gehosteten Jev-nahen Dienste liegen dicht beieinander. Jev und Kev über OpenRouter kosten 0,042 $ je Million Eingabetokens, milliseconds.ai 0,04 $ und Djev 0,035 $. Privatemode rechnet in Euro. Deshalb lassen sich die Werte ohne Wechselkurs nicht sauber vergleichen.
Zur Größenordnung hilft eine Rechenannahme, keine Prognose. Bei 1.000 Eingabetokens je Entscheidung kosten 100.000 Entscheidungen bei Jev 4,20 $. Bei kleinen und mittleren Mengen rechtfertigt die reine API-Ersparnis damit keinen eigenen GPU-Betrieb. Eigene Mengen rechnest du mit dem API-Kostenrechner nach.
Große Optionsmenüs können mehrere Aufrufe auslösen, bei Privatemode etwa über 128 auszulesenden Wahrscheinlichkeiten. Das verändert die Kosten je Fall.
Der Konfidenzwert ist nicht übertragbar
Jev berechnet den Konfidenzwert (in der Schnittstelle das Feld confidence) aus der Verteilung über die Optionen. Ein Wert von 0,9 bedeutet bei anderen Systemen etwas anderes, je nachdem ob sie Maximalwahrscheinlichkeit, Entropie oder eine normierte Größe nutzen.
Meine Schwellen von 0,75 bis 0,80 gelten deshalb nur für Jev. Eine Regel wie „ab 0,9 automatisch ausführen“ musst du für jedes Modell neu kalibrieren. Die Schwelle von einem System auf ein anderes zu kopieren, ist der schnellste Weg zu stillen Fehlern.
Kompatibel hat fünf Bedeutungen
Wenn ein Anbieter „kompatibel“ sagt, kann er fünf verschiedene Dinge meinen:
- Transport, also dieselbe Form der Anfrage.
- Schema, also dieselbe Struktur der Antwort.
- Semantik, also dieselbe Bedeutung der Felder.
- Wahrscheinlichkeit, also vergleichbare Werte.
- Betrieb, also gleiche Grenzen und Verfügbarkeit.
Erst wenn alle fünf stimmen, hast du einen Ersatz für Jev. Bei den Grenzen lohnt ein Blick in die Grafiken, denn Kontext und Optionen unterscheiden sich stark. Zuerst der Kontext in Tokens, dann die Zahl der Optionen je Frage.
Dazu kommt eine Falle im Wort „offen“. Ein offenes Modell ist nicht automatisch kommerziell frei, und die Lizenz des Codes ist nicht die Lizenz der Gewichte. Ein Beispiel dazu kommt gleich.
Auch bei der Auswahl gibt es Fallen. Ein paar Namen tauchen in mehreren Listen auf und fehlen hier trotzdem, mit gutem Grund.
Warum manche bekannten Namen fehlen
Bekannt heißt nicht empfehlenswert. Die Auswahl von 16 Einträgen aus rund 50 Projekten sagt nichts über Qualität aus. Sie folgt der Datenlage und dem Einsatzfall. Diese Auslassungen sind mir am wichtigsten:
- Laya: Die Basischeckpoints schneiden laut Pinggy-Blog zero-shot „near chance“ ab, taugen also nur mit Anpassung. Das ist die Beobachtung eines Blogs, kein unabhängiger Test. Über Codiv kannst du Laya trotzdem ausprobieren.
- Hopper: Die Modellkarte sagt „Do not use this adapter commercially“. Das ist das Warnbeispiel für Lizenzfallen.
- Decision 1.0: Die Gewichte liegen vor, der Pull Request #4086 für den Standardbetrieb ist aber noch offen.
- Tev1 und FlyMy Decision-2B: Bei Tev1 ist die Lizenz der Gewichte noch in Finalisierung, bei FlyMy Decision-2B sind Fragen zur Nutzung offen.
Dazu kommen Winnow, OneJev, reflex, jqv, Von, Verdict und einige mehr. Ich habe mich bei ihnen bewusst nicht entschieden. Manche brauchen ein Basismodell zum Adapter, manche haben eine Gemma-Lizenz, manche liegen im Medienfokus. Schlecht sind sie deshalb nicht. Anwendungen, die nur Jev nutzen, zählen nicht als Alternativen.
Bleibt die Frage, wie du selbst herausfindest, was zu dir passt.
So testest du, bevor du wechselst
Der beste Test ist langweilig. Du nimmst deine eigenen Fälle mit sauberen Antworten und vergleichst so, dass du es morgen wiederholen kannst.
Sechs Schritte reichen dafür:
- Halte den Vertrag fest. Schreib Modell-ID, Revision, Quantisierung und Laufzeit auf und mische keine Versionen.
- Sammle eigene Fälle mit Referenzantworten und trenne die Fälle zum Einstellen von denen zum Prüfen.
- Lege Mindestmetriken und die akzeptable Fehlerquote fest, bevor du das erste Ergebnis siehst.
- Prüfe die Robustheit. Stell die Frage allein, mit irrelevanten Zusatzfragen und in vertauschter Reihenfolge. Benenne außerdem Kategorien neutral um, denn typkorrekte Antworten können laut einem Preprint trotzdem die falsche Bedeutung wählen.
- Lass die Alternative im Schattenbetrieb neben dem Bestehenden laufen.
- Plane einen Rückfallpfad, bevor du umschaltest.
Dabei gilt eine Obergrenze. Nimm höchstens eine Referenz, drei Alternativen und einen Kontrollarm. Betragsgrenzen und Berechtigungen gehören in deinen Anwendungscode, nicht ins Modell.
Als Kontrollarm eignet sich ein unverändertes Basismodell wie bei Cygnet oder ein schlanker Klassifikator wie SetFit. Dazu kommt ein naheliegender dritter Weg, ein Sprachmodell mit vorgegebenem Ausgabeformat (Structured Outputs). Wie gut das im Vergleich zu Jev funktioniert, wurde für diesen Artikel nicht recherchiert. Deine eigenen Fälle zeigen es.
Wenn du bis hier gelesen hast, kennst du die Landkarte. Fehlt nur der Satz zum Mitnehmen.
Fazit
Kurzum:
Die eine Jev-Alternative gibt es nicht. Deine gibt es, und sie hängt davon ab, ob dir Datenschutz, deutscher Text, Selbstbetrieb oder ein einfacher Kontrollarm am wichtigsten ist. Über den Wechsel entscheiden deine eigenen Fälle.
Wenn ich dir nur eines mitgeben dürfte, dann das. Ein sauberer Kontrollarm schlägt jede Bestenliste, denn er misst auf deinen Fällen und nicht auf fremden.
Wo du Jev selbst sinnvoll einsetzt, zeigen dir die Anwendungsfälle für Jev.
Sammle deine echten Fälle mit der richtigen Antwort. Lass sie gegen Jev, höchstens drei Alternativen und ein unverändertes Basismodell laufen, bevor du irgendetwas umbaust.
Du musst nicht rund 50 Modelle kennen. Ein sauberer Testlauf mit deinen eigenen Fällen sagt dir mehr als jede Bestenliste, und der ist kein Hexenwerk.
Offene Fragen klären die sieben Antworten unten.






