Auf Hacker News ist gerade "Kev" von Jared Palmer aufgetaucht: kleine Decision-Models in 0,8B, 4B und 9B auf Qwen3.5-Basis, Apache-2.0, mit Trainingscode und Evaluationsdaten: https://github.com/jaredpalmer/kev Das Prinzip kennt ihr vielleicht von TypeSafes Jev: Ein Text geht rein, dazu typisierte Fragen (Ja/Nein, Auswahl, Bewertung), und zurück kommen keine Sätze, sondern Wahrscheinlichkeiten für jede erlaubte Antwort. Kev erreicht das mit Training: ein LoRA-Adapter (Rang 16) plus ein kleiner eigener Bewertungskopf, der die Antwortoptionen gegen die Frage abgleicht. Laut README liegt Kev-9B auf dem eigenen Entwicklungssatz 3,5 Punkte hinter Jev (0,822 gegen 0,857). Ich habe letzte Woche denselben Weg ohne Training gebaut, snapjudge: https://github.com/Micha0827/snapjudge Dort liest die Engine die Wahrscheinlichkeiten direkt aus den Logits eines unveränderten Qwen-Modells, lokal mit MLX. Beide nutzen dieselbe Schnittstelle (/v1/systemone), ein Client kann also zwischen Jev, Kev und snapjudge umschalten. Meine Zahlen auf Deutsch, 114 gelabelte Geschäftsentscheidungen (Mail-Kategorie, Mieteranfragen, Buchungskategorien): Qwen3.6-35B-A3B kommt ohne jedes Training auf 95,6 %. 89 % der Antworten haben eine Sicherheit über 0,9, und davon sind 99 % richtig. Das ist für Automationen der eigentliche Punkt: Ab einer Schwelle entscheidet der Workflow allein, darunter geht es an einen Menschen. Zum Training, weil Kev genau darauf setzt: Ein Qwen3.5-2B mit LoRA stieg bei mir auf dem typed-decisions-Datensatz von 0,41 auf 0,78. Beim 4B hat dasselbe Training den Benchmark verbessert, auf meinem deutschen Satz aber verschlechtert (86,8 % statt 93,9 % untrainiert). Wer trainiert, bekommt einen Spezialisten für genau seine Aufgabe, keinen besseren Allrounder. Zwei Dinge, die ihr bei Kev prüfen solltet: Das README sagt selbst, dass die Reihenfolge der Optionen die Antwort ändern kann, und zu deutschen Texten gibt es keine Angaben. MLX ist erst als nächster Schritt geplant, auf dem Mac läuft es bis dahin in bf16 (4B und 9B passen auf 32 GB). Ich lasse Kev-4B als Nächstes auf meinen 114 deutschen Entscheidungen laufen und teile den Vergleich hier.