Das KI-Modell, das keine Texte schreiben will
Nach TypeSafe Jev erscheint mit Laya ein offenes Entscheidungsmodell. Was kann die Alternative und wie belastbar sind die Versprechen?
Die spannendste Frage bei künstlicher Intelligenz lautet nicht immer: Welches Modell schreibt den besten Text?
Manchmal ist die wichtigere Frage: Welches Modell trifft die richtige Entscheidung, ohne überhaupt Text zu erzeugen?
In unserem Artikel über Jev von TypeSafe AI haben wir ein Modell vorgestellt, das genau diesen Perspektivwechsel verkörpert. Jev möchte kein klassischer Chatbot sein. Statt Antworten für Menschen zu formulieren, liefert das Modell typisierte Entscheidungen, Wahrscheinlichkeiten und Konfidenzwerte direkt an Software.
Nun bekommt dieser Ansatz eine offene Alternative: Laya. Das Modell von Convai Innovations verfolgt ein ähnliches Konzept wie Jev, ist aber als Open-Source-Projekt verfügbar und kann lokal betrieben werden. Laya will nicht das nächste ChatGPT sein. Es soll Supporttickets klassifizieren, Rechnungen bewerten, Sicherheitsvorfälle erkennen oder KI-Agenten routen, schnell, strukturiert und ohne Umweg über generierten Freitext.
Für uns ist Laya deshalb weniger ein „Jev-Killer“ als ein wichtiger Test für eine neue Modellklasse. TypeSafe zeigt, wie System-One-Modelle funktionieren könnten. Laya zeigt nun, dass sich dieses Prinzip auch offen und lokal umsetzen lässt.
Was Laya mit Jev verbindet
Large Language Models wurden dafür entwickelt, Text für Menschen zu erzeugen. In Software-Workflows werden sie jedoch häufig für Aufgaben eingesetzt, bei denen gar kein Text benötigt wird.
Ein Beispiel: Eine E-Mail trifft im Kundenservice ein. Das System soll lediglich drei Fragen beantworten:
- Welche Abteilung ist zuständig?
- Wie dringend ist die Anfrage?
- Ist eine Eskalation erforderlich?
Ein klassisches LLM könnte daraus eine strukturierte JSON-Antwort erzeugen. In der Praxis muss die Anwendung anschließend prüfen, ob das JSON gültig ist, ob alle Felder enthalten sind und ob die Werte den erwarteten Datentypen entsprechen.
Jev und Laya setzen früher an. Die Anwendung übergibt einen sogenannten State, etwa eine E-Mail, ein Supportticket, einen Log-Eintrag oder strukturierte JSON-Daten und stellt dazu typisierte Fragen. Das Modell liefert anschließend direkt verwertbare Werte zurück.
TypeSafe beschreibt dieses Prinzip bei Jev als Kombination aus State und typed Questions. Die Antworten enthalten typisierte Werte, Wahrscheinlichkeitsverteilungen und bei bestimmten Fragetypen Konfidenzwerte. Die Ergebnisse können von Code direkt zum Verzweigen, Sortieren und Weiterleiten verwendet werden.
Damit entfällt ein erheblicher Teil des klassischen LLM-Overheads:
- keine längere Textgenerierung,
- kein nachträgliches Parsen,
- weniger Probleme mit ungültigem JSON,
- ein klar definierter Output-Raum,
- parallele Verarbeitung mehrerer Fragen.
Laya ist kein kleineres ChatGPT
Die wichtigste Einordnung lautet: Laya ist kein generatives Sprachmodell im klassischen Sinn.
Das Modell schreibt keine Kundenantwort, keinen Blogartikel und keinen Programmcode. Es führt auch keinen offenen Dialog und ist nicht dafür gedacht, komplexe Sachverhalte ausführlich zu erklären.
Laya ist ein nicht-autoregressives System-1-Entscheidungsmodell. Während ein generatives Sprachmodell Text normalerweise Token für Token erzeugt, berechnet Laya seine Entscheidungen direkt in einem Forward Pass.
Das erklärt die versprochene Geschwindigkeit. Nach Angaben der veröffentlichten Model Card erreicht die englische Modellvariante auf einer Tesla-T4-GPU eine Latenz von ungefähr 32,8 Millisekunden. Bei mehreren Fragen beziehungsweise Batch-Verarbeitung soll der Durchsatz nochmals steigen.
Die Bezeichnung „System 1“ lehnt sich an die schnelle, intuitive Entscheidungslogik aus Daniel Kahnemans bekanntem Modell an. Das bedeutet nicht, dass Laya wie ein Mensch denkt. Gemeint ist vielmehr, dass das Modell für schnelle, klar abgegrenzte Bewertungen konzipiert wurde, nicht für langsames, mehrstufiges Reasoning.
Die drei Fragetypen
Laya arbeitet wie Jev mit typisierten Fragen. Diese drei grundlegenden Primitive bilden den Kern der Modellklasse.
Choice: Eine Option auswählen
Mit choice wählt das Modell eine Kategorie aus einer vorher definierten Liste aus.
Beispiel:
Frage: Welche Abteilung ist zuständig?
Optionen: Support, Vertrieb, Buchhaltung, Technik
Die Anwendung erhält nicht nur die wahrscheinlichste Auswahl, sondern auch Wahrscheinlichkeiten für die verfügbaren Optionen.
Score: Eine Skala bewerten
Mit score wird ein Zustand auf einer geordneten Skala bewertet.
Beispiel:
Frage: Wie dringend ist diese Anfrage?
Skala: 1 = niedrig, 5 = kritisch
Das eignet sich unter anderem für Prioritäten, Risikoanalysen oder Lead-Bewertungen.
Noul: Eine Ja-/Nein-Aussage bewerten
Der etwas ungewöhnliche Fragetyp noul liefert eine Wahrscheinlichkeit für eine binäre Aussage.
Beispiel:
Aussage: Der Kunde benötigt eine persönliche Beratung.
Ergebnis: 0,86
Die drei Fragetypen können in einer Anfrage kombiniert werden. Die Anwendung entscheidet anschließend selbst, welche Schwellenwerte gelten und was mit unsicheren Fällen passiert.
Die verfügbaren Laya-Modelle
Laya ist nicht nur ein einzelner Checkpoint. Convai Innovations veröffentlicht eine kleine Modellfamilie mit unterschiedlichen Schwerpunkten.
| Modell | Encoder | Parameter | Einsatzgebiet |
|---|---|---|---|
laya | ModernBERT-large | 421 Millionen | Allgemeine englische Entscheidungen |
laya-multilingual | mmBERT-base | 322 Millionen | Mehr als 100 Sprachen |
laya-typed-decisions | ModernBERT-large | 421 Millionen | Spezialisierte Typed-Decisions-Workflows |
Das spezialisierte Modell laya-typed-decisions wurde auf vier Anwendungsbereichen feinjustiert:
- Rechnungsverarbeitung,
- Sicherheitsvorfälle,
- Kundenservice,
- Überwachung von Agenten-Traces.
Die Modellfamilie steht unter der Apache-2.0-Lizenz zur Verfügung. Damit können Entwickler Laya lokal testen, in eigene Anwendungen integrieren und grundsätzlich auch in kommerziellen Projekten einsetzen. Die Modellgewichte und der Code sind über Hugging Face, GitHub und PyPI erreichbar.
Für Unternehmen ist das ein wesentlicher Unterschied zu einem ausschließlich über eine Hersteller-API verfügbaren Modell. Sensible Daten müssen nicht zwingend an einen externen Anbieter übertragen werden. Gleichzeitig verschwinden die Kosten natürlich nicht vollständig. Sie verlagern sich auf eigene Hardware, Hosting, Wartung und Monitoring.
Laya gegen Jev: Was sagen die Benchmarks?
Die veröffentlichten Zahlen machen Laya besonders interessant. Im Typed-Decisions-Benchmark mit 400 Testfällen und 2.000 Einzelentscheidungen erreicht das spezialisierte Laya-Modell eine Genauigkeit von 0,766.
Für TypeSafe Jev 1.13.0 wird in der Laya Model Card ein veröffentlichter Wert von 0,727 angegeben. Auf den ersten Blick liegt Laya damit 3,9 Prozentpunkte vorne. Auch beim Brier Score und beim Mean Absolute Error für Score-Fragen schneidet Laya in der veröffentlichten Gegenüberstellung besser ab.
Diese Zahlen sollten jedoch nicht als endgültiger Beweis für eine generelle Überlegenheit verstanden werden. Die Laya-Projektseite weist selbst darauf hin, dass die Jev-Werte aus einer Drittquelle stammen. Jev wurde in diesem Test nicht über die TypeSafe-API unter vollständig identischen Bedingungen vermessen. Stichprobengrößen, Prompts und Evaluationsbedingungen können voneinander abweichen.
Außerdem handelt es sich beim getesteten Laya-Checkpoint um einen Spezialisten. Das Modell wurde gezielt auf vier synthetische Workflows feinjustiert. Das Basismodell laya erreicht im gleichen Benchmark lediglich eine Genauigkeit von 0,362. Das ist ein wichtiger Unterschied.
| Modell | Genauigkeit | Brier Score | ECE |
|---|---|---|---|
| Laya Typed-Decisions | 0,766 | 0,062 | 0,213 |
| TypeSafe Jev 1.13.0 | 0,727 | 0,148 | 0,144 |
| Laya, nicht feinjustiert | 0,362 | 0,316 | 0,175 |
Die Werte stammen aus der veröffentlichten Laya-Evaluation und sind wegen der unterschiedlichen Messbedingungen nur als richtungsweisend zu verstehen.
Interessant ist außerdem, dass Jev bei der Kalibrierung der Wahrscheinlichkeiten besser abschneidet. Der niedrigere ECE-Wert von 0,144 gegenüber 0,213 bei Laya deutet darauf hin, dass Jevs Konfidenzen in diesem Test besser mit den tatsächlichen Trefferraten übereinstimmen.
Das ist kein nebensächliches Detail. Wenn ein System bei einer Konfidenz von 90 Prozent automatisch eine Zahlung freigibt, einen Sicherheitsvorfall eskaliert oder einen Kunden zurückweist, muss diese Wahrscheinlichkeit belastbar sein.
Die Grenzen von Laya
Laya ist ein interessantes Werkzeug, aber kein universeller KI-Ersatz.
Die größte Einschränkung liegt im Anwendungsbereich. Das spezialisierte Modell wurde auf vier bestimmten, synthetischen Workflows trainiert. Außerhalb dieser Bereiche sollte es nicht automatisch als zuverlässiger allgemeiner Klassifikator eingesetzt werden.
Auch die multilingualen Fähigkeiten sollten mit eigenen Daten überprüft werden. Obwohl laya-multilingual mehr als 100 Sprachen unterstützt, bedeutet das nicht, dass jede Sprache dieselbe Qualität erreicht. Für deutsche Fachtexte, branchenspezifische Begriffe und regionale Formulierungen sind eigene Tests unverzichtbar.
Weitere Einschränkungen:
- Laya kann keinen Freitext erzeugen.
- Das Modell ist keine allgemeine Reasoning-Engine.
- Der mögliche Output muss vorher definiert werden.
- Große Labelräume können die Genauigkeit verringern.
- Für
choice-Fragen werden weniger als ungefähr 20 Optionen empfohlen. - Die Wahrscheinlichkeiten sind laut Model Card weiterhin nicht perfekt kalibriert.
- Vor produktiven Entscheidungen ist eine Kalibrierung auf eigenen Validierungsdaten notwendig.
Laya ist deshalb kein kleineres ChatGPT. Es ist ein spezialisiertes Werkzeug für eine andere Aufgabenklasse.
Praktische Einsatzmöglichkeiten
Besonders sinnvoll erscheint Laya als Entscheidungsschicht in mehrstufigen KI-Architekturen.
Ein Website-Formular könnte beispielsweise zunächst durch Laya bewertet werden:
Eingabe: Anfrage eines potenziellen Kunden
Fragen:
- Welche Leistung ist relevant?
- Wie hoch ist die Priorität?
- Ist ein persönliches Beratungsgespräch erforderlich?
Das Ergebnis könnte anschließend den weiteren Workflow bestimmen:
Wenn Konfidenz >= 0,85:
Anfrage automatisch routen
Wenn Konfidenz < 0,85:
an ein großes LLM oder einen Menschen übergeben
Für Agentensysteme ergeben sich ähnliche Möglichkeiten. Laya könnte entscheiden, ob ein Agent eine Websuche, eine Datenbankabfrage oder einen spezialisierten Rechner aufruft. Ein größeres Sprachmodell müsste dann nicht jeden Routing-Schritt selbst übernehmen.
Auch im Umfeld von WordPress, Formularen und Conversion-Prozessen sind Anwendungen denkbar:
- Leads nach Thema und Kaufwahrscheinlichkeit klassifizieren.
- Kontaktanfragen an passende Teams verteilen.
- Supportfälle priorisieren.
- Spam- und Missbrauchsmuster erkennen.
- Freitextfelder vor der Übergabe an ein LLM kategorisieren.
- LLM-Ausgaben durch eine zusätzliche Prüfschicht bewerten.
Die wahrscheinlich sinnvollste Architektur ist dabei nicht Laya oder LLM, sondern Laya und LLM:
- Laya übernimmt schnelle, häufige und klar definierte Entscheidungen.
- Ein großes Sprachmodell kümmert sich um offene Antworten, Zusammenfassungen und komplexe Aufgaben.
- Menschen übernehmen Grenzfälle und Freigaben.
Open Source gegen Vendor Lock-in
Der Open-Source-Aspekt ist der größte Unterschied zu Jev.
Jev wird als proprietärer Dienst von TypeSafe AI angeboten. Das kann Vorteile haben: Der Nutzer muss sich nicht um Modellbetrieb, Hardware, Updates oder Skalierung kümmern. Außerdem kann ein Anbieter zentrale Verbesserungen an Infrastruktur und Modell automatisch ausrollen.
Laya bietet dafür mehr Kontrolle:
- lokale Ausführung,
- eigene Tests,
- bessere Datenhoheit,
- keine zwingenden Tokenkosten pro API-Aufruf,
- Anpassung an eigene Workflows,
- Einsicht in Code und Modellartefakte,
- potenziell weniger Abhängigkeit von einem einzelnen Anbieter.
Open Source bedeutet aber nicht automatisch bessere Qualität. Wer Laya produktiv einsetzt, trägt selbst Verantwortung für:
- Modellüberwachung,
- Datenschutz,
- Updates,
- Skalierung,
- Fehlermanagement,
- Sicherheitsprüfungen,
- Kalibrierung und Qualitätssicherung.
Für einen ersten lokalen Test genügt dagegen bereits eine überschaubare Entwicklungsumgebung. Das Modell kann über Python geladen und mit eigenen Zuständen und Fragen ausprobiert werden:
import laya
agent = laya.load("convaiinnovations/laya-typed-decisions")
result = agent.predict(state, questions)
Für Anwendungen mit hoher Anfragezahl sollte das Modell resident gehalten werden, statt es bei jeder Anfrage neu zu laden. Die Projekt-Dokumentation weist außerdem auf mögliche Probleme hin, wenn TensorFlow-Umgebungen automatisch erkannt werden.
Unsere Einschätzung
Laya macht Jev nicht überflüssig. Aber das Modell verändert die Diskussion.
TypeSafe AI hat mit Jev ein klares Problem sichtbar gemacht: Software benötigt häufig keine eloquente Textantwort, sondern eine schnelle und strukturierte Entscheidung. Laya greift diese Idee auf und bringt sie in eine offenere, lokal nutzbare Form.
Das überzeugt uns aus drei Gründen:
- Der Anwendungsfall ist klar abgegrenzt.
- Typisierte Ausgaben reduzieren Parsing- und Integrationsprobleme.
- Kleine Entscheidungsmodelle können große Sprachmodelle in Agenten-Workflows sinnvoll ergänzen.
Gleichzeitig bleiben wir bei den Leistungsversprechen vorsichtig. Die veröffentlichten Vergleiche mit Jev sind interessant, aber nicht vollständig unabhängig. Das spezialisierte Laya-Modell profitiert vom Training auf genau den Workflows, in denen es getestet wird. Die Kalibrierung der Wahrscheinlichkeiten ist noch nicht ideal, und der Einsatz in deutschsprachigen Unternehmensprozessen muss mit eigenen Daten validiert werden.
Fazit: Die Alternative zum Chatbot-Denken
Laya ist kein Modell für Menschen, die mit einer KI chatten möchten. Es ist ein Modell für Software, die Entscheidungen treffen muss.
Genau deshalb ist das Projekt relevant. Nach Jahren immer größerer Sprachmodelle zeichnet sich eine Gegenbewegung ab: KI-Systeme werden wieder stärker nach ihrer konkreten Funktion gebaut. Ein Modell soll nicht zwangsläufig alles können. Es soll eine bestimmte Aufgabe schnell, günstig und kontrollierbar erledigen.
Jev hat diesen Ansatz als proprietäres System-One-Modell bekannt gemacht. Laya zeigt nun, dass eine vergleichbare Idee auch als Open-Source-Projekt umgesetzt werden kann.
Laya ist kein Jev-Killer, sondern ein wichtiger Beleg dafür, dass sich eine neue Modellklasse entwickelt. Ob sie sich langfristig durchsetzt, entscheidet sich nicht an einzelnen Marketingzahlen, sondern an unabhängigen Benchmarks, echten Produktionsprojekten und der Frage, wie zuverlässig die Konfidenzwerte in der Praxis sind.
Für Entwickler und Unternehmen ist die Richtung trotzdem vielversprechend. Die Zukunft der KI besteht wahrscheinlich nicht nur aus einem einzigen großen Modell. Sie wird aus spezialisierten Bausteinen bestehen: einem Modell für Entscheidungen, einem anderen für Text, weiteren Modellen für Bilder, Audio, Suche oder Planung.
Und manchmal ist das beste KI-Modell eben nicht dasjenige, das am meisten sagt. Sondern dasjenige, das zuverlässig die richtige Entscheidung trifft.
Quellen:
[1] Introduction – TypeSafe AI https://docs.typesafe.ai/introduction
[2] convaiinnovations/laya-typed-decisions https://huggingface.co/convaiinnovations/laya-typed-decisions
Hinweis: Dieser Artikel enthält Inhalte, die mit Unterstützung eines KI-Systems erstellt wurden. Die Inhalte wurden anschließend von einem Menschen mit ❤️ überprüft und bearbeitet, um Qualität und Richtigkeit sicherzustellen.
