Laya: Nicht-autoregressive Decision Engine für schnelle Klassifizierungen

RepositoryNandhaKishorM/layaTool

Laya ist eine quelloffene Decision Engine in Python, die typisierte Entscheidungen wie Auswahl, Score oder Ja/Nein-Werte über Texte in mehr als 100 Sprachen liefert. Statt autoregressiver Textgenerierung verarbeitet das Modell Anfragen in einem einzigen Forward Pass innerhalb von rund 33 Millisekunden.

Das Wichtigste

  1. Führt typisierte Textentscheidungen (Choice, Score, Yes/No) in einem einzelnen Forward Pass in rund 33 ms aus.
  2. Unterstützt über 100 Sprachen und Kontextlängen von bis zu 8.192 Tokens beim Modell laya-multilingual.
  3. Wurde mit Reinforcement Learning gegen Strictly Proper Scoring Rules (RLCD) trainiert.
  4. Enthält einen Router, der pro Anfrage automatisch den passenden Modell-Checkpoint auswählt.
  5. Bietet optionale Integrationen für ONNX Runtime, TileLang-GPU-Beschleunigung, LangChain, MCP-Server und HTTP-Serving.

Warum das relevant ist

Viele Workflows in KI-Pipelines und Agentensystemen benötigen keine ausführliche Textgenerierung, sondern lediglich schnelle Klassifizierungen oder Routing-Entscheidungen. Laya ersetzt ressourcenintensive autoregressive LLMs an solchen Stellen durch deterministische, latenzarme Inferenz.

Einordnung

Das Projekt zielt auf ML-Entwickler und Systemarchitekten, die Routing-Schritte oder Klassifizierungen in Agenten- und API-Architekturen beschleunigen müssen. Technologisch stützt sich Laya auf Python 3.10+, PyTorch, Hugging Face, ModernBERT sowie Schnittstellen wie MCP und LangChain. Mit über 25.000 Sternen auf GitHub, PyPI-Paketen, Evaluierungsskripten und vorgefertigten Checkpoints zeigt das Repository unter Apache-2.0-Lizenz einen hohen Reifegrad.

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Repository:google-ai-edge/LiteRT-LM

    LiteRT-LM: Googles Open-Source-Inferenz-Framework für On-Device-LLMs

    LiteRT-LM ist ein Open-Source-Framework von Google zur plattformübergreifenden Ausführung großer Sprachmodelle direkt auf Edge-Geräten. Die Software nutzt Hardwarebeschleunigung über GPU und NPU und treibt On-Device-KI-Funktionen in Chrome, Pixel Watch und Chromebook Plus an.

    6375SterneC++

    KI & AI· Tool

  • Repository:LMCache/LMCache

    LMCache: Skalierbare KV-Cache-Verwaltung für LLM-Inferenz

    LMCache ist ein Open-Source-Projekt unter Apache-2.0-Lizenz, das als spezialisierter Management-Layer für den KV-Cache bei LLM-Inferenz dient. Es optimiert Latenz und Kosten beim Serving von Sprachmodellen auf GPUs von Nvidia und AMD.

    11.660SternePython

    KI & AI· Tool

  • Repository:ggml-org/llama.cpp

    llama.cpp: LLM-Inferenz in C/C++

    llama.cpp ist ein quelloffenes C/C++-Projekt der Organisation ggml-org, das auf LLM-Inferenz spezialisiert ist. Mit über 127.000 Sternen auf GitHub bietet es vorkompilierte Binärdateien, Docker-Container, REST-APIs und C-Bibliotheksanbindungen für den Betrieb von Sprachmodellen.

    127.115SterneC++

    KI & AI· Tool

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.