was ist das

Das Smarte ist nicht das Modell.
Es ist die Schicht drumherum.

ALLSmartLLM ist eine Routing- und Policy-Schicht über Open-Weights-LLMs auf eigener Hardware. Alles unten erklärt, was diesen Satz brauchbar macht.

eine API

OpenAI-kompatibel. Alias-zuerst.

Wenn dein Code die OpenAI-API spricht, spricht er ALLSmartLLM. Eine URL, ein Key ändern — das SDK bleibt.

Das Gateway routet auf Aliase, nicht auf Modell-Namen. Ein Alias bündelt drei Dinge:

  1. das konkrete Modell, das antwortet (wir können unter dir wechseln, sobald eine bessere Version unser Eval besteht)
  2. das Ziel — unsere Hardware oder ein extern angebundener Provider, für den du deinen eigenen Key hinterlegst
  3. die Datenschutz-Policy, die immer greift, egal was der Request sagt

Ein einziger String in deinem Code — "model": "frontier" — entscheidet, welches von 15 Open-Weights-Modellen läuft, ob es auf unserer Hardware bleibt und ob der Prompt pseudonymisiert reingeht. Zentrale Kontrolle, null Code-Änderungen bei Policy-Wechseln.

client = OpenAI(
  base_url="https://api.allsmartllm.com/v1",
  api_key="sk-your-key",
)
resp = client.chat.completions.create(
  model="frontier",        # alias, not a version
  privacy={"mode": "pseudonymize"},
  messages=[...],
)
datenschutz

Drei Stufen, plus ein Scanner für Zugangsdaten.

Jeder Prompt kann sich für eine von drei Stufen personenbezogener Daten entscheiden. Oben drauf: Zugangsdaten bekommen einen eigenen, immer aktiven Scanner — auch ohne aktivierte Privacy.

Die drei Modi für personenbezogene Daten:

pseudonymize

Erkannte Werte werden durch <<TYP_n>>-Platzhalter auf dem Weg zum Modell ersetzt. Die Zuordnung lebt nur im Request-Speicher. In der Antwort werden die Platzhalter wieder zurückgetauscht, bevor du sie siehst — Streaming inklusive.

mask

Gleiche Erkennung + Ersetzung, aber die Zuordnung wird sofort verworfen nach dem Upstream-Aufruf. Der Client sieht die Platzhalter. Verwende das, wenn der Rohwert nie zurücklaufen soll — externe Provider, auditierte Kontexte.

strict

Fügt einen Zweit-Check durch ein LLM auf unserer Hardware hinzu. Erkennt indirekte Kennungen, die Regex und NER verpassen — Rolle+Ort („die einzige Kardiologin in Neustadt"), Attribut-Ketten, einzigartige Beschreibungen. Additiv only: entfernt nie eine deterministische Detektion. Fail-closed bei jedem Fehler — ein Strict-Request, der nicht laufen kann, bekommt 503, nie ein stiller Downgrade.

Und immer aktiv: der Credential-Scanner

Prompts sammeln versehentlich ständig Zugangsdaten ein — eine eingefügte .env, ein Curl-Beispiel, ein Stack-Trace mit Auth-Header. Auf dem Weg zu einem externen Provider wäre das ein echtes Leak. Wir scannen davor.

Ab Werk erkannt:

  • Provider-Tokens — OpenAI, Anthropic, OpenRouter, Hugging Face, AWS, GitHub, Slack, Stripe (nur Live-Keys, Test-Keys sind unbedenklich zu teilen)
  • Strukturelle Zugangsdaten — JWTs (per Header-Decode validiert), PEM-Private-Key-Blöcke, HTTP-Basic-Auth-URLs
  • Datenbank-URIspostgres://user:pass@host/db: nur die Credentials werden maskiert, Schema + Host bleiben sichtbar, damit das Modell die Query weiterverstehen kann
  • Generische Key/Value-Zuweisungenapi_key=…, Authorization: Bearer …, mit Shannon-Entropy-Schwelle + Platzhalter-Wortliste, damit password: changeme oder <DEIN_TOKEN> nicht triggern

Werte, Platzhalter, Offsets tauchen nie in einem Log-Eintrag, Metrik-Label oder in einer Fehlermeldung auf. Die Zuordnung existiert nur im Request-Handler und wird garbage-collected, sobald die Antwort raus ist.

hardware

Prompts enden auf Hardware, die uns gehört.

Das Gateway ist eine Sache. Die Maschinen, die antworten, sind eine andere. Beide sind in Österreich.

Jeder Request an einen ALLSmartLLM-Alias, der auf ein Open-Weights-Modell zielt, landet auf unserer eigenen Hardware in Oberösterreich. Keine Sub-Prozessoren. Keine Drittländer-Hops.

Externe Frontier-Modelle sind trotzdem erreichbar — durch die Mask-/Pseudonymize-Schicht, und nur wenn du den Provider explizit mit deinem eigenen Key angebunden hast. Dein Vertrag mit dem Provider ist dein Vertrag; wir vermitteln keinen Zugang. Was wir tun, ist verhindern, dass ein Prompt die EU verlässt, ohne dass die Privacy-Schicht ihn gesehen hat.

gemessen

Zahlen auf dieser Seite sind gemessen, nicht versprochen.

Durchsatz, Detection-Recall, Latenz — alles mit einer Zahl drauf ist mit veröffentlichter Methodik gebenchmarkt. Wenn sich eine Zahl ändert, ändert sie sich, weil ein Lauf das gesagt hat.

Der Nightly-Bench pingt jedes geladene Modell mit einem Standard-Prompt, misst die Streaming-Decode-Rate, protokolliert den Median aus drei Läufen. Warm-up wird verworfen. Diese Zahl steht unter „Gemessen" auf der Startseite und in der Modell-Tabelle.

Detection-Qualität hat ihr eigenes Eval-Set: ~50 gelabelte deutschsprachige Beispiele über direkte PII (E-Mail, Telefon, IBAN, SVNR), kontextabhängige Kennungen für den Strict-Mode-Check und realistische Zugangsdaten für den Secret-Scanner. Precision + Recall pro Klasse, im Repo veröffentlicht. Wenn wir „erkennt OpenAI-Keys" sagen, ist das kein Marketing — das ist ein Test, der besteht.

fragen

Die fünf Fragen, die wir am häufigsten kriegen.

Muss ich meinen Code ändern?
Eine URL und ein Key. Die SDKs, die du eh schon nutzt — OpenAI, LangChain, LlamaIndex, was auch immer die OpenAI-API spricht — funktionieren weiter.
Wo laufen die Prompts wirklich?
Für unsere eigenen Aliase: ein GPU-Rack in Oberösterreich, das uns gehört. Für externe Aliase, die du angebunden hast: erst durch die Privacy-Schicht, dann zum Provider, mit dem du einen Vertrag hast, mit dem Key, den du uns hinterlegt hast.
Was passiert, wenn die Privacy-Schicht ausfällt?
Fail-closed. Wenn die Detection nicht laufen kann — Timeout, Backend nicht erreichbar, ungültige Antwort — kriegt der Request 503. Er wird nie stumm ohne den angeforderten Privacy-Schritt weitergereicht.
Kann ich das später selbst betreiben?
Ja. Das Gateway ist derselbe Code, den wir laufen lassen. Wenn deine Hardware bereit ist, änderst du eine URL — fertig. Siehe Betreiben.
Was kostet das?
8 € pro Million Tokens über alle Modelle. 10 Millionen Tokens gratis bei Registrierung. Keine Grundgebühr, kein Abo — nur Nutzung. Siehe den Preise-Bereich.

Bereit zum Ausprobieren?

10 Millionen Tokens gratis. Keine Karte, kein Abo.