Die smarte Schicht über dem Modell

Eine OpenAI-kompatible API zu Open-Weights-Modellen auf eigener Hardware in Österreich. Aliase, die Policy tragen. Datenschutz in Stufen, bis hin zu einer LLM-gestützten Prüfinstanz. Und jede Zahl auf dieser Seite ist nächtlich gemessen, nicht versprochen.

nightly-benchmark bench.smartllm, live datasheet
$ smartllm bench --nightly --stream
frontier 397B · loaded ......... 29.9 t/s
mid 35B · loaded ......... 53.3 t/s
fast 8B · loaded ......... 60.0 t/s
· privacy layer
pseudonymize streaming ............ pass-through
strict llm-check · local ..... on-hardware
· median of repeated runs, warm-up discarded
all systems measured ✓
1,277b+
Tokens ausgeliefert
132
Gemessener Durchsatz, bis zu
15
Open-Weights-Modelle
100
Daten bleiben in der EU
Nächtlich gemessen mit veröffentlichter Methodik. Median wiederholter Läufe, Warm-up verworfen.

Eine Schicht, die alles an einer Stelle organisiert

Deine Anwendung spricht mit einem Namen. Was dahinter passiert, welches Modell, welcher Anbieter, wie viel Datenschutz, konfigurierst du hier und änderst es jederzeit, ohne eine Zeile Code anzufassen. Probier es aus:

ALLSmartLLM
Alias big-fat-model
Ziel
aufgelöst auf ALLSmartLLM · Qwen 3.5 · 397B
Datenschutz
Nicht nötig. Der Prompt verlässt unser Haus ohnehin nicht.
Was deine App schickt
Bereite bitte die Antwort an Julia Berger vor, die neue Finanzvorständin von Innovatec Handel in Salzburg. Sie möchte den Status der offenen Rechnung 2026-0417 wissen. Zahlung ging an Konto AT61 1904 3002 3457 3201. Für den ERP-Import bitte den API-Key sk-live-9f2ac41b8e verwenden.
Was das Zielmodell sieht, ALLSmartLLM
Bereite bitte die Antwort an Julia Berger vor, die neue Finanzvorständin von Innovatec Handel in Salzburg. Sie möchte den Status der offenen Rechnung 2026-0417 wissen. Zahlung ging an Konto AT61 1904 3002 3457 3201. Für den ERP-Import bitte den API-Key sk-live-9f2ac41b8e verwenden.
Unverändert, der Prompt bleibt auf ALLSmartLLM in Österreich.
* Dein Key wird verschlüsselt gespeichert (AES-256, Master-Key im OS-Keyring, nie in der Datenbank, nie im Repo). Nur im Speicher des Request-Handlers dechiffriert, der ihn gerade verwendet. Nie geloggt, nie über einen Endpunkt zurückgegeben, jederzeit im Portal widerrufbar.

Eigene Inferenz

Open-Weights-Modelle auf Hardware, die uns gehört, in Oberösterreich. Keine Sub-Prozessoren, keine Drittländer, kein Weiterverkauf fremder APIs.

Ein Name, jedes Modell

Ein Alias bündelt Modell, Anbieter und Policy. Er zeigt auf unsere Modelle, oder mit deinem eigenen Key nach außen. Modell wechseln heißt: hier umstellen, sonst nichts.

Datenschutz zuschaltbar

Pro Alias in Stufen: Namen, Adressen, IBANs, und API-Keys, Tokens und Zugangsdaten, die versehentlich im Prompt landen. Raus geht nur, was raus darf.

OpenRouter direkt vs. via ALLSmartLLM

Beides sind valide Wege. Der Unterschied liegt in Rechnung, Datenschutz und wem du im Zweifel eine Mail schreibst.

OpenRouter direkt
  • Datenschutzkein Layer, Prompt geht 1:1 raus
  • ComplianceUS-Anbieter, kein DPA
  • Rate-Limitpro OpenRouter-Key
  • Modell-WechselClient-Code ändern
  • SupportDiscord + Docs
  • Fallbackkeiner, 500 = Ende
  • Modell-Katalog~500 Modelle sofort
via ALLSmartLLM
  • DatenschutzGLiNER-Detektion + LLM-Check bei strict
  • ComplianceDSGVO, DPA mit ALL Smart GmbH
  • Rate-Limiteinheitlich über alle Provider deines Kontos
  • Modell-WechselAlias umhängen, Client unverändert
  • SupportPersönlicher Ansprechpartner in DE
  • FallbackMulti-Provider-Chain automatisch
  • Modell-Katalog~15 kuratiert + BYOK-Passthrough zu OpenRouter/OpenAI

Inferenz ist das Rohmaterial. Das hier ist die Schicht, die daraus etwas Brauchbares macht.

Das Smarte war nie das Modell. Es ist das drumherum: Routing, Policy, Datenschutz, Nachweis.

Eine API, deine Aliase

Ein Alias ist mehr als ein Modellname, er bündelt Modell, Provider und Datenschutz-Policy. Modell zentral tauschen, deine Anwendung ändert sich nie.

big-fat-model ──► kimi-k2.6 kimi-k3
// Alias aktualisiert · null Code-Änderungen · Apps laufen weiter

Datenschutz in Stufen

Aus, pseudonymize oder strikt: eine LLM auf eigener Hardware prüft zusätzlich auf indirekte Kennungen, bevor irgendwas die EU verlässt.

aus mask pseudonymize strict
Bitte antworte an <<PERSON_1>> von <<ORG_1>> wegen Rechnung <<IBAN_1>>
Mapping lebt nur im Request-Speicher. Nie gespeichert, nie geloggt.

Deine Daten bleiben in Europa

Eigene Hardware in Österreich. Keine Sub-Prozessoren, keine Drittländer. Externe Frontier-Modelle sind erreichbar, aber nur durch die Masking-Schicht.

deine App ──► ALLSmartLLM · AT ─▍ Drittland
Prompts enden auf Hardware, die uns gehört, oder gehen maskiert raus, nach deiner Policy.

Gemessen, nicht versprochen

Nächtliche Benchmarks mit veröffentlichter Methodik. Detection-Recall der Privacy-Schicht als Zahl, nicht als Adjektiv.

Qwen 3.5 397B
54.8 t/s
Nemotron 3 Nano Omni
47.8 t/s
Nemotron Cascade 2
47.9 t/s
Decode-Rate, Streaming, Median wiederholter nächtlicher Läufe.

Fallback-Kette gegen tote Routen

Pro Alias bis zu vier Ziele hintereinander. Kippt der primäre Provider (429, 5xx, Timeout), wandert der Request automatisch zum nächsten. Auch quer über ALLSmartLLM und OpenRouter-Free.

free ──► google:free ──► nvidia:free ──► deepseek:free
// automatisch, live im Stream, kein Retry-Code auf deiner Seite

Eigene Provider-Keys, verschlüsselt

Bring dein OpenAI-, Anthropic- oder OpenRouter-Konto mit. Keys landen AES-256-GCM-verschlüsselt in einem Vault, Master-Key aus dem OS-Keyring. Klartext existiert nur im Request-Speicher, nie in Logs, nie in Backups.

dein Key ──► Vault · AES-256-GCM ──► Provider-Call
AES-256-GCM · OS-Keyring · Zero-Log für Klartext

Guards, Regeln vor der Antwort

Regelbasierte Policy-Prüfung pro Alias. „log_only" schreibt Verstöße nur ins Audit-Log, „enforce" bricht den Request. Für Compliance-Nachweis und harte Grenzen: keine Kunden-Daten in ext. Modelle, keine Kredit-Zahlen im Antwortstrom, keine PII in Trainingsdaten.

aus log_only enforce
log_only für Beobachten · enforce für Blockieren

Nicht ein Provider, alle

Ein Key bei uns, alle großen Anbieter darüber: eigene ALLSmartLLM-Hardware, OpenRouter (~300 Modelle), OpenAI, Anthropic, Groq, DeepSeek. Provider wechseln heißt: einen Alias umkonfigurieren.

ALLSmartLLM OpenRouter OpenAI Anthropic Groq DeepSeek
6 Provider · 1 API · pro Alias frei mischbar

Erste Antwort in unter fünf Minuten

Wenn deine Software OpenAI spricht, spricht sie schon ALLSmartLLM. Eine URL ändern.

Schritt 1

Account anlegen

10 Mio. Tokens gratis zum Testen und Einrichten. Keine Karte, kein Abo.

Gratis-Tokens10.000.000
Schritt 2

API-Key holen

Ein Key, alle Modelle, alle Aliase. Nutzungsbasiert, sonst nichts.

SMARTLLM_API_KEY••••••••••••
Schritt 3

Ersten Request senden

Ruf einen Alias auf, keine Modellversion. Datenschutz ist ein Parameter.

curl https://allsmartllm.com/v1/chat/completions \
  -H "Authorization: Bearer $KEY" \
  -d '{
    "model": "frontier",
    "privacy": {"mode": "pseudonymize"},
    "messages": [...]
  }'

Später auf eigener Hardware: gleiche API auf deiner Hardware. Sobald deine Box läuft, änderst du eine URL, fertig.

Kuratierte Open-Weights-Modelle

Geprüft, gebenchmarkt, aktuell gehalten. Aliase folgen unserer Empfehlung, oder du pinnst eine Version fest.

Modell Alias Kann Kontext Lizenz Qualität* Gemessen Status
Qwen 3.5 397B
397B / 17B MoE (int4 AutoRound)
frontier ToolsBildReasoning 256K Apache 2.0 26 54.8 t/s geladen
Nemotron 3 Nano Omni
33B / 3B MoE (Q4_K_M)
- ToolsBildReasoning 256K NVIDIA Open Model License 9 47.8 t/s on-demand
Erststart 50 s
Nemotron Cascade 2
32B dense (Q4_K_M)
- ToolsReasoning 256K NVIDIA Open Model License 12 47.9 t/s on-demand
Erststart 50 s
Phi 4
14B dense (Q4_K_M)
- Text 16K MIT 1 15.2 t/s on-demand
Erststart 8,3 s
Qwen 3.6 35B
35B / 3B MoE (FP8)
mid vision ToolsBildReasoning 256K Apache 2.0 26 78.7 t/s geladen
Qwen 3.5 35B
35B / 3B MoE (Q4_K_M)
- ToolsBildReasoning 256K Apache 2.0 23 41.6 t/s on-demand
Erststart 54 s
Granite 4.1
30B dense (Q4_K_M)
- Tools 256K Apache 2.0 3 7.6 t/s on-demand
Erststart 34 s
Nemotron 3 Nano
30B / 3.5B MoE (Q4_K_M)
- ToolsReasoning 256K NVIDIA Open Model License 9 48.3 t/s on-demand
Erststart 9,0 s
Nemotron 3.5 Lightning
30B / 3B MoE (NVFP4 (ModelOpt, MIXED_PRECISION))
- ToolsReasoning 256K OpenMDW-1.1 16 132.4 t/s geladen
Qwen 3.6 27B
27B dense (Q4_K_M)
- ToolsBildReasoning 256K Apache 2.0 29 8.1 t/s on-demand
Erststart 12 s
Qwen 3.8 27B
27B dense (Q4_K_M)
- ToolsBildReasoning 256K Apache 2.0 35 19.8 t/s on-demand
Erststart 76 s
Gemma 4 26B
26B / 4B MoE (Q4_K_M)
- ToolsBildReasoning 256K Apache 2.0 19 36.3 t/s on-demand
Erststart 63 s
Qwen3 Coder Next
80B dense (Q4_K_M)
coder Tools 256K Apache 2.0 14 35.3 t/s on-demand
Erststart 13 s
Qwen3 Coder
31B dense (Q4_K_M)
- Tools 256K Apache 2.0 8 48.4 t/s on-demand
Erststart 10 s
Qwen 3.5 9B
9B dense (Q4_K_M)
- ToolsBildReasoning 256K Apache 2.0 14 24.4 t/s on-demand
Erststart 50 s
15 Modelle · alle auf dedizierter Hardware in Oberösterreich *Unabhängiger Vergleich: Artificial Analysis → Status und Verfügbarkeit →

Ab 0,25 € pro Million Tokens. Das ist die Preisseite.

In und Output getrennt, gestaffelt nach Modell-Kategorie. 10 Mio. Tokens gratis. Keine Grundgebühr, kein Abo, nur Nutzung.

Kategorie Input Output
Flagship € 1 / Mtok € 4 / Mtok
Reasoning € 0,75 / Mtok € 3 / Mtok
Multimodal € 0,75 / Mtok € 3 / Mtok
Code € 0,50 / Mtok € 2 / Mtok
Standard € 0,50 / Mtok € 2 / Mtok
Schnell € 0,25 / Mtok € 1 / Mtok
Privacy-Detektor € 0,10 / Mtok nur wenn aktiv, auf Input-Tokens
Preise gelten für ALLSmartLLM-eigene Modelle. Der Privacy-Detektor kommt nur dazu wenn du „mask", „pseudonymize" oder „strict" nutzt. Externe Provider (OpenRouter, OpenAI, Anthropic, …) laufen über deinen eigenen Key. Du zahlst direkt beim Anbieter, wir stellen dafür nichts in Rechnung.

Was wir speichern

Die Liste stammt aus dem Log-Schema, nicht aus einem Werbetext. Über die API wird kein Inhalt gespeichert: weder Ihre Prompts noch die Antworten.

Angabe Über die API Wozu
Ihre Prompts nicht gespeichert Verlassen den Gateway nie in Richtung Datenbank.
Die Antworten des Modells nicht gespeichert Werden ausgeliefert und danach verworfen.
Zeitpunkt gespeichert Abrechnung und Fehlersuche.
Angefragtes und benutztes Modell gespeichert Damit Sie sehen, was tatsächlich gerechnet hat.
Anzahl Tokens (rein und raus) gespeichert Grundlage der Abrechnung.
Dauer der Anfrage gespeichert Erkennt, wenn ein Backend langsam wird.
Status und Fehlermeldung gespeichert Support: ohne das können wir Ihnen nicht helfen.
Aufgerufener Endpunkt gespeichert Abrechnung und Missbrauchserkennung.
IP-Adresse und User-Agent gespeichert Missbrauchserkennung und Rate-Limits. 30 Tage.
Gewählter Privacy-Modus gespeichert Nachweis, welche Stufe für die Anfrage galt.
Die Angaben gelten für alle Endpunkte unter /v1/. Gespeichert wird auf eigener Hardware in Oberösterreich.