Eine OpenAI-kompatible API zu Open-Weights-Modellen auf eigener Hardware in Österreich. Aliase, die Policy tragen. Datenschutz in Stufen, bis hin zu einer LLM-gestützten Prüfinstanz. Und jede Zahl auf dieser Seite ist nächtlich gemessen, nicht versprochen.
Deine Anwendung spricht mit einem Namen. Was dahinter passiert, welches Modell, welcher Anbieter, wie viel Datenschutz, konfigurierst du hier und änderst es jederzeit, ohne eine Zeile Code anzufassen. Probier es aus:
Open-Weights-Modelle auf Hardware, die uns gehört, in Oberösterreich. Keine Sub-Prozessoren, keine Drittländer, kein Weiterverkauf fremder APIs.
Ein Alias bündelt Modell, Anbieter und Policy. Er zeigt auf unsere Modelle, oder mit deinem eigenen Key nach außen. Modell wechseln heißt: hier umstellen, sonst nichts.
Pro Alias in Stufen: Namen, Adressen, IBANs, und API-Keys, Tokens und Zugangsdaten, die versehentlich im Prompt landen. Raus geht nur, was raus darf.
Beides sind valide Wege. Der Unterschied liegt in Rechnung, Datenschutz und wem du im Zweifel eine Mail schreibst.
Das Smarte war nie das Modell. Es ist das drumherum: Routing, Policy, Datenschutz, Nachweis.
Ein Alias ist mehr als ein Modellname, er bündelt Modell, Provider und Datenschutz-Policy. Modell zentral tauschen, deine Anwendung ändert sich nie.
Aus, pseudonymize oder strikt: eine LLM auf eigener Hardware prüft zusätzlich auf indirekte Kennungen, bevor irgendwas die EU verlässt.
Eigene Hardware in Österreich. Keine Sub-Prozessoren, keine Drittländer. Externe Frontier-Modelle sind erreichbar, aber nur durch die Masking-Schicht.
Nächtliche Benchmarks mit veröffentlichter Methodik. Detection-Recall der Privacy-Schicht als Zahl, nicht als Adjektiv.
Pro Alias bis zu vier Ziele hintereinander. Kippt der primäre Provider (429, 5xx, Timeout), wandert der Request automatisch zum nächsten. Auch quer über ALLSmartLLM und OpenRouter-Free.
Bring dein OpenAI-, Anthropic- oder OpenRouter-Konto mit. Keys landen AES-256-GCM-verschlüsselt in einem Vault, Master-Key aus dem OS-Keyring. Klartext existiert nur im Request-Speicher, nie in Logs, nie in Backups.
Regelbasierte Policy-Prüfung pro Alias. „log_only" schreibt Verstöße nur ins Audit-Log, „enforce" bricht den Request. Für Compliance-Nachweis und harte Grenzen: keine Kunden-Daten in ext. Modelle, keine Kredit-Zahlen im Antwortstrom, keine PII in Trainingsdaten.
Ein Key bei uns, alle großen Anbieter darüber: eigene ALLSmartLLM-Hardware, OpenRouter (~300 Modelle), OpenAI, Anthropic, Groq, DeepSeek. Provider wechseln heißt: einen Alias umkonfigurieren.
Wenn deine Software OpenAI spricht, spricht sie schon ALLSmartLLM. Eine URL ändern.
10 Mio. Tokens gratis zum Testen und Einrichten. Keine Karte, kein Abo.
Ein Key, alle Modelle, alle Aliase. Nutzungsbasiert, sonst nichts.
Ruf einen Alias auf, keine Modellversion. Datenschutz ist ein Parameter.
curl https://allsmartllm.com/v1/chat/completions \ -H "Authorization: Bearer $KEY" \ -d '{ "model": "frontier", "privacy": {"mode": "pseudonymize"}, "messages": [...] }'
Später auf eigener Hardware: gleiche API auf deiner Hardware. Sobald deine Box läuft, änderst du eine URL, fertig.
Geprüft, gebenchmarkt, aktuell gehalten. Aliase folgen unserer Empfehlung, oder du pinnst eine Version fest.
| Modell | Alias | Kann | Kontext | Lizenz | Qualität* | Gemessen | Status |
|---|---|---|---|---|---|---|---|
|
Qwen 3.5 397B
397B / 17B MoE (int4 AutoRound)
|
frontier | ToolsBildReasoning | 256K | Apache 2.0 | 26 | 54.8 t/s | geladen |
|
Nemotron 3 Nano Omni
33B / 3B MoE (Q4_K_M)
|
- | ToolsBildReasoning | 256K | NVIDIA Open Model License | 9 | 47.8 t/s |
on-demand
Erststart 50 s
|
|
Nemotron Cascade 2
32B dense (Q4_K_M)
|
- | ToolsReasoning | 256K | NVIDIA Open Model License | 12 | 47.9 t/s |
on-demand
Erststart 50 s
|
|
Phi 4
14B dense (Q4_K_M)
|
- | Text | 16K | MIT | 1 | 15.2 t/s |
on-demand
Erststart 8,3 s
|
|
Qwen 3.6 35B
35B / 3B MoE (FP8)
|
mid vision | ToolsBildReasoning | 256K | Apache 2.0 | 26 | 78.7 t/s | geladen |
|
Qwen 3.5 35B
35B / 3B MoE (Q4_K_M)
|
- | ToolsBildReasoning | 256K | Apache 2.0 | 23 | 41.6 t/s |
on-demand
Erststart 54 s
|
|
Granite 4.1
30B dense (Q4_K_M)
|
- | Tools | 256K | Apache 2.0 | 3 | 7.6 t/s |
on-demand
Erststart 34 s
|
|
Nemotron 3 Nano
30B / 3.5B MoE (Q4_K_M)
|
- | ToolsReasoning | 256K | NVIDIA Open Model License | 9 | 48.3 t/s |
on-demand
Erststart 9,0 s
|
|
Nemotron 3.5 Lightning
30B / 3B MoE (NVFP4 (ModelOpt, MIXED_PRECISION))
|
- | ToolsReasoning | 256K | OpenMDW-1.1 | 16 | 132.4 t/s | geladen |
|
Qwen 3.6 27B
27B dense (Q4_K_M)
|
- | ToolsBildReasoning | 256K | Apache 2.0 | 29 | 8.1 t/s |
on-demand
Erststart 12 s
|
|
Qwen 3.8 27B
27B dense (Q4_K_M)
|
- | ToolsBildReasoning | 256K | Apache 2.0 | 35 | 19.8 t/s |
on-demand
Erststart 76 s
|
|
Gemma 4 26B
26B / 4B MoE (Q4_K_M)
|
- | ToolsBildReasoning | 256K | Apache 2.0 | 19 | 36.3 t/s |
on-demand
Erststart 63 s
|
|
Qwen3 Coder Next
80B dense (Q4_K_M)
|
coder | Tools | 256K | Apache 2.0 | 14 | 35.3 t/s |
on-demand
Erststart 13 s
|
|
Qwen3 Coder
31B dense (Q4_K_M)
|
- | Tools | 256K | Apache 2.0 | 8 | 48.4 t/s |
on-demand
Erststart 10 s
|
|
Qwen 3.5 9B
9B dense (Q4_K_M)
|
- | ToolsBildReasoning | 256K | Apache 2.0 | 14 | 24.4 t/s |
on-demand
Erststart 50 s
|
In und Output getrennt, gestaffelt nach Modell-Kategorie. 10 Mio. Tokens gratis. Keine Grundgebühr, kein Abo, nur Nutzung.
| Kategorie | Input | Output |
|---|---|---|
| Flagship | € 1 / Mtok | € 4 / Mtok |
| Reasoning | € 0,75 / Mtok | € 3 / Mtok |
| Multimodal | € 0,75 / Mtok | € 3 / Mtok |
| Code | € 0,50 / Mtok | € 2 / Mtok |
| Standard | € 0,50 / Mtok | € 2 / Mtok |
| Schnell | € 0,25 / Mtok | € 1 / Mtok |
| Privacy-Detektor | € 0,10 / Mtok | nur wenn aktiv, auf Input-Tokens |
Die Liste stammt aus dem Log-Schema, nicht aus einem Werbetext. Über die API wird kein Inhalt gespeichert: weder Ihre Prompts noch die Antworten.
| Angabe | Über die API | Wozu |
|---|---|---|
| Ihre Prompts | nicht gespeichert | Verlassen den Gateway nie in Richtung Datenbank. |
| Die Antworten des Modells | nicht gespeichert | Werden ausgeliefert und danach verworfen. |
| Zeitpunkt | gespeichert | Abrechnung und Fehlersuche. |
| Angefragtes und benutztes Modell | gespeichert | Damit Sie sehen, was tatsächlich gerechnet hat. |
| Anzahl Tokens (rein und raus) | gespeichert | Grundlage der Abrechnung. |
| Dauer der Anfrage | gespeichert | Erkennt, wenn ein Backend langsam wird. |
| Status und Fehlermeldung | gespeichert | Support: ohne das können wir Ihnen nicht helfen. |
| Aufgerufener Endpunkt | gespeichert | Abrechnung und Missbrauchserkennung. |
| IP-Adresse und User-Agent | gespeichert | Missbrauchserkennung und Rate-Limits. 30 Tage. |
| Gewählter Privacy-Modus | gespeichert | Nachweis, welche Stufe für die Anfrage galt. |
/v1/. Gespeichert wird auf eigener Hardware in Oberösterreich.