Überblick
Hinter LuNa stecken mehrere Modelle. LuNa 0.5 ist das aktuelle Hauptmodell — kompakt und schnell; weil es klein ist, macht es noch Fehler. LuNa 0.4 ist unser Legacy-Modell: ein von Grund auf selbst trainierter Transformer (GQA, RoPE, SwiGLU, ~0,46 Mrd. Parameter, 2.048 Tokens Kontext) mit eigener Architektur und eigenem Tokenizer — schwächer, aber ohne GPU immer verfügbar und langfristig erhalten. LuNa St ist kein Eigenbau, sondern ein Finetune von Qwen2.5-7B-Instruct (~7,6 Mrd. Parameter) — ein Coding-Assistent, der nur auf GPU läuft. Drumherum entsteht das LuNa-System: ein Router wählt anhand deiner Anfrage die passende Version, das Modell antwortet, und ein Kritiker prüft die Antwort auf Fehler.
| Modell | ID | Status | Am besten für |
|---|---|---|---|
| LuNa St | luna-0.1 | GPU-only | Coding (Qwen2.5-7B-Finetune) |
| LuNa 0.5 | luna-0.5 | Hauptmodell | Kompakt & schnell für Chat & Code |
| LuNa 0.4 | luna-0.4 | Legacy · immer verfügbar | Eigenbau, läuft ohne GPU |
LuNa St
Der Coding-Spezialist — ein Finetune von Qwen2.5-7B-Instruct mit Persönlichkeit (freundlich-sarkastisch, ehrlich, gern Denglish) der Code Schritt für Schritt erklärt. Anders als LuNa 0.4 ist LuNa St kein Eigenbau, sondern baut auf einem offenen Fremdmodell auf. Läuft nur auf GPU — also nur verfügbar, wenn ein GPU-Worker an ist. Bekanntes Problem: Bei (fast) vollem Context-Window kann LuNa St fehlerhaft werden oder gar nicht mehr antworten — dann hilft ein neuer oder kürzerer Chat.
| Modell | Finetune von Qwen2.5-7B-Instruct · ~7,6 Mrd. Parameter |
| Basis & Lizenz | Qwen2.5-7B-Instruct · © Alibaba Cloud · Apache 2.0 |
| Format | ChatML |
| Ausführung | GPU-only (llama.cpp/Ollama) · nicht auf dem Pi |
| Stärken | Code, Erklärungen Schritt für Schritt, Persönlichkeit |
| Grenzen | Braucht einen laufenden GPU-Worker |
| API-Preis | Aktuell kostenlos · Abrechnung geplant |
# Frage an LuNa St (GPU-Worker muss laufen) curl https://api.luna-chat.xyz/v1/chat \ -H "Authorization: Bearer $LUNA_KEY" \ -d '{ "model": "luna-0.1", "message": "Fass mir RFC 9110 in 3 Sätzen zusammen." }'
LuNa 0.5
Das aktuelle Hauptmodell — kompakt und schnell und der empfohlene Default für Chat und API. Hinweis: Weil LuNa 0.5 klein ist, macht es noch Fehler und kann halluzinieren (sich Dinge einbilden) — am besten kritisch gegenlesen.
| Rolle | Aktuelles Hauptmodell · empfohlener Default für Chat & API |
| Charakter | Kompakt & schnell |
| Stärken | Sauberer, kommentierter Code · ehrliches Abwägen · Erklärungen |
| Grenzen | Klein — macht noch Fehler, kann halluzinieren · sehr lange Dokumente am Stück |
| API-Preis | Aktuell kostenlos · Abrechnung geplant |
Der Code-Stil
LuNa 0.5 schreibt Code nach festen Prinzipien: Kommentare erklären das Warum, Namen tragen Absicht, Sonderfälle stehen sichtbar am Anfang. Lange Code-Antworten landen im Chat automatisch als Artifact — ein eigenes Panel mit Kopieren & Download.
LuNa 0.4 Legacy
Unser Legacy-Modell und der Ursprung des Projekts: von Grund auf selbst trainiert, mit eigener Architektur und eigenem Tokenizer. Es ist schwächer als LuNa 0.5, läuft aber ganz ohne GPU und bleibt deshalb dauerhaft verfügbar — ein verlässlicher Fallback, wenn kein GPU-Worker läuft.
| Modell | Von Grund auf selbst trainiert · eigene Architektur (GQA, RoPE, SwiGLU) · ~0,46 Mrd. Parameter |
| Tokenizer | Eigener Tokenizer · Llama-2 / TinyLlama BPE (32k) |
| Kontextfenster | 2.048 Tokens |
| Ausführung | Läuft ohne GPU auf dem Pi — immer verfügbar · auf GPU deutlich schneller |
| Stärken | Dauerhaft verfügbarer Fallback · ehrliches Abwägen · Erklärungen |
| Grenzen | Schwächer als LuNa 0.5 · kurzes Kontextfenster |
| API-Preis | Aktuell kostenlos · Abrechnung geplant |
Hinweis: LuNa 0.4 bleibt langfristig erhalten — als verlässlicher Fallback, der auch ohne GPU funktioniert.
Limits & Kontingente
| Plan | Chat | Eigene API-Keys | Rate-Limit (API) |
|---|---|---|---|
| Free | 22 Nachr. / 5 Std (gleitend) | — | 5 Anfragen / Minute |
| Plus | Unbegrenzt | Ja | 60 Anfragen / Minute |
| Pro | Unbegrenzt | Ja | 120 Anfragen / Minute · Vorrang |
Das API-Limit gilt pro Account (über alle Keys und Account-Logins zusammen). Mit Free nutzt du die API per Account-Login in der CLI; eigene Keys gibt es ab Plus. LuNa ist aktuell im privaten Zugang und kostenlos — Plus/Pro werden auf Anfrage freigeschaltet. Bei extremer Auslastung kann eine Antwort kurz in den Hintergrund wandern („LuNa antwortet im Hintergrund").
Fehlercodes
Die API antwortet mit klaren, vorhersehbaren Fehlern — dieselben Zustände zeigt auch der Chat an:
| Code | Bedeutung | Was tun |
|---|---|---|
401 invalid_token | Token fehlt oder ist ungültig | Token prüfen, neu anmelden |
429 rate_limited | Limit erreicht (Plan oder Rate) | Warten oder Plan upgraden |
503 unavailable | LuNa-Server nicht erreichbar | Kurz warten, erneut versuchen — der Chat bietet automatisch „Erneut versuchen" an |
400 bad_request | Anfrage fehlerhaft (z. B. unbekanntes Modell) | Modell-ID gegen diese Doku prüfen |
Changelog
| 0.5 | LuNa 0.5 wird Hauptmodell — kompakt & schnell · empfohlener Default für Chat & API |
| 0.4 | LuNa 0.4 (Legacy) — von Grund auf selbst trainiert · eigene Architektur · ohne GPU immer verfügbar |
| St | LuNa St — Coding-Modell auf Basis von Qwen2.5-7B-Instruct (Finetune, GPU-only) |