Offizielle Dokumentation

Die LuNa-Modelle

Stand: Juni 2026 · Version 0.3.1 · Inhalte werden laufend aktualisiert

LuNa ist ein laufendes Projekt — Werte können sich mit neuen Trainingsläufen ändern.

Überblick

Hinter LuNa stecken mehrere Modelle. LuNa 0.5 ist das aktuelle Hauptmodell — kompakt und schnell; weil es klein ist, macht es noch Fehler. LuNa 0.4 ist unser Legacy-Modell: ein von Grund auf selbst trainierter Transformer (GQA, RoPE, SwiGLU, ~0,46 Mrd. Parameter, 2.048 Tokens Kontext) mit eigener Architektur und eigenem Tokenizer — schwächer, aber ohne GPU immer verfügbar und langfristig erhalten. LuNa St ist kein Eigenbau, sondern ein Finetune von Qwen2.5-7B-Instruct (~7,6 Mrd. Parameter) — ein Coding-Assistent, der nur auf GPU läuft. Drumherum entsteht das LuNa-System: ein Router wählt anhand deiner Anfrage die passende Version, das Modell antwortet, und ein Kritiker prüft die Antwort auf Fehler.

ModellIDStatusAm besten für
LuNa Stluna-0.1GPU-onlyCoding (Qwen2.5-7B-Finetune)
LuNa 0.5luna-0.5HauptmodellKompakt & schnell für Chat & Code
LuNa 0.4luna-0.4Legacy · immer verfügbarEigenbau, läuft ohne GPU
luna-0.1

LuNa St

Der Coding-Spezialist — ein Finetune von Qwen2.5-7B-Instruct mit Persönlichkeit (freundlich-sarkastisch, ehrlich, gern Denglish) der Code Schritt für Schritt erklärt. Anders als LuNa 0.4 ist LuNa St kein Eigenbau, sondern baut auf einem offenen Fremdmodell auf. Läuft nur auf GPU — also nur verfügbar, wenn ein GPU-Worker an ist. Bekanntes Problem: Bei (fast) vollem Context-Window kann LuNa St fehlerhaft werden oder gar nicht mehr antworten — dann hilft ein neuer oder kürzerer Chat.

ModellFinetune von Qwen2.5-7B-Instruct · ~7,6 Mrd. Parameter
Basis & LizenzQwen2.5-7B-Instruct · © Alibaba Cloud · Apache 2.0
FormatChatML
AusführungGPU-only (llama.cpp/Ollama) · nicht auf dem Pi
StärkenCode, Erklärungen Schritt für Schritt, Persönlichkeit
GrenzenBraucht einen laufenden GPU-Worker
API-PreisAktuell kostenlos · Abrechnung geplant
curlAPI-Beispiel
# Frage an LuNa St (GPU-Worker muss laufen)
curl https://api.luna-chat.xyz/v1/chat \
  -H "Authorization: Bearer $LUNA_KEY" \
  -d '{ "model": "luna-0.1", "message": "Fass mir RFC 9110 in 3 Sätzen zusammen." }'
luna-0.5

LuNa 0.5

Das aktuelle Hauptmodell — kompakt und schnell und der empfohlene Default für Chat und API. Hinweis: Weil LuNa 0.5 klein ist, macht es noch Fehler und kann halluzinieren (sich Dinge einbilden) — am besten kritisch gegenlesen.

RolleAktuelles Hauptmodell · empfohlener Default für Chat & API
CharakterKompakt & schnell
StärkenSauberer, kommentierter Code · ehrliches Abwägen · Erklärungen
GrenzenKlein — macht noch Fehler, kann halluzinieren · sehr lange Dokumente am Stück
API-PreisAktuell kostenlos · Abrechnung geplant

Der Code-Stil

LuNa 0.5 schreibt Code nach festen Prinzipien: Kommentare erklären das Warum, Namen tragen Absicht, Sonderfälle stehen sichtbar am Anfang. Lange Code-Antworten landen im Chat automatisch als Artifact — ein eigenes Panel mit Kopieren & Download.

luna-0.4 Legacy

LuNa 0.4 Legacy

Unser Legacy-Modell und der Ursprung des Projekts: von Grund auf selbst trainiert, mit eigener Architektur und eigenem Tokenizer. Es ist schwächer als LuNa 0.5, läuft aber ganz ohne GPU und bleibt deshalb dauerhaft verfügbar — ein verlässlicher Fallback, wenn kein GPU-Worker läuft.

ModellVon Grund auf selbst trainiert · eigene Architektur (GQA, RoPE, SwiGLU) · ~0,46 Mrd. Parameter
TokenizerEigener Tokenizer · Llama-2 / TinyLlama BPE (32k)
Kontextfenster2.048 Tokens
AusführungLäuft ohne GPU auf dem Pi — immer verfügbar · auf GPU deutlich schneller
StärkenDauerhaft verfügbarer Fallback · ehrliches Abwägen · Erklärungen
GrenzenSchwächer als LuNa 0.5 · kurzes Kontextfenster
API-PreisAktuell kostenlos · Abrechnung geplant

Hinweis: LuNa 0.4 bleibt langfristig erhalten — als verlässlicher Fallback, der auch ohne GPU funktioniert.

Limits & Kontingente

PlanChatEigene API-KeysRate-Limit (API)
Free22 Nachr. / 5 Std (gleitend)5 Anfragen / Minute
PlusUnbegrenztJa60 Anfragen / Minute
ProUnbegrenztJa120 Anfragen / Minute · Vorrang

Das API-Limit gilt pro Account (über alle Keys und Account-Logins zusammen). Mit Free nutzt du die API per Account-Login in der CLI; eigene Keys gibt es ab Plus. LuNa ist aktuell im privaten Zugang und kostenlos — Plus/Pro werden auf Anfrage freigeschaltet. Bei extremer Auslastung kann eine Antwort kurz in den Hintergrund wandern („LuNa antwortet im Hintergrund").

Fehlercodes

Die API antwortet mit klaren, vorhersehbaren Fehlern — dieselben Zustände zeigt auch der Chat an:

CodeBedeutungWas tun
401 invalid_tokenToken fehlt oder ist ungültigToken prüfen, neu anmelden
429 rate_limitedLimit erreicht (Plan oder Rate)Warten oder Plan upgraden
503 unavailableLuNa-Server nicht erreichbarKurz warten, erneut versuchen — der Chat bietet automatisch „Erneut versuchen" an
400 bad_requestAnfrage fehlerhaft (z. B. unbekanntes Modell)Modell-ID gegen diese Doku prüfen

Changelog

0.5LuNa 0.5 wird Hauptmodell — kompakt & schnell · empfohlener Default für Chat & API
0.4LuNa 0.4 (Legacy) — von Grund auf selbst trainiert · eigene Architektur · ohne GPU immer verfügbar
StLuNa St — Coding-Modell auf Basis von Qwen2.5-7B-Instruct (Finetune, GPU-only)