26.07.2026
Eine Architektur, die funktioniert. Und die wir trotzdem verworfen haben.
Wir haben Monate damit verbracht, ein Modell seine Gewichte ausrechnen statt speichern zu lassen — 22,6-fache Kompression auf Schicht-Ebene. Jeder Mechanismus funktionierte. Dann zeigte ein Lauf über 500 Millionen Token, dass ein schlichtes dichtes Modell es in der halben Laufzeit schlägt. Hier stehen alle Zahlen — auch die, die eine unserer eigenen Behauptungen widerlegt hat.
Lesen →