Architektur-Notiz
Ein zweites Gehirn, das sich weigert zu raten
Das Beantworten einer operativen Frage kostete ein lokales Modell bisher einen Dump von 30–50K Tokens. Ich habe eine kompilierte Memory-Schicht gebaut, die das in 2–5K erledigt und sich selbst blockiert, wenn sie keine Quelle angeben kann.