Messungen · Modell-Evals · Souveränität in Zahlen

Wir messen, welches Modell sich für welche Aufgabewirklich lohnt.

Statt pauschal „immer die Cloud" oder „immer lokal" zu behaupten, messen wir es: Für jede konkrete App-Operation jagen wir ein Dutzend Modelle — vom kleinen, auf dem Gerät laufenden bis zum teuersten Frontier-Modell — durch dieselbe Aufgabe und bewerten sie mit einem Modell-Panel. Die Empfehlung ist immer das günstigste Modell, das gut genug ist. Meist ist das ein lokales, kostenloses. Manchmal nicht — und dann sagen wir das auch. Methodik:docs/EVALS.md.

Routing-Karte — die Empfehlung pro Operation

Jede Messung zeigt das volle Leaderboard, die Kosten und einen ehrlich benannten Gegenpunkt — auch dort, wo das lokale Modell nicht reicht. Die Zahlen kommen aus unserem offenen Eval-Harness, nicht aus dem Marketing.

Warum das geht — die Thesen →