Messungen·mana-Hub·Analyse·geprüft 2026-06-05
Welches Modell leitet aus einer Cross-App-Aktivitäts-Timeline echte, konkrete Einsichten ab?

Muster aus der Timeline lesen: hier zahlt sich Frontier aus

Die ehrliche Gegenprobe: eine wirklich analytische Aufgabe. Hier brechen die lokalen und günstigen Modelle ein — nur die teuren Frontier-Modelle (GPT-5.5, Claude Opus) erreichen die Schwelle. Mehr Geld lohnt sich also doch — aber nur hier.

Empfehlung
Frontiergpt-5.5 (Frontier)Qualität 0.90$0,071
günstigstes Modell ≥ Schwelle 0.85 bei erfüllten Format-Checks
Leaderboard · 12 Modelle
ModellQualitätFormatKostenok?
Frontiergpt-5.5Empfehlung — das Reasoning-Modell glänzt hier endlich0.90100%$0,071
Frontierclaude-opus-4.80.88100%$0,088
Chinaglm-5knapp daneben (1 Schema-Fail) — günstige Alternative, 8× billiger0.8975%$0,009
Frontiergemini-3.1-pro-preview0.82100%$0,063
Chinadeepseek-v4-pro0.78100%$0,003
Frontiergemini-2.5-flash0.78100%$0,001
EU-Cloudmistral-small0.76100%$0,002
Chinaqwen3.7-max0.73100%$0,034
EU-Cloudmistral-large0.7075%$0,017
lokalgemma3:12blokal reicht für echte Analyse nicht0.53100%0 €
on-devicegemma3:4b0.51100%0 €
Frontiergemini-3.5-flash0.45100%$0,010

Methodik: 4 Fälle · Judge-Panel (Median): gemini-2.5-flash, deepseek-v4-pro, mistral-small. „Format" = deterministische Hard-Checks (gültiges Schema etc.). Die Judge-Modelle stehen selbst im Feld — ein Modell benotet sich nie selbst (Self-Ausschluss), aber Panel und Kandidaten überlappen, eine Peer-Bevorzugung ist nicht ausgeschlossen. Quelle:services/mana-evals.

Was wir sehen

Der mana-Hub kann aus deiner App-übergreifenden Aktivität — Mahlzeiten, gelesene Artikel, Stimmungen, gehörte Songs — kurze, konkrete Einsichten ableiten („du loggst Frühstück nur werktags“, „an niedergeschlagenen Tagen hörst du dreimal so lange Musik“). Das ist echte Analyse, kein Umformulieren.

Und hier kippt das Bild. Die lokalen Modelle brechen ein (0,51–0,53): sie produzieren generische Floskeln statt daten-belegter Muster. Die günstigen Clouds bleiben mittelmäßig (0,73–0,78). Nur die teuren Frontier-Modelle — GPT-5.5 (0,90) und Claude Opus (0,88) — erreichen die Schwelle.

Das ist der ehrliche Teil der Geschichte: Souveränität heißt nicht, dass das lokale Modell immer reicht. Für die einfachen, häufigen Aufgaben tut es das — und das ist der Großteil. Aber für die wenigen, wirklich analytischen Aufgaben verdient das Frontier seinen Preis. Genau deshalb messen wir pro Operation, statt pauschal zu entscheiden. Spannend am Rand: das chinesische glm-5 liegt mit 0,89 für ein Zehntel des Preises knapp dahinter.

Ehrlich benannt

Der Gegenpunkt

Wichtige Selbstkritik: das Judge-Panel besteht aus Modellen, die diese Aufgabe selbst nur mittelmäßig lösen (0,76–0,78). Dass sie die stärkeren Modelle dennoch oben einordnen, ist beruhigend — aber gerade für analytische Aufgaben gehört ein starker Judge ins Panel oder eine menschliche Eichung. n=4. Das Ergebnis ist belastbar genug für die Richtung, nicht für die zweite Nachkommastelle.