Messungen·Pageta·Kurztext·geprüft 2026-06-05
Welches KI-Modell braucht es, um einen Artikel in 3–5 Sätzen zusammenzufassen?

Artikel zusammenfassen: das Gerät-Modell reicht

Wir haben 12 Modelle von der Geräte-Klasse bis zum teuersten Frontier gegeneinander gemessen. Ergebnis: das kleine, lokal auf dem Gerät laufende Modell erreicht 93 % der Qualität des absolut besten — bei 0 Euro.

Empfehlung
on-devicegemma3:4b (on-device)Qualität 0.930 €
günstigstes Modell ≥ Schwelle 0.90 bei erfüllten Format-Checks
Leaderboard · 12 Modelle
ModellQualitätFormatKostenok?
Frontiergemini-3.1-pro-preview1.00100%$0,076
Frontiergemini-3.5-flash1.00100%$0,068
Frontiergemini-2.5-flash1.00100%$0,001
Chinaqwen3.7-max1.00100%$0,035
Chinaglm-51.00100%$0,012
Chinadeepseek-v4-pro0.99100%$0,004
lokalgemma3:12b0.98100%0 €
EU-Cloudmistral-large0.98100%$0,007
Frontierclaude-opus-4.80.98100%$0,054
EU-Cloudmistral-small0.95100%$0,001
on-devicegemma3:4bEmpfehlung — günstigste gut-genug Wahl0.93100%0 €
Frontiergpt-5.5Reasoning-Modell — über-denkt die einfache Aufgabe0.8080%$0,021

Methodik: 5 Fälle · Judge-Panel (Median): gemini-2.5-flash, deepseek-v4-pro, mistral-small. „Format" = deterministische Hard-Checks (gültiges Schema etc.). Die Judge-Modelle stehen selbst im Feld — ein Modell benotet sich nie selbst (Self-Ausschluss), aber Panel und Kandidaten überlappen, eine Peer-Bevorzugung ist nicht ausgeschlossen. Quelle:services/mana-evals.

Was wir sehen

Pageta fasst gespeicherte Artikel auf Wunsch in drei bis fünf Sätzen zusammen. Die Frage: muss dafür ein teures Cloud-Modell ran, oder reicht etwas Kleines, das lokal läuft?

Die Messung ist eindeutig. Ganz oben drängeln sich die Frontier- und die chinesischen Modelle mit perfekten Werten — aber das auf dem Gerät laufende gemma3:4b liegt nur Haaresbreite dahinter (0,93) und kostet nichts. Es braucht keine GPU-Box und keine Cloud: das Modell läuft im Browser bzw. auf dem Telefon. Selbst das stärkste gemessene Modell rechtfertigt für diese Aufgabe seinen Preis nicht.

Bemerkenswert am unteren Ende: das „smarteste“ Modell im Feld (ein Reasoning- Modell von OpenAI) fällt durch — es verbrennt sein Antwort-Budget mit internem Nachdenken und liefert abgeschnittene Zusammenfassungen. Mehr Intelligenz ist hier nicht besser, sondern schlechter.

Das ist die Souveränität in Zahlen: Die häufigste Textaufgabe läuft gratis, ohne dass Daten das Gerät verlassen. Die volle Methodik steht in docs/EVALS.md.

Ehrlich benannt

Der Gegenpunkt

Fünf Artikel sind ein Signal, kein statistischer Beweis. Die Qualität bewertet ein Panel aus drei Modellen (Median) — das mildert Verzerrung, ist aber selbst modell-basiert; final gehört es gegen menschliches Urteil geeicht. „Gut genug" heißt: für pagetas konkrete Zusammenfassungs-Aufgabe — nicht für jede Textsorte.