Messungen·Wordeck·Strukturiert·geprüft 2026-06-05
Welches Modell braucht es, um aus einem Thema ein gutes Karteikarten-Deck (JSON) zu bauen?

Lernkarten generieren: das lokale Modell genügt

Strukturierte Ausgabe ist härter als reiner Text. Das winzige Gerät-Modell reicht hier nicht mehr — aber das lokale 12-Mrd-Modell schon: 0,90 von 1,00, bei 0 Euro. Das teuerste Frontier-Modell ist nicht besser, nur 80× teurer.

Empfehlung
lokalgemma3:12b (lokal)Qualität 0.900 €
günstigstes Modell ≥ Schwelle 0.85 bei erfüllten Format-Checks
Leaderboard · 12 Modelle
ModellQualitätFormatKostenok?
Frontiergemini-2.5-flash1.00100%$0,002
Chinaqwen3.7-max0.98100%$0,057
Frontiergemini-3.5-flash0.9780%$0,081
Frontierclaude-opus-4.80.97100%$0,143
Chinadeepseek-v4-pro0.96100%$0,007
Chinaglm-50.96100%$0,009
EU-Cloudmistral-large0.9580%$0,021
lokalgemma3:12bEmpfehlung — günstigste gut-genug Wahl0.90100%0 €
EU-Cloudmistral-small0.90100%$0,002
on-devicegemma3:4bGerät-Klasse reicht für strukturierte Ausgabe nicht0.81100%0 €
Frontiergpt-5.5über-denkt den Task0.7880%$0,066
Frontiergemini-3.1-pro-preview0.7780%$0,086

Methodik: 5 Fälle · Judge-Panel (Median): gemini-2.5-flash, deepseek-v4-pro, mistral-small. „Format" = deterministische Hard-Checks (gültiges Schema etc.). Die Judge-Modelle stehen selbst im Feld — ein Modell benotet sich nie selbst (Self-Ausschluss), aber Panel und Kandidaten überlappen, eine Peer-Bevorzugung ist nicht ausgeschlossen. Quelle:services/mana-evals.

Was wir sehen

Wordeck baut aus einem Thema ein Karteikarten-Deck — als striktes JSON mit Vorder- und Rückseiten. Das ist schwerer als freier Text: das Modell muss das Format treffen und guten Lernstoff erzeugen.

Hier zeigt sich der Unterschied zur Zusammenfassung: das winzige Gerät-Modell reicht nicht mehr (0,81, unter der Schwelle). Aber das lokale 12-Mrd-Modell auf der eigenen GPU-Box schon (0,90) — und das kostet ebenfalls nichts. Das teuerste Modell im Test (Claude Opus, 0,143 $ pro Lauf) ist mit 0,97 nicht nennenswert besser als das günstige gemini-2.5-flash (1,00 für 0,002 $) — und beide rechtfertigen ihren Preis gegenüber dem kostenlosen lokalen Modell nicht.

Auch hier fallen die schweren Reasoning-Modelle (gpt-5.5, gemini-3.1-pro) durch: sie über-konstruieren die Aufgabe und verfehlen Format oder Schema. Die Lektion pro Operation die richtige Stufe — nicht das größtmögliche Modell.

Ehrlich benannt

Der Gegenpunkt

Anders als beim Zusammenfassen reicht das Gerät-Modell hier nicht — strukturiertes JSON ist anspruchsvoller, und 0,90 für das lokale 12B ist solide, aber nicht perfekt. Wer maximale Karten-Qualität will, findet in den günstigen Clouds (gemini-2.5-flash, mistral-small) für Bruchteile eines Cents einen Schritt mehr. n=5, Panel-Bewertung — ein Signal, kein Beweis.