Das folgt daraus, wie die Modelle gebaut sind. Ein stark auf fotografische Daten getrimmter Generator lernt Haut, Lichtabfall und Objektivverhalten — und liegt bei stilisierten Prompts subtil daneben: Die Linienführung ist weich, die Schattierung fotografisch, wo sie flächig sein sollte, und Gesichter driften Richtung Realismus, egal was Sie verlangen. Ein auf Illustration trainierter Generator lernt Strichstärke, Farbflächen und die spezifischen Konventionen von Anime-Gesichtern — und seine Fotorealismus-Versuche wirken airbrush-glatt.
Plattformen wissen das, weshalb mehrere zwei getrennte Modelle hinter einem Stilschalter ausliefern statt eines Modells mit Stil-Prompt. Wo Sie einen echten Schalter sehen, ist die Ausgabe meist auf beiden Seiten gut. Wo Stil nur ein Wort ist, das Sie in den Prompt tippen, wird eine Seite deutlich schwächer sein.
Das ist das Größte, was ein gemittelter Bildqualitätswert verbirgt, und deshalb würden wir jedem raten, sich für einen Stil zu entscheiden, bevor er irgendeine Zahl auf dieser Seite ansieht.