In der Welt der künstlichen Intelligenz jagen wir von einem Benchmark zum nächsten. MMLU, GSM8K oder HumanEval dominieren die technischen Datenblätter der großen Tech-Konzerne. Doch Hand aufs Herz: Wer kann sich unter einer Punktzahl bei abstrakten Logikfragen wirklich vorstellen, wie gut ein Modell im Alltag performt? Hier kommt ein unkonventioneller Herausforderer ins Spiel, der das Thema Evaluation mit einer gehörigen Portion Humor nimmt, dabei aber einen erstaunlich pragmatischen Ansatz verfolgt: der humoristisch benannte AssBench.
Die Anatomie des Stresstests
Die Aufgabe des Benchmarks klingt zunächst wie ein absurder Scherz: Verschiedene Sprachmodelle (LLMs) erhalten exakt dieselbe komplexe Anweisung, eine eigenständige HTML-Datei zu erstellen. Diese Datei soll eine interaktive, physikalisch halbwegs realistische 3D-Darstellung eines Gesäßes erzeugen. Was albern klingt, entpuppt sich bei genauerem Hinsehen als ein knallharter, mehrdimensionaler Belastungstest für die generative KI. Das Modell darf nämlich nicht nur isolierten Code ausspucken, sondern muss eine konkrete visuelle Vorstellung entwickeln. Es gilt, widersprüchliche Anforderungen an Anatomie, dreidimensionale Darstellung, Performance und Benutzerführung gleichzeitig in einer einzigen Datei zu lösen.
Wer die Ergebnisse auf der offiziellen Website von AssBench vergleicht, sieht schnell, woran viele Modelle scheitern. Ein schickes 3D-Modell nützt nichts, wenn die Interaktivität ruckelt. Eine physikalisch korrekte Bewegung bringt wenig, wenn die Geometrie völlig verzerrt dargestellt wird. Dieser direkte, visuelle Nebeneinander-Vergleich von zwei bis vier Modellen offenbart die Stärken und Schwächen der KI-Generierung weitaus plastischer, als es eine abstrakte Prozentzahl jemals könnte. Es ist ein exzellenter Indikator dafür, wie gut ein System komplexe, offene Programmier- und Gestaltungsaufgaben im Verbund meistert.
Klasse statt Masse im Modellvergleich
Spannend ist auch die Beobachtung, wie sich unterschiedliche Modellklassen schlagen. Der Benchmark dokumentiert präzise das Modell, die genutzten Einstellungen, das Datum und vor allem, ob der Code bereits im allerersten Versuch (Zero-Shot) funktionierte. Es zeigt sich eine interessante Tendenz: Kleinere, spezialisierte Modelle können bei dieser Art von kreativer und technischer Kombinationsaufgabe erstaunlich gut mit den gigantischen Flaggschiff-Modellen mithalten. Das relativiert den blinden Glauben an die reine Parametergröße.
Natürlich hat das Ganze seine Grenzen. AssBench liefert kein statistisch wasserdichtes, allgemeingültiges Ranking über die 'Intelligenz' eines Modells. Dafür ist das Szenario viel zu spezifisch und die Anzahl der Testläufe zu gering. Auch stehen einige der detaillierten Bewertungen für Kategorien wie Zuverlässigkeit und Physik noch aus. Wer eine endgültige Entscheidung für den produktiven Unternehmenseinsatz treffen will, kommt um eigene, systematische Tests mit realen Workflows nicht herum.
Unser Fazit
AssBench ist die perfekte Erinnerung daran, dass Benchmarks nicht trocken sein müssen, um einen echten Mehrwert zu bieten. Der spielerische Ansatz senkt die Einstiegshürde enorm und visualisiert die oft subtilen Unterschiede zwischen den KI-Modellen auf eine Weise, die auch Nicht-Entwickler sofort verstehen. Als humorvoller erster Eindruck für die kreativen Codierungs-Fähigkeiten eines LLMs ist dieser unkonventionelle Test deshalb ein absoluter Gewinn.