Ga naar de hoofdinhoud
MODEL ARENA

Methodologie

Hoe we modellen testen

1. Arena selectie

Kies een van de 12 visuele workflow arena's. Elke arena test een specifieke frontend vaardigheid — van landing pages tot mobiele reparaties.

2. Prompt tier

Drie prompt niveaus: vaag brief, implementatie spec, en handoff plan met Struq context. Zo meten we hoeveel context uitmaakt.

3. Output target

Repo-native Next.js/Tailwind of standalone HTML. Twee verschillende workflows, twee verschillende maatstaven.

4. Harness profiel

OpenCode, Claude Code, of Codex. Solo of met subagents. We meten niet alleen het model, maar de hele workflow.

5. Uitvoering

Elke run gebeurt in een geïsoleerde git worktree. De agent krijgt exact dezelfde prompt, context, en constraints.

6. Verificatie

Playwright screenshots op desktop, tablet, en mobiel. Build en typecheck verificatie. Geen handmatige interventie.

7. Scoring

Geautomatiseerde scoring op 7 dimensies: visueel vakmanschap, context adherence, responsive, copy, compleetheid, workflow discipline, en efficiëntie.

8. Publicatie

Resultaten worden gesanitized en gepubliceerd als immutable snapshots. Altijd herleidbaar naar exact model, prompt, en harness.