Methodologie
Hoe we modellen testen
1. Arena selectie
Kies een van de 12 visuele workflow arena's. Elke arena test een specifieke frontend vaardigheid — van landing pages tot mobiele reparaties.
2. Prompt tier
Drie prompt niveaus: vaag brief, implementatie spec, en handoff plan met Struq context. Zo meten we hoeveel context uitmaakt.
3. Output target
Repo-native Next.js/Tailwind of standalone HTML. Twee verschillende workflows, twee verschillende maatstaven.
4. Harness profiel
OpenCode, Claude Code, of Codex. Solo of met subagents. We meten niet alleen het model, maar de hele workflow.
5. Uitvoering
Elke run gebeurt in een geïsoleerde git worktree. De agent krijgt exact dezelfde prompt, context, en constraints.
6. Verificatie
Playwright screenshots op desktop, tablet, en mobiel. Build en typecheck verificatie. Geen handmatige interventie.
7. Scoring
Geautomatiseerde scoring op 7 dimensies: visueel vakmanschap, context adherence, responsive, copy, compleetheid, workflow discipline, en efficiëntie.
8. Publicatie
Resultaten worden gesanitized en gepubliceerd als immutable snapshots. Altijd herleidbaar naar exact model, prompt, en harness.