AI / GenAI·7 min·31 augustus 2026

Laat de tweede agent slopen wat de eerste bouwde

Ik kijk zelden een video van twee uur uit. Deze wel, met de laptop dicht en een notitieblok ernaast, omdat er halverwege iets gebeurde dat ik meteen wilde overnemen. Nate Herk bouwde op 10 augustus in één werkdag een AI-product van niets tot een werkende betaalde app, en filmde de hele rit. Het interessante zat niet in de app. Het zat in hoe hij zichzelf controleerde.

Zijn truc: hij liet twee verschillende coding-agents tegen elkaar werken. Claude Code bouwde, Codex kreeg de opdracht om het resultaat kapot te krijgen. Niet “kijk of het werkt”, maar “klik alles aan, upload rommel, zoek de gaten, en vertel me wat er stuk moet voordat er een klant binnenkomt”. Dat is een prompt die je vandaag kunt kopiëren, ongeacht wat je bouwt.

Wat er in die dag gebeurde

FaseWat er draaideUitkomst
OnderzoekVijf research-agents parallel over YouTube, een Skool-community, X en RedditDrie productideeën, met prijssignalen
PlanningClaude met Fable 5 als projectmanager, niet als uitvoerderEén plan-document waar alle agents uit lezen
BouwenSub-agents op Opus en Sonnet, parallel per werkstroomNext.js-app met Supabase en Stripe
SlopenCodex met computer-gebruik op de draaiende appTwee launch-blockers en een reeks bugs
ReparerenCodex fixt wat Codex vond, Claude werkt intussen door85 verificatie-checks

De rolverdeling die hij hanteert is het kopiëren waard. Het planmodel voert niets uit, want dat verbrandt dure tokens aan werk dat een goedkoper model prima doet. Het delegeert alleen. Van zijn wekelijkse Fable-limiet ging naar eigen zeggen 3 procent op aan een dag waarin negen agents tegelijk stonden te bouwen.

Het onderzoek dat de meesten overslaan

De ideefase kostte hem een uur wachten. Hij liet agents zijn eigen kanalen uitkammen: ongeveer 16.000 YouTube-reacties, 8.000 berichten in zijn community, 4.000 posts op X en zo’n 20.000 Reddit-reacties. Dat is bij elkaar rond de 48.000, terwijl de videobeschrijving spreekt over 60.000-plus. De optelsom in de video is de zuinigere claim en die houd ik aan.

Twee dingen daaraan vind ik belangrijker dan het getal zelf.

Ten eerste keerde het onderzoek zijn eigen aanname om. Hij dacht aan 5 tot 25 dollar per maand. De agents kwamen terug met 835 zinnen over prijs uit Reddit-discussies en een consistente band eromheen: 25 tot 50 dollar per maand, en je hebt er honderd tot tweehonderd van nodig. Dat is precies het soort correctie waarvoor je die berg data doorspit.

Ten tweede zei hij er hardop bij dat het gekozen idee geen verdedigbare positie heeft. Iemand kan het een maand gebruiken, begrijpen hoe het werkt en het namaken. Zijn conclusie: de waarde zit niet in de app maar in de prompt erachter, in de kennis en de blunders die je erin hebt gestopt. Wie zonder eigen vakgebied zo’n onderzoek start, krijgt hetzelfde generieke antwoord als iedereen die dezelfde vraag stelt.

Waar het misging

Dit is het deel dat een demo meestal weglaat. Toen de app naar een eigen domein verhuisde, was inloggen stuk. De beveiligingslaag weigerde het formulier omdat de geconfigureerde site-URL nog naar het oude adres wees. De app werkte op het tijdelijke adres en niet op het echte, wat de vervelendste variant is: alles lijkt klaar en de eerste bezoeker loopt vast.

Codex vond dat niet vooraf. Het vond wel twee blockers die er anders doorheen waren geglipt, waaronder een deck dat een klant een investeringsrendement van nul keer voorschotelde. Een goedkeuringsstap die niet werd afgedwongen was de andere. Dat zijn geen schoonheidsfoutjes maar dingen die je bedrijf schaden zodra iemand betaalt.

De kosten aan de andere kant vielen laag uit. Een volledige klantreis, van analyse tot gegenereerd document, kwam op ongeveer 13 dollarcent. De abonnementsprijs in zijn test stond op 39 dollar per maand.

De kanttekening

De standaard verschuift naar “ziet er af uit”. Acht uur voor iets met inlog, betalingen en een eigen domein maakt de drempel om te lanceren bijna nul. De drempel om het te onderhouden blijft precies waar hij was. Herk zegt dat zelf ook: je bouwt geen product in een dag dat je daarna nooit meer aanraakt. Wat er nu makkelijker uitziet dan het is, is niet het bouwen maar het jaar erna.

De verantwoordelijkheid landt bij degene die de prompt schreef. Twee agents die elkaar controleren voelen als toezicht, maar het zijn twee systemen van dezelfde soort, met dezelfde blinde vlekken. Het domeinprobleem vonden ze geen van beide. Als jouw naam op de betaalpagina staat, ben jij de verificatie, niet zij.

Er stroomt begrip weg dat je later nodig hebt. Wie zelf een authenticatielaag heeft gebouwd, herkent zo’n weigering binnen een minuut. Wie het heeft laten bouwen, moet het aan het model vragen. Dat gaat goed tot het model het mis heeft, en dan sta je stil bij iets wat op papier van jou is. Herk formuleert het scherp: je kunt het denkwerk en het verzamelen uitbesteden, het begrijpen niet.

Nog iets over de bron zelf. De video bevat betaalde links, onder meer naar de spraak-tool waarmee hij alles inspreekt en naar een hostingpartij met zijn eigen kortingscode. Dat maakt de werkwijze niet minder bruikbaar, maar de toolkeuze is niet neutraal gekozen.

Wat ik zelf doe

Ik ga geen product in een dag bouwen. Wat ik wel overneem is de sloopronde als vaste stap. Ik werk al met verificatie waarbij de agent zijn eigen werk moet kunnen draaien, en dit is de logische volgende laag: een tweede model dat niets van de bouw heeft meegemaakt en één opdracht krijgt, namelijk stukmaken. Dat is dezelfde reden waarom ik bij een middag echt werk met Fable 5 merkte dat de agent zijn eigen fouten opving zonder dat ik ze zag: prettig, maar het is geen controle van buitenaf.

Twee dingen neem ik niet over. De 30-dagen-verkoopaanpak uit het tweede uur is voor een publiek dat een bureau runt, niet voor mij. En het idee dat je onderzoek uitbesteedt aan agents zonder eigen data doe ik niet, om precies de reden die hij zelf noemt.

Veelgestelde vragen

Heb ik twee betaalde abonnementen nodig om dit te proberen?

Voor de kern niet. De sloopronde werkt ook binnen één tool, zolang je een verse sessie start zonder de bouwgeschiedenis. Het effect is kleiner, omdat hetzelfde model dezelfde aannames meeneemt, maar het vangt al veel. Twee verschillende modellen is beter en kost meer.

Werkt dit ook als ik geen app bouw?

Ja, en daar gebruik ik het zelf voor. Elk resultaat dat een agent aflevert kun je aan een tweede sessie geven met de opdracht om het onderuit te halen. Bij teksten vraag ik om de zwakste bewering en de bron die ontbreekt, bij scripts om de invoer die het laat crashen.

Wat is het verschil met gewoon tests laten schrijven?

Tests controleren wat je hebt bedacht. Een sloopronde met computer-gebruik klikt door de echte interface en vindt wat niemand heeft bedacht, zoals een knop die actief blijft terwijl alle velden leeg zijn. Beide zijn nodig, ze vangen andere dingen.

Bronnen

  • Nate Herk, “Build & Sell AI SaaS Products (2 HOUR COURSE)”, YouTube, 10 augustus 2026. Video van 2 uur en 22 minuten, plus de beschrijving met hoofdstukindeling.
  • Automatisch gegenereerde ondertiteling bij dezelfde video, geraadpleegd 11 augustus 2026.

Gecontroleerd op 11 augustus 2026. Alle cijfers in dit stuk komen uit de video zelf en zijn niet onafhankelijk te verifiëren: ik heb geen toegang tot zijn dashboards, zijn factuur of zijn database. Twee dingen spreken elkaar tegen. De beschrijving noemt meer dan 60.000 doorzochte reacties, terwijl de aantallen die hij in beeld noemt optellen tot ongeveer 48.000; ik houd de lagere aan. Daarnaast noemt hij zijn beveiligingsreview “OWASP 5.0” met een verwijzing naar een GitHub-repository die niet in beeld leesbaar is, dus welke standaard daar precies is gebruikt heb ik niet kunnen vaststellen.