Vijf AI-modellen voorspellen het WK 2026: welke blijkt het beste?

Vijf toonaangevende AI-modellen kregen exact dezelfde opdracht: voorspel het WK 2026 volledig, van de groepsfase tot en met de finale, nog vóór de eerste aftrap. Nu het toernooi is begonnen, wordt per gespeelde wedstrijd bijgehouden welk model het beste presteert. De komende zes weken moet blijken of AI daadwerkelijk in staat is sporttoernooien betrouwbaar te voorspellen.
Het experiment is opgezet door Onder. ChatGPT, Claude Opus, Copilot, Gemini en Perplexity voorspelden alle 72 groepswedstrijden met exacte uitslagen, de volledige knock-outfase en een top vijf van topscorers. Alle voorspellingen zijn op 8 juni 2026 vastgelegd en blijven gedurende het toernooi ongewijzigd. De prestaties worden beoordeeld met het Scorito-puntensysteem, waarbij exacte uitslagen zwaarder wegen dan alleen het correct voorspellen van de winnaar.
Een meting, geen mening
Alle vijf de modellen ontvingen dezelfde gestructureerde prompt, inclusief het officiële FIFA-speelschema, de FIFA-ranglijst en de resultaten van de laatste vijf wedstrijden van alle deelnemende landen. Daarnaast moesten de modellen uitleggen welke factoren zij meenamen in hun voorspellingen.
De uitkomsten lopen uiteen. Drie modellen voorspellen Spanje als wereldkampioen, één kiest Brazilië en één Argentinië. In zeven groepswedstrijden wijkt slechts één model af van de overige vier. ChatGPT kent daarbij geen enkele solo-afwijking en volgt steeds de consensus, terwijl Perplexity drie keer als enige een andere uitslag voorspelt.
Na afloop van de groepsfase, kwartfinales en finale wordt inzichtelijk welk model het meest accuraat voorspelde en of afwijkende keuzes juist beloond of afgestraft werden. De live tussenstand, alle voorspellingen en de actuele scores zijn gedurende het toernooi te volgen via onder.nl/ai-wk-voorspelling-battle/.
Waarom dit experiment relevant is
Iedereen die met AI werkt, kent dezelfde vraag: als vijf modellen op basis van dezelfde informatie verschillende antwoorden geven, welk antwoord kun je dan vertrouwen?
Het WK 2026 biedt daarvoor een zeldzaam objectief meetmoment. In tegenstelling tot veel AI-toepassingen zijn de uitkomsten van de voorspellingen binnen enkele weken verifieerbaar. Op 19 juli 2026 staat definitief vast welk model het beste presteerde en of afwijkende voorspellingen vaker gelijk kregen dan de consensus.
Over het onderzoek
Voor aanvang van het toernooi ontvingen de vijf AI-modellen exact dezelfde prompt met het officiële FIFA-speelschema. De voorspellingen zijn na vastlegging niet meer aangepast. Meer informatie over de opzet en de volledige voorspellingen is beschikbaar via onder.nl/ai-wk-voorspelling-2026/.
- Het onderzoek is uitgevoerd door Onder met de meest uitgebreide versies van ChatGPT (OpenAI), Claude (Anthropic), Copilot (Microsoft), Gemini (Google) en Perplexity. Alle modellen ontvingen op 8 juni 2026 exact dezelfde prompt, inclusief het volledige FIFA-speelschema voor de 72 groepswedstrijden en de complete knock-outstructuur tot en met de finale van 19 juli. Er zijn geen modelspecifieke aanpassingen gedaan. De prompt verplichtte ieder model om de gebruikte methodologie toe te lichten. Daarbij moesten zij aangeven welke factoren werden meegewogen – zoals recente vorm, selectiekwaliteit, FIFA-ranking, blessures en toernooicontext – welk gewicht iedere factor kreeg en welke bronnen daarvoor zijn gebruikt. Hierdoor kan niet alleen de voorspelkwaliteit worden vergeleken, maar ook de onderliggende afwegingen van de verschillende modellen.
- Per model is slechts één voorspelling gegenereerd. De eerste output is direct vastgelegd, zonder herhalingen of optimalisaties. Meerdere runs zouden weliswaar een gemiddelde kunnen opleveren, maar verminderen de vergelijkbaarheid omdat generatieve AI niet altijd dezelfde uitkomst produceert.
- De modellen werden expliciet uitgenodigd om actuele informatie uit mei en juni 2026 te gebruiken en – indien mogelijk – webbronnen te raadplegen. Of en hoe zij dat daadwerkelijk hebben gedaan, verschilt per model en configuratie en is niet afzonderlijk geregistreerd. Daardoor bevonden de modellen zich niet volledig in identieke informatieomstandigheden, een inherente beperking van het onderzoek.
Bij Copilot, Gemini en Perplexity kwamen enkele inconsistenties voor tussen de geschreven toelichting en de ingevulde knock-outbracket. In die gevallen is uitsluitend de bracket aangepast zodat deze overeenkomt met de eigen tekstuele redenering van het model; de voorspelde wedstrijdresultaten zijn niet gewijzigd. ChatGPT en Claude leverden direct intern consistente brackets aan.

