ChatGPT beste AI-voorspeller van het WK 2026

ChatGPT beste AI-voorspeller van het WK 2026

ChatGPT beste AI-voorspeller van het WK 2026

Hoe betrouwbaar zijn voorspellingen van kunstmatige intelligentie? Bureau Onder liet ChatGPT, Claude, Gemini, Copilot en Perplexity gedurende zes weken alle 104 wedstrijden van het WK 2026 voorspellen. De resultaten werden realtime bijgehouden aan de hand van het puntensysteem van Scorito.Nu het toernooi is afgelopen, kan de balans worden opgemaakt. ChatGPT behaalde de hoogste score en eindigde met 35 punten voorsprong op Claude. Ook het winnende model bleek echter verre van foutloos. ChatGPT voorspelde bij 33 van de 104 wedstrijden de verkeerde uitslag. Slechts bij veertien duels werd de exacte eindstand correct voorspeld.

Gemini behaalde van de vijf onderzochte AI-modellen de laagste totaalscore.

Drie modellen voorspelden de juiste wereldkampioen

Alle modellen ontvingen op 8 juni 2026 dezelfde gestructureerde prompt. Deze bevatte onder meer het officiële FIFA-speelschema, de FIFA-ranglijsten en de resultaten van de laatste vijf wedstrijden van ieder deelnemend land. Daarnaast moesten de modellen hun voorspellingsmethode en gebruikte bronnen verantwoorden. Voor aanvang van het toernooi voorspelden ChatGPT, Claude en Perplexity dat Spanje wereldkampioen zou worden. Copilot koos voor Argentinië, terwijl Gemini Brazilië als eindwinnaar aanwees.

Tijdens het toernooi weken de modellen regelmatig af van de gezamenlijke verwachting. ChatGPT deed slechts één afwijkende voorspelling ten opzichte van de andere vier modellen. Die voorspelling bleek bovendien exact correct. Claude week vier keer af, Gemini zes keer en Perplexity zeven keer. Copilot deed met acht afwijkende voorspellingen het vaakst een andere voorspelling dan de overige modellen, onder meer bij de finale.

De volledige einduitslag en een toelichting op de onderzoeksmethode zijn te vinden op onder.nl/ai-wk-voorspelling-battle.

Wat de resultaten zeggen over vertrouwen in AI

Het experiment sluit aan bij een vraag waar ook marketeers, onderzoekers en contentstrategen regelmatig mee te maken krijgen: welk antwoord is betrouwbaar wanneer meerdere AI-modellen verschillende uitkomsten geven? Het WK bood gedurende zes weken een groot aantal objectief meetbare resultaten. Bij veel andere toepassingen van AI ontbreekt een dergelijke mogelijkheid om antwoorden direct en onafhankelijk te controleren. Opvallend is dat ChatGPT, het model dat het minst vaak afweek van de gezamenlijke verwachting, uiteindelijk de hoogste score behaalde. Gemini voorspelde gemiddeld de meeste doelpunten, met 2,71 doelpunten per wedstrijd, maar eindigde onderaan.

De resultaten relativeren tegelijkertijd het beeld van AI als betrouwbaar voorspellingsinstrument. Zelfs het best presterende model voorspelde bij bijna een derde van de wedstrijden de verkeerde winnaar of een gelijkspel waar een ander resultaat volgde.

Voor organisaties die AI gebruiken om beslissingen te ondersteunen, is de belangrijkste conclusie daarom dat AI-antwoorden niet zonder controle als feit moeten worden aangenomen. Het blijft noodzakelijk om meerdere modellen of bronnen te vergelijken, uitkomsten onafhankelijk te toetsen en uiteindelijk zelf een onderbouwd oordeel te vormen.

Onderzoeksopzet

Het onderzoek werd uitgevoerd door Bureau Onder, onderdeel van onder.nl. Hiervoor werden de uitgebreide versies gebruikt van ChatGPT van OpenAI, Claude van Anthropic, Copilot van Microsoft, Gemini van Google en Perplexity. Alle modellen ontvingen op 8 juni 2026 exact dezelfde prompt. Daarin waren het officiële FIFA-speelschema van alle 72 groepswedstrijden en de volledige knock-outstructuur tot en met de finale van 19 juli opgenomen. Er zijn geen modelspecifieke aanpassingen gedaan. De modellen moesten vooraf toelichten welke factoren zij in hun voorspellingen meenamen. Het ging daarbij onder meer om:

  • recente wedstrijdvorm;
  • kwaliteit van de spelersselectie;
  • positie op de FIFA-ranglijst;
  • blessures en afwezigen;
  • de context van het toernooi.

Daarnaast moesten de modellen aangeven hoe zwaar iedere factor procentueel meetelde en welke bronnen zij daarvoor gebruikten. Hierdoor kon niet alleen de uiteindelijke score worden vergeleken, maar ontstond ook inzicht in de gehanteerde voorspellingsmethoden. Alle tabellen en visuals uit het onderzoek mogen met bronvermelding aan Bureau Onder en onder.nl worden overgenomen.

Patrick Petersen

Patrick Petersen RDM MA MSc is expert in AI, marketing en digitale innovatie. Als spreker, docent, onderzoeker en prijswinnend auteur helpt hij organisaties groeien met slimme combinaties van technologie, data en creativiteit. Hij schrijft onder meer voor MarketingReport, Adformatie en MarketingTribune en geldt als AI-, retail- en marketingexpert voor media als De Telegraaf, Metronieuws en Distrifood. Zijn boeken, waaronder Handboek Online Marketing, Handboek.AI en GenAI voor Professionals, behoren tot de standaardwerken in het vakgebied.