‘Grok 4 nieuwste AI-model maakt geen fouten meer’

xAI (de nieuwe eigenaar van socialemediaplatform X, red.) heeft z’n nieuwe AI-model tot leven gewekt en de naam is: Grok 4. Gewoon: “de krachtigste AI ter wereld.” Aldus Elon Musk zelf. Bold move. Grok 4 draait op een grote hoeveelheid rekenkracht: 200.000 Nvidia H100 GPU’s. Musk noemt het ‘Colossus’. Wat doet Grok met al die brute kracht? Hij raast door examens. ARC-AGI? Met gemak.
De ARC AGI Benchmark is een test die meet hoe slim AI echt is, niet door feiten uit het hoofd te leren, maar door puzzels op te lossen die logisch nadenken vereisen.
Het is bedacht door François Chollet in 2019, omdat hij vond dat bestaande AI-tests te makkelijk waren geworden door simpelweg informatie te memoriseren..
Geen probleem, dat zijn 2.500 vragen over basically elk onderwerp dat je ooit op school hebt gehaat. Musk zegt dat Grok geen fouten meer maakt in wiskunde of natuurkunde, tenzij je de AI-chatbot bewust probeert te misleiden. Sterker nog, Grok spot zelfs fouten in de vraag zelf, herformuleert die en geeft dan alsnog een goed antwoord. En dan Musk zelf:
Grok 4 is at the point where it essentially never gets math/physics exam questions wrong, unless they are skillfully adversarial. It can identify errors or ambiguities in questions, then fix the error in the question or answer each variant of an ambiguous question. [It’s] the first time, in my experience, that an AI has been able to solve difficult, real-world engineering questions where the answers cannot be found anywhere on the Internet or in books.
Lees die laatste zin nog eens; Grok 4 lost problemen op waar geen mens ooit het antwoord op heeft gepubliceerd. Het model verzint de oplossing zelf. Te danken aan zijn massieve denkkracht.

